RVC WebUI 内置 UVR5:5 分钟免费跑通一次人声伴奏分离
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
丢进一首 5 分钟的混音,几分钟之后你能拿到两条干净轨道:一条只剩人声、一条只剩伴奏。这就是开源项目 Retrieval-based-Voice-Conversion-WebUI(RVC WebUI)里内置的UVR5——一个免费、纯本地运行、可批量的人声提取 / 人声伴奏分离工具。下面按"拿到界面→备好模型→喂入音频→跑分离→取回文件"的动线,带你独立跑通第一遍 AI 音频分离。
为什么值得折腾:本地开源音频分离的收益
RVC WebUI 主打变声,但 UVR5 是它顺手带进来的重头功能。把它和"上传到云端"的在线分离工具放在一起比,本地开源方案的收益一眼能看清:
| 维度 | RVC WebUI 内置 UVR5(本地开源) | 在线 / 闭源分离工具 |
|---|---|---|
| 费用 | 免费,MIT 协议 | 订阅制 / 按量计费 |
| 数据去向 | 全程本地,音频不上传 | 需上传到云端 |
| 模型数量 | 8+ 种:HP2/HP3/HP5、VR-DeEcho 系列、onnx 去混响 | 通常只有 1~2 个固定档 |
| 硬件支持 | N 卡 / A 卡 / I 卡 / 纯 CPU 兜底 | 取决于平台 |
| 批量处理 | 直接丢整个文件夹进去 | 常限单文件 / 限速 |
| 后续加工 | 输出可直接进 RVC 变声、做训练 | 一般导出即止 |
一句话:数据不出本地、白嫖全部模型、跑完还能接着喂给 RVC。
动手前检查清单:显卡、Python 与待处理音频
开跑之前,对照下面勾一遍,能省掉一半报错:
- 显卡:有 NVIDIA 卡最顺;A 卡 / I 卡走 DirectML 方案;没有独显也能跑,只是慢(纯 CPU)。
- Python:版本 > 3.8,建议 3.9 / 3.10。
- ffmpeg:必须装,UVR5 靠它读音频和转码,缺了直接报错。
- 待处理音频:准备一首44100Hz 立体声的 wav/flac 最省心;MP3 也能进(自动转码,多耗几秒)。
- 模型文件:
assets/uvr5_weights/里默认是空的,需要下载.pth模型,见下一步。
跟着一首歌走完全流程:从启动界面到取回两条轨道
它怎么分的?可以理解成一条多层分拣传送带:先把音频按频率拆成低、中、高几层,每层过一道对应的"筛子"(模型)判断哪些格子属于人声、哪些是伴奏,最后把筛出来的东西拼回两条轨道。下面跟着走。
第一步,拿到界面。克隆并装依赖:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIpip install -r requirements.txtN 卡用户用上面这条;A 卡 / I 卡改装requirements-dml.txt,Linux 上的 A 卡 ROCm 用requirements-amd.txt。然后启动:
python infer-web.py(Windows 可直接双击go-web.bat,macOS 用sh ./run.sh。)
✅ 预期现象:浏览器自动打开http://localhost:7865,看到 RVC WebUI 主界面。 如果不对:端口被占就加--port 7866;装不上多半是没装 GPU 版 PyTorch,先pip install torch torchvision torchaudio。
第二步,备好模型。跑仓库自带的下载脚本,把 UVR5 的.pth落到 assets/uvr5_weights/:
python tools/download_models.py✅ 预期现象:assets/uvr5_weights/里出现HP2_*、HP3_all_vocals.pth、HP5_only_main_vocal.pth、VR-DeEcho*.pth等文件。 如果不对:下拉框是空的,多半是这一步没下全,重跑一次,或把.pth手动放进该目录。
第三步,喂入音频。打开顶部标签页伴奏人声分离&去混响&去回声,把歌放进一个文件夹,然后把路径贴进"输入待处理音频文件夹路径";也可以直接在"也可批量输入音频文件"里拖几首进去(优先读文件夹)。
✅ 预期现象:文本框里回显你填的路径 / 文件名。 如果不对:路径手敲容易错,去文件管理器的地址栏直接整段复制。
第四步,跑分离。在"模型"下拉框选HP2或HP3(保留人声);"指定输出主人声文件夹"和"指定输出非主人声文件夹"默认都是opt;"导出文件格式"选flac或wav;点转换。
✅ 预期现象:"输出信息"里逐行打印文件名->Success。 如果不对:报模型找不到,回到第二步确认.pth已就位。
第五步,取回文件。打开opt/文件夹。
✅ 预期现象:看到vocal_文件名_10.flac(主人声)和instrument_文件名_10.flac(非主人声)两条轨道,后缀是你选的格式,10是聚合度。 如果不对:只出一个文件,检查两个输出文件夹是否都填了路径。
UVR5 参数速查表:模型、聚合度、格式怎么选
| 选项 | 推荐值 | 适用场景 |
|---|---|---|
| 模型(保留人声,不带和声) | HP2/HP3 | 普通翻唱、纯人声提取;HP3 对主人声保留稍好,可能轻微漏伴奏 |
| 模型(仅主人声,带和声) | HP5 | 伴唱/和声重的混音,只要主唱 |
| 模型(去延迟) | VR-DeEchoAggressive/VR-DeEchoNormal | 录音视频的回声尾巴;Aggressive 去得更彻底 |
| 模型(去混响+去延迟) | VR-DeEchoDeReverb | 房间混响重;耗时约为另外两个 DeEcho 的近 2 倍 |
| 模型(双通道混响,较慢) | onnx_dereverb_By_FoxJoy | 立体声混响最干净;单声道混响无效 |
| 聚合度(人声提取激进程度) | 默认10(范围 0–20) | 调高剥离更狠但易失真;出现机器味就调低到 8–10 |
| 导出文件格式 | flac(默认)/ wav / mp3 / m4a | 无损选 flac/wav;要小文件分享选 mp3 |
| 采样率 | 输入44100Hz 立体声最省心 | 非 44100 立体声会自动 ffmpeg 转码 |
分离出来之后能干嘛:播客降噪、视频取声、翻唱取样
- 播客降噪:先用VR-DeEchoAggressive去房间回声,再用HP2提纯人声,两条轨道分别压电平混回,底噪比手拉均衡干净得多。
- 视频取声:把教程 / 采访原声喂进去,
vocal_那条直接丢进 ASR 做字幕,去混响那条留给做 BGM 的底。 - 翻唱取样:用HP5抠主唱、
instrument_轨当伴奏垫底,再拿vocal_轨听原主唱的气口与咬字,练声照谱来。
卡住了看这里:4 个最常见的报错与排查
Q:输出里还能听到伴奏 / 和声?A:先确认选的是"保留人声"类(HP2/HP3);和声重的歌改选HP5;仍不行就把聚合度从 10 往上调,或先跑一遍VR-DeEchoAggressive再去人声。
Q:一首歌跑很久 / 很慢?A:确认装的是 GPU 版 PyTorch——[configs/config.py](https://link.gitcode.com/i/9aea1629af74ce139fcca56b8d38cc15)启动时会打印当前设备,看到cpu就是没用上卡;再关掉占显存的程序,一次别塞太多文件。
Q:模型下拉框是空的,或下载卡住?A:看[assets/uvr5_weights/](https://link.gitcode.com/i/f36d198cead48463b14cfb28858215fe)里有没有.pth;没有就重跑[tools/download_models.py](https://link.gitcode.com/i/6c248f45028c110976ff54e665d849db),或把.pth手动放进该目录。
Q:报错 ffprobe / ffmpeg 找不到?A:装 ffmpeg——Ubuntusudo apt install ffmpeg、macOSbrew install ffmpeg、Windows 把ffmpeg.exe/ffprobe.exe放根目录;它是读音频和转码的硬依赖。
UVR5 把"人声伴奏分离"从付费工具变成了本地白嫖的批处理命令,一次跑通之后,降噪、取声、取样都能顺手做。把压箱底的那段录音拿出来试一次,更多细节看 docs/cn/faq.md 或参与社区讨论。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考