RVC WebUI UVR5人声分离实操指南:5分钟拆出干净人声与伴奏
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
手里只有一条带和声、带混响的成品音频,你想要一条干净的人声轨拿去练RVC或翻唱。RVC WebUI 内置的 UVR5 人声分离就能免费干这件事:丢进去一个音频文件,出来人声、伴奏两条无损轨,不用自己搭环境调参数。
🎯 功能定位:UVR5人声分离能做什么、不能做什么
| 适用场景 | 你能得到什么 | 上手难度 |
|---|---|---|
| 成品歌拆人声(RVC训练数据、翻唱素材) | vocal_歌名人声轨 | 低,会点按钮就行 |
| 成品歌拆伴奏(练琴、remix) | instrument_歌名伴奏轨 | 低 |
| 录音去混响、去回声 | 去混响后的人声 | 中,需两步组合 |
边界同样要说清楚,免得白折腾:
- MDX-Net 去混响只支持双通道混响,单通道录进去的混响它去不掉,这类要用 DeEcho 系列(界面说明原文如此,见 infer-web.py 中该 Tab 的提示文案)。
- 它只做"人声 / 非人声"两分法,不能单独把贝斯或鼓挑出来。
- 它不是降噪器,录音底噪会原样保留,指望它顺手去电流声不现实。
✅ 最小可用配置:首次运行与验收点
按四步走,每步只给一条关键命令,验收点不满足就停在这一步排错。
第 1 步,环境准备。这段命令完成克隆和依赖安装(N 卡选 requirements.txt,AMD 选 requirements-amd.txt,Intel 核显选 requirements-ipex.txt):
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt验收点:pip install无报错退出,当前目录下能看到infer-web.py。
第 2 步,模型资源。执行下面这条命令,它会把全部权重拉到assets/下,其中 UVR5 用的 6 个.pth文件进 assets/uvr5_weights/ 目录(HP2、HP3、HP5 各一个,DeEcho 三个):
python tools/download_models.py验收点:终端打印 "All models downloaded!",assets/uvr5_weights/下能看到 6 个.pth文件加onnx_dereverb_By_FoxJoy/子目录。
第 3 步,首次测试。启动 WebUI:
python infer-web.py --port 7865(Windows 直接双击go-web.bat也行。)验收点:浏览器自动打开http://127.0.0.1:7865,首页出现选项卡栏;终端里先看到Found GPU 显卡名才说明跑在显卡上。
第 4 步,结果验证。切到"伴奏人声分离&去混响&去回声"标签页,输入文件夹路径填一个只放了一首 30 秒测试音频的文件夹,模型选HP2_all_vocals,输出文件夹保持默认opt,点转换。验收点:输出信息栏出现文件名->Success,工作目录下opt/里多出vocal_文件名_10.flac和instrument_文件名_10.flac两个文件,各听 10 秒,人声轨里基本只剩歌声。
🎛️ 核心用法:人声分离模型与参数对照表
界面能动的参数其实就四个:输入文件夹(或多文件上传,二选一且文件夹优先)、主声输出文件夹(默认opt)、非主声输出文件夹、导出格式(wav/flac/mp3/m4a,默认 flac)。真正决定效果的是模型选择,直接抄下面这张表:
| 场景 | 关键参数(模型) | 推荐值 | 效果 |
|---|---|---|---|
| 带和声的成品,只留主唱 | HP5_only_main_vocal | 唯一选择 | 主声最干净,但对主唱本身可能有削弱 |
| 无和声成品,留人声练RVC | HP3_all_vocals | HP3 略优于 HP2 | HP3 保主唱稍好但可能轻微漏伴奏;HP2 反之 |
| 双通道混响录音去混响 | onnx_dereverb_By_FoxJoy | 单独使用 | 双通道混响首选,模型较大、速度偏慢 |
| 去回声/去延迟 | VR-DeEchoAggressive | 比 Normal 更彻底 | DeReverb 款能去单声道混响,但耗时约为前两者 2 倍 |
| 最干净的录音 | 两步串联 | 先 FoxJoy 再 VR-DeEchoAggressive | 官方界面里的个人推荐组合 |
两个细节值得记一下。第一,"人声提取激进程度"滑杆在当前版本里默认 10 且未在界面开放,无需操心——它会体现在输出文件名里(_10那段),对比不同结果时先认这个后缀。第二,输入若是 44.1kHz 立体声会直接进模型(infer/modules/uvr5/modules.py 里的探测逻辑),其他规格会先经 ffmpeg 转码成 44.1k 立体声再处理,所以源头文件规格越标准,整条链路越无损。
⚡ 提速技巧:GPU、精度与文件预处理
三条可验证的优化,对照看:
| 优化点 | 优化前 | 优化后 | 依据 |
|---|---|---|---|
| 设备与精度 | CPU 运行,整首歌按分钟计 | cuda:0+ fp16 自动启用 | configs/config.py 自动探测 GPU 并开半精度,终端日志Half-precision floating-point: True为达标;1060/1070/1080、P40 等老卡会被强制 fp32,属正常 |
| 去回声模型选型 | VR-DeEchoDeReverb | VR-DeEchoAggressive | 耗时约砍半,界面说明原文:DeReverb 耗时是另两个 DeEcho 的接近 2 倍 |
| 输入文件规格 | 128k 压缩 mp3 | 44.1kHz 立体声 wav | 满足规格即跳过一次 ffmpeg 转码,且压缩噪声不会被二次放大 |
批量处理不用额外调参:同一文件夹放多首歌会逐首处理,每首结束后代码自动执行torch.cuda.empty_cache()回收显存(modules.py 的 finally 段),4GB 显存的卡也会被 configs/config.py 自动降档(x_pad 3→1、x_query 10→5),所以长音频不用手动切片,一次丢 10 首以内没问题。
🛠️ 避坑指南:高频现象与解决办法
| 现象 | 可能原因 | 解决办法 |
|---|---|---|
| 模型下拉框是空的 | assets/uvr5_weights/下没有.pth文件 | 重跑python tools/download_models.py,确认 6 个.pth到位后再刷新页面 |
| DeEcho 模型输出的文件名和文件夹"对不上" | 三个 VR-DeEcho 模型的人声/伴奏命名是反的(infer/modules/uvr5/vr.py 注释明确写了) | DeEcho 系列按文件夹取文件:主声文件夹里的文件前缀是instrument_,别按名字捡 |
| 点转换后输出信息是路径或报错堆栈 | 输入路径带了空格、引号,或填了文件而不是文件夹 | 路径去空格去引号;走文件夹入口时目录里只放音频文件,不放子目录 |
| 处理时间比预期长一截 | 源文件不是 44.1kHz 立体声,触发了转码;或选了 MDX-Net/DeReverb 慢模型 | 先用 ffmpeg 把源转成 44.1k 立体声;能接受音质就换 Aggressive 款 |
| 显存不足报错或进程被杀 | 4GB 以下显存还开着浏览器大量标签 | 终端确认已出现force to fp32日志;每次只放 1-2 首歌,跑完手动关掉其他占显存程序 |
| 填了文件夹也传了文件,只处理了文件夹里的 | 代码逻辑是文件夹路径非空时忽略上传文件(modules.py 第 40 行) | 二选一:要么只填路径,要么只传文件 |
整套流程跑下来,一首 4 分钟的成品歌在 GPU 上拆出人声加伴奏通常一分多钟。下一步:把刚拆出的vocal_文件丢进"推理"标签页,接上你的 RVC 模型跑一遍,再和原伴奏对比听一遍合成后的听感。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考