UVR 5.6 免费人声分离教程:选对引擎,把一首歌拆成伴奏和人声
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
给喜欢的歌做一首没有原唱的伴奏,或者从访谈录音里把背景音乐抽掉——这件事 Ultimate Vocal Remover(UVR)5.6 可以帮你直接做掉。它是一个免费、开源的 AI 人声分离工具,能把一首歌拆成人声、伴奏(以及鼓、贝斯等)独立音轨,不需要会编曲,也不需要专业的音频编辑软件。下面按「装好 → 选引擎 → 跑一遍 → 调参数」的顺序走一遍,用 30 秒试听模式,三分钟以内就能出第一版结果。
三种系统,三条安装路径
UVR 只支持 64 位系统。Windows 和 macOS 用户在项目 Release 页面下载对应安装包即可,包里已经带了 Python、PyTorch 等全部依赖,无需配置环境;AMD 显卡或 Intel 核显的 Windows 用户注意选 OpenCL 版本,macOS 则分 arm64(M1/M2)和 x86_64 两种 dmg。
Linux 用户(Debian/Arch 系)建议走源码加安装脚本的方式:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui chmod +x install_packages.sh && ./install_packages.sh && python3 UVR.py脚本会装好依赖后启动主程序;如果非 WAV 文件转换报错,说明还缺 FFmpeg,用sudo apt install ffmpeg补上即可。
引擎怎么选:一张表看完
主界面的 "CHOOSE PROCESS METHOD" 下拉框里有五类方法,前三个是分离引擎,差别在于"拆得细"还是"拆得净":
| 引擎 | 定位 | 适用场景 | 选型建议 |
|---|---|---|---|
| VR Architecture | 人声提取专精,人声最干净 | 卡拉OK伴奏、播客降噪 | 只要人声或伴奏,优先试它 |
| MDX-Net | 高精度分离,处理复杂编曲更稳 | 电子乐、多轨remix | 通用默认项,新手首选 |
| Demucs | 一次拆出 4 条音轨(人声/鼓/贝斯/其他) | 整轨拆分、采样素材收集 | 需要多轨素材时用它 |
后面两个选项:Ensemble Mode 是同时跑多个模型再融合,质量更高但更耗时间;Audio Tools 不是分离功能,而是音量、变速、变调这类音频工具(依赖 Rubber Band 库)。拿不准就先从 MDX-Net 跑起,默认模型 MDX23C-InstVoc HQ 对大多数流行歌都够用,效果不理想再换 VR 或 Demucs 对比。
3 步完成首次分离
- 点Select Input选入一首歌。源文件质量直接决定上限,尽量用 WAV;MP3 转码依赖 FFmpeg。
- 点Select Output设好输出目录和格式。想保最大音质就选 WAV,想直接分享再选 MP3。
- 选引擎后点Start Processing。建议第一次先勾选Sample Mode (30s)只跑前 30 秒,听完确认效果再跑全长。
界面上的 Vocals Only / Instrumental Only 两个复选框控制只保存人声轨还是只保存伴奏轨,按需勾选即可;程序关闭后会自动记住你这次的设置。
三个最常调的参数
- Segment Size:默认 256。数字越大分离越细,但吃内存;报内存分配错误时降到 256 甚至 128。高配机器想冲质量可以试 512 或 1024。
- Overlap:默认 8。控制分段之间的重叠量,调到 16 能明显减少分段边界处的痕迹,代价是更慢。
- GPU Conversion:有 NVIDIA 卡(最低 RTX 1060 6GB,8GB 显存更稳)就勾上,速度能快数倍;M 系列 Mac 会自动走 MPS 加速;纯 CPU 跑只适合短片段测试。
踩坑速查:问题 → 原因 → 解法
伴奏里人声残留明显原因:当前引擎/模型对这类编曲不够强。 解法:换另一个引擎重跑;或把 Overlap 提到 16;或先用 Vocals Only 单独提取人声,再从原曲中减掉人声轨。
内存分配错误、中途崩溃原因:Segment Size 或窗口参数超过硬件承受范围。 解法:把 Segment Size 降到 128/256,重跑即可。
处理速度过慢原因:在纯 CPU 上跑大模型。 解法:确认勾选了 GPU Conversion 且显卡驱动正常;关掉占内存的后台程序。
非 WAV 文件直接报错原因:系统缺 FFmpeg,无法做格式转换。 解法:安装 FFmpeg 后重试(Linux 下sudo apt install ffmpeg)。
延伸入口:模型配置和源码
想换模型或看算法实现,仓库里这几个目录是主要入口:
- 官方说明:README.md
- VR 模型参数定义:lib_v5/vr_network/modelparams/
- MDX-Net 模型配置:models/MDX_Net_Models/model_data/mdx_c_configs/
- Demucs 模型数据:models/Demucs_Models/model_data/
- VR 模型清单(含卡拉OK、No Piano 等变体):models/VR_Models/model_data/model_data.json
- Demucs 算法源码:demucs/
- 分离主逻辑:separate.py
回到开头那件事:装好后挑一首歌,勾上 Sample Mode (30s),用 MDX-Net 默认模型跑一遍,半分钟后就能听到第一版没原唱的伴奏。不满意就换引擎再跑一次——这基本就是使用 UVR 的全部节奏。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考