音频分离零门槛上手:用 UVR 3 步把歌里的人声提取出来
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
想做卡拉OK伴奏,却不知道从哪下手?UVR(Ultimate Vocal Remover)就是干这个的:一个免费的开源桌面工具,用 AI 把人声从歌曲里单独提取出来,剩下的就是伴奏。不用会编程、不用懂 DSP,打开、选歌、点按钮,三分钟出结果。适合音乐人、播客、K 歌爱好者,以及任何想把一首歌拆成几轨素材的创作者。
三套模型打底,覆盖你 90% 的需求
先说结论:UVR 的护城河不是界面,而是内置模型。它内置三套主流分离架构,外加一个"多模型合流"模式:
- MDX-Net / VR Architecture / Demucs:三套不同的神经网络架构,同一首歌用不同架构分离,音色残留的多少都不一样——相当于给了你三把不同锋利度的刀。
- Ensemble Mode:同时跑多个模型再融合输出,用时间换精度,适合对音质挑剔的场景。
- 免安装人声分离:Windows 装完即用的安装包、Mac 的 DMG 都内置了 Python 和 PyTorch 运行环境,不折腾依赖;Linux 用户一条脚本搞定。
核心分离算法都在 separate.py 里,想深挖原理可以顺着看。
跑通流程:从下载到第一轨伴奏
装好依赖
- Windows / macOS:到项目 Releases 页下载安装包(Mac M 系列选 arm64 版,AMD 或 Intel Arc 显卡可选 OpenCL 版),双击安装即可。
- Linux:手动装环境,Debian 系照下面做:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui sudo apt install ffmpeg python3-tk ./install_packages.sh python3 UVR.py打开应用,选架构和模型
首次运行会下载基础模型,之后在Choose Process Method里挑架构(新手选 MDX-Net),再在模型下拉框里选一个模型。注意模型不会全部预装,缺的可以到内置下载中心一键拉取,文件分别落在 models/MDX_Net_Models/、models/VR_Models/、models/Demucs_Models/ 三个目录下。
选输入输出,开跑
点Select Input拖入音频(支持 WAV、MP3、FLAC 等常见格式),Select Output指定输出目录。建议先勾上Sample Mode (30s)只试跑 30 秒,确认效果满意再跑全曲。
点Start Processing,完成后输出目录会出现xxx_(Vocals).wav和xxx_(Instrumental).wav两个文件,到这一步你就毕业了。
挑对模型比调参数重要
参数别慌,就盯住这几个,其他保持默认即可(以下默认值取自应用内置设置):
| 参数 | 作用 | 默认值 | 什么情况需要改 |
|---|---|---|---|
| 处理架构 + 模型 | 决定分离质量的上限 | MDX-Net | 想要鼓/贝斯/人声多音轨选 Demucs;只要干净人声选 MDX-Net 或 VR |
| Segment Size | 每次送入模型的音频块大小,越大越精细但更吃显存 | 256 | 显存报错就调小;追求极限质量再调大 |
| Overlap | 音频分块之间的重叠量,影响接缝处是否平滑 | 8 | 听到接缝声就调大,代价是变慢 |
| Window Size | VR 架构的频窗大小,平衡速度和精度 | 512 | 求快选 1024,求质选 320 |
| Aggression | 主音轨提取强度,越大去得越狠 | 5 | 人声残留重时适当调大,过大声音发浑 |
| GPU Conversion | 让 MDX-Net 走显卡加速 | 关 | 有 N 卡(8GB 显存起步)就勾上,长音频提速明显 |
三个最典型的实战场景
做 K 歌伴奏。选 MDX-Net 的 MDX23C 模型,在输出选项里勾Instrumental Only只保存伴奏轨,跑完直接得到纯伴奏,丢进练歌软件就行。
拆轨重混。用 Demucs 的四轨模型,一次分出人声、鼓、贝斯、其他四轨,各自单独调音量或换鼓组,再进宿主软件二次混音,remix 的素材就齐了。
人声净化。用 MDX-Net 提出人声干声,配合应用内置的降噪选项,能把混响和底噪压下去,适合播客修复、卡拉OK 翻唱素材。
踩坑与调优
- 现象:处理 MP3 / FLAC 直接报错。原因:非 WAV 文件靠 FFmpeg 解码,而它没装。解法:Linux 执行
sudo apt install ffmpeg,Windows 从 gyan.dev 下 ffmpeg 压缩包,把ffmpeg.exe放进 UVR 安装目录,重启应用。 - 现象:内存 / 显存分配失败,进程卡死。原因:分块太大,单次推理超出显存。解法:把Segment Size从 256 降到 128,VR 架构同时把Window Size降到 320;还爆就取消GPU Conversion改用 CPU。
- 现象:人声轨里还有伴奏残留、或者伴奏里还能听见鬼影人声。原因:单模型有上限。解法:先试更高精度的模型;还不行就开Ensemble Mode组合 2 个以上模型融合(至少选两个,少一个会直接报错)。
延伸信息
UVR 遵循 MIT 协议,代码和模型可自由使用(商用请保留署名)。当前版本 v5.6.0,版本号维护在 __version__.py;模型库还在持续更新,不用翻官网,应用内下载中心直接拉取。遇到问题,点左侧设置按钮里的Error Log能拿到详细报错,贴给社区会更快定位。
先用Sample Mode试 30 秒,再跑全曲,是最省时间的姿势。同一首歌换 2~3 个模型各跑一次,耳朵不会骗你——哪轨干净用哪轨。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考