news 2026/9/12 3:05:46

音频分离零门槛上手:用 UVR 3 步把歌里的人声提取出来

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
音频分离零门槛上手:用 UVR 3 步把歌里的人声提取出来

音频分离零门槛上手:用 UVR 3 步把歌里的人声提取出来

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

想做卡拉OK伴奏,却不知道从哪下手?UVR(Ultimate Vocal Remover)就是干这个的:一个免费的开源桌面工具,用 AI 把人声从歌曲里单独提取出来,剩下的就是伴奏。不用会编程、不用懂 DSP,打开、选歌、点按钮,三分钟出结果。适合音乐人、播客、K 歌爱好者,以及任何想把一首歌拆成几轨素材的创作者。

三套模型打底,覆盖你 90% 的需求

先说结论:UVR 的护城河不是界面,而是内置模型。它内置三套主流分离架构,外加一个"多模型合流"模式:

  • MDX-Net / VR Architecture / Demucs:三套不同的神经网络架构,同一首歌用不同架构分离,音色残留的多少都不一样——相当于给了你三把不同锋利度的刀。
  • Ensemble Mode:同时跑多个模型再融合输出,用时间换精度,适合对音质挑剔的场景。
  • 免安装人声分离:Windows 装完即用的安装包、Mac 的 DMG 都内置了 Python 和 PyTorch 运行环境,不折腾依赖;Linux 用户一条脚本搞定。

核心分离算法都在 separate.py 里,想深挖原理可以顺着看。

跑通流程:从下载到第一轨伴奏

装好依赖

  • Windows / macOS:到项目 Releases 页下载安装包(Mac M 系列选 arm64 版,AMD 或 Intel Arc 显卡可选 OpenCL 版),双击安装即可。
  • Linux:手动装环境,Debian 系照下面做:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui sudo apt install ffmpeg python3-tk ./install_packages.sh python3 UVR.py

打开应用,选架构和模型

首次运行会下载基础模型,之后在Choose Process Method里挑架构(新手选 MDX-Net),再在模型下拉框里选一个模型。注意模型不会全部预装,缺的可以到内置下载中心一键拉取,文件分别落在 models/MDX_Net_Models/、models/VR_Models/、models/Demucs_Models/ 三个目录下。

选输入输出,开跑

Select Input拖入音频(支持 WAV、MP3、FLAC 等常见格式),Select Output指定输出目录。建议先勾上Sample Mode (30s)只试跑 30 秒,确认效果满意再跑全曲。

Start Processing,完成后输出目录会出现xxx_(Vocals).wavxxx_(Instrumental).wav两个文件,到这一步你就毕业了。

挑对模型比调参数重要

参数别慌,就盯住这几个,其他保持默认即可(以下默认值取自应用内置设置):

参数作用默认值什么情况需要改
处理架构 + 模型决定分离质量的上限MDX-Net想要鼓/贝斯/人声多音轨选 Demucs;只要干净人声选 MDX-Net 或 VR
Segment Size每次送入模型的音频块大小,越大越精细但更吃显存256显存报错就调小;追求极限质量再调大
Overlap音频分块之间的重叠量,影响接缝处是否平滑8听到接缝声就调大,代价是变慢
Window SizeVR 架构的频窗大小,平衡速度和精度512求快选 1024,求质选 320
Aggression主音轨提取强度,越大去得越狠5人声残留重时适当调大,过大声音发浑
GPU Conversion让 MDX-Net 走显卡加速有 N 卡(8GB 显存起步)就勾上,长音频提速明显

三个最典型的实战场景

做 K 歌伴奏。选 MDX-Net 的 MDX23C 模型,在输出选项里勾Instrumental Only只保存伴奏轨,跑完直接得到纯伴奏,丢进练歌软件就行。

拆轨重混。用 Demucs 的四轨模型,一次分出人声、鼓、贝斯、其他四轨,各自单独调音量或换鼓组,再进宿主软件二次混音,remix 的素材就齐了。

人声净化。用 MDX-Net 提出人声干声,配合应用内置的降噪选项,能把混响和底噪压下去,适合播客修复、卡拉OK 翻唱素材。

踩坑与调优

  • 现象:处理 MP3 / FLAC 直接报错。原因:非 WAV 文件靠 FFmpeg 解码,而它没装。解法:Linux 执行sudo apt install ffmpeg,Windows 从 gyan.dev 下 ffmpeg 压缩包,把ffmpeg.exe放进 UVR 安装目录,重启应用。
  • 现象:内存 / 显存分配失败,进程卡死。原因:分块太大,单次推理超出显存。解法:把Segment Size从 256 降到 128,VR 架构同时把Window Size降到 320;还爆就取消GPU Conversion改用 CPU。
  • 现象:人声轨里还有伴奏残留、或者伴奏里还能听见鬼影人声。原因:单模型有上限。解法:先试更高精度的模型;还不行就开Ensemble Mode组合 2 个以上模型融合(至少选两个,少一个会直接报错)。

延伸信息

UVR 遵循 MIT 协议,代码和模型可自由使用(商用请保留署名)。当前版本 v5.6.0,版本号维护在 __version__.py;模型库还在持续更新,不用翻官网,应用内下载中心直接拉取。遇到问题,点左侧设置按钮里的Error Log能拿到详细报错,贴给社区会更快定位。

先用Sample Mode试 30 秒,再跑全曲,是最省时间的姿势。同一首歌换 2~3 个模型各跑一次,耳朵不会骗你——哪轨干净用哪轨。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 3:02:16

行人检测与重识别:从监控视频中快速搜索目标轨迹的工程实践

简介:面向机器学习与计算机视觉方向的开发者,这份压缩包提供了一套基于Python的监控视频行人轨迹搜索方案。通过输入一张目标图像,即可在大量视频片段中检索并标记包含该目标的内容,适用于安防监控、智慧安防等需要跨镜头追踪的工…

作者头像 李华
网站建设 2026/9/12 3:01:35

React useEffect对象监听:依赖数组原理与五种可靠方案

1. 先看现象:useEffect到底能不能监听对象这个问题几乎是所有React开发者绕不过去的一道坎,社群里隔三差五就有类似的提问:“我useEffect的依赖数组里传了一个对象,为什么改了里面的属性却不触发?”“为什么我传了对象…

作者头像 李华
网站建设 2026/9/12 3:01:34

基于Spring Boot的校园访客管理系统设计与实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 3:00:50

量子蚁群算法、Grover搜索与量子神经网络:MATLAB实现与参数调优

简介:面向量子计算方向的科研初学者与算法爱好者,这份基于MATLAB的程序包提供了量子蚁群算法、量子格罗弗算法、量子神经网络算法等多类量子算法的可运行实现,可帮助读者快速搭建实验环境,理解不同算法的迭代机制与参数影响。压缩…

作者头像 李华