10 分钟语音训练 AI 变声模型:RVC 语音转换快速上手
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
Retrieval-based-Voice-Conversion-WebUI(下称 RVC)是一个基于 VITS 的开源变声框架:只要 10 分钟的目标人物语音,你就能在自己电脑上训练出一个 AI 变声模型,用来配音、翻唱或实时变声,普通显卡也够用。全文按"先跑通、再搭建、后调优"的顺序讲,3 条命令就能走到网页界面。
三分钟跑通:先看效果
最省事的路径是整合包或一键脚本,不需要你理解任何依赖。
- Windows:下载整合包
RVC-beta.7z解压后,双击go-web.bat,浏览器会自动打开训练/推理界面。 - Mac / Linux:克隆仓库后一条命令,
run.sh会自动建虚拟环境、装依赖、下载预模型并启动:
sh ./run.sh打开网页后,在"推理"选项卡选一个模型、传一段音频,你就能听到变声结果。效果满意了,再回头按下面的步骤搭自己的训练环境。
它到底能做什么
| 能力 | 对你的实际好处 |
|---|---|
| 一键训练(载入→提音高→训练→建索引) | 不用手动按顺序跑 4 个阶段,一个按钮走完 |
| top1 检索保护音色 | 变声结果不会被你输入音频的原始音色"带跑",出来就是目标音色 |
| UVR5 人声分离 | 从完整歌曲里直接抠出干声,省去手动找清唱素材 |
| RMVPE 音高提取 | 唱歌场景下的哑音(听不出音高)片段也能处理,速度比传统算法快、占资源少 |
| ckpt-merge 模型融合 | 两个音色按比例混合,调出"介于两人之间"的新音色 |
实时变声界面(go-realtime-gui.bat) | 端到端 170ms 延迟,ASIO 设备可压到 90ms,能直播能用 |
| A 卡 / I 卡加速 | 没有 N 卡也能训练和推理 |
正式搭建:3 步走完
1. 装依赖
前提是 Python 版本大于 3.8。先装 PyTorch(若已装可跳过),再按你的显卡选一份 requirements:
pip install torch torchvision torchaudio| 你的设备 | 安装命令 |
|---|---|
| N 卡 | pip install -r requirements.txt |
| A 卡 / I 卡 | pip install -r requirements-dml.txt |
| A 卡 ROCm(仅 Linux) | pip install -r requirements-amd.txt |
| I 卡 IPEX(仅 Linux) | pip install -r requirements-ipex.txt |
一个例外:Windows + RTX 30 系显卡时,装 PyTorch 要指定 CUDA 11.7 源(--index-url https://download.pytorch.org/whl/cu117),否则可能装到不匹配的版本。
2. 备好预模型和 ffmpeg
RVC 训练推理依赖一批预模型文件,放在assets/下:
assets/hubert/hubert_base.ptassets/pretrained(v2 模型还需assets/pretrained_v2)assets/uvr5_weights- 根目录的
rmvpe.pt(RMVPE 音高提取用)
仓库 tools/ 目录提供了下载脚本,直接运行即可自动拉取上述文件:
python tools/download_models.py另外确认 ffmpeg 可用:Ubuntu/Debian 用sudo apt install ffmpeg,Mac 用brew install ffmpeg,Windows 则把ffmpeg.exe、ffprobe.exe放到仓库根目录。
3. 启动
python infer-web.py浏览器自动打开后,所有操作(切分、提取、训练、推理)都在网页上点完。Linux 上用 I 卡 IPEX 的话,先执行source /opt/intel/oneapi/setvars.sh再启动。
练出好效果的关键
数据量怎么选:推荐 10~50 分钟。数据干净(低底噪、音色统一)的话,5~10 分钟精简素材就够用;1~2 分钟偶尔有人成功,但基本不可复现;1 分钟以下不建议试。理由:底模已经提供了通用语音能力,你只需要让它"记住"这一个音色,样本太少记不住,太多则收益递减。
训练轮数(total_epoch):素材底噪大就 20~30 轮停手——底模音质带不动你的低质数据,练再多只是放大噪音;素材音质高且时长多,可以放到 200 轮,反正训练速度很快。
index rate 为什么重要:可以把它理解成"先对齐声音指纹,再换音色"。推理时系统从你的训练集索引里找最接近当前片段的一条特征(top1 检索)替换输入源特征,你的原始音色就进不来了。index rate 调 1 时保护最强,但音质会向训练集靠拢;训练集本身音质比推理源差时,调太高反而降质。训练集质量高、轮数足够时,模型自带音色的能力强,index rate 调不调都无所谓。
想换音色细节?用 ckpt 选项卡的 ckpt-merge 融合两个模型,比例从 0 到 1 慢慢试,比重训快得多。
训练前处理:完整歌曲先过一遍 UVR5 抽人声(assets/uvr5_weights里自带权重),比混着伴奏训练干净得多。
避坑清单
按"现象 → 大概率原因 → 一条解法"自查:
载入音频时报 ffmpeg error 或 utf8 error大概率不是 ffmpeg 的锅,而是路径里有空格、括号或中文 把音频挪到纯英文、无空格的目录再试
一键训练结束,没看到
added_开头的索引文件显示"Training is done"说明模型已训完,紧邻的报错是假的;索引步骤是训练集太大时卡住了 手动再点一次"训练索引"按钮训练完了,推理时选不到这个音色模型列表没刷新,或训练过程实际有报错 先点"刷新音色",还没有就打开
logs/实验名下的日志看训练是否成功CUDA out of memory显存不够(4G 以下基本没救,4G 可以试试) 训练就把 batch size 往小调,最低到 1;推理就缩小 configs/config.py 结尾的
x_pad、x_query、x_center、x_maxWebUI 弹 "Expecting value: line 1 column 1 (char 0)"系统开了局域网/全局代理,连本地端口也被代理劫持了 关掉代理(服务端设过 http_proxy 的也一并 unset)再打开
Windows 报
llvmlite.dll加载失败缺 VC 运行库 安装微软官方 VC++ 运行包(x64)后重启 WebUI
收尾
一句话总结:RVC 把"少数据 + 检索防泄漏 + 网页操作"拼在一起,让你用 10 分钟素材和一条启动命令,就得到属于自己的 AI 变声模型。
遇到问题和想深入调参时,先看仓库自带文档:中文 FAQ、训练流程详解、faiss 索引调参说明、中文更新日志。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考