RVC 入门:10 分钟语音练出你的 AI 变声模型
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
Retrieval-based-Voice-Conversion-WebUI(简称 RVC)是一个开源语音转换框架:用 10 分钟低底噪语音就能训练出做语音克隆和 AI 变声的模型,全程在浏览器界面里完成。本文按安装、练第一个音色、排查问题三步走。
为什么十几分钟语音就够:检索式语音转换
RVC 的底模基于 VITS 架构,用接近 50 小时的开源高质量语音预训练,已经"会说话",你只需要用自己的数据教会它某一个人的音色,所以十几分钟通常够用。推理时它再做一步检索式转换:从你的训练集里检索最接近的声学特征,替换输入音频的对应特征,让输出音色锁定在训练集上,避免输入源音色"泄漏"进结果。配合 RMVPE 音高提取算法,小数据量下输出也比较稳。
🛠️ RVC 安装教程:三步跑起 WebUI
环境要求
| 项目 | 要求 |
|---|---|
| Python | 大于 3.8 |
| 系统 | Windows / Linux / macOS |
| 显卡 | NVIDIA 推荐;AMD / Intel 卡装 dml 版本 |
| 系统依赖 | ffmpeg(Windows 用户放到项目根目录即可) |
安装步骤
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt装完依赖还有两件事:运行 tools/ 目录下的下载脚本(如 download_models.py),把 hubert 等预训练模型放进 assets 目录;想用 RMVPE 算法的话,把 rmvpe.pt 模型文件放到项目根目录。
准备语音数据
- 时长建议 10-50 分钟,音质好、底噪低时 10 分钟就能起步
- 底噪尽量低,单条音频别太长,太长就手工切分
- 用 WAV 格式,48kHz / 16bit 比较稳妥
- 训练集放在纯英文路径,避免空格、中文和特殊符号
- 录音带伴奏的话,先用内置 UVR5 功能分离出人声再训练
🎙️ RVC 使用教程:练出第一个 AI 音色
Windows 下双击 go-web.bat 即可启动,其他系统执行:
python infer-web.py浏览器会自动打开界面。在"训练模型"选项卡里,新手只需要关心四处设置:
- 实验名:每个实验对应一个独立文件夹,起个能区分内容的名字
- 模型是否带音高指导:唱歌要勾选,纯语音可以不勾
- 音高提取算法:rmvpe 效果最好;输入歌声时 pm 更快;harvest 低音好但慢
- 总训练轮数 total_epoch:底噪明显的训练集 20-30 轮就够;音质好、数据多可以拉到 200
提示:第一次先用 20-30 轮小轮数试跑,听一下音色方向对不对,再上正式训练。相同参数重新点"训练模型"会从上次检查点继续,不用从头再来。
显存不够就调小批次大小 batch_size;训练完成后,weights 文件夹下会出现 60MB 以上、可直接分享和推理的模型文件。
音色的三个落地用法
游戏配音:录制 10-15 分钟角色台词,训练出音色后,在推理选项卡批量转换对话音频。关键是训练集的录音环境和音色要统一,别混入其他声音。
AI 翻唱:先用 UVR5 从歌曲里分离出人声轨,拿干净人声训练模型,训练时勾选"带音高指导"。转换完翻唱人声后,把伴奏重新合回去就是成品。
直播变声:双击 go-realtime-gui.bat 打开实时变声界面,选好麦克风和扬声器设备即可。官方给出的端到端延迟约 170ms,机器带不动时把采样率降到 32k 更流畅。
❓ 效果不佳怎么排查:RVC 问题排查步骤
先查数据:多数音质问题出在数据上。底噪大,训练再久也压不下去,先降噪或重录;训练集里有大段静音或坏文件的,手工切掉。
再查参数:输出音色偏向输入源或底模(音色泄露)时,把推理的 index_rate 调高;反过来再调低。训练中途不要更换采样率,换了就得换实验名从头再来。
最后查硬件:训练爆显存就先减小 batch_size,同时把"提取音高和处理数据使用的CPU进程数"调低。更多报错解释可以看 docs/cn/faq.md,训练流程源码在 infer/modules/train/。
高频报错速查:
| 症状 | 可能原因 | 处理办法 |
|---|---|---|
| CUDA out of memory | 显存不足 | 减小 batch size |
| 找不到 llvmlite.dll(Windows) | 缺 VC++ 运行库 | 安装 VC++ 运行库后重启 |
| ffmpeg error | 路径带空格或特殊符号 | 训练集路径改为纯英文 |
| 训练完没有索引文件 | 加索引步骤卡住 | 再点一次"训练索引"按钮 |
| Expecting value: line 1... | 系统代理干扰 | 关闭局域网/全局代理 |
先用预训练模型把推理流程跑通,再换上自己的 10 分钟语音试跑一轮,音色方向对了,逐步加数据、加轮数即可。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考