10 分钟录音,训出你的 RVC 专属音色模型
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
RVC 变声器把 10 到 50 分钟的人声录音炼成一个音色模型:之后任何音频丢进去,都以这个音色重新输出。真正的门槛是数据量,不是算力。
RVC 最低显存要求:开工前三笔账
- 硬件账:4GB 显存是下限。显存再小(3G、2G 的老卡)基本判死刑:训练时 batch size 缩到 1 仍然 OOM,说明卡真的不够,只能换卡或上云 GPU。4GB 能跑完训练和推理,程序启动时会自动读显存、调整内部分块参数。切分和音高提取走 CPU 多进程,系统内存吃紧就把"CPU 进程数"调低,或提前把训练音频切短。
- 数据账:10 分钟干净人声。建议总时长 10–50 分钟;录音干净、底噪低、音色有辨识度时,5–10 分钟也能训出可用的音色模型。数据不够的代价是单向的:底噪会被模型学进去,轮数再高也压不回来;语速语调单一,模型覆盖不了不同发音状态;单条片段拖太长,切分和内存两头吃亏。录完统一转 WAV,采样率不用纠结,预处理会重采样到训练档位。
- 软件账:ffmpeg + 预训练底模。缺 ffmpeg,切分和重采样直接起不来;assets 目录下缺 hubert、rmvpe、pretrained 等底模文件,训练和推理都跑不动。按 README.md 的模型目录结构把底模放齐即可。
RVC 环境怎么搭:一条命令从 clone 到 7865 端口
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv && source .venv/bin/activate pip install -r requirements.txt # 按显卡选对应依赖文件(NVIDIA / AMD / CPU 各一份) python webui.py显卡差异只在 pip 那一步:NVIDIA 装 CUDA 版依赖,AMD 走 DirectML(Windows)或 ROCm(Linux),命令形态不变。启动后浏览器自动打开 7865 端口,训练、索引、推理都在这一个网页里;Windows 用户也可以直接双击 go-webui.bat 走整合包路线,效果等价。
RVC 训练轮数怎么定:训练页上真正要动的旋钮
页面上值得碰的数字只有三个:总轮数、保存间隔、batch size,选法跟着训练集的状态走:
| 你的训练集 | 轮数 | 保存间隔 | batch size |
|---|---|---|---|
| 有底噪、时长一般 | 20–30 轮就收手 | 每 10 轮存一个点 | 页面默认值,OOM 再往下调 |
| 干净、底噪低、时长充足 | 可以拉到 200 轮 | 同上,逐个试听挑最早达标的 | 默认即可,按显存自动估算 |
底噪大的数据别贪轮数,噪音会被一起学进去(FAQ Q9);保存间隔设小是为了逐个试听、挑出最早达标的那个保存点,而不是闷头训到最后一刻。另外两个值得碰的选项跟着数据走:采样档位选 48k(配 v2 底模,官方配置里质量最高的一档,见 configs/v2/48k.json);音高提取选 rmvpe,标注里效果最好、显存开销小,harvest 低频更好但速度极慢,歌声场景可换 pm 提速。确认训练集路径、填一个实验名(找模型全靠它),点一键训练,随后自动跑完数据集预处理、特征提取和模型训练,日志写在 logs/实验名/ 里。
RVC 索引文件作用:相似度与音质的天平
索引决定音色像不像,index rate 决定天平往哪偏,是同一件事的两面。模型训好后先点"训练索引":它用 faiss 给训练特征建检索库,落在 logs/实验名/ 下、以 added_ 开头的 .index 文件。一键训练结束没看到索引,多半是训练集太大把添加步骤卡住了,重按一次即可(FAQ Q2)。漏掉它,出来的声音听着顺耳,相似度却会打折扣。
推理页要调的是检索特征占比(index rate),0 到 1,默认 0.75,三档行为预期:
- 拉到 1:音色完全锁死在训练集上,源音色和底模音色都漏不出来,代价是音质天花板被训练集质量封住
- 0.75:相似度和音质之间的平衡点
- 拉到 0:不做检索保护,音质上限打开,"音色泄露"问题回来
若训练集质量高、时长足,模型自身已很少引用外部音色,这个值给多少差别不大。移调按半音走,±12 就是升降一个八度;protect 滑条默认 0.33,作用是保住清辅音和呼吸声不裂,输出带电音就往上拨。
RVC 批量转换与实时变声:离开浏览器之后
两条路,各一个最短入口:
- 批量:推理页选批量转换,框选整个 wav 文件夹、填好输出目录,目录里逐条转换、成品落到指定文件夹
- 实时:启动实时界面,端到端延迟 170ms;换 ASIO 输入输出设备可压到 90ms,但这非常依赖声卡驱动支持,普通 USB 声卡压不到这个数
python realtime_gui.pyWindows 直接双击 go-realtime_gui.bat 效果相同。验收标准只有一条:挑一段训练没用过的音频丢进推理页转换,音色对上了,这套流程就通了。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考