4G 显存能跑 RVC 变声器吗?10 分钟录音训出专属音色
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
RVC(Retrieval-based Voice Conversion WebUI)是一个基于 VITS 架构的开源变声器:你给 10 到 50 分钟目标人声录音,它训出一个音色模型,之后任何音频扔进去都会以这个音色输出。适合给视频配音、给游戏角色换声、做翻唱,又不想碰音频工程细节的人。下面按"能不能跑 → 怎么装 → 怎么训 → 怎么查问题"展开,每一步都带原因。
先看红线:4G 显存、10 分钟录音
先回答"能不能跑":4G 显存能完成训练和推理;低于 4G(1060 的 3G、各种 2G 老卡)官方 FAQ 的建议是直接放弃。程序启动时会自己读显存并调整内部参数,4G 以下自动改用更保守的分块配置;训练时 batch size 缩到 1 还报 out of memory,就是显卡确实不够,换卡或租云 GPU。内存不够则把"提取音高和处理数据使用的 CPU 进程数"调低,或手动把训练音频切短。
数据量决定效果上限,这是整个流程里最不可逆的一步:总时长 10~50 分钟;底噪低、音色有辨识度的干净录音,5~10 分钟也能训出可用模型。环境要安静(底噪会直接进模型,轮次再高也压不下去),语速语调有些变化(样本要覆盖不同发音状态),单条片段几十秒到一两分钟即可。
系统侧三件不能省:Python 3.12 x64、ffmpeg(切分和重采样都靠它)、预训练底模。
装对依赖和底模,别卡在第一步
最易翻车的一步:缺 assets 目录下的底模,训练和推理都起不来。先 clone 并按硬件装依赖:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv rvc-env # 激活 rvc-env 后: # CPU / AMD(Windows 走 DirectML,Linux 走 CPU) pip install -r requirments_cpu_py312.txt # NVIDIA RTX 50 系:先装 CUDA 12.8 版 Torch,再执行: pip install -r requirments_cu128_py312.txt # NVIDIA RTX 50 系以前:先装 CUDA 11.8 版 Torch,再执行: pip install -r requirments_cu118_py312.txt然后按 README 的"下载模型"一节,把 hubert_base、rmvpe、pretrained、pretrained_v2 等底模下到 assets/ 对应目录——目录结构 README 里写得很清楚,照着放就行。装完跑一句python webui.py,浏览器自动打开 7865 端口的训练页,看到显卡信息栏能识别出你的卡,启动就算通了。
一键训练前,只动这几个参数
训练页真正值得动的数字就这几个,其余保持默认:
| 参数 | 怎么设 | 为什么 |
|---|---|---|
| 总轮数 total_epoch | 有底噪:20~30;干净且时长足:可到 200 | 底噪大的数据训太多轮,模型只会把噪音也学进去(FAQ Q9) |
| 保存频率 save_every_epoch | 用默认每 5 轮存一个点 | 间隔小才能逐个试听,挑最早达标的点,避免过拟合 |
| batch_size | 保持页面默认值,OOM 就往下调 | 默认按显存自动估算(1 + 显存 GB 数的一半),是稳定起步值 |
| 采样率 / 底模版本 | 48k 对应 v2 | 官方配置里质量上限最高的一档(configs/v2/48k.json) |
| 音高提取算法 | rmvpe | 效果最好且只占少量显存;harvest 低音更好但极慢,pm 适合歌声输入提速 |
确认训练集文件夹路径、填一个实验名(后面找模型全靠它),点一键训练。流程依次执行切分、音高提取、特征提取、训练,日志全部写在 logs/实验名/ 下,出问题先看这里。
训完声音不对?八成是索引这步漏了
索引决定结果保留多少训练集的音色,跳过它,音质可能不错但相似度打折扣。训完先点"训练索引",产物是 logs/实验名/ 下 added_ 开头的 .index 文件。如果一键训练结束没看到索引,多半是训练集太大卡住了索引步骤,重按一次"训练索引"即可(FAQ Q2)。
推理页重点调的是检索特征占比 index rate,范围 0~1,默认 0.75:
- 调高接近 1:音色完全锚定训练集,不泄露输入源或底模的音色,但音质上限被训练集锁死
- 调低到 0:不做检索保护,音质可能更好,但"音色泄露"会回来
- 训练集本身优质且时长足时,这个值反而不重要,模型自己已经不太引用外部音色
变调按半音计,+12 升八度、-12 降八度;保护滑条 protect 默认 0.33,专防清辅音和呼吸声撕裂,输出有电音就往高调。
跑通后:实时变声和验证
批量转换不用开网页,直接走 WebUI 的推理页逐个丢文件;想说话实时变声,双击 go-realtime_gui.bat 启动实时界面,官方给出的端到端延迟是 170ms,换 ASIO 输入输出设备可压到 90ms——但后者非常依赖声卡驱动支持,普通 USB 声卡别期待这个数字。
最后一步验证:从 10 分钟录音里挑一段没用过的音频,扔进推理页转换,听音色对没对——对上了,整个流程就通了。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考