RVC快速上手:10分钟语音训练AI变声模型的完整部署指南
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
想让视频角色、游戏语音换成自己的专属音色?RVC(Retrieval-based-Voice-Conversion-WebUI)是一个基于VITS的AI变声框架:准备约10分钟的低底噪语音,就能训练出可复用的变声模型,网页里一键完成"分离-切分-训练-转换"全流程。零基础照做,大约1小时跑通,训练1个模型再等10~20分钟。
它凭什么好用
- 训练数据只要10分钟:低底噪语音即可,远低于传统方案动辄几小时的要求
- 实时延迟170ms:端到端延迟已做到170ms,换ASIO声卡设备可压到90ms,直播、语音房都够用
- 跨平台、显存门槛低:Windows/Linux/MacOS全覆盖,A卡、I卡有专用加速路径,4G显存起步可训练
| 指标 | 数值 | 说明 |
|---|---|---|
| 最少训练数据 | 10分钟 | 越长越好,50分钟内效果最稳 |
| 实时变声延迟 | 170ms(ASIO可达90ms) | 端到端 |
| 训练显存门槛 | 约4G | 更低显存只建议跑推理 |
装环境:先看这张选路表
先确认系统里装了Python 3.8 或更高版本(终端输入python --version查看)。然后根据"系统 × 显卡"对号入座:
| 系统 | 显卡 | 依赖安装命令 |
|---|---|---|
| Windows | N卡 | pip install -r requirements.txt |
| Windows | A卡/I卡 | pip install -r requirements-dml.txt |
| Linux | N卡 | pip install -r requirements.txt |
| Linux | A卡(ROCM) | pip install -r requirements-amd.txt |
| Linux | I卡(IPEX) | pip install -r requirements-ipex.txt |
| MacOS | 统一内存芯片 | sh ./run.sh(一条命令装完) |
小贴士:Windows 不熟命令行的话,直接下载项目提供的RVC-beta.7z整合包解压,双击go-web.bat就带完整环境,跳过下面所有步骤。
通用:先装 PyTorch
所有显卡第一步都一样,先装深度学习框架:
# 安装PyTorch核心包(N/A/I卡都需要) pip install torch torchvision torchaudioWindows + RTX 30 系(Ampere 架构)需要指定 CUDA 版本安装:
# RTX30系指定cu117版PyTorch pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117Windows:按显卡装依赖
拿到代码仓库(git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI)后,进入项目目录:
# N卡装这套 pip install -r requirements.txt # A卡/I卡改成这套 pip install -r requirements-dml.txtLinux:N卡之外的补充
A卡(ROCM)用户装完requirements-amd.txt后,个别型号(如 RX 6700XT)还要补环境变量:
# 部分A卡需要指定GFX版本并加入render/video用户组 export ROCM_PATH=/opt/rocm export HSA_OVERRIDE_GFX_VERSION=10.3.0 sudo usermod -aG render $USERNAME sudo usermod -aG video $USERNAMEI卡(IPEX)用户每次开终端先执行source /opt/intel/oneapi/setvars.sh。
下载预训练模型与 FFmpeg
RVC 要靠预训练模型才能工作。项目自带一键下载脚本,会按assets/目录结构自动放好文件(hubert 特征模型、v1/v2 预训练权重、UVR5 人声分离模型、RMVPE 音高模型):
# 一键下载全部预训练模型到assets目录 python tools/download_models.py检查点:看到输出All models downloaded!,且assets/hubert/、assets/pretrained/下有文件即算成功。
再装音频处理工具 FFmpeg:
| 系统 | 命令 |
|---|---|
| Ubuntu/Debian | sudo apt install ffmpeg |
| MacOS | brew install ffmpeg |
| Windows | 下载ffmpeg.exe、ffprobe.exe放到项目根目录 |
检查点:终端输入ffmpeg -version能打印版本信息。
跑起来:一条命令与成功标志
在项目根目录启动:
# 启动训练推理WebUI python infer-web.py浏览器会自动打开 Gradio 网页。看到"模型训练""UVR5人声提取""推理"等标签页,并且左侧已列出模型/设备信息,即算成功。实时变声模式单独启动:Windows 双击go-realtime-gui.bat,其他系统执行python gui_v1.py。
核心链路:从录音到成品音色
准备录音:录 10~50 分钟人声,要求同一人、底噪低、清晰(建议 WAV 格式)。检查点:音频总时长 ≥10 分钟。
人声分离:把歌曲/带背景音的录音丢进 UVR5 人声提取标签页,选出人声文件。检查点:输出目录出现纯人声的 wav 文件。
切分与训练:切分工具按 3.7 秒左右把长音频切成短段,然后在模型训练标签页选数据集、采样率(V2 选 40k)和版本,点一键训练。检查点:控制台依次出现数据集处理、F0 提取、特征提取日志,无红字报错。
生成索引:训练结束自动建索引;卡住就手动点"训练索引"按钮。检查点:logs/实验名/下出现added_*.index文件。
转换试听:在推理标签页选刚训练的音色,填入原唱/任意音频,转换。检查点:output/目录出现变声后的 wav,播放音色已替换。分享模型时给assets/weights/下 60MB+ 的 .pth 文件即可。
避坑手册
FFmpeg error / utf8 error现象:预处理阶段报 ffmpeg 或编码错误。 原因:音频路径带空格、括号,或中文路径写 filelist 失败。 解法:把音频挪到简短的英文路径下重试。
CUDA out of memory现象:训练或推理中途崩掉。 原因:显存不够(4G 以下风险高)。 解法:调小 batch_size;推理端改 configs/config.py 里的x_pad、x_query、x_center、x_max四个参数,数值越小越省显存。
训练完没有索引文件现象:日志显示训练完成,却没有added_*.index。 解法:点一次"训练索引"按钮手动生成;训练集太大时先减小规模。
不知道分享哪个文件现象:把logs/下几百 MB 的 pth 发给别人,对方推理报错。 解法:分享assets/weights/下 60MB+ 的 pth;logs 里的 pth 是实验状态,不是成品。
Connection Error / Expecting value现象:浏览器打不开界面或弹 JSON 解析错误。 解法:确认黑色控制台窗口没被关掉;关闭系统代理(客户端、服务端代理都要关)。
收尾清单
- 代码仓库 + 依赖 + 预训练模型 + FFmpeg,四样齐了才能启动;
- 启动成功标志 = 浏览器出现 Gradio 界面;
- 跑通顺序 = 分离 → 切分 → 训练 → 索引 → 推理。
参考资料:
- 常见问题:docs/cn/faq.md
- 更新日志:docs/cn/Changelog_CN.md
- 推理参数配置:configs/config.py
- 批量推理脚本:tools/infer_batch_rvc.py
- API 接口:api_240604.py
拿一段自己的录音,从分离做到推理走一遍,今天就能听到第一个属于你的变声效果。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考