news 2026/9/2 10:41:51

RVC快速上手:10分钟语音训练AI变声模型的完整部署指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RVC快速上手:10分钟语音训练AI变声模型的完整部署指南

RVC快速上手:10分钟语音训练AI变声模型的完整部署指南

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

想让视频角色、游戏语音换成自己的专属音色?RVC(Retrieval-based-Voice-Conversion-WebUI)是一个基于VITS的AI变声框架:准备约10分钟的低底噪语音,就能训练出可复用的变声模型,网页里一键完成"分离-切分-训练-转换"全流程。零基础照做,大约1小时跑通,训练1个模型再等10~20分钟。

它凭什么好用

  • 训练数据只要10分钟:低底噪语音即可,远低于传统方案动辄几小时的要求
  • 实时延迟170ms:端到端延迟已做到170ms,换ASIO声卡设备可压到90ms,直播、语音房都够用
  • 跨平台、显存门槛低:Windows/Linux/MacOS全覆盖,A卡、I卡有专用加速路径,4G显存起步可训练
指标数值说明
最少训练数据10分钟越长越好,50分钟内效果最稳
实时变声延迟170ms(ASIO可达90ms)端到端
训练显存门槛约4G更低显存只建议跑推理

装环境:先看这张选路表

先确认系统里装了Python 3.8 或更高版本(终端输入python --version查看)。然后根据"系统 × 显卡"对号入座:

系统显卡依赖安装命令
WindowsN卡pip install -r requirements.txt
WindowsA卡/I卡pip install -r requirements-dml.txt
LinuxN卡pip install -r requirements.txt
LinuxA卡(ROCM)pip install -r requirements-amd.txt
LinuxI卡(IPEX)pip install -r requirements-ipex.txt
MacOS统一内存芯片sh ./run.sh(一条命令装完)

小贴士:Windows 不熟命令行的话,直接下载项目提供的RVC-beta.7z整合包解压,双击go-web.bat就带完整环境,跳过下面所有步骤。

通用:先装 PyTorch

所有显卡第一步都一样,先装深度学习框架:

# 安装PyTorch核心包(N/A/I卡都需要) pip install torch torchvision torchaudio

Windows + RTX 30 系(Ampere 架构)需要指定 CUDA 版本安装:

# RTX30系指定cu117版PyTorch pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117

Windows:按显卡装依赖

拿到代码仓库(git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI)后,进入项目目录:

# N卡装这套 pip install -r requirements.txt # A卡/I卡改成这套 pip install -r requirements-dml.txt

Linux:N卡之外的补充

A卡(ROCM)用户装完requirements-amd.txt后,个别型号(如 RX 6700XT)还要补环境变量:

# 部分A卡需要指定GFX版本并加入render/video用户组 export ROCM_PATH=/opt/rocm export HSA_OVERRIDE_GFX_VERSION=10.3.0 sudo usermod -aG render $USERNAME sudo usermod -aG video $USERNAME

I卡(IPEX)用户每次开终端先执行source /opt/intel/oneapi/setvars.sh

下载预训练模型与 FFmpeg

RVC 要靠预训练模型才能工作。项目自带一键下载脚本,会按assets/目录结构自动放好文件(hubert 特征模型、v1/v2 预训练权重、UVR5 人声分离模型、RMVPE 音高模型):

# 一键下载全部预训练模型到assets目录 python tools/download_models.py

检查点:看到输出All models downloaded!,且assets/hubert/assets/pretrained/下有文件即算成功。

再装音频处理工具 FFmpeg:

系统命令
Ubuntu/Debiansudo apt install ffmpeg
MacOSbrew install ffmpeg
Windows下载ffmpeg.exeffprobe.exe放到项目根目录

检查点:终端输入ffmpeg -version能打印版本信息。

跑起来:一条命令与成功标志

在项目根目录启动:

# 启动训练推理WebUI python infer-web.py

浏览器会自动打开 Gradio 网页。看到"模型训练""UVR5人声提取""推理"等标签页,并且左侧已列出模型/设备信息,即算成功。实时变声模式单独启动:Windows 双击go-realtime-gui.bat,其他系统执行python gui_v1.py

核心链路:从录音到成品音色

准备录音:录 10~50 分钟人声,要求同一人、底噪低、清晰(建议 WAV 格式)。检查点:音频总时长 ≥10 分钟。

人声分离:把歌曲/带背景音的录音丢进 UVR5 人声提取标签页,选出人声文件。检查点:输出目录出现纯人声的 wav 文件。

切分与训练:切分工具按 3.7 秒左右把长音频切成短段,然后在模型训练标签页选数据集、采样率(V2 选 40k)和版本,点一键训练。检查点:控制台依次出现数据集处理、F0 提取、特征提取日志,无红字报错。

生成索引:训练结束自动建索引;卡住就手动点"训练索引"按钮。检查点logs/实验名/下出现added_*.index文件。

转换试听:在推理标签页选刚训练的音色,填入原唱/任意音频,转换。检查点output/目录出现变声后的 wav,播放音色已替换。分享模型时给assets/weights/下 60MB+ 的 .pth 文件即可。

避坑手册

FFmpeg error / utf8 error现象:预处理阶段报 ffmpeg 或编码错误。 原因:音频路径带空格、括号,或中文路径写 filelist 失败。 解法:把音频挪到简短的英文路径下重试。

CUDA out of memory现象:训练或推理中途崩掉。 原因:显存不够(4G 以下风险高)。 解法:调小 batch_size;推理端改 configs/config.py 里的x_padx_queryx_centerx_max四个参数,数值越小越省显存。

训练完没有索引文件现象:日志显示训练完成,却没有added_*.index。 解法:点一次"训练索引"按钮手动生成;训练集太大时先减小规模。

不知道分享哪个文件现象:把logs/下几百 MB 的 pth 发给别人,对方推理报错。 解法:分享assets/weights/下 60MB+ 的 pth;logs 里的 pth 是实验状态,不是成品。

Connection Error / Expecting value现象:浏览器打不开界面或弹 JSON 解析错误。 解法:确认黑色控制台窗口没被关掉;关闭系统代理(客户端、服务端代理都要关)。

收尾清单

  1. 代码仓库 + 依赖 + 预训练模型 + FFmpeg,四样齐了才能启动;
  2. 启动成功标志 = 浏览器出现 Gradio 界面;
  3. 跑通顺序 = 分离 → 切分 → 训练 → 索引 → 推理。

参考资料:

  • 常见问题:docs/cn/faq.md
  • 更新日志:docs/cn/Changelog_CN.md
  • 推理参数配置:configs/config.py
  • 批量推理脚本:tools/infer_batch_rvc.py
  • API 接口:api_240604.py

拿一段自己的录音,从分离做到推理走一遍,今天就能听到第一个属于你的变声效果。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 10:41:47

弱模型生成内容如何避免“失礼”?提示词与管线优化实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/2 10:41:38

Obsidian多端同步方案全解析:从WebDAV到Git的选型指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/2 10:39:49

ZYNQ自定义AXI-FULL IP核设计:实现PS与PL双向高速数据交互

简介&#xff1a;本资源是面向ZYNQ SoC开发者与FPGA高级工程师的实战型工程包&#xff0c;聚焦PS与PL间高速双向通信这一核心难点&#xff0c;提供基于AXI-FULL协议的自定义IP完整实现方案。资源包含1261个文件&#xff0c;涵盖277个C头文件、221个C源码、78个Verilog模块&…

作者头像 李华
网站建设 2026/9/2 10:39:39

Python数据分析实战:从爬虫到可视化的二手房市场研究

简介&#xff1a;本资源是一套完整的南京二手房数据分析实战项目&#xff0c;面向Python初学者、数据科学入门者及计算机专业本科毕业设计或期末大作业需求者&#xff0c;聚焦真实房产数据采集、清洗、可视化与聚类建模全流程。压缩包共157个文件&#xff08;40.04MB&#xff0…

作者头像 李华
网站建设 2026/9/2 10:39:19

Excel数据透视表与函数实战:从表格规范到完整数据处理流程

Excel 是职场里用量最大、但系统学习比例最低的工具之一。很多人在处理报表时只会手动敲数、逐个求和&#xff0c;遇到跨表汇总、条件统计、按月份聚合这类需求时&#xff0c;要么求助同事&#xff0c;要么临时搜索函数公式&#xff0c;结果往往是复制过来能跑&#xff0c;换一…

作者头像 李华
网站建设 2026/9/2 10:38:00

基于SpringBoot的大学宿舍楼公用物品借还管理系统(程序+文档+讲解)

温馨提示&#xff1a;本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片&#xff01; 温馨提示&#xff1a;本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片&#xff01; 温馨提示&#xff1a;本人主页置顶文章(点我)开头有 CSDN 平台…

作者头像 李华