GPT-SoVITS:1 分钟录音完成语音克隆微调,原生输出 48kHz 高清语音
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
GPT-SoVITS 是一个少样本语音克隆项目:5 秒参考音频即可零样本合成人声,1 分钟录音微调后音色相似度显著提升。v4 版本直接输出 48kHz 音频,支持中、英、日、韩、粤五种语言,v2ProPlus 在 RTX 4090 上 RTF 低至 0.014。适合想给自己录播、给视频换配音、翻新旧音频的创作者和开发者。
先看效果:谁在什么场景下用它
- 短视频/播客口播:创作者录 1 分钟自己的声音做一次微调,之后口播脚本直接交给模型生成,48k 成品交付前不用再跑升采样。
- 跨语言配音:用中文素材训好一个音色,推理时把文本切到日语、韩语或英语,同一个声音读多语言内容,配音成本从"找配音员"降到"改文本"。
- 旧音频翻新:影视二创和配音修复时,用 WebUI 内置的 UVR5 人声分离、自动切分和 ASR 标注把老素材整理成训练集,再合成一条干净的替代配音。
安装与启动
环境门槛不高:conda + Python 3.10,N 卡走 CUDA 12.6/12.8,也兼容 ROCm、MPS 和纯 CPU。
git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF参数这样选:
--device按硬件取 CU126/CU128/ROCM/MPS/CPU,N 卡按你装好的 CUDA 版本选。--source取 HF/HF-Mirror/ModelScope,国内网络建议 ModelScope,下载更稳。- 想顺带下人声分离权重,就加
--download-uvr5。 - 装完后确认 GPT_SoVITS/pretrained_models/ 下有
gsv-v4-pretrained/s2Gv4.pth与vocoder.pth,v4 推理靠这两个文件。
如何完成第一次语音克隆:最小闭环三步
- 启动:运行
python webui.py,浏览器打开http://127.0.0.1:9874,进入推理页面。 - 填参数:模型下拉框选 v4,上传一段 5 秒左右、无背景音的参考音频,选择目标语言并输入待合成文本。
- 合成试听:点击合成,等待生成,试听输出。5 秒参考音频就能零样本克隆音色,整条链路是否跑通以这一步为准。
原理速览:只讲三个关键点
- 48k 干净音质来自整数倍上采样:v4 声码器的上采样链全是整数倍(GPT_SoVITS/configs/s2v2ProPlus.json 中
upsample_rates为 10×8×2×2×2),从根上消除了 v3 非整数倍上采样引入的金属音,BigVGAN 直接产出 48k,取代 v3 的 24k 输出。 - 两段式分工 + 更大预训练语料:GPT 部分负责语义与韵律,SoVITS 部分负责声学细节;预训练语料从 2k 小时扩到 5k 小时,所以 1 分钟数据的少样本效果明显好于零样本。
- 半精度默认开启:GPT_SoVITS/configs/tts_infer.yaml 里
is_half在较新显卡上默认 true,推理更快、显存占用更低。
进阶调优:按情况选参数
| 你的情况 | 怎么选 |
|---|---|
| 训练集音质干净、追求保真 | 模型下拉框选 v4,音色保真、高频最干净 |
| 训练集音质一般、怕翻车 | 改选 v2Pro 系列,官方口径音质接近 v4,硬件占用和速度等同 v2,更稳 |
| 显卡较新(SM 6.1 以上) | 保持is_half半精度开启,推理更快 |
| 显存吃紧报 OOM | 关闭半精度改 FP32 跑,或换更大显存的卡 |
| 纯 CPU 无 GPU | 用 GPT_SoVITS/export_torch_script.py 导出优化模型再推理;长文本分段合成,参考音频保持 5 秒左右 |
常见问题速查
- 音色下拉框为空→ 预训练模型缺失或放错目录 → 检查 GPT_SoVITS/pretrained_models/ 是否含对应版本的
.pth/.ckpt文件。 - 提示未找到显卡、自动退回 CPU→ 驱动或 CUDA 缺失 → 装好 N 卡驱动,或显式指定
--device CPU接受 CPU 速度。 - 合成有金属音→ 还在用 v3 权重或非整数倍上采样配置 → 换 v4 并重新下载
vocoder.pth。 - v3/v4 训练效果不如 v2→ v3/v4 对训练数据质量挑剔 → 先做分离降噪,或改用 v2Pro 系列。
- Mac 上训出的模型质量偏低→ 已知现象 → 官方建议 Mac 用户用 CPU 模式训练。
- 显存溢出→ 显存不足 → 关闭半精度或换更大显存的卡,CPU 训练只建议少量数据试跑。
下一步
先用 5 秒参考音频跑通零样本合成,确认链路无误;再准备 1 分钟干净人声做微调,对比零样本与微调的相似度差异。升级版本前扫一眼 docs/en/Changelog_EN.md,确认你的权重和配置仍然兼容。
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考