GPT-SoVITS 声音克隆 TTS 六版本选型指南:v1 到 v2ProPlus,三分钟挑对版本
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
GPT-SoVITS 是一款开源的声音克隆 TTS 工具,1 分钟人声就能微调出高相似度的专属语音模型,目前分 v1、v2、v3、v4、v2Pro、v2ProPlus 六条线。直接给结论:大多数场景选 v2ProPlus;显存低、训练录音音质一般的,选 v2 最稳。
选型速查:按你的画像对号入座
| 你是谁 | 推荐版本 | 一句话理由 |
|---|---|---|
| 纯新手、低配显卡,先跑通流程 | v2 | 教程最多、显存最省、生态最成熟 |
| 高显存(≥12GB),要音质和相似度上限 | v4 | 原生 48kHz、无金属音,作者认证的 v3 替代品 |
| 手机录音、训练集有底噪 | v2 / v2Pro | 这个谱系对平均音质偏低的语料容忍度明显更高 |
| 直播、实时对话,要快 | v2ProPlus | 推理速度极低,还带流式推理 |
| 已有 v3 训练产物 | v4 | 无损替换,v3 不用继续投入 |
六版本核心差异一张表
| 维度 | v1 | v2 | v3 | v4 | v2Pro / Plus |
|---|---|---|---|---|---|
| 支持语种 | 中/英/日 | 加韩/粤 | 同 v2 | 同 v2 | 同 v2 |
| 预训练规模 | 2k 小时 | 5k 小时 | v3 级底模 | 与 v3 共用 GPT 底模 | 与 v3 共用 GPT 底模 |
| 原生输出采样率 | 32kHz | 32kHz | 24kHz | 48kHz | 32kHz |
| 训练显存 | 低 | 低 | 高(LoRA 约 8GB 起) | 高 | 中等 |
| 音色更像 | 整个训练集 | 整个训练集 | 参考音频 | 参考音频 | 整个训练集 |
| 低质量训练集 | 尚可 | 较好 | 不推荐 | 不推荐 | 较好 |
| 教程/生态 | 多 | 最多 | 多 | 中 | 快速积累中 |
表格里装不下的四件事:
- v4 相对 v3 只换了 SoVITS 声码器一侧:从 config.py 能看到 v3 和 v4 的 GPT 底模都是同一个
s1v3.ckpt,区别在输出端。 - v2Pro 与 v2ProPlus 同族,Plus 推理更快,实测 RTF 4090 约 0.014,4 分钟音频几秒合成完。
- 各版本训练产物按目录隔离(
SoVITS_weights到SoVITS_weights_v2ProPlus六个),互不覆盖,可同环境共存。 - v3 已不再是新项目的合理选择,它只服务于"已经训了 v3 想继续"的人。
三组拆开看:轻量入门、高音质、性价比
轻量入门组:v1 和 v2
共同点:显存门槛低、32kHz 输出、音色贴合整个训练集,对平均音质一般的语料更友好。v1 是 2k 小时语料的开山版,只支持中/英/日,已停更,新项目直接忽略。v2 升级:加韩语/粤语、底模扩到 5k 小时、文本前端重做,多音字和中英混读更准,低音质参考音频的可用度也上来了。适合老显卡和新手工练手。
⚠️ 典型坑:v2 做中文时要把 G2PWModel 解压后放进
GPT_SoVITS/text目录,漏装这一步中文推理会直接失败。
高音质组:v3 和 v4
共同点:音色相似度上一个台阶(不训练直接推底模的提升最大),GPT 侧更稳、重复漏字更少、情绪表达更丰富,且新增 LoRA 微调,显存需求压到约 8GB。v4 的升级是定向修复:消掉 v3 非整数倍上采样带来的金属音,并原生输出 48kHz,声音不再闷糊。适合显存 12GB 以上、训练录音质量过关的用户。
⚠️ v3/v4 的音色更偏参考音频而非整个训练集,且对低质量语料效果反而更差;v3 原生 24kHz 听着发闷,v4 已根治。
性价比组:v2Pro 和 v2ProPlus
共同点:音质超过 v4,显存成本(比 v2 稍高)和推理速度回到 v2 水平,音色贴合整个训练集,并支持流式推理。两者共用 v3 的 GPT 底模,差别在 SoVITS 侧,Plus 的推理速度更快。适合直播、实时 TTS 这类既要快又要好的场景。坑:生态和第三方教程还不如 v2 丰富,照抄旧教程时参数对不上的概率高。
实操速记:换版本、找权重、认训练入口
git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS # 拉取代码 python webui.py v1 # 显式切 v1 界面;不加参数默认 v2 及以上 python GPT_SoVITS/inference_webui.py # 只开推理界面,版本在界面里切- 训练入口按谱系分:v1/v2 走 GPT_SoVITS/s2_train.py,v3/v4 走 GPT_SoVITS/s2_train_v3.py,v3 的 LoRA 训练在 GPT_SoVITS/s2_train_v3_lora.py。
- 训练产物目录映射(v1→
SoVITS_weights、v2→SoVITS_weights_v2,其余类推加_v3/_v4/_v2Pro/_v2ProPlus后缀),完整逻辑见 config.py。 - 各版本预训练底模的路径默认注册在 GPT_SoVITS/TTS_infer_pack/TTS.py,推理参数模板在 GPT_SoVITS/configs/tts_infer.yaml,版本发布说明看 docs/cn/README.md。
FAQ:新手必踩的四个坑
Q1:v2 训的模型能直接拿到 v4 或 v2Pro 上推理吗?不能。训练产物按版本分目录、模型不互通;只有pretrained_models里的预训练底模是共用的。换版本等于重新训练。
Q2:显存只有 8GB,v3/v4 完全跑不了吗?能走 v3 的 LoRA 微调路线,约 8GB 可完成;全量微调建议 12GB 起。再低就换 v2/v2Pro。
Q3:怎么确认我手里的预训练权重是哪个版本?看GPT_SoVITS/pretrained_models/下的子目录:s2G488k.pth是 v1,gsv-v2final-pretrained/是 v2,s2Gv3.pth是 v3,gsv-v4-pretrained/是 v4,v2Pro/是 Pro 系列。
Q4:为什么 v3 听着比 v4 闷?v3 原生只出 24kHz,高频直接丢了;v4 改整数倍上采样并原生 48kHz,顺带把金属音也清掉了。
一句话总结
低配先跑 v2,高配直接 v4,要速度又要音质就 v2ProPlus——记住这三句,版本选型不会翻车。
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考