news 2026/9/15 19:18:18

GPT-SoVITS 声音克隆 TTS 六版本选型指南:v1 到 v2ProPlus,三分钟挑对版本

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
GPT-SoVITS 声音克隆 TTS 六版本选型指南:v1 到 v2ProPlus,三分钟挑对版本

GPT-SoVITS 声音克隆 TTS 六版本选型指南:v1 到 v2ProPlus,三分钟挑对版本

【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS

GPT-SoVITS 是一款开源的声音克隆 TTS 工具,1 分钟人声就能微调出高相似度的专属语音模型,目前分 v1、v2、v3、v4、v2Pro、v2ProPlus 六条线。直接给结论:大多数场景选 v2ProPlus;显存低、训练录音音质一般的,选 v2 最稳。

选型速查:按你的画像对号入座

你是谁推荐版本一句话理由
纯新手、低配显卡,先跑通流程v2教程最多、显存最省、生态最成熟
高显存(≥12GB),要音质和相似度上限v4原生 48kHz、无金属音,作者认证的 v3 替代品
手机录音、训练集有底噪v2 / v2Pro这个谱系对平均音质偏低的语料容忍度明显更高
直播、实时对话,要快v2ProPlus推理速度极低,还带流式推理
已有 v3 训练产物v4无损替换,v3 不用继续投入

六版本核心差异一张表

维度v1v2v3v4v2Pro / Plus
支持语种中/英/日加韩/粤同 v2同 v2同 v2
预训练规模2k 小时5k 小时v3 级底模与 v3 共用 GPT 底模与 v3 共用 GPT 底模
原生输出采样率32kHz32kHz24kHz48kHz32kHz
训练显存高(LoRA 约 8GB 起)中等
音色更像整个训练集整个训练集参考音频参考音频整个训练集
低质量训练集尚可较好不推荐不推荐较好
教程/生态最多快速积累中

表格里装不下的四件事:

  • v4 相对 v3 只换了 SoVITS 声码器一侧:从 config.py 能看到 v3 和 v4 的 GPT 底模都是同一个s1v3.ckpt,区别在输出端。
  • v2Pro 与 v2ProPlus 同族,Plus 推理更快,实测 RTF 4090 约 0.014,4 分钟音频几秒合成完。
  • 各版本训练产物按目录隔离(SoVITS_weightsSoVITS_weights_v2ProPlus六个),互不覆盖,可同环境共存。
  • v3 已不再是新项目的合理选择,它只服务于"已经训了 v3 想继续"的人。

三组拆开看:轻量入门、高音质、性价比

轻量入门组:v1 和 v2

共同点:显存门槛低、32kHz 输出、音色贴合整个训练集,对平均音质一般的语料更友好。v1 是 2k 小时语料的开山版,只支持中/英/日,已停更,新项目直接忽略。v2 升级:加韩语/粤语、底模扩到 5k 小时、文本前端重做,多音字和中英混读更准,低音质参考音频的可用度也上来了。适合老显卡和新手工练手。

⚠️ 典型坑:v2 做中文时要把 G2PWModel 解压后放进GPT_SoVITS/text目录,漏装这一步中文推理会直接失败。

高音质组:v3 和 v4

共同点:音色相似度上一个台阶(不训练直接推底模的提升最大),GPT 侧更稳、重复漏字更少、情绪表达更丰富,且新增 LoRA 微调,显存需求压到约 8GB。v4 的升级是定向修复:消掉 v3 非整数倍上采样带来的金属音,并原生输出 48kHz,声音不再闷糊。适合显存 12GB 以上、训练录音质量过关的用户。

⚠️ v3/v4 的音色更偏参考音频而非整个训练集,且对低质量语料效果反而更差;v3 原生 24kHz 听着发闷,v4 已根治。

性价比组:v2Pro 和 v2ProPlus

共同点:音质超过 v4,显存成本(比 v2 稍高)和推理速度回到 v2 水平,音色贴合整个训练集,并支持流式推理。两者共用 v3 的 GPT 底模,差别在 SoVITS 侧,Plus 的推理速度更快。适合直播、实时 TTS 这类既要快又要好的场景。坑:生态和第三方教程还不如 v2 丰富,照抄旧教程时参数对不上的概率高。

实操速记:换版本、找权重、认训练入口

git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS # 拉取代码 python webui.py v1 # 显式切 v1 界面;不加参数默认 v2 及以上 python GPT_SoVITS/inference_webui.py # 只开推理界面,版本在界面里切
  • 训练入口按谱系分:v1/v2 走 GPT_SoVITS/s2_train.py,v3/v4 走 GPT_SoVITS/s2_train_v3.py,v3 的 LoRA 训练在 GPT_SoVITS/s2_train_v3_lora.py。
  • 训练产物目录映射(v1→SoVITS_weights、v2→SoVITS_weights_v2,其余类推加_v3/_v4/_v2Pro/_v2ProPlus后缀),完整逻辑见 config.py。
  • 各版本预训练底模的路径默认注册在 GPT_SoVITS/TTS_infer_pack/TTS.py,推理参数模板在 GPT_SoVITS/configs/tts_infer.yaml,版本发布说明看 docs/cn/README.md。

FAQ:新手必踩的四个坑

Q1:v2 训的模型能直接拿到 v4 或 v2Pro 上推理吗?不能。训练产物按版本分目录、模型不互通;只有pretrained_models里的预训练底模是共用的。换版本等于重新训练。

Q2:显存只有 8GB,v3/v4 完全跑不了吗?能走 v3 的 LoRA 微调路线,约 8GB 可完成;全量微调建议 12GB 起。再低就换 v2/v2Pro。

Q3:怎么确认我手里的预训练权重是哪个版本?GPT_SoVITS/pretrained_models/下的子目录:s2G488k.pth是 v1,gsv-v2final-pretrained/是 v2,s2Gv3.pth是 v3,gsv-v4-pretrained/是 v4,v2Pro/是 Pro 系列。

Q4:为什么 v3 听着比 v4 闷?v3 原生只出 24kHz,高频直接丢了;v4 改整数倍上采样并原生 48kHz,顺带把金属音也清掉了。

一句话总结

低配先跑 v2,高配直接 v4,要速度又要音质就 v2ProPlus——记住这三句,版本选型不会翻车。

【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/15 19:17:47

Unity角色口型同步与眼神模拟:SALSA With RandomEyes实战调优指南

学过几年Unity动画,接手过不少数字人、对话NPC的项目,我敢说在“让角色开口说话”这件事上,最让我省心的方案就是SALSA With RandomEyes。这个插件从名字就能看出来,它干两件事:SALSA负责说话时的口型同步,…

作者头像 李华