news 2026/9/7 17:11:35

GPT-SoVITS:1 分钟录音完成语音克隆微调,原生输出 48kHz 高清语音

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
GPT-SoVITS:1 分钟录音完成语音克隆微调,原生输出 48kHz 高清语音

GPT-SoVITS:1 分钟录音完成语音克隆微调,原生输出 48kHz 高清语音

【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS

GPT-SoVITS 是一个少样本语音克隆项目:5 秒参考音频即可零样本合成人声,1 分钟录音微调后音色相似度显著提升。v4 版本直接输出 48kHz 音频,支持中、英、日、韩、粤五种语言,v2ProPlus 在 RTX 4090 上 RTF 低至 0.014。适合想给自己录播、给视频换配音、翻新旧音频的创作者和开发者。

先看效果:谁在什么场景下用它

  • 短视频/播客口播:创作者录 1 分钟自己的声音做一次微调,之后口播脚本直接交给模型生成,48k 成品交付前不用再跑升采样。
  • 跨语言配音:用中文素材训好一个音色,推理时把文本切到日语、韩语或英语,同一个声音读多语言内容,配音成本从"找配音员"降到"改文本"。
  • 旧音频翻新:影视二创和配音修复时,用 WebUI 内置的 UVR5 人声分离、自动切分和 ASR 标注把老素材整理成训练集,再合成一条干净的替代配音。

安装与启动

环境门槛不高:conda + Python 3.10,N 卡走 CUDA 12.6/12.8,也兼容 ROCm、MPS 和纯 CPU。

git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF

参数这样选:

  • --device按硬件取 CU126/CU128/ROCM/MPS/CPU,N 卡按你装好的 CUDA 版本选。
  • --source取 HF/HF-Mirror/ModelScope,国内网络建议 ModelScope,下载更稳。
  • 想顺带下人声分离权重,就加--download-uvr5
  • 装完后确认 GPT_SoVITS/pretrained_models/ 下有gsv-v4-pretrained/s2Gv4.pthvocoder.pth,v4 推理靠这两个文件。

如何完成第一次语音克隆:最小闭环三步

  1. 启动:运行python webui.py,浏览器打开http://127.0.0.1:9874,进入推理页面。
  2. 填参数:模型下拉框选 v4,上传一段 5 秒左右、无背景音的参考音频,选择目标语言并输入待合成文本。
  3. 合成试听:点击合成,等待生成,试听输出。5 秒参考音频就能零样本克隆音色,整条链路是否跑通以这一步为准。

原理速览:只讲三个关键点

  • 48k 干净音质来自整数倍上采样:v4 声码器的上采样链全是整数倍(GPT_SoVITS/configs/s2v2ProPlus.json 中upsample_rates为 10×8×2×2×2),从根上消除了 v3 非整数倍上采样引入的金属音,BigVGAN 直接产出 48k,取代 v3 的 24k 输出。
  • 两段式分工 + 更大预训练语料:GPT 部分负责语义与韵律,SoVITS 部分负责声学细节;预训练语料从 2k 小时扩到 5k 小时,所以 1 分钟数据的少样本效果明显好于零样本。
  • 半精度默认开启:GPT_SoVITS/configs/tts_infer.yaml 里is_half在较新显卡上默认 true,推理更快、显存占用更低。

进阶调优:按情况选参数

你的情况怎么选
训练集音质干净、追求保真模型下拉框选 v4,音色保真、高频最干净
训练集音质一般、怕翻车改选 v2Pro 系列,官方口径音质接近 v4,硬件占用和速度等同 v2,更稳
显卡较新(SM 6.1 以上)保持is_half半精度开启,推理更快
显存吃紧报 OOM关闭半精度改 FP32 跑,或换更大显存的卡
纯 CPU 无 GPU用 GPT_SoVITS/export_torch_script.py 导出优化模型再推理;长文本分段合成,参考音频保持 5 秒左右

常见问题速查

  • 音色下拉框为空→ 预训练模型缺失或放错目录 → 检查 GPT_SoVITS/pretrained_models/ 是否含对应版本的.pth/.ckpt文件。
  • 提示未找到显卡、自动退回 CPU→ 驱动或 CUDA 缺失 → 装好 N 卡驱动,或显式指定--device CPU接受 CPU 速度。
  • 合成有金属音→ 还在用 v3 权重或非整数倍上采样配置 → 换 v4 并重新下载vocoder.pth
  • v3/v4 训练效果不如 v2→ v3/v4 对训练数据质量挑剔 → 先做分离降噪,或改用 v2Pro 系列。
  • Mac 上训出的模型质量偏低→ 已知现象 → 官方建议 Mac 用户用 CPU 模式训练。
  • 显存溢出→ 显存不足 → 关闭半精度或换更大显存的卡,CPU 训练只建议少量数据试跑。

下一步

先用 5 秒参考音频跑通零样本合成,确认链路无误;再准备 1 分钟干净人声做微调,对比零样本与微调的相似度差异。升级版本前扫一眼 docs/en/Changelog_EN.md,确认你的权重和配置仍然兼容。

【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 17:10:05

智能化测试落地实战:从体系搭建到团队内训的完整指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 17:09:51

QMK 开发环境搭建指南:从第一条命令到编译出第一个 .hex

QMK 开发环境搭建指南:从第一条命令到编译出第一个 .hex 【免费下载链接】qmk_firmware Open-source keyboard firmware for Atmel AVR and Arm USB families 项目地址: https://gitcode.com/GitHub_Trending/qm/qmk_firmware 这篇指南带你从零搭好 QMK 开发…

作者头像 李华
网站建设 2026/9/7 17:09:21

Unity游戏角色镜像技术:从Sprite到骨骼动画的完整实现方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 17:09:12

嵌入式固件核心三要素:启动流程、故障定位与OTA升级

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 17:06:50

AgentScope 2.0实战:从零搭建多智能体协作应用全指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 17:04:48

AI Agent驱动的用户回放分析:从行为证据链到转化率优化

做用户回放分析的人都知道,这活儿表面上是在看录屏,实际上是在做“考古”——从一堆鼠标轨迹和点击热力里,还原用户当时到底在想什么,为什么走到了这一步却突然放弃。传统的回放工具能告诉你“用户在哪个页面停留最久”“哪里点击…

作者头像 李华