5分钟上手KittenTTS:轻量级多语言TTS从安装到语音风格切换
【免费下载链接】KittenTTSState-of-the-art TTS model under 25MB 😻项目地址: https://gitcode.com/gh_mirrors/ki/KittenTTS
KittenTTS 是一个开源文本转语音库:模型文件最小仅 25MB,纯 CPU 即可运行,内置 8 个可切换音色,是多语言语音合成场景里上手成本很低的工具。
一个场景:先要出配音,再决定用什么引擎
你在给产品页做多语言配音,或者只是想快速听一段外语朗读。用商业 API 要申请密钥、算计费、依赖网络;用本地大模型,几个 GB 显存先摆在那里,还要有 GPU。
KittenTTS 适合这种场合:它基于 ONNX 推理,CPU 就能跑完整合成流程,最小的 nano 模型磁盘占用只有 25MB。项目官方路线图明确列出了多语言模型,当前版本以英文合成为主,多语言支持是接下来的方向。
KittenTTS 能力盘点:语言、音色与模型体积
| 维度 | 内容 |
|---|---|
| 语言范围 | 当前版本以英文为主,多语言合成在官方路线图中 |
| 内置音色 | 8 个:Bella、Jasper、Luna、Bruno、Rosie、Hugo、Kiki、Leo |
| 语音风格 | 通过voice参数按调用切换音色与表达方式 |
| 模型体积 | 25MB(nano int8)/ 41MB(micro)/ 80MB(mini) |
| 运行环境 | CPU 即可,无需 GPU,输出 24kHz 音频 |
音色列表与模型加载逻辑在 kittentts/get_model.py 里,也可以直接读model.available_voices拿到全部音色名。
上手路径:装好环境,跑通第一段语音,再换风格
装好环境
准备一个 Python 3.8+ 的独立虚拟环境,安装依赖很少,主要是 ONNX Runtime 这一类库:
pip install kittentts跑通第一段语音
首次运行会从远端下载模型文件并缓存到本地,之后直接走缓存。下面这段代码就能出音频:
from kittentts import KittenTTS m = KittenTTS("KittenML/kitten-tts-mini-0.8") audio = m.generate("Hello, this is KittenTTS.", voice="Jasper") import soundfile as sf sf.write("output.wav", audio, 24000)generate返回 24kHz 的音频数组,交给任意播放器就能听;也可以用m.generate_to_file直接写文件,仓库里的 example.py 是完整可运行的示例。
换语言与换风格
换音色只需把voice参数换成另一个名字:8 个音色里 4 男 4 女,Jasper、Bruno 偏男声,Luna、Rosie 偏女声。调语速传speed参数,1.0 是默认速度,1.2 表示快 20%。整个过程不需要改配置文件,也不用重新加载模型。
调优与进阶:这几个参数值得知道
- 语速:
speed控制整体语速,模型配置里带各音色的速度先验,不同声音的基础节奏略有差异。 - 音调与音量:接口没有单独暴露这两项参数,靠音色选择加语速调节,或者对返回的音频数组做后处理。
- 风格选择:正式朗读和口语化播报建议用不同音色,8 个内置声音定位各不相同,听一遍再定。
- 自定义训练:接口仍处于开发者预览阶段,训练专属音色可以走官方支持渠道;推理核心在 kittentts/onnx_model.py,方便二次开发。
🎯 避坑指南:三个高频问题的排查顺序
- 合成效果不稳、读中文文本表现差→ 原因:当前版本的音素处理按英文流程构建 → 先用英文文本验证流程,多语言能力以官方新模型为准。
- 音质明显不如预期→ 原因:用了 25MB 的 int8 量化 nano 模型 → 换 41MB 的 micro 或 80MB 的 mini,听感差距比较明显。
- 首次运行等待很久→ 原因:模型文件要先下载再加载 → 下载完成后有本地缓存,第二次运行很快;网络中断时重新运行即可续传。
机器有 GPU 的话,也可以按仓库的 GPU 依赖安装并启用 cuda 后端,批量合成时速度更快。
结语
到这里,跑通的门槛已经很低:现在打开终端装好依赖,执行上面那段代码,几分钟内就能拿到第一段音频。下一步把 8 个音色挨个切换一遍,风格选择空间就一目了然了。
【免费下载链接】KittenTTSState-of-the-art TTS model under 25MB 😻项目地址: https://gitcode.com/gh_mirrors/ki/KittenTTS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考