news 2026/8/24 4:38:29

5分钟上手KittenTTS:轻量级多语言TTS从安装到语音风格切换

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
5分钟上手KittenTTS:轻量级多语言TTS从安装到语音风格切换

5分钟上手KittenTTS:轻量级多语言TTS从安装到语音风格切换

【免费下载链接】KittenTTSState-of-the-art TTS model under 25MB 😻项目地址: https://gitcode.com/gh_mirrors/ki/KittenTTS

KittenTTS 是一个开源文本转语音库:模型文件最小仅 25MB,纯 CPU 即可运行,内置 8 个可切换音色,是多语言语音合成场景里上手成本很低的工具。

一个场景:先要出配音,再决定用什么引擎

你在给产品页做多语言配音,或者只是想快速听一段外语朗读。用商业 API 要申请密钥、算计费、依赖网络;用本地大模型,几个 GB 显存先摆在那里,还要有 GPU。

KittenTTS 适合这种场合:它基于 ONNX 推理,CPU 就能跑完整合成流程,最小的 nano 模型磁盘占用只有 25MB。项目官方路线图明确列出了多语言模型,当前版本以英文合成为主,多语言支持是接下来的方向。

KittenTTS 能力盘点:语言、音色与模型体积

维度内容
语言范围当前版本以英文为主,多语言合成在官方路线图中
内置音色8 个:Bella、Jasper、Luna、Bruno、Rosie、Hugo、Kiki、Leo
语音风格通过voice参数按调用切换音色与表达方式
模型体积25MB(nano int8)/ 41MB(micro)/ 80MB(mini)
运行环境CPU 即可,无需 GPU,输出 24kHz 音频

音色列表与模型加载逻辑在 kittentts/get_model.py 里,也可以直接读model.available_voices拿到全部音色名。

上手路径:装好环境,跑通第一段语音,再换风格

装好环境

准备一个 Python 3.8+ 的独立虚拟环境,安装依赖很少,主要是 ONNX Runtime 这一类库:

pip install kittentts

跑通第一段语音

首次运行会从远端下载模型文件并缓存到本地,之后直接走缓存。下面这段代码就能出音频:

from kittentts import KittenTTS m = KittenTTS("KittenML/kitten-tts-mini-0.8") audio = m.generate("Hello, this is KittenTTS.", voice="Jasper") import soundfile as sf sf.write("output.wav", audio, 24000)

generate返回 24kHz 的音频数组,交给任意播放器就能听;也可以用m.generate_to_file直接写文件,仓库里的 example.py 是完整可运行的示例。

换语言与换风格

换音色只需把voice参数换成另一个名字:8 个音色里 4 男 4 女,Jasper、Bruno 偏男声,Luna、Rosie 偏女声。调语速传speed参数,1.0 是默认速度,1.2 表示快 20%。整个过程不需要改配置文件,也不用重新加载模型。

调优与进阶:这几个参数值得知道

  • 语速speed控制整体语速,模型配置里带各音色的速度先验,不同声音的基础节奏略有差异。
  • 音调与音量:接口没有单独暴露这两项参数,靠音色选择加语速调节,或者对返回的音频数组做后处理。
  • 风格选择:正式朗读和口语化播报建议用不同音色,8 个内置声音定位各不相同,听一遍再定。
  • 自定义训练:接口仍处于开发者预览阶段,训练专属音色可以走官方支持渠道;推理核心在 kittentts/onnx_model.py,方便二次开发。

🎯 避坑指南:三个高频问题的排查顺序

  • 合成效果不稳、读中文文本表现差→ 原因:当前版本的音素处理按英文流程构建 → 先用英文文本验证流程,多语言能力以官方新模型为准。
  • 音质明显不如预期→ 原因:用了 25MB 的 int8 量化 nano 模型 → 换 41MB 的 micro 或 80MB 的 mini,听感差距比较明显。
  • 首次运行等待很久→ 原因:模型文件要先下载再加载 → 下载完成后有本地缓存,第二次运行很快;网络中断时重新运行即可续传。

机器有 GPU 的话,也可以按仓库的 GPU 依赖安装并启用 cuda 后端,批量合成时速度更快。

结语

到这里,跑通的门槛已经很低:现在打开终端装好依赖,执行上面那段代码,几分钟内就能拿到第一段音频。下一步把 8 个音色挨个切换一遍,风格选择空间就一目了然了。

【免费下载链接】KittenTTSState-of-the-art TTS model under 25MB 😻项目地址: https://gitcode.com/gh_mirrors/ki/KittenTTS

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/24 4:36:24

2026年先降重还是先降AI?实操顺序实测清单

拿到初稿先别急着丢进查重系统。先降重还是先降AI,顺序搞反了,一晚上白干。这篇直接给结论和操作顺序,基于2026年主流工具的实际使用体验,不吹不黑。 两个操作到底在解决什么问题 降重和降AI,处理的是两码事。 降重…

作者头像 李华
网站建设 2026/8/24 4:35:01

基于SSM框架的Java火车票预售系统:从零搭建到核心功能实现

这次我们来看一个基于 SSM 框架的 Java 火车票预售系统。对于计算机专业的同学来说,毕业设计选题既要体现技术栈的完整性,又要具备实际的应用场景,这个火车票在线预订与退改签管理系统就是一个非常经典且实用的选择。它涵盖了 Java Web 开发的…

作者头像 李华
网站建设 2026/8/24 4:33:27

LLM智能体如何实现配置漂移的智能检测与风险评估

1. 项目概述:当LLM智能体遇上配置漂移在运维和DevOps的世界里,配置漂移(Configuration Drift)是个让人头疼的“慢性病”。想象一下,你精心设计并部署了一套服务,所有配置文件都像教科书一样标准。但几个月后…

作者头像 李华