Voicebox上手指南:本地声音克隆与语音生成,从几秒音频到能用的声音
【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voicebox
Voicebox 是一个开源的本地 AI 声音克隆工作室:几秒人声就能克隆出一个可用音色,配合 7 个 TTS 引擎在本地生成 23 种语言的语音。做旁白、播客、听写、给 Agent 接语音的开发者都适用,模型和数据全程不出你的电脑。
为什么值得试试
- 全本地运行:模型、声音样本、录音都存在你自己机器上,隐私问题从根上不存在
- 输入输出两头都管:一边是 TTS 生成和声音克隆,一边是全局听写加 Whisper 本地转写,声音 I/O 的完整闭环在一个应用里
- 7 个 TTS 引擎随便切:Qwen3-TTS、Chatterbox Multilingual、LuxTTS、HumeAI TADA 等,按场景换引擎,低配机器用 LuxTTS 约 1GB 显存就能跑
- API-first 设计:REST API 加内置 MCP 服务器,克隆出来的声音可以直接给你的智能体当嘴巴
三分钟跑起来
桌面端提供 macOS(DMG)和 Windows(MSI)安装包,Linux 用 Docker 三条命令即可:
git clone https://gitcode.com/GitHub_Trending/voicebox1/voicebox cd voicebox docker compose up| 系统 | 加速方式 |
|---|---|
| macOS | MLX / Metal |
| Windows / Linux | NVIDIA CUDA、AMD ROCm、Intel Arc |
| 无独显 | 纯 CPU 也能跑(LuxTTS 约 1GB 显存档) |
启动后照着 快速开始文档 建第一个声音档案:Voices 标签页里新建档案,上传或录制 10~30 秒清晰人声,保存,就能开始生成。
按场景对号入座
配音总缺个自己的声音?几秒音频克隆一个 🎙️
核心能力就是零样本声音克隆:一段参考音频,之后任意文本都能用它朗读。
- Voices 标签页点New Voice,填名称和语言,再上传、录制或捕获一段 10~30 秒的参考音频,存成声音档案
- 不想克隆?有 50+ 个预设声音(Kokoro、Qwen CustomVoice 提供)直接选用
- 生成时按内容切引擎:综合质量选 Qwen3-TTS 1.7B,23 种语言覆盖选 Chatterbox Multilingual,长文本选 HumeAI TADA
- 引擎、档案、文本每次生成都可换,同一档案能反复复用
整本书想变有声书,5 万字符直接丢进去 📚
长文本不是问题:单次输入上限 50,000 字符,整章小说、整篇稿子直接粘贴。
- 文本自动按句子边界切分,每段独立生成后交叉淡化拼接,长文无感
- 分段逻辑认识缩写和中日韩标点,不会在奇怪的位置断句
- 生成走异步队列,提交后还能继续编辑下一条,互不阻塞
- History 里每次生成都保留"原始版本",换种子重录多条 Take、加星标收藏都行
短视频角色太机械?情绪标签加音效救场
机械念稿感靠两层"表演"解决,都在生成端就能出效果。
- Chatterbox Turbo 支持副语言标签:
[laugh][chuckle][gasp][sigh][groan][clear throat],文本框里敲/直接调出标签插入器 - 注意标签只对 Chatterbox Turbo 生效,其他引擎会把标签当文字念出来
- 8 种后期音效基于 Spotify 的 pedalboard 库:移调(最高 12 个半音)、混响、延迟、合唱、压缩、增益、高/低通滤波,生成后实时预览
- 内置 Robotic、Radio、Echo Chamber、Deep Voice 四个预设,还能自建并设为某个声音档案的默认
做多人播客和有声剧,用多轨时间线编排 🎬
Stories 编辑器是个类似 DAW 的多轨时间线,专门给对话、播客、叙事类内容用。
- 每个角色/讲者一条轨道,拖拽编排,自动播放头整体预览
- 时间线上直接裁剪、拆分音频片段
- 每段剪辑可锁定对应的生成版本,重生成不会打乱整片
- 适用:多主持播客、有声书(旁白加角色音)、游戏对话、广播剧,细节见 Stories Editor 文档
每天要写大量文字?全局听写解放双手
Voicebox 把"输入"半边也补上了:按住组合键说话、松手停止,Whisper 本地转写后自动粘进当前聚焦的文本框,macOS 下剪贴板原样保存恢复。
- 组合键可在设置里自定义,支持 push-to-talk 和 toggle 两种模式
- 本地 LLM 可自动清理口头语
- 每次听写自动存入 Captures,原始音频和文字稿成对保存,可重转写、编辑,还能一键升级为声音样本
- 流程细节见 听写文档
进阶:给 Agent 和你的应用接上嘴巴 🤖
Voicebox 后端本身就是一个服务(默认端口 17493),REST 和 MCP 两套入口都开箱即用。
curl -X POST http://127.0.0.1:17493/speak \ -H "X-Voicebox-Client-Id: my-script" \ -d '{"text": "部署完成。", "profile": "Morgan"}'MCP 侧一条命令接入 Claude Code,四个工具voicebox.speak、voicebox.transcribe、voicebox.list_captures、voicebox.list_profiles随即可用:
claude mcp add voicebox --transport http \ --url http://127.0.0.1:17493/mcp \ --header "X-Voicebox-Client-Id: claude-code"在 Settings → MCP 里给不同 Agent 绑定不同音色,听到声音就知道谁在说话;朗读时屏幕会浮现提示气泡,全程可见。工具实现见 mcp_server 源码,路由在 speak.py。
先跑通哪一个
| 你的情况 | 建议先跑通 | 原因 |
|---|---|---|
| 短视频 / 公众号创作者 | 克隆一个自己的声音,生成一条旁白 | 零样本克隆加情绪标签,最快出"人味儿"成片 |
| 播客 / 有声书作者 | 丢一章 5 万字符内的稿子进生成框 | 自动分段加多轨时间线,从稿件到成片一条龙 |
| 开发者 | REST 的/speak或 MCP 接入你的 Agent | 一条命令跑通,声音 I/O 直接进自己的应用 |
模型、声音数据、录音始终只留在你的机器上——把声音 I/O 的完整闭环交给本地硬件,就是 Voicebox 的全部意义。
【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voicebox
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考