电子书转有声书保姆级教程:ebook2audiobook 如何三步跑通,支持语音克隆与 1158 种语言
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
ebook2audiobook 是一款开源的电子书转有声书工具:把 EPUB、MOBI 或 PDF 丢进它的 Web 界面,就能得到带章节标记的 M4B 有声书。它支持语音克隆、OCR 识别扫描版、1158 种语言,最低 2GB 内存、1GB 显存就能跑。本文带你三步跑通完整流程。
🧩 拆解核心能力:24 种输入格式与 8 种 TTS 引擎
先说结论:它做的事,就是把文字变成带章节的音频,中间环节全部替你处理。
输入侧支持 EPUB、PDF、MOBI、AZW3、FB2、TXT、DOCX、HTML、RTF、ODT 等 24 种格式,完整清单在 lib/conf.py 的ebook_formats里。EPUB 和 MOBI 能自动识别章节结构,效果最好。扫描版 PDF、JPG、PNG、TIFF、BMP 也能处理——内置 OCR 会把图片里的文字认出来再合成:
输出侧有 m4b、mp3、flac、wav、ogg 等 10 种音频格式,默认 m4b 单声道——这是有声书专用格式,自带章节标记。合成引擎共 8 种:XTTSv2、Bark、VITS、YourTTS、Tacotron2、Fairseq、Tortoise、GlowTTS,界面会按语言自动推荐。
还有三件事值得记住:
- 上传音频即可语音克隆,仓库里也自带一组内置音色
- 支持 SML 标签,用
[pause:3]这类标记精确控制停顿和换声 - 可以批量转换整个文件夹,还能先机器翻译再合成
💻 三步跑通:从克隆仓库到第一本有声书
第 1 步:准备环境。硬件门槛不高:最低 2GB 内存、1GB 显存,推荐 8GB 内存、4GB 显存。CPU、NVIDIA(CUDA)、AMD(ROCm)、苹果 MPS、Intel XPU、Jetson 都能跑。Python 不用你操心,脚本会自动装好 3.10–3.12 的运行环境。
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook第 2 步:启动 Web 界面。
./ebook2audiobook.commandWindows 用户直接双击ebook2audiobook.cmd。首次运行会自动安装依赖,耐心等几分钟;启动成功后浏览器打开http://localhost:7860/。
第 3 步:上传并转换。在 "Input Options" 页签里操作:
- 左侧上传电子书(epub、mobi、pdf、txt 等)
- 右侧可选地上传一段录音做语音克隆,不传就用内置音色
- "Processor Unit" 选 CPU 或 GPU,下方选语言,默认 English
- 也可以传一个自定义模型 zip(需包含 config.json、model.pth 等文件)
点底部的 Convert,转完的有声书可以直接在页面里试听和下载:
两个坑提前说:停掉脚本再启动时,网页要手动刷新才能重连;GPU 没被识别就先检查驱动,实在不行退回 CPU 也能用。
🎚️ 调节合成参数:温度、语速与文本分割
切到 "Audio Generation Preferences" 页签,可调的旋钮都在这里:
- Temperature:0.1–10,默认 0.65。调高更"有创造性"但容易失控,叙事类建议留在默认值附近
- Repetition Penalty:1–10,默认 2.5,防止语句重复
- Top-k / Top-p:调低输出更稳定,生成速度也更快
- Speed:0.5x–3x 调节语速
- Enable Text Splitting:把长文本切句分块合成,长书建议打开;代价是效率一般,短文本不必开
输出格式默认 m4b(带章节),想换 mp3、flac 在设置里选,单声道/立体声也可切换。
如果合成的音频被截断,多半是分句逻辑没适配你那种语言——建议直接提 issue,团队需要不同语言用户的反馈来修。
🎙️ 克隆你的声音:上传音频与 SML 标签
想用自己的声音,上传一段录音就行。wav、mp3、m4a、ogg 等 17 种音频格式都收,时长以 1–5 分钟为宜。录音带背景噪声、甚至夹着音乐也没关系,它会先做降噪再克隆。
想要更细的控制,可以在文本里插 SML 标签:
[break]:0.3–0.6 秒短停顿[pause]:1.0–1.6 秒长停顿[pause:3]:固定 3 秒停顿[voice:音频路径]...[/voice]:段落内临时切换声音
想更进一步,可以用仓库里的微调工具训练自己的 XTTSv2 模型,Notebooks/finetune/xtts/ 下有现成的 WebUI 笔记本,训完打包成 zip 传到界面即可,其中的 ref.wav 会成为该模型的固定音色。
⚡ 批量转换:headless 命令行模式
不想点界面?headless 模式一条命令直接出书。单本转换:
./ebook2audiobook.command --headless \ --ebook ./ebooks/tests/test_eng.txt --language eng整个文件夹一起转,把--ebook换成--ebooks_dir:
./ebook2audiobook.command --headless \ --ebooks_dir ./my_books --language eng --tts_engine XTTS常用组合:--voice 路径指定克隆声音;--output_format mp3换输出格式;--translate fra先机器翻译再合成(用 ISO 639-3 语言代码);--session记录会话,中断后可接着转。注意--ebook和--ebooks_dir二选一,全部参数加--help可查。
🎧 评估适用场景:四类用户与三条边界
- 通勤党:技术文档、网文转成 m4b 丢进播放器,章节跳转是现成的
- 视障用户:EPUB、MOBI 的章节结构自动保留,不用手工切分
- 播客与视频创作者:SML 标签 + 语音克隆,能做出带停顿节奏的旁白
- 语言学习者:1158 种语言里挑目标语言,再配
--translate先译后听
三条边界提前知道:只用于无 DRM 的合法电子书,DRM 内容别碰;EPUB 没有统一的章节标准,前言、版权页这类不想要的文字要先手动删掉;纯 CPU 跑大引擎很慢,建议选 YourTTS、Tacotron2 这类轻量引擎,GPU 下才能接近实时。
🚀 现在动手:转换你的第一本书
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook && cd ebook2audiobook敲完启动脚本,把仓库自带的ebooks/tests/test_eng.txt拖进界面点 Convert——听完整本书之前,先换上你自己的书和声音。
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考