Buzz 离线音频转录工具:如何在本地免费完成语音转文字的完整指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款运行在你自己电脑上的离线音频转录工具,基于 OpenAI 的 Whisper 模型,把会议录音、播客、视频音频转成文字,并支持翻译成 90 多种语言。全程不上传任何数据,一次配置后完全免费。适合经常整理录音、需要处理敏感音频、又不想依赖在线服务的用户。
为什么值得关注
在线转录服务要你把音频传到云端,敏感内容过第三方服务器,按用量收费,断网不可用。Buzz 的做法很直接:Whisper 模型下载一次之后,转录、翻译、导出全部在本地完成,录音文件从头到尾不离开你的设备。
对新手来说它也是零门槛的:图形界面点两下就能开始转录,不需要写代码;而对进阶用户,它又提供了 CLI、文件夹监控和插件系统,可以搭自动化流程。
| 对比维度 | 在线转录服务 | Buzz 本地方案 |
|---|---|---|
| 数据去向 | 上传云端 | 留在本地设备 |
| 网络要求 | 必须联网 | 下载模型后可离线 |
| 费用 | 按量/订阅收费 | 免费开源 |
| 语言支持 | 视服务而定 | 90+ 种语言 |
| 自动化 | 依赖其 API | CLI + 监控文件夹 |
10 分钟上手:安装 Buzz 并跑通第一次转录
Buzz 支持 macOS、Windows 和 Linux,三种装法任选一种即可。
方式一:直接装图形界面(推荐新手)
- macOS:下载官方
.dmg安装包,打开后拖入 Applications。 - Windows:下载安装包运行;应用未签名,弹窗时选「更多信息 → 仍要运行」。
- Linux:
sudo snap install buzz
方式二:Python 环境安装(适合已有开发环境的人)
- 先装好 ffmpeg(转录依赖它解析音频)。
- 使用 Python 3.12 环境,执行:
pip install buzz-captions python -m buzz
第一次转录
- 启动后点左上角「+」导入一个 mp3/mp4 文件,或直接粘贴 YouTube 链接。
- 在任务行里选好模型(日常用 base 即可),点 Run。
- 等状态变成 Completed,双击该行打开转录结果,就能边听音频边校对文字。
核心能力一览:按你能用到的价值来说
- 本地转录与翻译:Whisper 在本地跑,音频转文字、再翻译成目标语言,数据不出电脑。
- 实时录音转录:接上麦克风边说边出文字,适合会议纪要;另有专门的演示窗口,开会时投屏展示很方便(见 recording_transcriber.py)。
- 说话人识别:多人对话自动区分不同说话者,整理采访录音时很实用(见 speaker_identification_widget.py)。
- 多后端硬件加速:NVIDIA 显卡走 CUDA,Mac 走 Apple Silicon,普通显卡可走 Vulkan,速度取决于你的硬件。
- 字幕精修工具:按标点、间隔自动重新分段,把转录稿整理成合规字幕(见 transcription_resizer_widget.py)。
- 文件夹监控:指定一个文件夹,新放进去的音频自动开始转录,适合批量处理。
- 插件系统:内置 AI 摘要、深度降噪等插件,按需启用即可扩展能力(见 plugins/)。
- CLI 接口:可以用命令行脚本化批量转录,方便接入自己的自动化流程(文档见 cli.md)。
选对配置不踩坑:模型与硬件怎么搭配
选模型的核心逻辑是:机器内存够不够,音频质量好不好。宁可先用小模型快速出稿,再按需换大模型精修,也不建议上来就跑 large 然后把电脑卡死。
| 你的情况 | 推荐模型 | 说明 |
|---|---|---|
| 8GB 内存 / 核显本 | tiny 或 base | 出稿快,适合先过一遍内容 |
| 16GB 内存 / 独显 | small 或 medium | 日常会议、播客的主力档位 |
| 大内存 + GPU 加速 | medium 或 large | 长音频、专业交付、翻译场景 |
几条能少踩坑的习惯:
- 语言尽量手动指定,自动检测偶尔会判错,尤其对方言或混合语言音频。
- 专有名词多的场景(人名、产品名),在「高级选项」里填一句包含这些词的 Initial prompt,能明显减少错别字。
- 嘈杂环境录音,开启「语音提取」或降噪插件,准确率提升比较明显。
- 模型下载失败时,检查网络代理设置,或手动把模型放进缓存目录(首选项里可以看到缓存路径)。
实战场景走一遍
场景一:会议录音 → 纪要文档
- 导入会议录音文件,模型选 medium,语言选中文。
- 转录完成后打开结果页,边播放边修正人名和公司名。
- 需要精简的话,启用 AI 摘要插件生成要点。
- 导出为 TXT 归档,文件名可在首选项里用模板自定义。
场景二:视频 → 平台可用字幕
- 导入 mp4 视频,导出格式选 SRT。
- 转录完成后进入字幕调整界面,按标点自动分段。
- 把单行长度控制在 42–50 字符左右,检查合并间隔是否顺口。
- 导出 SRT/VTT,直接上传到视频平台。
场景三:外语音频 → 中文文稿
- 导入外语音频,模型选 small 以上保证翻译质量。
- 任务类型选「翻译」,目标语言选中文。
- 本地先出译文,个别术语不对就在查看界面手动改。
- 导出 TXT 或带时间轴的 SRT 双语对照稿。
遇到问题先查这里
| 现象 | 可能原因 | 解决办法 |
|---|---|---|
| 启动报错、提示缺依赖 | 没装 ffmpeg 或系统运行库 | 先安装 ffmpeg;Windows 补装 VC++ 运行库 |
| 模型一直下载失败 | 网络/代理问题 | 换网络环境,或手动下载模型放到缓存目录 |
| 转录明显变慢 | 模型太大、内存不足 | 换更小模型,关掉占内存的后台应用 |
| 识别准确率不高 | 音质差或模型太小 | 开语音提取/降噪,或换大一号模型 |
| GPU 没生效 | 驱动或 torch 版本不对 | 更新显卡驱动,按官方说明重装对应 CUDA 版 torch |
完整排错内容可查 faq.md;首选项各字段含义见 preferences.md。
写在最后
Buzz 适合三类人:手里有大量录音要整理的职场人、需要给视频配字幕的创作者,以及处理敏感音频、数据绝对不能出本地的用户。它免费、开源、开箱即用,从安装到第一份转录稿通常半小时内就能走完。打开它,导入一个音频试试,比看十篇介绍都直观。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考