Buzz:零成本本地语音识别,离线音频转录从安装到出稿的完整指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
手头有一段两小时的会议录音,涉及客户报价和人事讨论,不敢交给任何云服务。我把它拖进了 Buzz,拿到了一份带时间戳、可逐段编辑的文字稿。Buzz 是一款基于 OpenAI Whisper(一个开源的语音转文字模型)的免费离线音频转录桌面工具,全程在你自己的电脑上完成,不联网、不按分钟计费。这篇文章按从安装到调优的完整动线写,顺带把常见坑一次说清。
从下载到第一段文字稿
双击 Windows 或 macOS 安装包即可装好;Windows 首次运行若弹出"未签名"提示,点"更多信息"再选"仍要运行"就能继续。Linux 用户走 Flatpak 或 Snap 商店,一条命令装完,升级也顺手。命令行党则可以直接pip install buzz-captions,再用python -m buzz启动,效果一致。
程序打开后是一张任务列表,每个转录任务的文件名、所用模型、任务类型和状态排成一行。别急着拖文件,先用快捷键Ctrl/Cmd + ,打开偏好设置:设一个默认导出路径,让结果自动落到你常用的文件夹;顺手调一下界面字体大小。如果你以后打算用云端模型或 AI 翻译,把 API 密钥填上即可,纯离线用户这步跳过。
然后点左上角的"+",或者直接把音频、视频文件拖进去,MP3、WAV、MP4、AVI 都认。选任务类型:转录(转成原文)或翻译(转成英文),指定语言和模型,点 Run。等状态变成 Completed,双击这一行,转录查看器就打开了——每段文字带起止时间戳,底部有播放条,可以逐段试听、修改。
有一个细节值得多说一句:语言请手动指定。自动检测偶尔会猜错,中文被误判成别的语种再转回来,整段文字基本报废;手动选对语言后,准确率立刻不一样。
模型与引擎:按你的硬件选
Buzz 背后是 Whisper 的五个模型档位,体积、速度、精度各不相同:
| 模型 | 体积 | 速度 | 精度 | 适合谁 |
|---|---|---|---|---|
| Tiny | 约 75 MB | 最快 | 基础 | 预览、老电脑 |
| Base | 约 142 MB | 快 | 良好 | 日常随手记 |
| Small | 约 466 MB | 中等 | 优秀 | 正式会议、视频字幕 |
| Medium | 约 1.5 GB | 较慢 | 很好 | 学术资料、高精度需求 |
| Large | 约 2.9 GB | 最慢 | 最佳 | 专业级转录、多语种 |
试了两周的结论很明确:日常用 Base,重要内容用 Small。Medium 和 Large 的精度提升有限,耗时却是成倍的,普通材料不划算。
模型选完还要选引擎,条件句式记一下:如果你有 NVIDIA 显卡且显存不小于 6 GB,选 Faster Whisper,它走 CUDA(英伟达的 GPU 并行计算平台)加速,提升最明显;否则选 Whisper.cpp,它是 C++ 重写版,速度快、占内存少,还支持 Vulkan(一种跨平台的图形计算接口),核显也能参与运算,笔记本上接近实时转录,这也是 Whisper 本地部署最省心的路线;需要加载社区定制模型、或使用 Meta MMS 系列上千种语言时,选 HuggingFace 版。
偏好设置里的"模型"页能看到每个模型的下载状态,支持删除和重新下载,"显示文件位置"按钮可以一键打开模型存放目录。
把转录质量拉满的几个开关
初始提示(Initial Prompt)。专有名词、人名、公司名经常被转错。在任务的高级设置里,把这些词写进初始提示——它是先给模型看的一段提示文本,等于提前交了一份"术语表"。实测医学讲座里把药品名列进去之后,拼写错误明显减少。
字幕后处理。这里有两个开关值得一起打开。词级时间戳(Word-Level Timings)给每个词打上时间点,是字幕精修的基础,建议默认勾选。字幕重排则解决分段糟糕的问题:一段话被拆得稀碎时,可以按静音间隙合并、按标点分割、限制每条字幕的字符上限。跑下来几秒钟,导进剪辑软件就是一副整整齐齐的字幕。
文件夹自动转录。每次手动点 Run 太繁琐。在偏好设置的文件夹监控页勾选启用、指定一个目录,之后把音频丢进去就自动开始转录,处理一堆讲座录音时相当于半自动流水线。
插件系统。Buzz 从 1.4.5 版起支持插件,在"帮助 → 插件"里管理。两个值得开的:AI 摘要,转录完成后自动把要点总结写进笔记;降噪,用深度滤波模型在转录前去掉背景噪声,嘈杂录音的识别率能上一个台阶。
速度排查:按这个顺序来
转录慢,多半是模型或加速的问题,按顺序检查:
- 📥降一档模型:Small 换 Base,速度提升最直观,多数材料的精度损失可以接受;
- 开 GPU 加速:NVIDIA 显卡走 CUDA,Windows 安装版默认支持;Mac 的 Apple Silicon 有原生优化;Whisper.cpp 还支持 Vulkan,核显也能算。开启后,一小时音频的转录时间可以从 40 分钟缩到 10 分钟以内;
- 减线程数:Whisper.cpp 的线程数设为 CPU 核心数的一半,往往比拉满更快——线程太多时,结果合并环节反而拖后腿。可用环境变量
BUZZ_WHISPERCPP_N_THREADS设置。
完全离线的机器也能用 Buzz:先在有网电脑上把模型下好,再按界面"显示文件位置"找到的路径,把整个模型文件夹拷到离线机的相同位置即可。
卡住了?三个高频问题速查
- 现象:转录特别慢→ 可能原因:模型档位过高、后台程序抢占资源、GPU 加速没真正生效 → 解法:降一档模型,关掉无关程序,到设置里看有没有报错,确认 GPU 确实被用上了。
- 现象:专有名词总认错→ 可能原因:语言靠自动检测、模型没得到术语提示 → 解法:手动指定语言,把术语、人名写进初始提示。
- 现象:导出的文件用不了→ 可能原因:格式和用途没对上 → 解法:TXT 当纯文本笔记,SRT 给剪辑软件(通用标准字幕),VTT 给网页视频,JSON 给程序处理。
写在最后
Buzz 把"专业级语音转文字要花钱、要联网、要担心数据去向"这件事,变成了免费的本地默认选项:完全开源、无需联网、录音全程不出你的设备。会议记录、视频字幕、讲座整理、外语句子翻译,它都接得住。今晚装一个,拖一段 3 分钟的录音进去,看看离线音频转录的速度和效果。
- 官方文档:docs/
- 转录核心源码:buzz/transcriber/
- 设置模块:buzz/settings/
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考