Buzz 离线音频转录指南:用本地 Whisper 快速完成语音转文字与字幕导出
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款免费开源的离线音频转录工具,基于 OpenAI 的 Whisper 模型,在你的电脑上本地完成语音转文字与翻译。它支持 100 多种语言,既能处理 MP3、WAV、FLAC、MP4 等音视频文件和 YouTube 链接,也能实时录音转录,并内置字幕编辑、说话人识别与多种格式导出(TXT、SRT、VTT)。所有数据都在本地处理,无需上传服务器。
先做选型:云端转录和本地转录怎么选
把录音交给云端服务,通常换来的是更省心的算力,代价是音频会离开自己的设备。本地转录正好相反:
| 维度 | 云端转录服务 | Buzz 本地转录 |
|---|---|---|
| 数据去向 | 上传到第三方服务器 | 完全保留在本机 |
| 网络要求 | 必须在线 | 可离线运行 |
| 费用 | 多按分钟/时长计费 | 免费,无隐藏收费 |
| 硬件要求 | 无 | 取决于模型大小(约 75MB 至 2.9GB) |
| 可定制性 | 受限于平台功能 | 可换后端、写插件、接入脚本 |
如果你的内容涉及商业信息、个人隐私,或者经常在没有网络的环境下工作,本地路线更稳妥;对算力要求不高的轻量场景,两者都可行。下文假设你已经决定使用 Buzz。
按操作系统选择 Buzz 的安装方式
详细步骤见官方 安装文档。四种路径任选其一:
- macOS:下载
.dmg安装包,拖入 Applications 即可(支持 Intel 与 Apple 芯片)。 - Windows:下载安装包后按提示安装。Buzz 未做代码签名,系统提示安全警告时选择"更多信息"→"仍要运行"。
- Linux:Flatpak 或 Snap 均可:
flatpak install flathub io.github.chidiwilliams.Buzz # 或 sudo snap install buzz- PyPI:需要 Python 3.12 环境和 ffmpeg,适合想参与开发或定制的用户:
pip install buzz-captions python -m buzz选对 Whisper 模型:速度、精度和内存的平衡
Buzz 的模型管理入口在偏好设置(菜单打开,或按Ctrl/Cmd + ,)的 Model 标签页里,可以下载新模型、删除不用的模型。
Whisper 系列模型按体积分五档,体积越大识别越精细,但转录也更慢、更吃内存:
| 模型 | 体积(约) | 适用情况 |
|---|---|---|
| tiny | 75MB | 快速预览、实时转录、低配设备 |
| base | 142MB | 日常使用的平衡之选 |
| small | 466MB | 需要更高准确度的正式内容 |
| medium | 1.5GB | 高精度、长内容 |
| large | 2.9GB | 最高准确度,资源需求也最高 |
除了原始 Whisper,Buzz 还支持 Whisper.cpp、Faster Whisper、Hugging Face 模型族和 OpenAI API 后端。几个和性能直接相关的选择:
- Whisper.cpp 后端支持 CUDA(NVIDIA 显卡)、Vulkan(多数独立/核显显卡)和 Apple Silicon,实时录音场景官方也建议用它。
- 大模型可以选量化版本(如
q_5)来降低显存占用;在偏好设置里开启"Reduce GPU RAM"或使用 Whisper.cpp 量化模型都能减少显存消耗。 - 显卡老旧或出问题时,可以设置环境变量
BUZZ_FORCE_CPU=true强制用 CPU。
日常对话内容,base 或 small 通常就够用;先把小模型跑通,确认准确度不足再换大的,是更省时间的做法。
第一次转录:导入文件、挑语言、跑通导出
完整说明见 文件导入文档,流程是四步:
- 点 File → Import Media File(或工具栏的 "+" 按钮、快捷键
Ctrl/Cmd + O),选择音频、视频文件或粘贴 YouTube 链接。 - 选择任务(转录 / 翻译成英文)、语言、模型。官方建议明确指定语言——自动检测依据的是开头几秒的音频,容易误判。
- 点 Run 开始处理,任务列表里会显示排队、进行中、已完成状态。
- 状态变为 Completed 后,双击该行(或选中后点展开图标)打开转录查看器。
三个值得留意的选项:
- Initial prompt(初始提示词):在 Advanced 按钮下填写,把容易写错的人名、术语放进去,能明显减少同音字错误。
- Word-level timings(词级时间戳):开启后每个词都有独立时间点,之后才能用调整工具把文本切分成规范字幕(详见下文)。
- Export As:导出格式可选 TXT、SRT、VTT。
转录完成之后:编辑文字、识别说话人、调整字幕长度
转录查看器是 Buzz 里功能最集中的页面,常用能力如下(详见 转录查看器文档):
- 搜索与定位:
Ctrl/Cmd + F打开搜索,Ctrl/Cmd + G让文本滚动跟随播放位置;播放速度支持 0.5 到 2.0 倍。 - 时间戳微调:
Ctrl/Cmd + ←/→以 0.5 秒为单位移动片段起止时间,配合 Loop Segment 反复试听同一段落。 - 说话人识别:在查看器点"Identify speakers",Buzz 会标注不同说话人的句子,可以试听任意一句并把手动改标签改为真实姓名,还能勾选合并同一人的连续句子(Intel 芯片的 Mac 上不可用)。
- 字幕长度调整:点"Resize"。启用过词级时间戳的转录,可以按标点拆分、按最大长度合并,还能延长每段字幕的显示时长,并借助音频静音分析优化切分位置;没有词级时间戳的转录则只能按最大长度重新合并。详见 编辑与调整文档。
- 翻译:Whisper 本身支持把非英语音频翻译成英文;要翻到其他语言,需在偏好设置里配置 OpenAI 兼容 API(支持 OpenAI、Ollama、LM Studio 等),再在查看器的 Translate 按钮里填入翻译指令。参考成本:一小时音频用 ChatGPT/Claude 级别模型约 1 美元。
- 导出:TXT、SRT、VTT、JSON 等格式,可直接交给视频剪辑软件或其他脚本处理。
批量与自动化:命令行、文件夹监控和实时录音
用 CLI 批量处理文件
Buzz 自带命令行入口(CLI 文档),适合脚本化场景。转录单个文件并导出 SRT:
buzz add --task transcribe --language zh --model-type whisper --model-size small --srt 音频文件.mp3批量处理目录内所有 MP3:
for f in *.mp3; do buzz add --task transcribe "$f"; done其他常用参数:-t指定任务(transcribe/translate),-m指定后端(whisper、whispercpp、fasterwhisper、huggingface、openaiapi),-p传入初始提示词,--hide-gui后台运行。
用文件夹监控实现"扔进去就转"
在偏好设置的 Folder Watch 标签页指定一个目录,放入的音频文件会自动进入转录队列。配合内置插件Skip Already Transcribed(检测同名 TXT/SRT/VTT 文件或数据库记录),重复导入同一批文件时会自动跳过已完成的任务。
实时录音与演示窗口
麦克风录音转录的步骤:选好任务(转录 / 翻译成英文)、语言、麦克风,点 Record 即可。官方提示:默认 Whisper 后端实时转录开销较大,建议用 Whisper.cpp,并优先 tiny、base 这类小模型。三个实时模式各有取舍——Append below / Append above只追加新句子,Append and correct会持续回改末尾错误,更准但更耗算力。录音开始后还会出现 Presentation window 选项,可以开一个独立窗口在大屏上投出实时文字。
想转录电脑里播放的声音(网课、播客、系统音效),需要装一个虚拟音频设备(macOS 可用 BlackHole,Windows 可用 VB CABLE)把系统输出引到虚拟设备,再在 Buzz 里把它选为麦克风。完整步骤见 实时录音文档。
插件:给转录流水线加扩展
1.4.5 起支持插件(Help → Plugins 管理),内置的六个能覆盖不少重复劳动:AI Summary(接 OpenAI 兼容 API 生成摘要)、Enhanced Language Detection(转录前本地检测语言)、Export DOCX(导出 Word,可带时间戳)、Resize Transcript(转录完自动重排字幕)、DeepFilterNet 降噪(先消噪再转录,适合嘈杂录音)、Skip Already Transcribed。自定义插件可参考 buzz/plugins 目录的源码结构。
关于效果的四个高频问题
- 语言该选"自动检测"吗?已知语种就手动指定,检测基于前几秒音频,双语或口音重的内容更容易出错。
- 长音频要分段吗?模型会整段处理;更实际的优化是关掉其他占内存的程序、用 smaller 的模型或量化版本,而不是人为切碎音频。
- 有 GPU 怎么开加速?NVIDIA 显卡装带 CUDA 的 PyTorch(
pip install torch torchaudio --index-url https://download.pytorch.org/whl/cu129);Whisper.cpp 后端可走 Vulkan,核显也能加速。 - 录音环境要讲究吗?要。安静环境、外接麦克风、录音前试一次电平,对最终准确度的影响比换更大模型更明显。
下一步行动清单
- 下载你操作系统的安装包(或
pip install buzz-captions),打开 Buzz。 - 在偏好设置里下载 base 模型,导入一段两三分钟的音频跑通第一次转录。
- 在查看器里试一次搜索、时间戳微调和 SRT 导出。
- 需要常态化使用时,再依次配置文件夹监控、CLI 脚本和实时录音。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考