Buzz 音频转录工具:在本地离线完成 Whisper 转录与翻译
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款在本机运行的音频转录与翻译工具,它用 OpenAI 的 Whisper 模型把录音、视频或 YouTube 链接转成文字,全程离线完成,音频不需要离开你的设备。对处理敏感会议录音、播客或讲座的人来说,这一点的价值在于数据不经过第三方服务器。
安装 Buzz 并启动应用
macOS 和 Windows 用户可以从官方发布页下载对应安装包;Windows 包未签名,安装时选择"更多信息 → 仍要运行"即可。Linux 用户用 Flatpak 或 Snap:
flatpak install flathub io.github.chidiwilliams.Buzz也可以从 PyPI 安装,需要本机已有 ffmpeg 和 Python 3.12:
pip install buzz-captions python -m buzz更完整的系统和依赖说明见 安装文档。首次转录某个模型时,Buzz 会先联网下载模型文件;下载完成后即可离线使用。
把音频文件转成文字
在工具栏点"+"图标(或按 Ctrl/Cmd + O)导入一个 MP3、WAV、MP4 等文件,然后在右侧选择任务(转录或翻译成英文)、语言和模型大小,点"运行"开始。任务状态变为"已完成"后,双击该行即可打开转录查看器,逐句对照时间戳查看和播放。
如果音频里有容易听错的人名或术语,可以点"高级"按钮,在 Initial prompt 里写上这些词,能明显减少拼写错误。建议直接指定语言而不是依赖自动检测,检测有时会给出不稳定结果。操作细节参考 文件导入文档。
给视频生成字幕并导出 SRT
给视频加字幕时,导入前先勾选"词级时间戳",Buzz 会为每个词生成单独字幕行。完成后在转录查看器里点"Resize",设定单条字幕的最大长度、是否按标点拆分,必要时延长每条字幕的显示时间,再导出为 SRT 或 VTT 文件,直接拖进剪辑软件即可。
没有词级时间戳的转录则只能按最大长度重新合并字幕。这一步适合做教学视频或播客的字幕稿,省去手动对齐时间轴的工作。
实时录音转写
切到实时录音模式,选好麦克风、语言和模型,点红色录音按钮即可边说边出文字。注意:默认 Whisper 模型计算量大,实时场景建议改用 Whisper.cpp 后端,并选更小的模型(如 tiny、base)以控制延迟。若队列积压,可在高级设置里加大"转录步长"来降低系统负载。
Buzz 还提供演示窗口,会议或现场演讲时把实时转录投到大屏;若开启实时导出,转写文本会边生成边写入 TXT,方便接入 OBS 等软件。
用命令行批量转录
Buzz 自带 CLI,适合脚本化和批量任务。buzz add接受多个文件或 URL,常用参数如下:
buzz add --model-type whispercpp --model-size small \ --language zh --srt --vtt audio.mp3--task可选 transcribe / translate,--model-type支持 whisper、whispercpp、fasterwhisper、huggingface、openaiapi,--txt/--srt/--vtt控制输出格式,--hide-gui可隐藏主窗口。完整参数表见 CLI 文档,核心逻辑在 buzz/transcriber/。
选择 Whisper 模型与加速方案
| 后端 | 特点 | 适合场景 |
|---|---|---|
| Whisper | 官方实现,准但慢、吃内存 | 内存充足、追求基准精度 |
| Faster Whisper | 比 Whisper 快很多、更省内存 | 有 ≥6GB 显存的 Nvidia GPU |
| Whisper.cpp | C++ 实现,可用各类 GPU 或纯 CPU | 无 Nvidia 卡、Mac、实时转写 |
| HuggingFace | 支持大量自定义与多语言模型 | 需要特定语言优化模型 |
模型大小从 tiny 到 large:越小越快但错越多,越大越准但越占硬件。large-v3 精度常最好但偶尔会"幻觉"出音频里没有的词,large-v3-turbo 在速度和精度间更平衡。Nvidia 显卡在 Linux 上开箱支持 GPU 加速;想省显存可在偏好里勾选 8bit 量化。模型管理界面见下方截图。
离线环境部署模型
Buzz 本身可以完全离线运行,但模型文件需要先在有网的机器上下载好。在"帮助 → 偏好 → 模型"里下载一个模型并点"显示文件位置",把该文件夹整体拷贝到离线机器的相同路径(如 Linux 的~/.cache/Buzz/models)。仓库里的 scripts/download-models.py 可以帮你一次性准备离线模型缓存。
容易踩的坑
- 转录太慢:换更小的模型或改用 Whisper.cpp;有 6GB 以上显存可试 Faster Whisper。
- 崩溃或结果异常:多半是模型下载不完整,到偏好里删掉重新下载。
- 老 CPU 跑不起来:Buzz 需要 CPU 支持 AVX2,过老的机器不受支持。
- 录音报 PaErrorCode-9999:检查系统是否允许应用访问麦克风(Windows 在"设置 → 隐私 → 麦克风")。
- 录制系统声音:需借助虚拟音频设备(macOS 用 BlackHole、Windows 用 VB CABLE),再在 Buzz 里选它作为麦克风。
Buzz 适合需要在本机完成会议、讲座、播客转录,或为视频批量生成字幕、做实时记录的用户;局限是精度上限受所选模型和本机硬件约束,大模型在低配机器上会明显变慢。更多细节可查 官方文档,源码在仓库根目录的 buzz/。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考