3步搞定离线语音转文字:Buzz从安装到导出SRT的完整路径
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
周五例会录了90分钟,周一早上要交一份带时间戳的纪要,录音里还混着键盘声和空调噪音,而你又不想把这段音频上传到任何云服务。Buzz 是一款离线转录与翻译工具,基于 OpenAI 的 Whisper 模型,转录、翻译和实时识别全部在本地完成,音频文件自始至终不离开你的电脑。
项目速览
| 项目 | 说明 |
|---|---|
| 项目定位 | 本地运行的音频转录与翻译桌面应用 |
| 支持平台 | Windows、macOS、Linux |
| 核心引擎 | Whisper 原版、Whisper.cpp、Faster Whisper、Hugging Face 模型、OpenAI API 五种后端可选 |
| 硬件加速 | NVIDIA CUDA、Apple Silicon 原生支持、Vulkan(兼容核显) |
| 许可证 | MIT |
| 安装方式 | 各平台安装包、Flatpak、Snap,或 pip 安装 buzz-captions |
| 界面与依赖 | PyQt6 图形界面;PyPI 安装需 Python 3.12 和 ffmpeg |
| 适用人群 | 会议记录、视频字幕、课堂听力辅助、播客与访谈整理 |
不用 GPU 也能跑,纯 CPU 下速度会慢一些,但换到 CUDA 或开启 Vulkan 之后能快好几倍。
核心能力拆解 ⚡
从一段录音到一份带时间戳的纪要
- 通过文件导入或 URL 导入添加任务,支持一次选中多个文件批量转录
- 每个任务可选择"转录"或"翻译"两种任务,语言可指定也可自动检测,首次使用会自动下载所选模型
- 结果按段落排列并带起止时间戳,可切换查看原文、译文或时间戳视图
- 转录完成后可直接导出 TXT、SRT 或 VTT,无需再经第三方转换
- 嘈杂录音可在转录前先启用语音分离(基于 Demucs),把说话声从背景音里摘出来再识别,准确率提升明显
开会时的实时语音转录
- 按 Ctrl+R 打开录音窗口,麦克风音频边说边转,延迟在秒级
- 三种追加模式可选:下方追加、上方追加、追加并修正,最后一种会随录音进行不断回头修正之前的识别结果
- 演讲场景可打开演示窗口,大字号实时字幕投到教室前方的屏幕上
- 支持演讲者识别,多人对话时把不同说话人的话分开标注
| 手动整理 | Buzz 实时转录 |
|---|---|
| 会后反复听录音补时间轴 | 边说边出字,时间戳自动生成 |
| 前文口误只能在最后统一改 | "追加并修正"模式持续回改已识别文本 |
| 多人发言混成一段 | 演讲者识别按人分列 |
把外语音频转成字幕文件
- "翻译"任务会把外语音频直接转成英文文本,适合把外文访谈、课程音频整理成英文文稿
- 想要中文字幕时,可先转录出 SRT 再对文本做翻译,时间轴可以原样保留
- 需要逐字对齐的歌词式字幕时,可用 CLI 的 word-timestamps 选项生成词级时间戳,具体参数见 cli.md
- 字幕段落过长或过短,用字幕调整器(resizer 插件)按长度规则自动重新切分,插件目录在 plugins/
从0到1上手路径
- 安装:Windows 和 macOS 从发行页下载安装包(Windows 应用未签名,安装时选"更多信息 → 仍然运行");Linux 用 Snap 或 Flatpak。喜欢源码或要跑脚本的话,
pip install buzz-captions即可。 - 首次配置:打开偏好设置(Ctrl+,),选一个后端引擎和模型大小,确认录音输入设备;模型文件会在第一次运行时自动下载,之后可改存其他目录。
3.跑第一个任务:按 Ctrl+O 导入一段音频,选好任务类型和语言,点运行。完成后你会看到任务列表里的进度条走完,点开转录结果,每段话都带着起止时间,点一下就能跳到音频对应位置播放。
实用贴士 💡
- 模型不是越大越好:tiny 适合先试速度,medium 是日常平衡点,large 准确率最高但同样硬件下慢好几倍,重要内容再上。
- 快捷键比鼠标快:Ctrl+O 导入、Ctrl+R 录音、Ctrl+P 播放暂停、Ctrl+F 搜索、Ctrl+G 跳到当前播放位置,全部可在偏好里改。
- 输出格式按用途选:纯纪要导出 TXT,给播放器挂字幕用 SRT 或 VTT,VTT 对网页播放器更友好。
- 批量任务交给文件夹监视:把录音丢进监视目录会自动开始转录,配合 CLI 可以完全无人值守。
Buzz 把"说话变文字"这件最耗时的活搬回了本地:离线、可控,还能实时。
pip install buzz-captions python -m buzz【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考