Buzz 本地语音转文字:两小时录音十分钟出 SRT 字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
把一段两小时的面试录音丢进 Buzz,几分钟后就得到一份带时间戳的 SRT 字幕文件,想附带中文翻译也能顺手生成。Buzz 是基于 OpenAI Whisper 的语音转文字工具,音频处理与模型推理全部在你自己的电脑上完成,断网也能用,文件不出机器。
一句话讲清 Buzz 是什么
Buzz 是在 Whisper 之上包了一层图形界面的离线语音转文字工具:可以导入音频、视频文件做转录或翻译,也可以直接对着麦克风实时录音转文字,Windows、macOS、Linux 三个平台都能跑。后面还有播放校对、片段编辑、多格式导出这些下游能力,核心转录逻辑集中在 buzz/transcriber/ 目录。下面按你实际会走的路径讲,从装到出片。
三分钟装好它
Windows
没有现成的包管理器命令,直接去项目发布页下载安装文件,运行 .exe 即可。注意应用没有做代码签名,安装时会弹出警告窗口,点"更多信息" → "仍要运行"就行。
macOS
下载 .dmg 打开,把 Buzz 拖进 Applications 就完事了。macOS 版支持 Apple Silicon 硬件加速,在 M 系列芯片的机器上推理速度比 Intel 版快一截。
Linux
官方提供 Flatpak 和 Snap 两种渠道,任选其一:
flatpak install flathub io.github.chidiwilliams.Buzz或者:
sudo snap install buzzSnap 方式在部分发行版上需要先装 portaudio 等依赖。如果你习惯从源码装,也可以走 PyPI:
pip install buzz-captions装完用python -m buzz启动,前提是 Python 3.12 环境和 ffmpeg。
实时录音转文字:先录一条看效果
文件转录之前,建议先玩录音这条线,因为它最直观,几秒就能见效:
- 主界面切到"录音转录"标签页
- 选好麦克风设备、目标语言和模型
- 点红色圆钮开始录音,说一句试试
- 文字会实时出现在窗口里,说完点停止按钮,转录结果自动保存
如果你是在讲座、会议这种场合用,还可以开一个独立的演示窗口,把实时字幕投到更大的屏幕上(对应 buzz/widgets/ 里的 presentation 组件)。
实时转录对机器比较吃紧,建议选 Whisper.cpp 后端,模型用 base 或 small 起步,流畅度会好很多。
把一段音频变成字幕文件
这是最常用的文件转录流程,四步走完:
- 导入:菜单"文件" → "导入媒体文件"(Ctrl+O),或直接点工具栏的"+",mp3、wav、mp4 这些常见格式都认
- 选参数:弹窗里定任务类型(转录还是翻译)、语言和模型
- 跑起来:点"运行",任务列表里能盯实时进度
- 看结果:状态变成已完成后,双击任务行打开转录查看器
查看器里有个模式切换按钮,三档对应三种看法:
- 时间戳模式:表格列出每个片段的开始/结束时间和文本,做字幕就靠它
- 文本模式:所有文本合并成一篇,不带时间标记,适合通读
- 翻译模式:显示翻译结果(前提是先跑过翻译任务)
快捷键 Ctrl+T、Ctrl+E、Ctrl+L 可以跳过鼠标直接切模式。双击表格里的文本单元格就能改内容,修改自动落库;片段的起止时间也能微调——选中文本后用"调整大小"功能拖动边界,或者用 Ctrl+←/→(改开始时间)、Ctrl+Shift+←/→(改结束时间),每次步进 0.5 秒。
不想开界面的话,命令行也能干同样的事,一行命令批量转并输出 SRT:
buzz add meeting.mp3 --language zh --model-size small --srt位置参数可以传多个文件,--vtt、--txt也能叠加,加--hide-gui就纯后台跑。
导出与二次编辑
转录完成后的导出菜单在查看器工具栏里,点"导出"就能看到各格式选项,原文和译文都能单独导出:
- TXT:纯文本,段落按音频间隔自动切分
- SRT / VTT:字幕文件,视频编辑软件直接拖进去就能用
- DOCX:Word 文档,由 plugins/export_docx/ 插件自动生成,可选带不带时间戳
校对环节有个"播放三件套"很实用:勾选"循环片段"可以反复听某一段;"跟随音频"打开后,文本会自己滚到当前播放位置;变速从 0.5x 拉到 2x,用旁边的"+"、"−"按钮微调,听漏的地方放慢重听。
键盘党可以再看一眼"偏好设置" → "快捷键"标签页,所有快捷键(播放/暂停是 Ctrl+P、跳转当前文本是 Ctrl+G、重播当前片段是 Ctrl+Shift+P)都能改成自己的习惯组合。
让转录更快更准
Whisper 本地部署的核心变量是模型大小, Buzz 里常见三档定位:
- tiny / base:最轻量,实时录音和低配电脑首选
- small / medium:速度和准确率的平衡点,大多数人停在这里
- large 系列(large-v3、large-v3-turbo):准确率最高,专业级转录再上
模型在"偏好设置" → "模型"标签页里统一管理,选哪个、下哪个、删哪个都在那。
跑得慢的时候按这三条排查:
- 换更小的模型
- 关掉抢资源的应用
- 先提取语音再转录(高级设置里开)
另外,Buzz 对 Nvidia 显卡有 CUDA 加速,Whisper.cpp 后端还能走 Vulkan,核显机器也能吃到加速,装好后在模型偏好里选对应后端即可。
想录的是电脑里正在放的声音(播客、线上会议)而不是麦克风?走虚拟音频设备:Windows 装 VB-CABLE 后把它选为录音源,macOS 用 BlackHole,Linux 则在 pavucontrol 里把应用声音重定向过来,三平台思路一样。
卡住了怎么办
先翻 docs/docs/faq.md,装不上、找不到模型、性能不达标这类高频问题基本都答了。没解决就去项目 Issues 提个 bug,或者进 Discord 社区直接问,也可以发邮件找作者。代码层面想动手的话,PR 随时欢迎,流程写在 CONTRIBUTING.md 里。
去发布页把最新版 Buzz 拉下来,今晚正在听的播客,明早醒来就能收到一份带时间戳的字幕文件。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考