Buzz离线转录:3分钟跑通的本地Whisper语音转文字工具
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz是一款基于OpenAI Whisper模型的开源离线音频转录工具,它把语音转文字这件事直接放在你自己的电脑上完成。音频、视频文件和麦克风实时录音都支持,免费,适合会议纪要、字幕制作、采访整理这类日常需求。
3分钟装好Buzz并完成一次转录
安装方式有三种,按你的环境挑一种:
- Windows / macOS:到官方发布页下载对应系统的安装程序。Windows安装时会弹出提示(程序未签名),选"更多信息"后点"仍要运行"即可。
- Linux:提供 Flatpak 和 Snap 两种包,各一条命令装完。
- Python用户:需要 Python 3.12 以上,并先在系统里装好 ffmpeg(一个音视频处理工具),然后:
pip install buzz-captions python -m buzz第一次启动会提示下载语音识别模型,这一步需要联网;模型下载完成后,之后就可以全程离线使用。
第一次文件转录照着做
- 打开 File 菜单,选"Import Media File"(快捷键 Ctrl/Cmd + O),或点工具栏的"+"。
- 选中音频或视频文件,在语言栏明确指定说话语言。官方建议指定语言,自动检测偶尔会误判。
- 模型先选
base或small:模型越大越准,但耗时也更长。 - 点 Run。状态变成"Completed"后,双击该行打开转录结果。
结果界面支持搜索、播放和调速,可导出为 TXT 文本或 SRT、VTT 字幕文件。
Buzz擅长什么、不擅长什么,一次说清
擅长的:
- MP3、MP4、WAV、M4A 等常见音视频格式的本地转录,也支持导入 YouTube 链接
- 麦克风实时录音,配有专门的"演示窗口",演讲时可以把实时文字投到大屏
- 硬件加速:NVIDIA 显卡走 CUDA,Mac 走 Apple Silicon,集显也能用 Vulkan
- 说话人识别,以及插件扩展:AI 摘要、字幕自动重新分段等
- 监控文件夹(新文件自动转录)和命令行接口,适合批量处理
不擅长或要绕一步的:
- 内置翻译任务只支持"翻译成英文";翻译成中文等其他语言要接云端 API,可能产生费用
- 实时录音的"追加并纠错"模式对系统负载最高,性能一般的电脑不建议开
- 录制电脑系统声音需要额外配置虚拟音频设备
- 不支持没有 AVX2 指令集的老款 CPU
场景一:把会议录音MP3整理成文字纪要
目标:把一场会议的录音变成能直接阅读的文字稿。
操作步骤:按上文导入文件,语言指定为"中文",模型用base。如果有常转录错的人名或术语,可以在高级选项的"Initial prompt"里提前写上,能明显减少拼写错误。
产出结果:一份 TXT 文字稿,关键段落人工过一遍即可归档。
场景二:给视频做出能烧录的字幕文件
目标:得到可直接使用的 SRT 字幕。
操作步骤:
- 导入视频文件,勾选"词级时间戳"选项(每个词都有时间,方便后续合并)。
- 转录完成后打开结果,点"Resize"按钮。
- 设置每条字幕的最大字数、是否按标点断开,执行合并。
产出结果:SRT 或 VTT 字幕文件,每行长度和显示时长符合常见字幕规范。
场景三:活动现场的实时同声文字
目标:整场演讲都有实时文字跟播。
操作步骤:在 Live Recording 界面选好任务、语言和麦克风,点 Record,再打开演示窗口。
产出结果:句子实时追加到窗口;在首选项里开启"实时转录导出"后,文字还会同步写进一个文本文件,方便后续集成到直播推流等工具。
转录太慢?这5个报错和症状这样处理
| 症状 | 可能原因 | 处理办法 |
|---|---|---|
| 转录明显偏慢 | 模型过大 | 换更小的模型,或改用 Whisper.cpp 后端;显存 6GB 以上的 N 卡可选 Faster Whisper |
| 启动时崩溃 | 模型下载不完整 | 在 Help → Preferences → Models 删掉对应模型后重新下载 |
| 麦克风无法启动 | 系统权限或杀毒软件拦截 | 检查系统设置里 Buzz 的麦克风访问权限 |
| GPU 没生效 | 驱动缺失 | 更新显卡驱动;Linux 补装 CUDA 12 相关库 |
| 识别语言经常错 | 用了自动检测 | 手动指定语言 |
补充两点:
- 完全离线的机器也可以跑:在有网的电脑上下好模型,把模型文件夹拷过去即可(路径在 Preferences → Models 里点"Show file location"查看)。
- 想用命令行批量处理,仓库里的 docs/docs/cli.md 有完整参数说明。
数据与隐私:本地处理对你意味着什么
对普通用户来说,"本地处理"意味着三件事:
- 音频文件和转录结果都留在你自己的机器上,不会上传到第三方服务器
- 断网环境照样能用,前提是模型已就位
- 存哪里、保留多久,由你自己决定
两个需要知道的小细节:Buzz 默认会收集操作系统、架构这类基本使用统计,可通过环境变量BUZZ_DISABLE_TELEMETRY关闭;使用 AI 翻译功能时,待翻译的文本会发给你配置的 API。模型存放位置、离线用法等细节可查 docs/docs/faq.md。
获取源码,继续深入
项目采用 MIT 协议开源,代码可以自行查阅和修改。想深入看实现,直接克隆仓库:
git clone https://gitcode.com/GitHub_Trending/buz/buzz【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考