如何用 Buzz 离线转录音频:3 步完成本地语音转文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议结束,你拿到一段 47 分钟的录音,天黑前要出会议纪要。我用 Buzz 做离线转录:把录音丢进去,Whisper 模型在我自己的电脑上跑出带时间戳的文字稿,全程不联网、不花订阅费。处理访谈、播客、课堂录音的人都可以照搬这套做法。
一分钟认识 Buzz
Buzz 是一个基于 OpenAI Whisper 的开源音频转录工具,把语音转文字和翻译全部放在本地完成。文件不离开你的电脑,这是它和云端服务的最大区别:不用上传、不用配 API 密钥、没有订阅费。它支持 99 种以上语言,可以导入音频视频文件或链接,也能直接对着麦克风实时转写。
| 项目 | 说明 |
|---|---|
| 平台 | Windows、macOS、Linux,也支持 Python 安装 |
| 联网要求 | 完全离线,模型下载一次即可断网使用 |
| 费用 | 开源免费,无订阅 |
| 支持格式 | MP3、WAV、MP4、M4A 等常见音视频 |
三步跑起来
第 1 步:安装
按系统挑一种方式,Linux 直接用 snap:
sudo snap install buzz开发者可以用 pip,需要先装好 ffmpeg 并使用 Python 3.12:
pip install buzz-captions python -m buzz第 2 步:首次启动
首次运行选择转写引擎和模型大小。硬件一般就选 whisper.cpp 加 base,模型会在首次使用时自动下载到本地缓存。存储位置可以在 Help → Preferences → Models 里查看。
第 3 步:完成第一次转录
- File 菜单 → Import Media File(快捷键 Ctrl/Cmd + O),选择音频或视频文件。
- 设置任务(转录或翻译)、语言、模型,点击 Run。
- 状态变成 Completed 后,双击该行打开查看器,把结果存成 TXT、SRT 或 VTT。
核心功能拆解
1. 批量文件转录
你要做的事:把一批录音一次性变成文字稿。怎么操作:导入时多选文件,它们进入任务队列依次处理,每一行显示独立的进度和状态;在偏好里配置 watched folder 后,文件夹里出现的新音频会自动入队。得到什么:每个音频对应一份文字稿,全部保存在本地。
2. 实时录音转录
你要做的事:会议和讲座现场不落下一句话。怎么操作:点麦克风按钮开始,转写结果实时显示,还可以打开 presentation window 把实时文字投屏。得到什么:停止后录音和文字稿自动按停顿分段保存,可直接导出 TXT。
3. 字幕查看与重排
你要做的事:把文字稿改成能直接用的字幕。怎么操作:在查看器里边播放边逐条核对,直接改文字和时间戳;用 resize 工具设置单行最大字符数和合并间隔,长句按标点自动断开。得到什么:符合播出规范的 SRT、VTT 字幕文件,导入剪辑软件就能和画面同步。
上手菜谱
菜谱一:会议记录
- 开场点麦克风按钮开始实时录音转录,需要投屏就选 presentation window。
- 会议结束点停止,系统自动保存录音和文字稿,已按停顿分段。
- 打开查看器,用播放头核对错误处,直接改错别字和人名。
- 导出 TXT 作为纪要,或装 DOCX 导出插件直接生成 Word 文档。
菜谱二:视频字幕
- 导入视频文件,点 Advanced 按钮勾选 Word-Level Timings。
- 精度要求高就选 medium 及以上模型,点击 Run。
- 完成后打开 resize 工具,单行 40-50 字符、合并间隔 0.3 秒起步调。
- 导出 SRT,导入剪辑软件即可挂到画面上。
性能与避坑
模型不是越大越好,按硬件匹配:
| 硬件条件 | 推荐模型 | 预期效果 |
|---|---|---|
| 8GB 内存,无独显 | base(whisper.cpp) | 草稿级精度,接近实时,日常够用 |
| 16GB 内存,Nvidia ≥6GB 显存 | medium(faster-whisper) | 精度良好,1 小时音频几分钟出稿 |
| 32GB 内存,高端显卡 | large-v3 | 精度最高,适合正式交付和学术研究 |
| 追求速度与精度平衡 | turbo | 速度接近 medium,精度接近 large |
实际使用中常见的问题:
| 现象 | 可能原因 | 解决办法 |
|---|---|---|
| 转录速度慢 | 模型太大、跑在 CPU 上 | 换 whisper.cpp 后端或更小模型,有显卡就开 GPU 加速 |
| 专有名词识别错得多 | 没给模型上下文 | 在 Initial Prompt 里填入人名和术语 |
| 语言识别乱跳 | 依赖自动检测 | 手动指定目标语言 |
| 录音按钮没反应 | 系统隐私设置拦了麦克风 | 检查操作系统麦克风权限,或临时关杀毒软件 |
| 启动后崩溃 | 模型文件不完整、CPU 过老 | 重新下载模型;确认 CPU 支持 AVX2 |
继续深入
- 想自动出摘要、降噪,看项目自带的 6 个插件和编写规范,源码在 buzz/plugins/。
- 模型存放位置、GPU 加速、离线迁移模型等细节答案,在官方文档 docs/docs/faq.md 里。
Buzz 把"音频转文字"从云服务变成了本地习惯,数据留在自己的机器上,每一步都可复现。挑一段手头的录音,先用小模型跑一遍,三分钟就能知道你的电脑能做到什么程度。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考