如何用Buzz把3小时会议录音变成逐字稿?一份完全离线的语音转文字指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
周五下午 5 点,你收到一份 3 小时的会议录音,明早就要交纪要。里面是客户名字、报价数字和法务条款——上传到云端转写怕泄密,纯靠手打又通宵不够。
答案是一款完全离线的语音转文字工具:Buzz。它把 OpenAI 的 Whisper 模型放在你自己的电脑上运行,免费、不联网、数据不出本机,还能直接生成字幕文件。下面这份指南,我带你从拿到录音到导出成稿,完整走一遍真实流程。
🧭 先看一张速览表
| 项目 | 说明 |
|---|---|
| 项目名称 | Buzz(当前版本 1.4.5) |
| 核心功能 | 本地离线语音转文字 + 翻译 |
| 驱动引擎 | OpenAI Whisper,多后端支持 |
| 输入来源 | 音频、视频文件、YouTube 链接、麦克风实时录音 |
| 输出格式 | TXT、SRT、VTT、JSON,插件可导出 DOCX |
| 支持平台 | Windows / macOS / Linux,另有 Python 包 |
| 价格与授权 | MIT 开源协议,完全免费 |
一句话记住它:Whisper 的本地方便版——装好即用,双击转写。
🔍 你以为的转写服务,其实还有另一种打开方式
在线转写工具为什么让人纠结?
- 按分钟收费,一次长音频就是几十上百元;
- 录音要上传服务器,商业内容心里没底;
- 网络一波动,排队半天等不出结果。
而 Buzz 把整个流程搬到了你的本机:
- 免费:软件和模型都不要钱,没有次数限制;
- 离线:断网也能转,录音永远不出你的硬盘;
- 可控:模型、语言、导出格式全都由你指定。
怎么做到?因为它不是"调用别人的服务",而是把 Whisper 模型下载到本地直接运行。下面这条主线,就是一次完整的实际操作。
Buzz 主界面:文件、模型、任务、进度一目了然,支持多任务排队处理
📥 第一步:把素材交给 Buzz
第一步非常简单——导入素材。Buzz 认识这些输入:
- 音频文件:MP3、WAV、M4A、FLAC 等常见格式;
- 视频文件:MP4、MKV、AVI 等,直接提取音轨转写;
- YouTube 链接:粘贴网址即可;
- 麦克风:实时录音转写(进阶部分细说)。
导入方式有两种:点击工具栏的+号,或直接拖拽多个文件进窗口。批量任务会依次排队,每个任务的状态(排队中 / 转写中 / 已完成)随时可见。
给素材多的人一句话:一次拖入十几个文件,统一配置后让机器自己排队跑,你只需要回来收结果。
⚙️ 第二步:5 分钟完成安装
Buzz 的安装体验对普通用户相当友好,四选一即可:
| 平台 | 做法 |
|---|---|
| Windows | 下载安装程序,双击运行;首次启动自动下载模型 |
| macOS | brew install --cask buzz,或直接安装 DMG 文件 |
| Linux | sudo snap install buzz,或使用 Flatpak 安装 |
| Python | pip install buzz-captions后运行python -m buzz |
如果你恰好装了 Python 3.12,最后一种方式一条命令就能跑起来。Windows 安装包未签名,首次运行会弹提示,选择"更多信息 → 仍要运行"即可。想尝鲜新版或研究源码的开发者,也可以把仓库克隆到本地:
git clone https://gitcode.com/GitHub_Trending/buz/buzz第一次启动时,Buzz 会按你选的模型下载对应文件(最小的约 200MB),之后就可以全程离线使用。
给不想折腾的人一句话:Windows 和 macOS 用户直接下载安装包,其余全部交给引导流程,全程不用碰命令行。
🎯 第三步:选对模型,开始转写
转写前你会看到任务配置界面,这是决定速度和精度的关键。Buzz 提供 5 档 Whisper 模型:
| 模型 | 特点 | 适合场景 |
|---|---|---|
| tiny | 最快,最省资源 | 临时速记、实时转写 |
| base | 速度与精度平衡 | 日常录音 |
| small | 精度较好,速度适中 | 一般会议、讲座 |
| medium | 高精度 | 重要访谈、正式内容 |
| large | 最高精度 | 字幕制作、专业用途 |
几个实用技巧:
- GPU 加速:NVIDIA 显卡可用 CUDA 加速,Mac 走 Apple Silicon 优化,Whisper.cpp 后端还支持 Vulkan,多数显卡都能提速;
- 初始提示词:在"高级"里填上人名、产品名等易错词,能明显减少专名拼写错误;
- 词级时间戳:开启后每个词都有精确时间点,是后续精细调整字幕的基础;
- 提取语音:嘈杂音频开启后,会先分离人声再转写,精度更好。
偏好设置:字体、API 密钥、导出命名规则等集中管理
给精度敏感的人一句话:重要内容直接上 medium/large,配合初始提示词,专有名词的错误率会肉眼可见地下降。
✍️ 第四步:精修转录结果
转写完成只是开始。双击任务行,打开转录查看器,你会看到一段段带精确时间戳的文字。
转录查看器:每段文字都有开始/结束时间,可边听边改
这个界面值得花点时间熟悉:
- 搜索定位:按
Ctrl+F输入关键词,立刻跳到对应片段,在长录音里找关键讨论点特别好用; - 播放校对:边播放边核对,支持 0.5x~2x 变速,长音频听稿不费劲;
- 跟播与循环:开启"跟随音频"让文字随播放自动滚动;勾选"循环片段"反复听某一段,校对口齿不清的部分最省事;
- 微调时间戳:按
Ctrl+←/→微调片段起止时间,让字幕对齐更精确。
如果你做字幕,别错过Resize(重排)功能:设定目标字幕长度后,Buzz 会自动按标点拆分长句、按音频静音间隙合并短句,把碎片化文本重组为规整的字幕。
字幕重排:设定目标长度,Buzz 自动拆分、合并,一句句整理成字幕
给字幕制作者一句话:转写时记得开启词级时间戳,Resize 才能发挥全部威力。
📤 第五步:导出、翻译、交稿
精修完成后,导出非常直接,支持格式包括:
- TXT:纯文本,适合会议纪要、笔记;
- SRT / VTT:带时间轴字幕,可直接导入剪辑软件;
- JSON:结构化数据,方便程序二次处理。
需要跨语言场景时,Buzz 也内置翻译能力:Whisper 默认可以把内容译成英文;从 1.0.0 起,还能借助 OpenAI 兼容接口(比如本地的 Ollama、LM Studio)把字幕翻译成任意语言,全程同样可以不出本机。
给外语学习者一句话:导入外语音频 → 翻译出双语文本 → 导出 SRT,一套"外语音频 + 双语字幕"的学习材料就做好了。
🚀 进阶玩法:再快一步的三件事
基础流程跑通后,这几个功能能显著提升效率:
- 实时录音转写:接上麦克风边录边转,还配有独立的"演示窗口",开会、讲座时投到大屏幕上,观众能实时看到字幕;
- 文件夹监控:设定一个监控目录,新放入的音频自动转写,适合搭建"上传即出稿"的半自动流水线;
- 插件系统:1.4.5 起支持插件,官方内置了 AI 摘要、DeepFilterNet 降噪、导出 DOCX、跳过已转写文件、自动语言检测等,在"帮助 → 插件"里即可开关和排序。
想批量自动化处理,Buzz 还提供命令行接口(CLI),脚本跑批、定时任务都能接得上。
给团队效率控一句话:把文件夹监控和跳过已转写插件一开,每天丢进去的音视频会自动变成文字稿,你只管写周报。
✅ 谁适合用 Buzz?一张清单看明白
| 人群 | 典型场景 | 推荐用法 |
|---|---|---|
| 职场人 | 会议录音整理纪要 | 批量导入 + TXT 导出 |
| 视频创作者 | 给视频配字幕 | large 模型 + 词级时间戳 + Resize + SRT |
| 学生与研究者 | 讲座、访谈转文字 | 实时转写 + 翻译 |
| 记者与编辑 | 采访素材整理 | medium 模型 + 搜索定位 |
| 隐私敏感者 | 涉密内容处理 | 全程离线,数据不出本机 |
如果上面的场景有一个戳中你,不妨现在就动手:
- 零基础用户:去项目发布页下载安装包,首次启动选 tiny 模型试跑一段短音频,3 分钟就能看到效果;
- 开发者:
pip install buzz-captions后python -m buzz即可体验,也可以git clone https://gitcode.com/GitHub_Trending/buz/buzz浏览源码——插件机制和 CLI 都很适合二次开发。
一份 3 小时的会议录音,从导入到拿到可编辑的逐字稿,全程离线、免费、数据不出本机。剩下的时间,留给你自己。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考