Buzz 离线语音转文字实操指南:5 分钟转好、改好、导出字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的本地语音转文字工具:丢进音频或视频,产出带时间轴的文字稿,全程离线,文件不出你的电脑。整理采访、写会议纪要、给视频做字幕,都在这一个工具里完成。
🚀 快速上手:第一次转录只需四步
最省事的装法是下载对应系统的安装包,Windows 用户双击安装即可,macOS 用户下载 DMG 拖入应用程序;Linux 可以执行sudo snap install buzz,Python 用户pip install buzz-captions后用python -m buzz启动。
首次运行,按这四步走:
- 准备模型:打开「Help → Preferences → Models」,选中一个模型(比如 base 或 small)并下载。首次联网拉取模型文件,之后彻底离线可用。
- 导入文件:菜单 File 里选 Import Media File,或按 Ctrl+O,也可以直接点工具栏的 +。音频、视频文件都行。
- 设置任务:在弹出的表单里选 Transcribe(转写)或 Translate(翻译),手动指定音频语言——官方建议别依赖自动检测,效果更稳;再确认模型。
- 运行并查看:点 Run。状态变为 Completed 后,双击该行打开转录详情页。
主界面就是任务队列,每行记录文件、模型、任务类型和实时进度。关掉窗口,任务会在后台继续跑,批量导入几十个文件也不用守着。
🎯 核心功能:转录选项与模型怎么选
解决什么问题:Whisper 模型分五个档位,速度和准确率是跷跷板,选错了要么干等几小时,要么拿到一堆错别字。
在哪里操作:模型选择就在导入文件后的任务表单里;模型的下载与删除在「Preferences → Models」页面管理。
关键选项怎么选:
| 模型档位 | 速度 | 准确率 | 适合场景 |
|---|---|---|---|
| Tiny | 最快 | 一般 | 首次试跑、实时转写 |
| Base | 快 | 尚可 | 随手笔记、语音备忘 |
| Small | 中等 | 良好 | 会议纪要、访谈初稿 |
| Medium | 较慢 | 很高 | 重要内容精转 |
| Large | 最慢 | 最高 | 字幕制作、交付级文本 |
建议直接给:随手记录选 Base 就够,要交付的字幕一步到位上 Large。
档位之外还要选 whisper 类型(后端):
- Whisper:官方实现,稳但慢,吃内存。
- Whisper.cpp:C++ 优化版,任何显卡都能加速,纯 CPU 也能实时转写,Mac 用户首选。
- Faster Whisper:有 6GB 以上显存的 NVIDIA 卡选它,快一个量级。
- HuggingFace:支持大量社区定制模型,想试某语言专用优化模型就选它。
任务表单的「Advanced...」按钮下还有个易漏的选项:Initial prompt。把音频里会出现的专有名词、易拼错词写进去,转录结果就不会写错。访谈录音尤其值得用。
✍️ 转录详情页:把文稿变成能用的东西
双击已完成的任务进入转录详情页。它不是只读视图,而是一个可以编辑的字幕工作台。
解决什么问题:Whisper 切出来的句子长短不一,文本不能直接用,需要改错、切字幕长度、再导出。
在哪里操作:详情页顶部工具栏集中了视图切换、搜索、播放控制、翻译、Resize(字幕调整)、导出等入口。
- 每段文字都带起止时间戳,点哪段就跳到音频对应位置。
- 播放面板支持 0.5 倍到 2.0 倍速,可勾选「Loop Segment」循环播放当前段、「Follow Audio」让文字跟随音频滚动。
- 改文字自动保存;用 Ctrl+← / Ctrl+→ 可以按 0.5 秒为单位微调段落时间戳。
关键选项怎么选:想导字幕,导入文件时勾选 Word-Level Timings 生成词级时间戳,之后点 Resize 把词级片段合并成字幕行——可设每条字幕最大长度、按标点断句、按音频静音间隙合并碎片。调完从 Export 菜单导 SRT 丢进剪辑软件即可;只当文字笔记就导 TXT 或 VTT。
延伸阅读:文件导入文档
🛠️ 进阶用法:三条主流程之外的场景
1. 会议、课堂实时转写。打开 Live Recording 界面,选好麦克风、语言和模型,点 Record,说话的同时文字就出来。长会议用 Whisper.cpp 后端配小模型,默认 Whisper 的资源消耗扛不住。开始录音后还能打开演示窗口,把实时文字投到大屏上;结束录音后,文稿以普通任务形式存在列表里,可继续编辑导出。
2. 文件夹监控自动转录。开启 watch folder 功能后,新音频丢进指定文件夹,Buzz 自动排队转写。团队协作用它最顺手:录音丢进共享目录,文字稿自己出来。重复导入已转过的文件时,内置的 Skip Already Transcribed 插件会自动跳过,不重复跑模型。
3. 命令行批量处理。习惯脚本的话,内置 CLI 一条命令搞定:buzz add --task transcribe --model-type whispercpp --model-size small --srt 你的视频.mp4,加--hide-gui还能完全隐藏界面跑批处理,适合写进自动化流水线。参数全集见 CLI 文档。
另外 Buzz 还有插件系统(Help → Plugins):AI 摘要、DOCX 导出、DeepFilterNet 降噪等都是内置项,拖拽即可调整执行顺序,也可以照着 plugins 源码 自己写。
❓ 常见问题
- 转得太慢怎么办?换小一号的模型,或把后端换成 Whisper.cpp / Faster Whisper;有 NVIDIA 卡就吃满 GPU 加速,同时别开太多并行任务。
- 任务一直卡在排队?多半是模型没下载完。先去「Preferences → Models」确认模型就位,再添加任务。
- 启动后闪退?大概率是模型文件下载不完整,在 Models 页面删掉对应模型重新下载;另注意 Buzz 要求 CPU 支持 AVX2,太老的机器带不动。
- 完全离线的电脑能用吗?能。先在联网机器下载好模型,点「Show file location」定位模型目录,整体拷贝到离线机器的同一路径即可。
Buzz 适合手里语音素材多、又不想把录音传到云端的你。下一步:打开「Preferences → Models」下载一个 base 模型,把第一段音频丢进去。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考