语音转文字不用出网:Buzz 本地音频转录实战笔记
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议录音、播客、课程视频,想把语音变成文字,又怕录音内容被上传到别人的服务器?Buzz 是一个开源的本地音频转录工具,底层跑 OpenAI 的 Whisper 模型,识别全程在你的电脑里完成,结果可以直接导出 TXT、SRT、VTT 字幕。这篇笔记按任务来写:先让你跑通第一次离线转录,再把最常用的三条工作流讲透,最后讲模型选择和高频卡点的排查思路。
不想把录音交给云端,Buzz 能帮你做什么
它解决的核心问题就一个:音频进、文字出,中间不经过任何服务器。能力大致覆盖这几块:导入音频或视频文件做转录或翻译;对着麦克风做实时录音转录,还能开一个演示窗口把实时文字投到大屏上;转录完成后提供带搜索、变速播放、字幕合并调整的查看器;再加一个文件夹监控,目录里放进新音频就自动转。更进阶的还有说话人识别、噪声分离、插件系统(比如 AI 摘要、DOCX 导出),这些后面按需提。
🏁 十分钟跑通第一次本地转录
先装上一个能跑的版本
三个系统都有现成安装包:macOS 装.dmg,Windows 是安装程序(应用未签名,弹窗时选"更多信息"→"仍要运行"即可),Linux 走 Flatpak 或 Snap。图省事的话,Linux 上执行一条命令:
flatpak install flathub io.github.chidiwilliams.Buzz开发者也可以走 PyPI 安装buzz-captions,前提是装好 FFmpeg 并用 Python 3.12 环境。装完打开应用,不用做任何配置,就可以导入文件了。
导入文件,点运行
在文件菜单里选 Import Media File,或点工具栏的 "+" 图标(快捷键 Ctrl/Cmd+O),挑一个音频或视频文件。接下来三个选择:任务选"转录"或"翻译成英文";语言直接手动指定,别用自动检测——官方文档也推荐这么做,指定语言后质量通常更稳;模型先不管,默认值就能转。点 Run,状态列变成 Completed 后,双击这一行就打开了转录查看器,文字、时间轴、播放器都在里面。
第一次转完,你手里就已经有一份能用的文本了。后面的内容都是让这件事更快、更准、更顺手。
三条最常用的工作流
文件转录:把参数调到够用就行
文件导入这条线里,真正值得碰的参数有三个。一是"Export As",决定导出成 TXT、SRT 还是 VTT;二是 Word-Level Timings(单词级时间戳),勾上之后每个词都有独立时间轴,后面做字幕合并时才玩得转;三是 Advanced 里的 Initial prompt(初始提示词),把容易识别错的人名、专业术语写进去,能明显减少错别字。背景很吵的音频可以再开 Extract speech,它会先把人声分离出来再转录。
实时录音:麦克风进,文字流式出
主界面选一个录音任务,设好语言、模型质量、麦克风,点 Record 就开始。两个注意点:默认 Whisper 后端比较吃资源,实时场景建议换 Whisper.cpp 并用小模型;另外录音模式里有"Append and correct",它会在追加新句子的同时回头修正上一句的误差,效果最好但更耗算力,机器吃紧就退回普通追加模式。开录之后会出现演示窗口的入口,全屏一投,观众能实时看到字幕,开会做手语式展示、活动直播字幕都能用。细节见 实时录音文档。
文件夹监控:放进来就自动转
如果你手上有一整个目录的待处理音频,不想一个个导入,可以在首选项里配 Folder Watch(文件夹监控):指定一个目录后,新落地的音频文件会被自动识别并转录。配合插件系统里的"Skip Already Transcribed",重复导入的已转录文件会直接跳过,不会白烧一遍算力。
⚡ Buzz 模型怎么选才不踩坑
Buzz 里的"模型"其实分两层:先选后端(Whisper 的几种实现),再选规模(tiny 到 large)。新手最容易绕晕的是后端,先看这张表:
| 后端 | 特点 | 适合谁 |
|---|---|---|
| Whisper(原版) | 准确但慢,内存占用大 | 有耐心、硬件好的用户 |
| Whisper.cpp | 快且省,支持 Vulkan,集显甚至纯 CPU 都能跑 | 没有 N 卡、Mac 用户的首选 |
| Faster Whisper | 比原版快一个量级,省内存 | N 卡且显存 6GB 以上 |
| HuggingFace | 支持大量第三方微调模型 | 有特定语言优化需求 |
规模上的经验值:tiny/base 试水和实时够用,small 是日常会议的主力,medium 往上是正式交付的档位。Large 家族里 V2 更稳、V3 多数情况最准但偶尔会"编"出音频里没有的词,Turbo 则是速度和准头的折中。没有标准答案,拿同一段你的目标语言音频各试一次最靠谱。
GPU 加速方面:Linux 上 N 卡开箱即用,Windows 安装包已内置 CUDA 12 支持,旧版本 CUDA 会自动回落到 CPU。如果 GPU 反而拖慢速度,可以用环境变量BUZZ_FORCE_CPU强制走 CPU。模型下载和管理都在 帮助 → 首选项 → Models 里,还能给大模型挑 q_5 这类量化版本省显存。
一个容易被忽略的用法:模型缓存在本机(Linux 在~/.cache/Buzz),所以完全可以在有网的机器上把模型下好,整个文件夹拷到无网的机器同一位置,Buzz 就能纯离线工作。常见问题里有更完整的说明。
转录完之后:查看、搜索与字幕调整
双击任务行打开查看器,这是后续所有操作的基地。顶部可以切换时间戳表、纯文本、译文三种视图;Ctrl/Cmd+F 打开搜索栏直接定位关键词;播放面板支持 0.5 到 2 倍速,还能勾选 Loop Segment 循环某一段、勾选 Follow Audio 让文字跟着音频滚动。导出菜单里 TXT、SRT、VTT、JSON 都能出。
真正提效的是 Resize(字幕调整)功能,文档在这里。前提是转录时开了单词级时间戳:打开 Resize 后可以设定每行字幕最大长度、是否按标点断句,Buzz 会把逐词结果重新合并成适合观看的字幕条;如果源音频还在本地,它甚至会分析静音间隙来校准边界。字幕一闪而过看不清?还有个选项能给每条字幕统一延长显示时长。
多人对话的录音,可以点"Identify speakers"做说话人识别:它给每句自动贴标签,你能试听 10 秒样本、把标签改成真名,保存时还能勾选把同一人的连续发言合并成一段。(此功能在 Intel 芯片的 Mac 上不可用。)
三个场景的操作要点
会议与访谈:录音 + 说话人识别
选 small 或 base 模型保证实时跟得上,会议开始时点 Record 录全程,用演示窗口给不方便看笔记的与会者实时投字幕。会后打开转录结果,跑一遍说话人识别,把标签改成人名,再导 TXT 发群。录音文件本身留底,这是双保险。
给视频配字幕:转录 + 调整 + 导出
导入视频后 Buzz 会自动抽取音频。正式内容建议 medium 起步,勾上单词级时间戳;转完在 Resize 里按"最大长度 + 按标点断句"合并成字幕条,需要的话给每条延长一两秒;最后导 SRT,直接拖进剪辑软件,时间轴是对齐的,不用手动卡点。
批量音频:文件夹监控 + CLI
一整个目录的待转文件,配好 Folder Watch 让它自己跑;想脚本化就用 CLI,例如用 Whisper.cpp 的 small 模型转中文音频并直接出 SRT:
buzz add -m whispercpp -s small -l zh --srt 音频文件.mp3插件里的 AI Summary 可以在转录完成后自动用 OpenAI 兼容 API 生成摘要存进备注,批量处理访谈材料时很省心。
🔧 常见卡点:按现象排查
转得太慢→ 大概率是模型或后端选型问题。先换 Whisper.cpp,再把规模降到 small 以下;N 卡显存够 6GB 就换 Faster Whisper。实在慢还可以走 OpenAI API 把识别放到远端。
识别结果不准→ 优先查三处:语言是不是手动指对了;音频噪声大不大(开 Extract speech 或插件里的 DeepFilterNet 降噪);专名是否在初始提示词里。模型越大不必然越准,音频质量和语言设置的影响更大。
提示PaErrorCode-9999或采不到麦克风→ 多半是系统权限拦了。Windows 去 设置 → 隐私 → 麦克风 里确认 Buzz 的权限,杀毒软件的拦截规则也看一眼。
启动崩溃→ 常见原因是模型下载不完整。到 Models 面板删掉对应模型重新下;仍不行就去 帮助 → About Buzz → Show logs 看日志。另外注意 Buzz 要求 CPU 支持 AVX2,非常老的机器跑不起来。
离线机器没法用→ 在联网机器上下载好模型,把模型缓存文件夹整体拷到离线机器的相同位置即可,详见 FAQ。
接下来
从一条录音到一份对齐的字幕,Buzz 全程离线就能走完闭环。想继续深入,从 偏好设置 和 使用文档目录 开始看就行;日常卡壳先翻 常见问题,大多数现象都有现成答案。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考