news 2026/9/7 16:28:24

语音转文字不用出网:Buzz 本地音频转录实战笔记

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
语音转文字不用出网:Buzz 本地音频转录实战笔记

语音转文字不用出网:Buzz 本地音频转录实战笔记

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

会议录音、播客、课程视频,想把语音变成文字,又怕录音内容被上传到别人的服务器?Buzz 是一个开源的本地音频转录工具,底层跑 OpenAI 的 Whisper 模型,识别全程在你的电脑里完成,结果可以直接导出 TXT、SRT、VTT 字幕。这篇笔记按任务来写:先让你跑通第一次离线转录,再把最常用的三条工作流讲透,最后讲模型选择和高频卡点的排查思路。

不想把录音交给云端,Buzz 能帮你做什么

它解决的核心问题就一个:音频进、文字出,中间不经过任何服务器。能力大致覆盖这几块:导入音频或视频文件做转录或翻译;对着麦克风做实时录音转录,还能开一个演示窗口把实时文字投到大屏上;转录完成后提供带搜索、变速播放、字幕合并调整的查看器;再加一个文件夹监控,目录里放进新音频就自动转。更进阶的还有说话人识别、噪声分离、插件系统(比如 AI 摘要、DOCX 导出),这些后面按需提。

🏁 十分钟跑通第一次本地转录

先装上一个能跑的版本

三个系统都有现成安装包:macOS 装.dmg,Windows 是安装程序(应用未签名,弹窗时选"更多信息"→"仍要运行"即可),Linux 走 Flatpak 或 Snap。图省事的话,Linux 上执行一条命令:

flatpak install flathub io.github.chidiwilliams.Buzz

开发者也可以走 PyPI 安装buzz-captions,前提是装好 FFmpeg 并用 Python 3.12 环境。装完打开应用,不用做任何配置,就可以导入文件了。

导入文件,点运行

在文件菜单里选 Import Media File,或点工具栏的 "+" 图标(快捷键 Ctrl/Cmd+O),挑一个音频或视频文件。接下来三个选择:任务选"转录"或"翻译成英文";语言直接手动指定,别用自动检测——官方文档也推荐这么做,指定语言后质量通常更稳;模型先不管,默认值就能转。点 Run,状态列变成 Completed 后,双击这一行就打开了转录查看器,文字、时间轴、播放器都在里面。

第一次转完,你手里就已经有一份能用的文本了。后面的内容都是让这件事更快、更准、更顺手。

三条最常用的工作流

文件转录:把参数调到够用就行

文件导入这条线里,真正值得碰的参数有三个。一是"Export As",决定导出成 TXT、SRT 还是 VTT;二是 Word-Level Timings(单词级时间戳),勾上之后每个词都有独立时间轴,后面做字幕合并时才玩得转;三是 Advanced 里的 Initial prompt(初始提示词),把容易识别错的人名、专业术语写进去,能明显减少错别字。背景很吵的音频可以再开 Extract speech,它会先把人声分离出来再转录。

实时录音:麦克风进,文字流式出

主界面选一个录音任务,设好语言、模型质量、麦克风,点 Record 就开始。两个注意点:默认 Whisper 后端比较吃资源,实时场景建议换 Whisper.cpp 并用小模型;另外录音模式里有"Append and correct",它会在追加新句子的同时回头修正上一句的误差,效果最好但更耗算力,机器吃紧就退回普通追加模式。开录之后会出现演示窗口的入口,全屏一投,观众能实时看到字幕,开会做手语式展示、活动直播字幕都能用。细节见 实时录音文档。

文件夹监控:放进来就自动转

如果你手上有一整个目录的待处理音频,不想一个个导入,可以在首选项里配 Folder Watch(文件夹监控):指定一个目录后,新落地的音频文件会被自动识别并转录。配合插件系统里的"Skip Already Transcribed",重复导入的已转录文件会直接跳过,不会白烧一遍算力。

⚡ Buzz 模型怎么选才不踩坑

Buzz 里的"模型"其实分两层:先选后端(Whisper 的几种实现),再选规模(tiny 到 large)。新手最容易绕晕的是后端,先看这张表:

后端特点适合谁
Whisper(原版)准确但慢,内存占用大有耐心、硬件好的用户
Whisper.cpp快且省,支持 Vulkan,集显甚至纯 CPU 都能跑没有 N 卡、Mac 用户的首选
Faster Whisper比原版快一个量级,省内存N 卡且显存 6GB 以上
HuggingFace支持大量第三方微调模型有特定语言优化需求

规模上的经验值:tiny/base 试水和实时够用,small 是日常会议的主力,medium 往上是正式交付的档位。Large 家族里 V2 更稳、V3 多数情况最准但偶尔会"编"出音频里没有的词,Turbo 则是速度和准头的折中。没有标准答案,拿同一段你的目标语言音频各试一次最靠谱。

GPU 加速方面:Linux 上 N 卡开箱即用,Windows 安装包已内置 CUDA 12 支持,旧版本 CUDA 会自动回落到 CPU。如果 GPU 反而拖慢速度,可以用环境变量BUZZ_FORCE_CPU强制走 CPU。模型下载和管理都在 帮助 → 首选项 → Models 里,还能给大模型挑 q_5 这类量化版本省显存。

一个容易被忽略的用法:模型缓存在本机(Linux 在~/.cache/Buzz),所以完全可以在有网的机器上把模型下好,整个文件夹拷到无网的机器同一位置,Buzz 就能纯离线工作。常见问题里有更完整的说明。

转录完之后:查看、搜索与字幕调整

双击任务行打开查看器,这是后续所有操作的基地。顶部可以切换时间戳表、纯文本、译文三种视图;Ctrl/Cmd+F 打开搜索栏直接定位关键词;播放面板支持 0.5 到 2 倍速,还能勾选 Loop Segment 循环某一段、勾选 Follow Audio 让文字跟着音频滚动。导出菜单里 TXT、SRT、VTT、JSON 都能出。

真正提效的是 Resize(字幕调整)功能,文档在这里。前提是转录时开了单词级时间戳:打开 Resize 后可以设定每行字幕最大长度、是否按标点断句,Buzz 会把逐词结果重新合并成适合观看的字幕条;如果源音频还在本地,它甚至会分析静音间隙来校准边界。字幕一闪而过看不清?还有个选项能给每条字幕统一延长显示时长。

多人对话的录音,可以点"Identify speakers"做说话人识别:它给每句自动贴标签,你能试听 10 秒样本、把标签改成真名,保存时还能勾选把同一人的连续发言合并成一段。(此功能在 Intel 芯片的 Mac 上不可用。)

三个场景的操作要点

会议与访谈:录音 + 说话人识别

选 small 或 base 模型保证实时跟得上,会议开始时点 Record 录全程,用演示窗口给不方便看笔记的与会者实时投字幕。会后打开转录结果,跑一遍说话人识别,把标签改成人名,再导 TXT 发群。录音文件本身留底,这是双保险。

给视频配字幕:转录 + 调整 + 导出

导入视频后 Buzz 会自动抽取音频。正式内容建议 medium 起步,勾上单词级时间戳;转完在 Resize 里按"最大长度 + 按标点断句"合并成字幕条,需要的话给每条延长一两秒;最后导 SRT,直接拖进剪辑软件,时间轴是对齐的,不用手动卡点。

批量音频:文件夹监控 + CLI

一整个目录的待转文件,配好 Folder Watch 让它自己跑;想脚本化就用 CLI,例如用 Whisper.cpp 的 small 模型转中文音频并直接出 SRT:

buzz add -m whispercpp -s small -l zh --srt 音频文件.mp3

插件里的 AI Summary 可以在转录完成后自动用 OpenAI 兼容 API 生成摘要存进备注,批量处理访谈材料时很省心。

🔧 常见卡点:按现象排查

转得太慢→ 大概率是模型或后端选型问题。先换 Whisper.cpp,再把规模降到 small 以下;N 卡显存够 6GB 就换 Faster Whisper。实在慢还可以走 OpenAI API 把识别放到远端。

识别结果不准→ 优先查三处:语言是不是手动指对了;音频噪声大不大(开 Extract speech 或插件里的 DeepFilterNet 降噪);专名是否在初始提示词里。模型越大不必然越准,音频质量和语言设置的影响更大。

提示PaErrorCode-9999或采不到麦克风→ 多半是系统权限拦了。Windows 去 设置 → 隐私 → 麦克风 里确认 Buzz 的权限,杀毒软件的拦截规则也看一眼。

启动崩溃→ 常见原因是模型下载不完整。到 Models 面板删掉对应模型重新下;仍不行就去 帮助 → About Buzz → Show logs 看日志。另外注意 Buzz 要求 CPU 支持 AVX2,非常老的机器跑不起来。

离线机器没法用→ 在联网机器上下载好模型,把模型缓存文件夹整体拷到离线机器的相同位置即可,详见 FAQ。

接下来

从一条录音到一份对齐的字幕,Buzz 全程离线就能走完闭环。想继续深入,从 偏好设置 和 使用文档目录 开始看就行;日常卡壳先翻 常见问题,大多数现象都有现成答案。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 16:28:02

果宝特攻同人创作:寒冰西瓜尊角色设计与IP扩展实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 16:27:38

深入理解Git冲突:从三方合并到实战解决

很多人刚接触 Git 时,最困惑的往往不是那些 push、pull、commit 的基本操作,而是“分支到底是怎么走的”“为什么我明明什么都没动,一拉代码就冲突了”。我自己带过不少前端同事和实习生,几乎每个人第一次遇到 merge conflict 的时…

作者头像 李华
网站建设 2026/9/7 16:24:34

macOS上部署OpenClaw:IPC架构设计与踩坑全记录

最近我在 macOS 上折腾 OpenClaw 本地部署,把整个框架跑通之后,顺手给项目起了个外号叫"人人养虾"。原因很简单:OpenClaw 的 claw 在英文里就是爪子、螯的意思,虾最有辨识度的部位也是那对螯,所以养 OpenCla…

作者头像 李华
网站建设 2026/9/7 16:22:26

Power BI矩阵表与Qt QGLWidget编译错误排查实战

这个标题第一次看到的时候我愣了一下:前半句是Power BI矩阵表,后半句突然变成了一条C编译错误。两种几乎毫无交集的技术内容被拼在一起,看起来很像搜索栏里随手敲出来的关键词组合。但我在实际工作里见过太多类似的场景,业务分析组…

作者头像 李华
网站建设 2026/9/7 16:21:48

机器学习驱动的ERα拮抗剂QSAR建模与ADMET预测实战解析

这是怎么一个项目 先说说结论:这是一个用分子结构数据直接预测药物性质的典型计算机辅助药物设计任务,目标对象是ERα(雌激素受体α)拮抗剂,同时还要预测这类分子的ADMET属性。直白点讲,就是给定一个有机小…

作者头像 李华
网站建设 2026/9/7 16:20:24

需求是意图,QA是证明:从验收标准到安装排错的工程闭环

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华