news 2026/9/7 16:56:03

Buzz 音频转录工具:在本地离线完成 Whisper 转录与翻译

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 音频转录工具:在本地离线完成 Whisper 转录与翻译

Buzz 音频转录工具:在本地离线完成 Whisper 转录与翻译

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款在本机运行的音频转录与翻译工具,它用 OpenAI 的 Whisper 模型把录音、视频或 YouTube 链接转成文字,全程离线完成,音频不需要离开你的设备。对处理敏感会议录音、播客或讲座的人来说,这一点的价值在于数据不经过第三方服务器。

安装 Buzz 并启动应用

macOS 和 Windows 用户可以从官方发布页下载对应安装包;Windows 包未签名,安装时选择"更多信息 → 仍要运行"即可。Linux 用户用 Flatpak 或 Snap:

flatpak install flathub io.github.chidiwilliams.Buzz

也可以从 PyPI 安装,需要本机已有 ffmpeg 和 Python 3.12:

pip install buzz-captions python -m buzz

更完整的系统和依赖说明见 安装文档。首次转录某个模型时,Buzz 会先联网下载模型文件;下载完成后即可离线使用。

把音频文件转成文字

在工具栏点"+"图标(或按 Ctrl/Cmd + O)导入一个 MP3、WAV、MP4 等文件,然后在右侧选择任务(转录或翻译成英文)、语言和模型大小,点"运行"开始。任务状态变为"已完成"后,双击该行即可打开转录查看器,逐句对照时间戳查看和播放。

如果音频里有容易听错的人名或术语,可以点"高级"按钮,在 Initial prompt 里写上这些词,能明显减少拼写错误。建议直接指定语言而不是依赖自动检测,检测有时会给出不稳定结果。操作细节参考 文件导入文档。

给视频生成字幕并导出 SRT

给视频加字幕时,导入前先勾选"词级时间戳",Buzz 会为每个词生成单独字幕行。完成后在转录查看器里点"Resize",设定单条字幕的最大长度、是否按标点拆分,必要时延长每条字幕的显示时间,再导出为 SRT 或 VTT 文件,直接拖进剪辑软件即可。

没有词级时间戳的转录则只能按最大长度重新合并字幕。这一步适合做教学视频或播客的字幕稿,省去手动对齐时间轴的工作。

实时录音转写

切到实时录音模式,选好麦克风、语言和模型,点红色录音按钮即可边说边出文字。注意:默认 Whisper 模型计算量大,实时场景建议改用 Whisper.cpp 后端,并选更小的模型(如 tiny、base)以控制延迟。若队列积压,可在高级设置里加大"转录步长"来降低系统负载。

Buzz 还提供演示窗口,会议或现场演讲时把实时转录投到大屏;若开启实时导出,转写文本会边生成边写入 TXT,方便接入 OBS 等软件。

用命令行批量转录

Buzz 自带 CLI,适合脚本化和批量任务。buzz add接受多个文件或 URL,常用参数如下:

buzz add --model-type whispercpp --model-size small \ --language zh --srt --vtt audio.mp3

--task可选 transcribe / translate,--model-type支持 whisper、whispercpp、fasterwhisper、huggingface、openaiapi,--txt/--srt/--vtt控制输出格式,--hide-gui可隐藏主窗口。完整参数表见 CLI 文档,核心逻辑在 buzz/transcriber/。

选择 Whisper 模型与加速方案

后端特点适合场景
Whisper官方实现,准但慢、吃内存内存充足、追求基准精度
Faster Whisper比 Whisper 快很多、更省内存有 ≥6GB 显存的 Nvidia GPU
Whisper.cppC++ 实现,可用各类 GPU 或纯 CPU无 Nvidia 卡、Mac、实时转写
HuggingFace支持大量自定义与多语言模型需要特定语言优化模型

模型大小从 tiny 到 large:越小越快但错越多,越大越准但越占硬件。large-v3 精度常最好但偶尔会"幻觉"出音频里没有的词,large-v3-turbo 在速度和精度间更平衡。Nvidia 显卡在 Linux 上开箱支持 GPU 加速;想省显存可在偏好里勾选 8bit 量化。模型管理界面见下方截图。

离线环境部署模型

Buzz 本身可以完全离线运行,但模型文件需要先在有网的机器上下载好。在"帮助 → 偏好 → 模型"里下载一个模型并点"显示文件位置",把该文件夹整体拷贝到离线机器的相同路径(如 Linux 的~/.cache/Buzz/models)。仓库里的 scripts/download-models.py 可以帮你一次性准备离线模型缓存。

容易踩的坑

  • 转录太慢:换更小的模型或改用 Whisper.cpp;有 6GB 以上显存可试 Faster Whisper。
  • 崩溃或结果异常:多半是模型下载不完整,到偏好里删掉重新下载。
  • 老 CPU 跑不起来:Buzz 需要 CPU 支持 AVX2,过老的机器不受支持。
  • 录音报 PaErrorCode-9999:检查系统是否允许应用访问麦克风(Windows 在"设置 → 隐私 → 麦克风")。
  • 录制系统声音:需借助虚拟音频设备(macOS 用 BlackHole、Windows 用 VB CABLE),再在 Buzz 里选它作为麦克风。

Buzz 适合需要在本机完成会议、讲座、播客转录,或为视频批量生成字幕、做实时记录的用户;局限是精度上限受所选模型和本机硬件约束,大模型在低配机器上会明显变慢。更多细节可查 官方文档,源码在仓库根目录的 buzz/。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 16:56:01

C++11 constexpr 完全指南:从编译期计算到各版本演进与避坑

C11 里让我觉得“原来还能这样”的特性不少,constexpr 绝对排得上号。它出现得很安静,不过是在函数或者变量前面多了一个修饰词,但效果相当于给编译器开了一条“提前把结果算好”的高速通道。我第一次正儿八经用它,是为了给一个信…

作者头像 李华
网站建设 2026/9/7 16:55:39

SWIOTLB深度解析:从DMA兜底到机密计算安全边界

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 16:54:57

Linux系统信息查看全攻略:跨发行版命令详解与实战

入行这么多年,我接触过的服务器没有一千也有八百台,从最早的物理机到后来的云主机,从 CentOS 6 到现在的 Ubuntu 24.04、Debian 12,每次接手一台新机器,第一件事永远是同一件:把系统信息摸清楚。这个问题看…

作者头像 李华
网站建设 2026/9/7 16:52:34

第41篇|推送通知库适配 HarmonyOS:Token 管理、通知权限和消息去重

第41篇|推送通知库适配 HarmonyOS:Token 管理、通知权限和消息去重 图 1:推送通知库适配封面图,用来概括本文主题、适配对象和工程边界。 实际项目里,推送通知库适配经常不是“引入依赖就能用”的问题。真正麻烦的是输…

作者头像 李华
网站建设 2026/9/7 16:52:28

python的图论工业场景模拟第九十五篇:完美派单可行性校验与缺口分析,任务:验证是否存在完美匹配,不存在则输出缺口工单,图建模说明:二分无向图,核心点:最大匹配数与节点集规模对比。

完美派单可行性校验与缺口分析:验证是否存在完美匹配,不存在则输出缺口工单 "某设备运维中心,每晚要给 12 台待修设备派 8 个值班工程师。系统需要判断:能不能让每台设备都分到合适的人?——也就是完美匹配是否存…

作者头像 李华