news 2026/9/7 1:52:30

Buzz 离线音频转录指南:用本地 Whisper 快速完成语音转文字与字幕导出

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线音频转录指南:用本地 Whisper 快速完成语音转文字与字幕导出

Buzz 离线音频转录指南:用本地 Whisper 快速完成语音转文字与字幕导出

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款免费开源的离线音频转录工具,基于 OpenAI 的 Whisper 模型,在你的电脑上本地完成语音转文字与翻译。它支持 100 多种语言,既能处理 MP3、WAV、FLAC、MP4 等音视频文件和 YouTube 链接,也能实时录音转录,并内置字幕编辑、说话人识别与多种格式导出(TXT、SRT、VTT)。所有数据都在本地处理,无需上传服务器。

先做选型:云端转录和本地转录怎么选

把录音交给云端服务,通常换来的是更省心的算力,代价是音频会离开自己的设备。本地转录正好相反:

维度云端转录服务Buzz 本地转录
数据去向上传到第三方服务器完全保留在本机
网络要求必须在线可离线运行
费用多按分钟/时长计费免费,无隐藏收费
硬件要求取决于模型大小(约 75MB 至 2.9GB)
可定制性受限于平台功能可换后端、写插件、接入脚本

如果你的内容涉及商业信息、个人隐私,或者经常在没有网络的环境下工作,本地路线更稳妥;对算力要求不高的轻量场景,两者都可行。下文假设你已经决定使用 Buzz。

按操作系统选择 Buzz 的安装方式

详细步骤见官方 安装文档。四种路径任选其一:

  • macOS:下载.dmg安装包,拖入 Applications 即可(支持 Intel 与 Apple 芯片)。
  • Windows:下载安装包后按提示安装。Buzz 未做代码签名,系统提示安全警告时选择"更多信息"→"仍要运行"。
  • Linux:Flatpak 或 Snap 均可:
flatpak install flathub io.github.chidiwilliams.Buzz # 或 sudo snap install buzz
  • PyPI:需要 Python 3.12 环境和 ffmpeg,适合想参与开发或定制的用户:
pip install buzz-captions python -m buzz

选对 Whisper 模型:速度、精度和内存的平衡

Buzz 的模型管理入口在偏好设置(菜单打开,或按Ctrl/Cmd + ,)的 Model 标签页里,可以下载新模型、删除不用的模型。

Whisper 系列模型按体积分五档,体积越大识别越精细,但转录也更慢、更吃内存:

模型体积(约)适用情况
tiny75MB快速预览、实时转录、低配设备
base142MB日常使用的平衡之选
small466MB需要更高准确度的正式内容
medium1.5GB高精度、长内容
large2.9GB最高准确度,资源需求也最高

除了原始 Whisper,Buzz 还支持 Whisper.cpp、Faster Whisper、Hugging Face 模型族和 OpenAI API 后端。几个和性能直接相关的选择:

  • Whisper.cpp 后端支持 CUDA(NVIDIA 显卡)、Vulkan(多数独立/核显显卡)和 Apple Silicon,实时录音场景官方也建议用它。
  • 大模型可以选量化版本(如q_5)来降低显存占用;在偏好设置里开启"Reduce GPU RAM"或使用 Whisper.cpp 量化模型都能减少显存消耗。
  • 显卡老旧或出问题时,可以设置环境变量BUZZ_FORCE_CPU=true强制用 CPU。

日常对话内容,base 或 small 通常就够用;先把小模型跑通,确认准确度不足再换大的,是更省时间的做法。

第一次转录:导入文件、挑语言、跑通导出

完整说明见 文件导入文档,流程是四步:

  1. 点 File → Import Media File(或工具栏的 "+" 按钮、快捷键Ctrl/Cmd + O),选择音频、视频文件或粘贴 YouTube 链接。
  2. 选择任务(转录 / 翻译成英文)、语言、模型。官方建议明确指定语言——自动检测依据的是开头几秒的音频,容易误判。
  3. 点 Run 开始处理,任务列表里会显示排队、进行中、已完成状态。
  4. 状态变为 Completed 后,双击该行(或选中后点展开图标)打开转录查看器。

三个值得留意的选项:

  • Initial prompt(初始提示词):在 Advanced 按钮下填写,把容易写错的人名、术语放进去,能明显减少同音字错误。
  • Word-level timings(词级时间戳):开启后每个词都有独立时间点,之后才能用调整工具把文本切分成规范字幕(详见下文)。
  • Export As:导出格式可选 TXT、SRT、VTT。

转录完成之后:编辑文字、识别说话人、调整字幕长度

转录查看器是 Buzz 里功能最集中的页面,常用能力如下(详见 转录查看器文档):

  • 搜索与定位Ctrl/Cmd + F打开搜索,Ctrl/Cmd + G让文本滚动跟随播放位置;播放速度支持 0.5 到 2.0 倍。
  • 时间戳微调Ctrl/Cmd + ←/→以 0.5 秒为单位移动片段起止时间,配合 Loop Segment 反复试听同一段落。
  • 说话人识别:在查看器点"Identify speakers",Buzz 会标注不同说话人的句子,可以试听任意一句并把手动改标签改为真实姓名,还能勾选合并同一人的连续句子(Intel 芯片的 Mac 上不可用)。
  • 字幕长度调整:点"Resize"。启用过词级时间戳的转录,可以按标点拆分、按最大长度合并,还能延长每段字幕的显示时长,并借助音频静音分析优化切分位置;没有词级时间戳的转录则只能按最大长度重新合并。详见 编辑与调整文档。
  • 翻译:Whisper 本身支持把非英语音频翻译成英文;要翻到其他语言,需在偏好设置里配置 OpenAI 兼容 API(支持 OpenAI、Ollama、LM Studio 等),再在查看器的 Translate 按钮里填入翻译指令。参考成本:一小时音频用 ChatGPT/Claude 级别模型约 1 美元。
  • 导出:TXT、SRT、VTT、JSON 等格式,可直接交给视频剪辑软件或其他脚本处理。

批量与自动化:命令行、文件夹监控和实时录音

用 CLI 批量处理文件

Buzz 自带命令行入口(CLI 文档),适合脚本化场景。转录单个文件并导出 SRT:

buzz add --task transcribe --language zh --model-type whisper --model-size small --srt 音频文件.mp3

批量处理目录内所有 MP3:

for f in *.mp3; do buzz add --task transcribe "$f"; done

其他常用参数:-t指定任务(transcribe/translate),-m指定后端(whisper、whispercpp、fasterwhisper、huggingface、openaiapi),-p传入初始提示词,--hide-gui后台运行。

用文件夹监控实现"扔进去就转"

在偏好设置的 Folder Watch 标签页指定一个目录,放入的音频文件会自动进入转录队列。配合内置插件Skip Already Transcribed(检测同名 TXT/SRT/VTT 文件或数据库记录),重复导入同一批文件时会自动跳过已完成的任务。

实时录音与演示窗口

麦克风录音转录的步骤:选好任务(转录 / 翻译成英文)、语言、麦克风,点 Record 即可。官方提示:默认 Whisper 后端实时转录开销较大,建议用 Whisper.cpp,并优先 tiny、base 这类小模型。三个实时模式各有取舍——Append below / Append above只追加新句子,Append and correct会持续回改末尾错误,更准但更耗算力。录音开始后还会出现 Presentation window 选项,可以开一个独立窗口在大屏上投出实时文字。

想转录电脑里播放的声音(网课、播客、系统音效),需要装一个虚拟音频设备(macOS 可用 BlackHole,Windows 可用 VB CABLE)把系统输出引到虚拟设备,再在 Buzz 里把它选为麦克风。完整步骤见 实时录音文档。

插件:给转录流水线加扩展

1.4.5 起支持插件(Help → Plugins 管理),内置的六个能覆盖不少重复劳动:AI Summary(接 OpenAI 兼容 API 生成摘要)、Enhanced Language Detection(转录前本地检测语言)、Export DOCX(导出 Word,可带时间戳)、Resize Transcript(转录完自动重排字幕)、DeepFilterNet 降噪(先消噪再转录,适合嘈杂录音)、Skip Already Transcribed。自定义插件可参考 buzz/plugins 目录的源码结构。

关于效果的四个高频问题

  • 语言该选"自动检测"吗?已知语种就手动指定,检测基于前几秒音频,双语或口音重的内容更容易出错。
  • 长音频要分段吗?模型会整段处理;更实际的优化是关掉其他占内存的程序、用 smaller 的模型或量化版本,而不是人为切碎音频。
  • 有 GPU 怎么开加速?NVIDIA 显卡装带 CUDA 的 PyTorch(pip install torch torchaudio --index-url https://download.pytorch.org/whl/cu129);Whisper.cpp 后端可走 Vulkan,核显也能加速。
  • 录音环境要讲究吗?要。安静环境、外接麦克风、录音前试一次电平,对最终准确度的影响比换更大模型更明显。

下一步行动清单

  1. 下载你操作系统的安装包(或pip install buzz-captions),打开 Buzz。
  2. 在偏好设置里下载 base 模型,导入一段两三分钟的音频跑通第一次转录。
  3. 在查看器里试一次搜索、时间戳微调和 SRT 导出。
  4. 需要常态化使用时,再依次配置文件夹监控、CLI 脚本和实时录音。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 1:50:22

马克思主义社会科学方法论复习:从概念辨析到材料题破题

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 1:48:36

用户信息管理系统课程设计全攻略:从技术选型到Lodop打印

简介:武汉理工大学计算机学院Web技术课程设计大作业,基于Spring、Spring MVC、MyBatis三大框架搭建的用户信息管理系统,适合正在完成SSM项目作业或入门Java Web开发的高校学生参考。系统实现了用户注册、登录、注销、密码修改、个人资料编辑&…

作者头像 李华
网站建设 2026/9/7 1:48:01

STM32充电桩环境安全监测系统实战:从原理图到仿真完整解析

在嵌入式项目里摸爬滚打这些年,我越来越觉得“环境安全监测”这类系统是最适合练手、也最容易出成果的方向。它不涉及复杂的运动控制或算法,但把传感器采集、信号处理、阈值判断、执行机构动作、人机交互这些嵌入式核心环节全串起来了,是一个…

作者头像 李华
网站建设 2026/9/7 1:47:37

DDR5内存标签全解读:从JESD401-5C标准看懂PC5、CL和Rank

简介:JESD401-5C是JEDEC发布的DDR5 DIMM标签标准编辑修订版,专为内存模组设计、制造、采购及验证人员提供统一的标签格式与标注规范。该标准有助于消除厂商与采购方之间的理解偏差,促进产品互换性与选型效率。压缩包内仅含1个PDF文档&#xf…

作者头像 李华