news 2026/9/6 15:24:45

Buzz 离线语音转文字实操指南:5 分钟转好、改好、导出字幕

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转文字实操指南:5 分钟转好、改好、导出字幕

Buzz 离线语音转文字实操指南:5 分钟转好、改好、导出字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的本地语音转文字工具:丢进音频或视频,产出带时间轴的文字稿,全程离线,文件不出你的电脑。整理采访、写会议纪要、给视频做字幕,都在这一个工具里完成。

🚀 快速上手:第一次转录只需四步

最省事的装法是下载对应系统的安装包,Windows 用户双击安装即可,macOS 用户下载 DMG 拖入应用程序;Linux 可以执行sudo snap install buzz,Python 用户pip install buzz-captions后用python -m buzz启动。

首次运行,按这四步走:

  1. 准备模型:打开「Help → Preferences → Models」,选中一个模型(比如 base 或 small)并下载。首次联网拉取模型文件,之后彻底离线可用。
  2. 导入文件:菜单 File 里选 Import Media File,或按 Ctrl+O,也可以直接点工具栏的 +。音频、视频文件都行。
  3. 设置任务:在弹出的表单里选 Transcribe(转写)或 Translate(翻译),手动指定音频语言——官方建议别依赖自动检测,效果更稳;再确认模型。
  4. 运行并查看:点 Run。状态变为 Completed 后,双击该行打开转录详情页。

主界面就是任务队列,每行记录文件、模型、任务类型和实时进度。关掉窗口,任务会在后台继续跑,批量导入几十个文件也不用守着。

🎯 核心功能:转录选项与模型怎么选

解决什么问题:Whisper 模型分五个档位,速度和准确率是跷跷板,选错了要么干等几小时,要么拿到一堆错别字。

在哪里操作:模型选择就在导入文件后的任务表单里;模型的下载与删除在「Preferences → Models」页面管理。

关键选项怎么选

模型档位速度准确率适合场景
Tiny最快一般首次试跑、实时转写
Base尚可随手笔记、语音备忘
Small中等良好会议纪要、访谈初稿
Medium较慢很高重要内容精转
Large最慢最高字幕制作、交付级文本

建议直接给:随手记录选 Base 就够,要交付的字幕一步到位上 Large。

档位之外还要选 whisper 类型(后端):

  • Whisper:官方实现,稳但慢,吃内存。
  • Whisper.cpp:C++ 优化版,任何显卡都能加速,纯 CPU 也能实时转写,Mac 用户首选。
  • Faster Whisper:有 6GB 以上显存的 NVIDIA 卡选它,快一个量级。
  • HuggingFace:支持大量社区定制模型,想试某语言专用优化模型就选它。

任务表单的「Advanced...」按钮下还有个易漏的选项:Initial prompt。把音频里会出现的专有名词、易拼错词写进去,转录结果就不会写错。访谈录音尤其值得用。

✍️ 转录详情页:把文稿变成能用的东西

双击已完成的任务进入转录详情页。它不是只读视图,而是一个可以编辑的字幕工作台。

解决什么问题:Whisper 切出来的句子长短不一,文本不能直接用,需要改错、切字幕长度、再导出。

在哪里操作:详情页顶部工具栏集中了视图切换、搜索、播放控制、翻译、Resize(字幕调整)、导出等入口。

  • 每段文字都带起止时间戳,点哪段就跳到音频对应位置。
  • 播放面板支持 0.5 倍到 2.0 倍速,可勾选「Loop Segment」循环播放当前段、「Follow Audio」让文字跟随音频滚动。
  • 改文字自动保存;用 Ctrl+← / Ctrl+→ 可以按 0.5 秒为单位微调段落时间戳。

关键选项怎么选:想导字幕,导入文件时勾选 Word-Level Timings 生成词级时间戳,之后点 Resize 把词级片段合并成字幕行——可设每条字幕最大长度、按标点断句、按音频静音间隙合并碎片。调完从 Export 菜单导 SRT 丢进剪辑软件即可;只当文字笔记就导 TXT 或 VTT。

延伸阅读:文件导入文档

🛠️ 进阶用法:三条主流程之外的场景

1. 会议、课堂实时转写。打开 Live Recording 界面,选好麦克风、语言和模型,点 Record,说话的同时文字就出来。长会议用 Whisper.cpp 后端配小模型,默认 Whisper 的资源消耗扛不住。开始录音后还能打开演示窗口,把实时文字投到大屏上;结束录音后,文稿以普通任务形式存在列表里,可继续编辑导出。

2. 文件夹监控自动转录。开启 watch folder 功能后,新音频丢进指定文件夹,Buzz 自动排队转写。团队协作用它最顺手:录音丢进共享目录,文字稿自己出来。重复导入已转过的文件时,内置的 Skip Already Transcribed 插件会自动跳过,不重复跑模型。

3. 命令行批量处理。习惯脚本的话,内置 CLI 一条命令搞定:buzz add --task transcribe --model-type whispercpp --model-size small --srt 你的视频.mp4,加--hide-gui还能完全隐藏界面跑批处理,适合写进自动化流水线。参数全集见 CLI 文档。

另外 Buzz 还有插件系统(Help → Plugins):AI 摘要、DOCX 导出、DeepFilterNet 降噪等都是内置项,拖拽即可调整执行顺序,也可以照着 plugins 源码 自己写。

❓ 常见问题

  • 转得太慢怎么办?换小一号的模型,或把后端换成 Whisper.cpp / Faster Whisper;有 NVIDIA 卡就吃满 GPU 加速,同时别开太多并行任务。
  • 任务一直卡在排队?多半是模型没下载完。先去「Preferences → Models」确认模型就位,再添加任务。
  • 启动后闪退?大概率是模型文件下载不完整,在 Models 页面删掉对应模型重新下载;另注意 Buzz 要求 CPU 支持 AVX2,太老的机器带不动。
  • 完全离线的电脑能用吗?能。先在联网机器下载好模型,点「Show file location」定位模型目录,整体拷贝到离线机器的同一路径即可。

Buzz 适合手里语音素材多、又不想把录音传到云端的你。下一步:打开「Preferences → Models」下载一个 base 模型,把第一段音频丢进去。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 15:21:34

Multisim仿真对比:二极管包络检波与同步检波原理及失真分析

简介:二极管包络检波与同步检波仿真实验报告,面向通信电子线路课程学习者及高频电路实验人员,完整呈现调幅波解调的仿真验证过程。报告基于 EWB 软件搭建二极管包络检波器与双边带调幅同步检波电路,包含调幅度 0.8 下的正常波形、…

作者头像 李华
网站建设 2026/9/6 15:17:46

基于Java的充电站管理系统设计与实现:从并发控制到分时计费

简介:一套基于Java的新能源汽车充电站管理系统的设计与实现资料,包含论文与源码,面向计算机类专业学生、毕业设计者以及充电站相关项目开发者。内容围绕充电站实际业务展开,完整覆盖了研究背景、国内外现状、关键技术、可行性分析…

作者头像 李华
网站建设 2026/9/6 15:13:17

MCP实战:用大模型批量解读PDF文献的保姆级教程

简介:MCP(模型上下文协议)近期热度很高,但真正能带新手落地实践的教程并不常见。这份PDF以arxiv为实战场景,手把手展示如何让大模型自动完成文献搜索、下载与解读的一条龙流程,面向有初步开发经验、希望用M…

作者头像 李华