Buzz 本地语音转文字:离线转写一条录音并导出可用字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款本地语音转文字工具,基于 OpenAI 的 Whisper 模型在你电脑上离线运行:音频不上传,不按量计费。读完这篇指南,你能装好 Buzz,把第一个音频文件转成带时间轴的文本,并导出 SRT 或 TXT 成果。
Buzz 语音转文字适合哪三类使用场景
先对号入座,你的情况大概率在下面三类之一。
采访录音整理(两小时录音人工转写要四五个小时)。把音频导入 Buzz 排队转写,打开详情后点任意一行,播放位置会跳到对应处,你只负责修人名和术语。 输入:一段录音 → 输出:带时间轴的文本稿
外语内容转成中文(重听加手敲效率太低)。导入时把任务类型选Translate,目标语言选中文,Buzz 先转写再翻译,一次生成中文稿,可直接用于笔记或双语字幕。 输入:英文播客音频 → 输出:中文文本稿
共享目录自动处理(团队成员各自往文件夹放音频)。在Preferences开启 Folder Watch 并指定目录,新音频自动排队转写,结果集中出现在输出目录,不需要有人专门处理。 输入:共享目录里的音频 → 输出:对应目录的文本与字幕文件
Buzz 各系统安装方式与平台特有提醒
四个平台的安装都不复杂,差别在平台特有的授权与警告,装之前先看好下表第三列。
| 系统 | 安装方式 | 容易踩的坑 |
|---|---|---|
| Windows | 下载官方安装程序,双击安装 | 应用未签名,警告弹窗先选「更多信息」再点「仍要运行」 |
| macOS | 下载 .dmg 拖入应用程序,或执行brew install --cask buzz | 仅支持 Apple 芯片,Intel 机型最高只能装 1.4.5 |
| Linux(Snap) | 执行sudo snap install buzz | 装完再执行sudo snap connect buzz:password-manager-service授权密码存储 |
| Python 环境 | 执行pip install buzz-captions,再运行python -m buzz | 需要 Python 3.12,且系统已装好 ffmpeg |
Buzz 第一次转写并导出字幕的完整路径
第一次出稿只需四个动作,按顺序做完就能得到可导出的结果。
- 导入:点工具栏「+」图标或File菜单的Import Media File,选中 MP3 或 MP4,队列里出现一行新任务,显示文件、模型和状态。
- 排队处理:在该行选好模型和语言后点Run;首次会自动下载模型,状态从 Queued 变为 Completed。转写比较耗时,所以任务放在后台队列里跑,关掉窗口也不会中断。
- 打开详情校对:双击已完成的那一行进入转录详情,点任意段落,音频跳到对应位置;直接改字会自动保存。
- 导出:点详情页右上角的导出菜单,选TXT、SRT或VTT保存。
步骤做完后,参数按下表选,不用逐一试错:
| 我的需求 | 建议设置 | 原因 |
|---|---|---|
| 日常笔记、文件不大 | 模型选Base | 速度与准确率平衡好,CPU 也能较快完成 |
| 交付级字幕、有 NVIDIA 显卡 | 模型选Large-v3并装 CUDA 加速 | 准确率上限最高,GPU 能把大模型耗时压下来 |
| 英文音频要中文结果 | 任务类型选Translate,语言选 en | 转写加翻译一步完成,免去二次处理 |
| 短音频或混合语言 | 手动指定语言代码 | 自动检测在短音频上容易判错 |
| 纯文字笔记 | 导出TXT | 没有时间轴干扰,直接阅读 |
| 视频配字幕 | 导出SRT | 通用字幕格式,后续还能调整每行长度 |
更多命令行参数见 docs/docs/cli.md。
Buzz 提升转写速度与质量的几个开关
有四个开关最影响转写速度和质量,按你的硬件条件挑着开。
- 模型档位:决定速度与准确率的平衡点。快速试听选Tiny,日常交付选Base,重要交付选Large;没有 GPU 时别选 Large。
- CUDA GPU 加速:用 NVIDIA 显卡跑大模型可提速数倍。有 NVIDIA 显卡时,在Help菜单的About Buzz里点 Install CUDA Acceleration 安装;没有显卡就保持关闭,改用小一号模型。
- 词级时间戳(Word-Level Timings):给字幕留二次调整的余地。做字幕就开启,之后在详情页点Resize按钮,长句按标点自动拆、碎片自动合并。
- Folder Watch 文件夹监控:共享目录的自动转写。在Preferences的 Folder Watch 页开启并指定目录,再启用Skip Already Transcribed插件,已有结果的文件会被跳过而不是重跑。
插件的更多实现方式可以参考源码 buzz/plugins/。
Buzz 转写常见问题排查表
出问题不必重装或重导,按现象对号入座,通常一两分钟就能定位。
| 现象 | 先检查 | 处理方法 |
|---|---|---|
| 任务一直排队不动 | 模型是否下载完成 | 到Preferences的 Models 页确认模型文件就位,再重新点Run |
| 转写速度明显偏慢 | 模型档位、GPU 是否启用 | 先降一档模型;有 NVIDIA 显卡就装 CUDA 加速;避免多个大任务并行 |
| 识别错漏太多 | 录音质量与模型大小 | 换Large模型重跑;底噪大就先降噪或换干净录音 |
| 自动检测语言不准 | 是否手动指定了语言 | 手动填语言代码,短音频和混合语言尤其要指定 |
| 超大文件内存吃紧 | 文件时长 | 先切段再分批导入,或降一档模型 |
Buzz 把一套完整的 Whisper 转写工作站装在本地:不上传、不计费、离线可用。现在装好它,把第一段音频拖进队列,导出你的第一份文本稿或字幕。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考