Buzz 离线语音转文字:99+ 语言免费转写,录音不出门
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
两小时的访谈录音还躺在硬盘里,你不敢把它传上云端转录。Buzz 把 Whisper(语音识别模型)直接装进桌面程序,在你电脑上完成离线转录,支持 99+ 种语言,转写文件自动落盘。
能力边界
| 维度 | 说明 |
|---|---|
| 能转的 | 音频、视频文件、YouTube 链接、麦克风实时录音 |
| 不碰的 | 不上传文件、无账号、无订阅费 |
| 联网 or 离线 | 模型首次自动下载,之后全程离线 |
| 免费 or 付费 | 完全免费 |
| 协议 | MIT 开源 |
| 导出格式 | TXT 纯文本、SRT、VTT 字幕 |
离线转录怎么装
- macOS:下载安装页里的
.dmg,打开即用 - Windows:下载安装包,提示"未签名"时点"仍要运行"
- Linux:终端执行
sudo snap install buzz,或flatpak install flathub io.github.chidiwilliams.Buzz - 开发环境:先装好 FFmpeg 与 Python 3.12,再执行
pip install buzz-captions - 想改源码:
git clone https://gitcode.com/GitHub_Trending/buz/buzz
首次运行怎么出结果
你选一个 Whisper 模型 → 首次使用会自动下载,之后就是纯离线转录。你把音频拖进主界面(也支持粘贴 YouTube 链接)→ 任务自动排队。你点开始 → 表格里实时显示每个任务的进度百分比。跑完 → 转写文件自动导出成 TXT、SRT、VTT 存到本地。全程零注册、零配置,装完即用。
三种工作流怎么串
如果手里攒了一批访谈或会议录音,一次全拖进去。任务自动排队依次处理,长文件可以勾选"转录前做语音分离",嘈杂环境下的多人对话准确率会稳很多。
想一边开会一边看文字,点麦克风按钮开始实时录音转录。文字边说边出,事后还能切到演示窗口,把转写内容放大投给台下的听众。
视频要上字幕,导入后走同样的流程。进转写查看器逐句校对:搜索关键词、拖动进度条就能定位到具体那一秒,改完错字还能微调时间戳,按 2 倍速快进复查。字幕长度不统一时,打开 Resize 功能,它会按你设定的目标长度重新切分短字幕。
Whisper 模型怎么选
| 模型 | 速度 | 精度 | 适用 |
|---|---|---|---|
| Tiny | 最快 | 较低 | 草稿速览 |
| Base | 快 | 日常够用 | 普通录音 |
| Small | 中等 | 均衡 | 日常主力 |
| Medium | 较慢 | 较好 | 正式文稿 |
| Large | 最慢 | 最高 | 长文精转 |
Turbo 档在速度和精度之间做了折中。拿不准就先用 Small 跑一遍自己的文件,效果不合意再往上加。
几招少走弯路
转得太慢→ 换 Tiny 或 Base 小模型,或给 GPU 加速(CUDA / Vulkan / Apple Silicon)打开。
转出来冒出原文没有的话→ Large-V3 偶尔会"编"内容,换 Large-V2 或 Turbo 试试。
录音环境差→ 转录前开启语音分离,多人对话准确率明显更稳。
专业内容错字多→ 用"初始提示"填入领域术语和人名,准确率提升明显。
文件超过一小时→ 先切成几段再转,稳定不易中断;要批量自动化,直接用 CLI 跑脚本。
五分钟试错
回到开头那盘访谈录音:找一个你不想上云的敏感文件,拖给 Buzz 跑一遍。五分钟就能判断它适不适合你。
- 官方文档:docs/docs/
- 插件源码:buzz/plugins/
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考