Vibe 语音转写工具:离线批量转录的高效实战指南
【免费下载链接】vibeTranscribe on your own!项目地址: https://gitcode.com/GitHub_Trending/vib/vibe
Vibe 是一款基于 Whisper 引擎的本地语音转写工具,全程在你的设备上运行。它能离线转录音频文件、视频、麦克风与系统声音,支持批量处理与 7 种格式导出,适合不希望语音内容离开本机的人。
三大系统安装部署
Windows
- 下载最新
.exe安装包,双击运行安装向导 - 按提示完成安装,首次启动会自动下载默认模型
- 打开应用即可拖入文件开始转写
系统要求 Windows 8 及以上。若启动时报
msvc140.dll或vcomp140.dll缺失,需先安装 Visual C++ 运行库(vc_redist.x64.exe)再重试。
macOS
- 按芯片选择安装包:Apple Silicon(M1/M2)选
aarch64.dmg,Intel 选x64.dmg - 将应用拖入应用程序文件夹
- 右键点击应用图标,选择「打开」完成首次启动
macOS 13.3 以下版本无法运行。首次必须通过右键「打开」绕过系统安全限制,直接双击会被拦截且无任何提示。
Linux
- 下载
.deb安装包 - 执行安装:
sudo dpkg -i vibe.deb sudo apt-get install -f官方在 Ubuntu 22.04+ 上测试。Arch 用户可用
debtap将.deb转为本地包。若界面渲染异常,启动前执行export WEBKIT_DISABLE_COMPOSITING_MODE=1。
用户打开应用就会试的几个能力
批量转录多个文件
一次把多份音频加入队列,按顺序处理并显示每个文件的进度。
- 打开 Batch 页面,添加
.mp3、.wav等文件 - 选择导出格式:
SRT、VTT、TXT、HTML、PDF、JSON、DOCX - 开始处理,等待队列完成
典型场景:一整季播客或一周的会议录音一次性转出文字。
从网址抓取音频转写
支持从 YouTube、Vimeo、Facebook 等站点抓取音频,也支持麦克风与系统声音直接转写。
- 在主页粘贴视频或音频网址
- 应用自动下载音频并转写
- 或切换输入源,实时转录麦克风 / 系统声音
典型场景:把一段视频讲义转成文字稿存档。Linux 上暂不支持音频文件监听,麦克风与系统声音转写可用。
多语言识别与英文翻译
自动检测并转录 100 多种语言,还支持从任意语言翻译为英文。
- 转录前选择目标语言,或保持自动检测
- 翻译到英文需使用 Whisper
small、medium、large模型(large-v3-turbo不支持翻译) - 转录完成后导出所需格式
典型场景:外语演讲录音转成中文环境可检索的文本。
实时预览与结果导出
转写过程中文字实时刷新,而非等全部跑完才看到结果。
- 拖入文件后观察实时预览面板
- 校对后一键复制、打印或导出
- 可直接打印到任意打印机
提速手段:GPU 加速、macOS MLC 与模型选择
GPU 加速配置
原理:转写引擎通过 Vulkan(NVIDIA/AMD/Intel)或 CoreML(macOS)把推理交给显卡。
- 在设置的模型区确认「Transcribe on CPU」开关为关闭状态
- 在 GPU device 下拉框选择目标显卡,默认
auto - 转写一段已知时长的音频,对比耗时验证生效
预期效果:有独立显卡的机器上,GPU 转写通常比纯 CPU 快 2~3 倍,具体取决于模型大小与显卡型号。
macOS 专属:MLC 模型加速
原理:把模型预编译为 CoreML 格式,Apple Silicon 直接走硬件加速,免去运行时编译。
- 下载与当前模型匹配的
.mlcmodelc.zip(例如ggml-medium-encoder.bin对应ggml-medium-encoder.mlmodelc) - 在 Vibe 设置中打开模型路径
- 把
.mlmodelc文件夹放到.bin同目录
预期效果:首次使用会现场编译、耗时较长,之后同一模型转写速度提升 2~3 倍。
模型选择:速度与精度的取舍
原理:模型越大精度越高但越慢,按需切换比盲目升级划算。
- 在设置里选择内置推荐模型:
tiny/small/medium/large-v3/large-v3-turbo - 也支持 Whisper 之外的 Nemotron 3.5 与 Parakeet TDT v3 模型,适合听写流式场景
- 手动添加自有
.bin/.gguf文件(模型列表参考 docs/models.md)
预期效果:medium是精度与速度的平衡点;large-v3-turbo在大卡上兼顾精度与速度,适合主力使用。
进阶集成:Ollama 摘要与手机 QR 转写
Ollama 本地摘要
前置条件:本机已安装并运行 Ollama。
- 拉取摘要模型:
ollama run llama3.1 - 在 Vibe 设置中开启「转录前摘要」
- 运行内置的 check 确认连接正常
效果:转写完成后自动生成多语言摘要,全程本地离线,还支持批量摘要。
手机扫码转写(QR Handoff)
前置条件:电脑端 Vibe 正在运行。
- 在 Settings → Phone 获取配对 URL 与二维码
- 手机浏览器扫码打开
- 手机录音,经点对点直连发送到电脑转写,文字直接回传
效果:iOS 与 Android 均可用,无需安装任何 App,走 iroh 直连,没有中间服务器。
高频问题速查
msvc140.dll 缺失报错
- 现象:Windows 启动即失败,报
msvc140.dll not found - 原因:系统缺少 Visual C++ 运行库
- 解法:下载安装
vc_redist.x64.exe,重启应用
vulkan-1.dll 缺失
- 现象:GPU 模式不可用,日志报
vulkan-1.dll缺失 - 原因:未安装 Vulkan 运行时
- 解法:安装官方
VulkanRT-Installer.exe
Linux 界面渲染异常
- 现象:窗口白屏、黑块或图形错乱
- 原因:WebKit 合成模式与部分显卡驱动不兼容
- 解法:启动前
export WEBKIT_DISABLE_COMPOSITING_MODE=1
应用闪退且无报错
- 现象:点击启动后立即退出,日志为空
- 原因:多为模型文件或音频文件不兼容
- 解法:用默认模型和标准测试音频复现,并按 docs/debug.md 开启
RUST_LOG=vibe=debug,whisper_rs=debug抓日志
进阶技巧:CLI、无头服务器与字幕级时间戳
CLI 直用。适合脚本化或自动化场景:
vibe --model ggml-medium.bin --file single.wav完整参数见vibe --help,桌面端与 CLI 共用同一转写引擎。
无图形界面服务器跑转写。适合纯命令行环境,用 Xvfb 伪造显示器:
sudo apt-get install xvfb -y Xvfb :1 -screen 0 1024x768x24 & export DISPLAY=1之后正常调用 CLI 即可。
字幕级稳定时间戳。适合给影片或长视频做字幕:在 More Options 中开启Stable timestamps,首次会提示下载 VAD 模型(ggml-silero-v6.2.0.bin)。注意该模式以质量优先,速度约慢 4 倍,普通转写没必要开。
写在最后
Vibe 把 Whisper 转写、批量处理、GPU 加速、本地摘要和手机转写收进一个离线桌面应用,隐私与效率两头都不妥协。建议先跑一个medium模型 + 批量队列熟悉基本流程,再按需叠加 GPU 配置和 Ollama 摘要。更多细节可以看 docs/install.md 与 docs/architecture.md,遇到问题优先翻 docs/debug.md。
【免费下载链接】vibeTranscribe on your own!项目地址: https://gitcode.com/GitHub_Trending/vib/vibe
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考