第一次用FluidVoice听写?这份保姆级上手清单帮你避坑
【免费下载链接】FluidVoiceFastest and only macOS Dictation app with on-device STT and custom trained AI enhancement model. Windows pre-build available! A local Wispr Flow alternative. DM us on X exclusive model access! 😉 - https://x.com/fluidvoiceapp项目地址: https://gitcode.com/GitHub_Trending/fl/FluidVoice
FluidVoice 是一款 macOS 上的开源语音听写软件,支持本地语音转文字(On-Device STT)和可选的 AI 文本增强,被不少用户当作 Wispr Flow 的本地平替。如果你刚安装它,却不知道从哪下手、权限怎么开、语音模型怎么选,这份新手上手清单就把第一次使用中最容易踩的坑一次性列全了,跟着做 10 分钟即可跑通第一次听写。
开始之前:先确认你的 Mac 符合要求
FluidVoice 对系统有硬性要求,不满足的话后面所有步骤都会卡住:
| 项目 | 要求 |
|---|---|
| 系统版本 | macOS 15.0 (Sequoia) 或更高 |
| 芯片 | Apple Silicon 支持全部模型;Intel Mac 只能通过 Whisper 模型使用 |
| 磁盘空间 | 语音模型约 1 GB;可选的本地 AI 增强模型约 3.5 GB |
| 权限 | 麦克风访问 + 辅助功能(Accessibility) |
💡 避坑提示:如果你的 Mac 是 2020 年以前的 Intel 机型,装完会发现大部分模型列表灰色不可选,这是正常现象,请直接在语音引擎里选 Whisper。
一步安装:用 Homebrew 最快装好
在终端执行一行命令即可,这是目前最快的安装方式:
brew install --cask fluidvoice不想用 Homebrew 的话,也可以去 Releases 页面手动下载最新版。安装完成后从启动台打开 FluidVoice,就会进入新手引导流程。
第一次打开:三张权限与检查清单
启动后主界面是 Welcome 页,左侧导航里的Quick Setup区域就是你的"避坑清单",五项全部变绿才算真正就绪:
逐项说明(也是新手最容易卡住的地方):
- 语音模型就绪——第一次需要下载模型,下载完这一项才亮绿;
- 麦克风权限——系统弹窗里务必点"允许",否则无法录音;
- 辅助功能权限——这是最容易被忽略的一项。FluidVoice 靠它把听写结果"打字"进任意应用,不授权的话你只能得到文本、却无法自动填入 Word、微信等输入框;
- AI 增强配置——可跳过,属于可选项;
- 完成一次试写——引导里会让你实际说一句话验证全链路,强烈建议完成,能提前暴露权限问题。
快捷键方面,听写的默认全局快捷键是右 Option(Alt)键,在任何应用里按一下就能开始说话,松手结束,识别结果会自动输入到光标位置。嫌它不好按的话,可以在设置里换成更顺手的组合键。
语音模型怎么选:先看语言,再看速度
这是新手问得最多的问题。FluidVoice 内置了 Nemotron、Parakeet、Cohere、Apple Speech、Whisper 等多个引擎,界面右上角有速度 / 准确率双仪表盘辅助判断:
给新手的三个选择口诀:
- 只说英语、追求最跟手:选 Parakeet 系列,延迟极低,说话到出字几乎零停顿;
- 中英混合或说小语种:选 Nemotron 或 Parakeet TDT v3,覆盖约 25~40 种语言;
- 想要最准、机器内存大:选高精度模型(Whisper Large 需要 10GB+ 内存,内存小的机器慎选,界面会有明显警告)。
另外有一个"零下载"选项:Apple Speech,直接用 macOS 系统自带的识别能力,适合想先快速体验、不想等下载的用户。模型与语言的完整对照见 README.md 的 Supported Models 一节。
AI 文本增强:要不要开?
识别出来的原始文字往往带着口语化的毛病——"五点三十"、缺标点、大小写混乱。FluidVoice 的Fluid Intelligence是一个完全跑在本地的 AI 引擎,能把原始听写润色成规范文本,全程不上传任何数据:
新手建议:先别急着开。先用纯听写熟悉几天,觉得文字糙了再在引导里下载这个本地模型(约 3.5 GB)。它和云端 AI 提供商(OpenAI、Groq 等)都是可选项,不开也完全能用核心听写功能。所有功能的实现逻辑可以参考 ASRService.swift。
遇到总听错的词:把词"教"给它
专有名词、同事名字、产品代号是语音识别的重灾区。FluidVoice 内置自定义词典,支持两种方式纠正:
- 语音教学:输入正确写法后,对着麦克风把这个词说 3 次,听对即通过;
- 手动添加:直接输入正确文本。
右上角的Auto-learn words开关打开后,它会观察你反复纠正的词并自动学习,属于"用着用着就变聪明"的功能。词典数据的存取逻辑在 PronunciationDictionaryStore.swift。
说错了想重来?翻一翻历史记录
每次听写都会本地留存(可配置),在侧栏History里能看到完整列表,点进去对比"原始识别"和"AI 处理后"的文本,支持一键复制、删除单条或清空:
这不只是"后悔药"——新手用它的最佳方式是:挑几条听写不准的记录,回到词典页把错词教给它,识别准确率会肉眼可见地提升。
新手避坑速查表
| 症状 | 原因 | 解法 |
|---|---|---|
| 识别出来了但没打进应用 | 缺辅助功能权限 | 系统设置 → 隐私与安全性 → 辅助功能,勾选 FluidVoice |
| 模型列表大部分置灰 | Intel Mac 或系统低于 15.0 | 换 Whisper 模型,或升级系统/换 Apple Silicon |
| 按快捷键没反应 | 快捷键被其他应用占用 | 换一个全局快捷键,避开输入法热键 |
| 大模型下载后应用卡顿 | 机器内存不足 | 换 Parakeet / Nemotron 等轻量模型 |
| 英文识别偶尔出错 | 专有名词未学习 | 到自定义词典里用语音教学纠正 |
写在最后
记住核心思路:权限先给足 → 模型按语言选 → 增强功能按需开。FluidVoice 的设计原则是"一切皆可选",除麦克风和快捷键外没有必选项,所以第一次上手不必追求把所有开关都点亮。
想深入了解的,可以看看仓库内的 docs/MACOS_UI_AUTOMATION_BRANCH_PLAN.md 了解自动化的开发规划,或浏览 Sources/Fluid/Services/ 目录下的各功能模块源码。祝你的第一次语音听写顺利!
【免费下载链接】FluidVoiceFastest and only macOS Dictation app with on-device STT and custom trained AI enhancement model. Windows pre-build available! A local Wispr Flow alternative. DM us on X exclusive model access! 😉 - https://x.com/fluidvoiceapp项目地址: https://gitcode.com/GitHub_Trending/fl/FluidVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考