Loqua 使用指南:让思维不再因键盘而减速
传统键盘 45 wpm,Loqua 语音输入 220 wpm。把粗略的想法变成即用型文字、理解屏幕上的内容、选择聆听而非阅读、用语音推进改写/翻译/日程/编程——减少打字,减少上下文切换,更多时间沉浸于心流。
一、Loqua 是什么?
1.1 一句话定义
Loqua是一款 Mac 和 Windows 原生的 AI 语音输入(Voice Typing & Dictation)软件。它不只是"语音转文字"——它通过读取你的屏幕上下文,把同一句话在你所在的应用里变成恰好正确的内容:在 VS Code 里是代码注释,在 GitHub 里是结构化 PR 描述,在 Slack 里是一条消息。
1.2 核心理念
“你的思维本不该因键盘而减速。”
Loqua 的目标不是做转录工具,而是在你想写的位置,写出你真正想表达的内容。官方明确定位:Loqua 的工作不是转录,而是 destination-aware writing(面向目标的书写)——同一个口头短语,在 Slack、Cursor、GitHub、Apple Notes 和代码编辑器里应该变成不同的文本。
1.3 核心功能
| 功能 | 说明 |
|---|---|
| 语音转文字 | 自然开口说话,粗略想法 → 即用型文字(220 wpm vs 键盘 45 wpm) |
| Capture to Ask | 捕获屏幕任意区域,用语音提问,获得分析/翻译/摘要,无需切换应用 |
| Ask & Edit | 选中文本后口头要求改写,不用打字 |
| 聆听模式 | 不想阅读时选择"听" |
| 语音推进工作 | 改写、翻译、日程安排、编程工作流,全程不离开当前工作 |
1.4 与普通语音输入的区别
| 维度 | 普通语音输入 | Loqua |
|---|---|---|
| 输出 | 转录你说的话 | 写出你真正想表达的内容 |
| 上下文 | 只听音频 | 音频 + 屏幕 + 当前应用 + 光标附近内容 |
| 格式化 | 无 / 通用 | App-aware:按目标应用决定输出格式 |
| 技术词汇 | 音素级,常出错 | 上下文感知 NER:react query→@tanstack/react-query |
| 延迟 | 批量转录为主 | 流式输出,200ms 级端到端延迟 |
| 隐私 | 云端处理 | 混合架构,屏幕内容永不出机器 |
二、三模型架构(为什么它不一样)
Loqua 不是套壳 Whisper,而是由三层协作组成的小型听写模型栈:
2.1 第 1 层:语音识别
- 任务特定的流式识别器(不是直接套 Whisper)
- 三个设计约束:Streaming-first(没说完就开始输出)、Neural Engine 兼容(Apple Silicon 上高效运行)、低音量鲁棒(咖啡馆、深夜小声听写也覆盖)
- 输出带 timing 和 confidence 的 token 序列
2.2 第 2 层:语言智能(投入最多的一层)
把语音识别结果变成用户真正想写的内容,三件事并行:
- 清理:“Um, so, basically, we should — actually wait, let me start over — we should cache this” → “We should cache this.”
- 技术词汇 NER:识别库、框架、模型家族、文件扩展名、终端命令。“React query” 在 JS 文件上下文里变成
@tanstack/react-query - 结构化成形:根据目标位置判断输出是句子、项目符号列表、Markdown 表格还是代码注释
按参数量算这一层是栈里最小的模型,但按用户体验影响它最大——团队在这一层投入的工时比另外两层加起来还多。
2.3 第 3 层:多模态上下文
- 通过 macOS Accessibility 读取:当前活动 app、选中文本、可见相邻文本、目标位置结构线索(Gmail compose vs Slack thread vs VS Code Python file vs Cursor chat panel)
- 输出一条format directive,语言层用它塑造最终文本
- 这是 Loqua 不把自己叫"听写 app"的原因
2.4 为什么拆三层而不是一个大模型?
官方做过消融实验:把第 2 层和第 3 层合并成一个 multi-task transformer,两边准确率都下降。"正确转录音素"的 loss surface 和"为 Slack 格式化输出"的 loss surface 指向不同方向,联合训练会同时折中两边。
2.5 内部指标(非第三方基准)
| 指标 | 内部目标 |
|---|---|
| 端到端延迟 | Apple Silicon 上 200ms 级 |
| Time-to-first-token | 流式场景 <200ms |
| NER 准确率 | 领域技术词汇 high 90s |
| 多语言 WER | 支持条件下低个位数 |
三、快速开始
3.1 安装
- 访问 theloqua.ai,下载 Mac 或 Windows 版
- 安装后开启14 天免费试用
- 授予必要的权限(麦克风、macOS Accessibility——屏幕上下文读取需要)
3.2 首次使用
基础听写:
- 把光标放到目标位置(文档、邮件、代码编辑器、聊天框)
- 按快捷键(如 Fn),开始自然说话
- 说完停顿约 1.5 秒,输出自动落位
小技巧:中途思考时用填充词(“嗯…就是…”)——Loqua 会把填充词从输出中剥离,但会用它们保持录音开启。1.5 秒静默会被识别为话语结束。
3.3 自然说话,不要"朗读"
Loqua 的设计前提是你说得像正常人,而不是像在念稿:
- 不要放慢语速去"配合转录"
- 说错了直接口头纠正,继续推进思路
- 输出会自动清理错误开头和句中修正
四、核心功能详解
4.1 Capture to Ask(截图提问)
看到看不懂的东西?不用切换应用:
- 捕获:按快捷键,框选屏幕上的表格、图表或任意区域
- 提问:用语音说出你的问题
- 获得:分析、翻译或摘要——就在当前应用内返回
4.2 Ask & Edit(语音改写)
- 选中文本段落
- 说出改写要求(“更正式一点”、“缩短一半”、“改成给客户的语气”)
- Loqua 按你的要求改写,覆盖选中内容
4.3 代码听写(Cursor / VS Code / Claude Code)
Loqua 能识别你是否在 IDE 里,自动调整输出:
| 位置 | 输出形态 |
|---|---|
| VS Code 代码文件 | 代码/代码注释 |
| Cursor 聊天面板 | 结构化 prompt |
| 终端 | 命令 |
| GitHub PR 描述 | 结构化 Markdown |
Cursor 聊天面板注意:面板必须可见——不可见时 Loqua 可能把你的听写当成代码编辑而不是 prompt。先打开面板再说。
代码听写示例:说"如果认证失败返回 401,重定向到登录页,不要重试",Loqua 会输出:
# On auth failure (401): redirect to /login — do not retry.它同时做了三件事:识别你在代码环境(输出为注释而非散文)、格式化显式值(“十五分钟” → “15 min”)、把第二句收紧成结构化指令。
4.4 会议笔记(voice to tasks)
- 说"start meeting note decisions and follow ups for this call"
- Loqua 读取屏幕上下文自动标记:活动窗口标题含 Zoom/Meet 会议名 → 笔记继承该标题;日历事件可见 → 用作笔记标题
- 动作项可直接发送到 Things 或 Reminders
4.5 8 个被低估的高杠杆工作流
官方建议别只用来"听写一段话"——最有价值的是思维和交付之间的小型重复产物:
- Commit 消息
- PR 描述
- Linear issues
- 客户回复
- 头脑风暴树
- 技术规格(specs)
- 代码注释
- 异步站会更新
语音工作流在输出是结构化时最好用,而不是为了追求原始转录稿。
五、隐私设计(混合架构)
5.1 三层数据去向
| 层 | 默认运行位置 | 原因 |
|---|---|---|
| 第 2 层语言智能(清理、NER、基础格式化) | 设备端 | 延迟;词汇表是你的 |
| 第 3 层多模态上下文(屏幕读取) | 设备端 | 屏幕内容永不出你的机器 |
| 云端后处理 | 仅 opt-in | 长文改写、某些翻译;Loqua 托管云,TLS 加密 |
5.2 隐私可视性
- 菜单栏指示器:录音时图标变红;某次话语正在使用云时,图标叠加小云朵标识——实时看到是否有东西离开你的机器
- 设置 → Privacy 面板:列出所有已启用的云端调用,每个都有开关(可以开翻译关长文改写,或反之)
- 音频处理:音频不外发,设备端完成
六、多语言
- 支持近100 种语言的自然表达
- 中英混合 code-switching:语言层直接在 code-switched 数据上训练,句中切换无需模式开关
- 官方团队内部 Slack 一半是中文夹英文——这是日常场景,不是边缘用例
七、使用技巧与最佳实践
7.1 听写技巧
- 光标即目标:先放好光标,再说话
- 说人话:不要放慢、不要念稿、说错了口头纠正
- 用填充词保持录音:思考时用"嗯/就是"延续,避免 1.5 秒静默提前结束
- 修正即时化:错了马上说"等一下,改成……",输出会自动整理
7.2 场景化技巧
| 场景 | 技巧 |
|---|---|
| Cursor 编程 | 先打开聊天面板;描述需求而非代码细节 |
| 代码文件 | 口头说逻辑,让 Loqua 输出为注释/代码 |
| 会议 | 开启会议笔记,用屏幕上下文自动加标题 |
| 写作 | 先口述完整思路,再选中段落用 Ask & Edit 精修 |
| 翻译 | 选中文本直接语音要求翻译,不切换应用 |
7.3 心流原则
- 减少打字 = 减少思维到输出的损耗
- 减少上下文切换 = 保持专注状态
- 语音 220 wpm vs 键盘 45 wpm,约5 倍表达速度
八、常见问题
Q: Loqua 和 macOS 自带听写有什么区别?
A: 自带听写只做转录。Loqua 是三模型栈:清理口语、识别技术词汇(react query→@tanstack/react-query)、按目标应用格式化输出,且流式输出延迟 200ms 级。
Q: 屏幕内容会发给云端吗?
A: 不会。第 3 层(屏幕上下文读取)默认在设备端运行,屏幕内容永不出你的机器。云端仅用于你明确开启的功能(长文改写、某些翻译),且每个都有独立开关和实时指示器。
Q: 说错了怎么办?
A: 直接口头纠正继续说话即可。Loqua 会保留句中修正、清理错误开头。不用重录。
Q: 支持中文吗?
A: 支持。近 100 种语言,且专门针对中英混合场景训练,句中切换无需开关。
Q: 代码能直接听写吗?
A: 能。Loqua 识别 IDE/终端/聊天面板/PR 描述等位置并调整输出。但官方诚实的说法是:“口述代码和口述散文是不同的技能”——适合用语音表达逻辑和注释,逐字符听写代码不一定是最高效方式。
Q: 一次说话多久算结束?
A: 1.5 秒静默视为话语结束。思考时用填充词保持录音开启。
Q: 支持 Windows 吗?
A: 支持。Loqua 提供 Mac 和 Windows 版本。
参考资源
- 官方网站:https://www.theloqua.ai/zh-CN/
- 三模型架构解析:https://www.theloqua.ai/zh-CN/blog/three-model-architecture.html
- 多模态语音识别(能看见的监听器):https://www.theloqua.ai/zh-CN/blog/building-a-listener-that-sees.html
- 代码听写指南(Mac):https://www.theloqua.ai/en/blog/dictate-code-on-mac.html
- AI 编码语音提示:https://www.theloqua.ai/en/blog/voice-typing-ai-coding.html
- 语音工作流 8 例:https://www.theloqua.ai/en/blog/voice-typing-workflows-ai-work.html
- 隐私设计(混合架构):https://www.theloqua.ai/en/blog/privacy-by-design-hybrid.html
- 写作场景页:https://www.theloqua.ai/en/use-cases/writers.html
Loqua 由 Shuran Zhou 创立的小型算法研究团队开发,本文基于 2026 年 9 月公开资料整理。架构指标为官方内部测量,功能以实际产品为准。