news 2026/9/13 6:00:03

Loqua 使用指南:让思维不再因键盘而减速

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Loqua 使用指南:让思维不再因键盘而减速

Loqua 使用指南:让思维不再因键盘而减速

传统键盘 45 wpm,Loqua 语音输入 220 wpm。把粗略的想法变成即用型文字、理解屏幕上的内容、选择聆听而非阅读、用语音推进改写/翻译/日程/编程——减少打字,减少上下文切换,更多时间沉浸于心流。

一、Loqua 是什么?

1.1 一句话定义

Loqua是一款 Mac 和 Windows 原生的 AI 语音输入(Voice Typing & Dictation)软件。它不只是"语音转文字"——它通过读取你的屏幕上下文,把同一句话在你所在的应用里变成恰好正确的内容:在 VS Code 里是代码注释,在 GitHub 里是结构化 PR 描述,在 Slack 里是一条消息。

1.2 核心理念

“你的思维本不该因键盘而减速。”

Loqua 的目标不是做转录工具,而是在你想写的位置,写出你真正想表达的内容。官方明确定位:Loqua 的工作不是转录,而是 destination-aware writing(面向目标的书写)——同一个口头短语,在 Slack、Cursor、GitHub、Apple Notes 和代码编辑器里应该变成不同的文本。

1.3 核心功能

功能说明
语音转文字自然开口说话,粗略想法 → 即用型文字(220 wpm vs 键盘 45 wpm)
Capture to Ask捕获屏幕任意区域,用语音提问,获得分析/翻译/摘要,无需切换应用
Ask & Edit选中文本后口头要求改写,不用打字
聆听模式不想阅读时选择"听"
语音推进工作改写、翻译、日程安排、编程工作流,全程不离开当前工作

1.4 与普通语音输入的区别

维度普通语音输入Loqua
输出转录你说的话写出你真正想表达的内容
上下文只听音频音频 + 屏幕 + 当前应用 + 光标附近内容
格式化无 / 通用App-aware:按目标应用决定输出格式
技术词汇音素级,常出错上下文感知 NER:react query@tanstack/react-query
延迟批量转录为主流式输出,200ms 级端到端延迟
隐私云端处理混合架构,屏幕内容永不出机器

二、三模型架构(为什么它不一样)

Loqua 不是套壳 Whisper,而是由三层协作组成的小型听写模型栈

2.1 第 1 层:语音识别

  • 任务特定的流式识别器(不是直接套 Whisper)
  • 三个设计约束:Streaming-first(没说完就开始输出)、Neural Engine 兼容(Apple Silicon 上高效运行)、低音量鲁棒(咖啡馆、深夜小声听写也覆盖)
  • 输出带 timing 和 confidence 的 token 序列

2.2 第 2 层:语言智能(投入最多的一层)

把语音识别结果变成用户真正想写的内容,三件事并行:

  1. 清理:“Um, so, basically, we should — actually wait, let me start over — we should cache this” → “We should cache this.”
  2. 技术词汇 NER:识别库、框架、模型家族、文件扩展名、终端命令。“React query” 在 JS 文件上下文里变成@tanstack/react-query
  3. 结构化成形:根据目标位置判断输出是句子、项目符号列表、Markdown 表格还是代码注释

按参数量算这一层是栈里最小的模型,但按用户体验影响它最大——团队在这一层投入的工时比另外两层加起来还多。

2.3 第 3 层:多模态上下文

  • 通过 macOS Accessibility 读取:当前活动 app、选中文本、可见相邻文本、目标位置结构线索(Gmail compose vs Slack thread vs VS Code Python file vs Cursor chat panel)
  • 输出一条format directive,语言层用它塑造最终文本
  • 这是 Loqua 不把自己叫"听写 app"的原因

2.4 为什么拆三层而不是一个大模型?

官方做过消融实验:把第 2 层和第 3 层合并成一个 multi-task transformer,两边准确率都下降。"正确转录音素"的 loss surface 和"为 Slack 格式化输出"的 loss surface 指向不同方向,联合训练会同时折中两边。

2.5 内部指标(非第三方基准)

指标内部目标
端到端延迟Apple Silicon 上 200ms 级
Time-to-first-token流式场景 <200ms
NER 准确率领域技术词汇 high 90s
多语言 WER支持条件下低个位数

三、快速开始

3.1 安装

  1. 访问 theloqua.ai,下载 Mac 或 Windows 版
  2. 安装后开启14 天免费试用
  3. 授予必要的权限(麦克风、macOS Accessibility——屏幕上下文读取需要)

3.2 首次使用

基础听写:

  1. 把光标放到目标位置(文档、邮件、代码编辑器、聊天框)
  2. 按快捷键(如 Fn),开始自然说话
  3. 说完停顿约 1.5 秒,输出自动落位

小技巧:中途思考时用填充词(“嗯…就是…”)——Loqua 会把填充词从输出中剥离,但会用它们保持录音开启。1.5 秒静默会被识别为话语结束。

3.3 自然说话,不要"朗读"

Loqua 的设计前提是你说得像正常人,而不是像在念稿:

  • 不要放慢语速去"配合转录"
  • 说错了直接口头纠正,继续推进思路
  • 输出会自动清理错误开头和句中修正

四、核心功能详解

4.1 Capture to Ask(截图提问)

看到看不懂的东西?不用切换应用:

  1. 捕获:按快捷键,框选屏幕上的表格、图表或任意区域
  2. 提问:用语音说出你的问题
  3. 获得:分析、翻译或摘要——就在当前应用内返回

4.2 Ask & Edit(语音改写)

  1. 选中文本段落
  2. 说出改写要求(“更正式一点”、“缩短一半”、“改成给客户的语气”)
  3. Loqua 按你的要求改写,覆盖选中内容

4.3 代码听写(Cursor / VS Code / Claude Code)

Loqua 能识别你是否在 IDE 里,自动调整输出:

位置输出形态
VS Code 代码文件代码/代码注释
Cursor 聊天面板结构化 prompt
终端命令
GitHub PR 描述结构化 Markdown

Cursor 聊天面板注意:面板必须可见——不可见时 Loqua 可能把你的听写当成代码编辑而不是 prompt。先打开面板再说。

代码听写示例:说"如果认证失败返回 401,重定向到登录页,不要重试",Loqua 会输出:

# On auth failure (401): redirect to /login — do not retry.

它同时做了三件事:识别你在代码环境(输出为注释而非散文)、格式化显式值(“十五分钟” → “15 min”)、把第二句收紧成结构化指令。

4.4 会议笔记(voice to tasks)

  • 说"start meeting note decisions and follow ups for this call"
  • Loqua 读取屏幕上下文自动标记:活动窗口标题含 Zoom/Meet 会议名 → 笔记继承该标题;日历事件可见 → 用作笔记标题
  • 动作项可直接发送到 Things 或 Reminders

4.5 8 个被低估的高杠杆工作流

官方建议别只用来"听写一段话"——最有价值的是思维和交付之间的小型重复产物:

  1. Commit 消息
  2. PR 描述
  3. Linear issues
  4. 客户回复
  5. 头脑风暴树
  6. 技术规格(specs)
  7. 代码注释
  8. 异步站会更新

语音工作流在输出是结构化时最好用,而不是为了追求原始转录稿。


五、隐私设计(混合架构)

5.1 三层数据去向

默认运行位置原因
第 2 层语言智能(清理、NER、基础格式化)设备端延迟;词汇表是你的
第 3 层多模态上下文(屏幕读取)设备端屏幕内容永不出你的机器
云端后处理仅 opt-in长文改写、某些翻译;Loqua 托管云,TLS 加密

5.2 隐私可视性

  • 菜单栏指示器:录音时图标变红;某次话语正在使用云时,图标叠加小云朵标识——实时看到是否有东西离开你的机器
  • 设置 → Privacy 面板:列出所有已启用的云端调用,每个都有开关(可以开翻译关长文改写,或反之)
  • 音频处理:音频不外发,设备端完成

六、多语言

  • 支持近100 种语言的自然表达
  • 中英混合 code-switching:语言层直接在 code-switched 数据上训练,句中切换无需模式开关
  • 官方团队内部 Slack 一半是中文夹英文——这是日常场景,不是边缘用例

七、使用技巧与最佳实践

7.1 听写技巧

  • 光标即目标:先放好光标,再说话
  • 说人话:不要放慢、不要念稿、说错了口头纠正
  • 用填充词保持录音:思考时用"嗯/就是"延续,避免 1.5 秒静默提前结束
  • 修正即时化:错了马上说"等一下,改成……",输出会自动整理

7.2 场景化技巧

场景技巧
Cursor 编程先打开聊天面板;描述需求而非代码细节
代码文件口头说逻辑,让 Loqua 输出为注释/代码
会议开启会议笔记,用屏幕上下文自动加标题
写作先口述完整思路,再选中段落用 Ask & Edit 精修
翻译选中文本直接语音要求翻译,不切换应用

7.3 心流原则

  • 减少打字 = 减少思维到输出的损耗
  • 减少上下文切换 = 保持专注状态
  • 语音 220 wpm vs 键盘 45 wpm,约5 倍表达速度

八、常见问题

Q: Loqua 和 macOS 自带听写有什么区别?

A: 自带听写只做转录。Loqua 是三模型栈:清理口语、识别技术词汇(react query@tanstack/react-query)、按目标应用格式化输出,且流式输出延迟 200ms 级。

Q: 屏幕内容会发给云端吗?

A: 不会。第 3 层(屏幕上下文读取)默认在设备端运行,屏幕内容永不出你的机器。云端仅用于你明确开启的功能(长文改写、某些翻译),且每个都有独立开关和实时指示器。

Q: 说错了怎么办?

A: 直接口头纠正继续说话即可。Loqua 会保留句中修正、清理错误开头。不用重录。

Q: 支持中文吗?

A: 支持。近 100 种语言,且专门针对中英混合场景训练,句中切换无需开关。

Q: 代码能直接听写吗?

A: 能。Loqua 识别 IDE/终端/聊天面板/PR 描述等位置并调整输出。但官方诚实的说法是:“口述代码和口述散文是不同的技能”——适合用语音表达逻辑和注释,逐字符听写代码不一定是最高效方式。

Q: 一次说话多久算结束?

A: 1.5 秒静默视为话语结束。思考时用填充词保持录音开启。

Q: 支持 Windows 吗?

A: 支持。Loqua 提供 Mac 和 Windows 版本。


参考资源

  • 官方网站:https://www.theloqua.ai/zh-CN/
  • 三模型架构解析:https://www.theloqua.ai/zh-CN/blog/three-model-architecture.html
  • 多模态语音识别(能看见的监听器):https://www.theloqua.ai/zh-CN/blog/building-a-listener-that-sees.html
  • 代码听写指南(Mac):https://www.theloqua.ai/en/blog/dictate-code-on-mac.html
  • AI 编码语音提示:https://www.theloqua.ai/en/blog/voice-typing-ai-coding.html
  • 语音工作流 8 例:https://www.theloqua.ai/en/blog/voice-typing-workflows-ai-work.html
  • 隐私设计(混合架构):https://www.theloqua.ai/en/blog/privacy-by-design-hybrid.html
  • 写作场景页:https://www.theloqua.ai/en/use-cases/writers.html

Loqua 由 Shuran Zhou 创立的小型算法研究团队开发,本文基于 2026 年 9 月公开资料整理。架构指标为官方内部测量,功能以实际产品为准。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/13 5:58:32

Qwen 3.5 Plus大模型本地化部署与显存优化实战

1. Qwen 3.5 Plus部署方案概述Qwen 3.5 Plus作为阿里云推出的旗舰级大语言模型&#xff0c;其强大的多模态能力和智能体特性使其在编程、办公自动化等场景表现优异。但传统部署方式对显存的高需求&#xff08;通常需要40GB以上显存&#xff09;将大多数个人开发者拒之门外。最新…

作者头像 李华
网站建设 2026/9/13 5:57:01

多晶振变单时钟芯片:硬件时序架构的范式迁移

1. 为什么工程师开始把板子上七八颗晶振“砍”成一颗芯片&#xff1f; 我第一次在客户产线看到那块老主板时&#xff0c;差点以为自己眼花了&#xff1a;密密麻麻贴了9颗晶振——25MHz给CPU&#xff0c;12MHz给USB PHY&#xff0c;32.768kHz给RTC&#xff0c;还有4颗不同频点的…

作者头像 李华
网站建设 2026/9/13 5:55:34

多模检索数据库:标量+向量+全文一体化架构解析

1. 多模检索数据库到底在解决什么问题&#xff1f;——从“搜不到”“搜不准”“搜不快”说起你有没有遇到过这样的场景&#xff1a;在电商后台查一款商品&#xff0c;输入“轻便透气的运动鞋”&#xff0c;系统返回一堆帆布鞋和凉拖&#xff1b;在客服工单系统里搜索“用户反馈…

作者头像 李华
网站建设 2026/9/13 5:54:44

Django+Vue.js小说推荐系统:架构设计与实现

1. 项目概述与核心价值这个基于DjangoVue.js的小说推荐系统项目&#xff0c;本质上是一个融合了大数据处理、机器学习算法和现代Web开发技术的综合性解决方案。作为一名经历过多个推荐系统实战的老兵&#xff0c;我认为这个项目的独特之处在于它完整覆盖了从数据采集、存储计算…

作者头像 李华
网站建设 2026/9/13 5:54:19

C#/VB与三菱FX5U PLC通过SLMP协议实现以太网通讯交互

简介&#xff1a;这套源码采用C#与VB.NET编写&#xff0c;面向三菱FX5U可编程控制器的上位机通讯交互&#xff0c;专为需要将个人电脑与控制器对接的开发者打造&#xff0c;尤其适用于自动化设备的调试与数据采集场景。方案基于TCP协议&#xff0c;支持整数、双整数与浮点数的读…

作者头像 李华