VisionClaw行动后端双选指南:自建OpenClaw与云托管Gateway如何选
【免费下载链接】VisionClawReal-time AI assistant for Meta Ray-Ban smart glasses -- voice + vision + agentic actions via Gemini Live and OpenClaw项目地址: https://gitcode.com/gh_mirrors/vi/VisionClaw
VisionClaw是一款面向 Meta Ray-Ban 智能眼镜的实时 AI 助手:它通过语音 + 视觉 + 代理式行动让你"口动眼随"——看到什么问什么,还能帮你发消息、查资料、管待办。其中"大脑"由 Gemini Live 实时语音负责,而真正"动手干活"的部分需要一个行动后端。VisionClaw 支持两种后端:在自家 Mac 上自建的 OpenClaw 网关,以及部署在云端的 Gateway。本文带你用 5 分钟搞清楚两者差异,选到最适合你的那一个。
为什么需要"行动后端"?
Gemini Live 本身只负责"看"和"说":相机以约 1fps 推流给它,音频双向实时对话。但当你说"给购物清单加瓶牛奶"或"给 John 发消息说我迟到"时,它必须把任务委托给一个会执行动作的系统——这就是行动后端的职责。没有它,VisionClaw 退化为"纯语音 + 视觉";有了它,你才拥有发消息、搜索、控制智能家居等 56+ 项技能。
两种后端都遵守同一套协议(OpenAI 兼容的/v1/chat/completions+ WebSocket 事件通道),所以 App 侧几乎无感知,可以任意切换。
方案一:自建 OpenClaw(本地网关)🏠
一句话概括:在你自己的 Mac 上跑一个本地网关,手机通过家庭 Wi-Fi 连过去。
适用场景
- 你有一台常开的 Mac/电脑,且手机与它在同一 Wi-Fi下
- 重视隐私:执行环境、凭据全部在自己机器上
- 单人使用、不想多花部署成本
三步自建步骤
- 安装 OpenClaw:按 OpenClaw 官方仓库的指南安装(参考 README.md 中 "Setup: OpenClaw" 一节),并确认网关开启。
- 配置
~/.openclaw/openclaw.json:三个关键项——bind: "lan"(暴露到局域网,让手机可达)、http.endpoints.chatCompletions.enabled: true(默认关闭,必须打开)、auth.token(App 用来认证的令牌)。 - 配置 App:在 Secrets.swift.example(iOS)或 Secrets.kt.example(Android)中填入 Mac 的 Bonjour 主机名(如
http://Your-Mac.local)、端口18789和 token;也可以在 App 内置的Settings → Agent界面运行时修改,无需重新编译。
启动后验证:
openclaw gateway restart curl http://localhost:18789/health⚠️ 常见坑:手机与 Mac 必须在同一 Wi-Fi、主机名要和系统设置 → 通用 → 共享顶部显示的 Bonjour 名一致,否则就是连接超时。
方案二:云托管 Gateway ☁️
一句话概括:把行动智能体部署到云上,手机随时随地连,不依赖家里的机器开机。
Gateway 位于 gateway/ 目录,官方文档见 gateway/README.md。它对外说和 OpenClaw 完全一样的协议,背后则驱动托管式智能体运行时:每个用户一条持久会话、独立长期记忆存储、独立凭据保险库,外加云端沙箱执行工具(网页搜索、文件、bash)——你不需要运维任何沙箱设施。
云托管 Gateway 的额外福利
- 随处可用:离开家 Wi-Fi 也能执行任务;
- 多用户:
GATEWAY_TOKENS="s3cret-a:alice,s3cret-b:bob"即可为多人发各自的访问令牌,会话互不串扰; - OAuth 连接生态 App:Notion、Slack、Google Calendar 等通过 gateway/src/apps.ts 注册,凭据按用户存在云端保险库并自动续期;
- 两段式回合:简单问题最快 30 秒内回;长任务先回一句确认,结果通过 WebSocket 稍后送达,语音层永不被长任务卡住。
如何自己部署到云
仓库已附 Fly.io 部署配置 gateway/fly.toml,本地开发则:
git clone https://gitcode.com/gh_mirrors/vi/VisionClaw cd VisionClaw/gateway npm install cp .env.example .env # 填入 ANTHROPIC_API_KEY 与 GATEWAY_TOKENS npm run provision # 首次创建共享环境 + 智能体 npm run dev # 本地 :8788 端口部署后,在 App 的Settings → Agent中把 host 指向你的网关地址、端口8788、填入该用户的 token 即可。
双方案对比:一张表看懂差异
| 维度 | 自建 OpenClaw | 云托管 Gateway |
|---|---|---|
| 部署位置 | 自家 Mac/电脑 | 云服务器(如 Fly.io) |
| 网络要求 | 手机与主机同一 Wi-Fi | 任意网络均可 |
| 用户数 | 通常为单人 | 多用户(每人独立会话/记忆) |
| 记忆与凭据 | 本地文件 | 云端按用户隔离、自动续期 |
| 连接生态 App | 依赖 OpenClaw 自身能力 | 内置 OAuth 流程(Notion/Slack/Calendar 等) |
| 运维负担 | 低(openclaw gateway restart即可) | 中(需维护云部署与密钥) |
| 数据隐私 | 全部本地 | 经过第三方托管运行时 |
快速决策清单 ✅
- 只想在家试试、重视隐私、有常开的 Mac→ 选自建 OpenClaw,半小时搞定;
- 想在公司/地铁/咖啡馆也用,或要分发给多个用户→ 选云托管 Gateway;
- 两者不是互斥替换关系:App 保留本地模式,云端是替代后端,可随时切换(官方文档原话:"an alternative backend, not a replacement")。
别忘了:语音通话还需要"声音工人" 🎙️
无论选哪个后端,完整语音体验还需要 agent/main.py 这个语音 worker 参与:它加入 LiveKit 房间、驱动实时模型,工具调用则转发给所选网关执行。Gateway 只负责签发房间票据和执行任务,worker 与网关必须配置同一套 LiveKit 凭据,否则 App 会一直卡在 "Waiting for agent"。部署参考 agent/fly.toml。
如果你还要真正戴上 Ray-Ban Meta 眼镜使用,记得先在 Meta AI 应用中开启Developer Mode(设置 → App Info → 连续点击版本号 5 次),否则眼镜链路会被拒绝。
常见问题速查 🛠️
- App 打不开,提示访问码错误?访问码不是官方发放的,而是你的网关签发的令牌:自建 Gateway 时
GATEWAY_TOKENS里冒号前的秘密字符串就是你的访问码。 - OpenClaw 连接超时?三查:同 Wi-Fi、
openclaw gateway restart已运行、主机名与 Bonjour 名一致。 - 卡在 "Waiting for agent"?检查语音 worker 是否在跑、LiveKit 凭据网关与 worker 两端是否一致(免费版 LiveKit Cloud 即可)。
- 想边改边试?两种后端都支持 App 内 Settings → Agent 运行时改 host/token,不必动源码。
结语
VisionClaw 的"行动后端"就像给它配了一双手:自建 OpenClaw 胜在私密、零成本、上手快;云托管 Gateway 胜在随身、多人、生态全。新人建议先从本地 OpenClaw 跑通全链路,再按需升级云端——协议一致,切换只是改三个配置项的事。戴上眼镜,说出第一句话,你的 AI 助手就会真的"动手"了 🚀
【免费下载链接】VisionClawReal-time AI assistant for Meta Ray-Ban smart glasses -- voice + vision + agentic actions via Gemini Live and OpenClaw项目地址: https://gitcode.com/gh_mirrors/vi/VisionClaw
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考