摘要
本文解读 IROS 2026 论文《WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control》。该论文提出WayFinder,一个端到端闭环的分层 VLA(Vision-Language-Action)自主导航框架,通过融合零样本多模态大模型(MLLM)的高层战略推理、高频深度强化学习(DRL)的低层运动控制与射线追踪构建的 RGB 语义状态图,让无人机在未知环境中脱困,其特别之处在于把大模型降级为只在进展停滞时才触发的恢复层。实验表明在四张 AirSim 地图上成功率提升 1.82~27.45 个百分点,AirSimNH 从 84.91% 提升到 96.09%,且恢复率随 Gemma 3 参数规模(4B/12B/27B)单调上升,为算力受限的具身智能部署提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 为什么 VLA 一上机器人就"卡壳"?
- 三条相关工作线的局限
- 研究主线:从问题到结论
- 基准/方法设计
- 分层解耦:让谁负责什么
- 分类全景
- 状态图用强对比图元"迎合"视觉编码器
- 方法细节
- 触发、坐标接地与训练可行性
- 视觉状态图的八层语义编码
- 实验设计与结果
- 评测协议
- 主结果:完全可观测地图下的导航成功率
- 部分观测地图:性能不降反升
- 消融研究:每条设计选择都被单独钉死
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- WayFinder 需要微调大模型吗?
- 为什么不每一步都问大模型?
- 为什么用部分观测地图反而比真值地图更好?
- 低层策略为什么用 DQN 而不是连续控制?
- 这套框架能迁移到别的机器人上吗?
- 评估用了多少数据?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control |
| 标题(中文) | 分层视觉-语言-动作:零样本航点生成与低层运动控制 |
| 作者 | Timothy K Johnsen, Marco Levorato |
| 机构 | University of California, Irvine · San Diego State University |
| 会议 | IROS 2026(IEEE/RSJ International Conference on Intelligent Robots and Systems) |
| arXiv | arXiv:2609.37922 |
| 项目网站 | github.com/WreckItTim/OmniNaviPy |
背景与动机
为什么 VLA 一上机器人就"卡壳"?
视觉-语言-动作模型的开放世界泛化能力有目共睹,但把它真正部署到移动机器人上有两个绕不开的瓶颈:其一,算力开销与移动平台的硬件约束直接冲突,持续高频推理在轻型平台上难以维持;其二,大模型输出具有随机性与黑箱特性,而实时运动控制需要的是确定性的安全保证。
现有路线普遍依赖后训练、微调或蒸馏,把大模型知识绑定到特定机器人本体。但微调不仅计算昂贵,在专门的空中导航任务上还几乎不存在大规模高质量示范数据,损失函数对泛化指令本身也不友好。
三条相关工作线的局限
- 经典无地图导航(人工势场、向量场直方图):有确定性的安全保证、计算高效,但容易陷入局部极小,在遮蔽严重的环境里难以脱困。
- DRL 无地图导航:把导航建模为马尔可夫决策过程,用深度 Q 网络(DQN)把高维深度感知直接映射为运动指令,可扩展性强,但缺乏语义常识,分布外泛化误差明显。
- VLA 基础模型(RT-2、OpenVLA):开放世界泛化能力突出,代价是持续推理开销与昂贵的微调。
与本文最接近的是 2023 年 CoRL 的LM-Nav:它同样把语言模型当作高层规划器,通过 CLIP 接地把指令转成视觉接地航点,再交给既有低层导航模块执行——但它依赖完全可观测的全局信息,也缺少针对停滞的恢复机制。WayFinder 的关键差异是把这条零样本分层范式做成闭环:状态图由机载深度射线追踪在线生成,并显式加入"停滞 → 恢复"的触发逻辑,从而消除人工接管。
从更大的历史脉络看,这条路线是两个范式线的竞争与合流:分层线(2023 年 LM-Nav:语言规划器 + 既有执行接口)与端到端线(2023 年 RT-2:首个把动作离散成 token 的 VLA,泛化跃升但微调成本高企)。2024–2025 年分层 VLA 重回导航任务——NaVILA 用中层语言动作驱动视觉运动强化学习策略,VAMOS 做成可转向的分层视觉-语言-动作模型,FASTNav 则用 LoRA 微调的小语言模型把指令跟随做到机载实时。2026 年的 WayFinder 是两条线的合流:既保留大模型式的推理能力,又保留分层架构的确定性控制,而且大模型全程零样本、只在停滞时触发。
研究主线:从问题到结论
图 2:WayFinder 研究主线(Mermaid 流程图)——从 VLA 部署双瓶颈出发,放弃微调、改走分层异步架构,由停滞触发零样本航点生成,最终在四张地图上取得 1.82~27.45 个百分点的成功率增益
基准/方法设计
分层解耦:让谁负责什么
WayFinder 的核心设计是把导航显式拆成默认模式与恢复模式:
- 默认模式(低层 DQN):以长度 $\tau=3$ 的滑动时间窗为状态,包含 $144\times256$ 的深度图 $\mathbf{D}$、相对目标或当前航点的局部 GPS 坐标 $\mathbf{c}$ 与 IMU 航向 $\theta$,输出离散的平移与偏航指令,并配有确定性的短程碰撞规避机制——障碍物一旦被检出就立即中止本次运动,从物理上避免碰撞。
- 恢复模式(高层 MLLM):当滚动窗口内的最大前进量 $\Delta\rho_t = d_{t-N} - \min_{k\in[t-N,t]} d_k$ 低于阈值 $\epsilon$ 时触发标志位 $T_t$,把在线构建的 RGB 状态图 $M_t$ 与结构化语言提示一起送给零样本 Gemma 3,返回的坐标替换当前目标;抵达航点后目标复位为全局终点,重新交回低层策略。
图 1:WayFinder 总体框架——闭环自主栈对传感器作出运动学响应;仅在检测到"停滞"时查询 MLLM 生成新航点(原论文 Fig. 1)
分类全景
状态图用强对比图元"迎合"视觉编码器
$M_t$ 是一张 2D 俯瞰 RGB 图,用强对比的基础图元编码全部语义。设计动机很直接:当代 MLLM 的视觉前端(如 SigLIP)对强对比、语义清晰的图元 token 化得更稳、更准,比直接送 RGB-D 原始观测更省 token。
图 3:WayFinder 的分层职责划分(Mermaid 树状图)——低层 DQN 消费深度图与相对 GPS/IMU 航向,高层零样本 MLLM 消费 RGB 语义状态图与结构化坐标提示
方法细节
触发、坐标接地与训练可行性
三个工程细节决定了这套设计能不能跑起来:
- 稀疏触发条件:大模型只在 $\Delta\rho_t < \epsilon$ 时被调用。作者明确指出每步查询既低效(算力开销大)又无效(会诱发偏离良好轨迹的幻觉),因此触发后还要重置时间窗,避免连续误触发。
- 语言坐标接地:MLLM 在视觉预处理阶段会做动态重缩放与分块(Pan & Scan),这会打断像素索引与空间坐标的对应关系,SigLIP 这类 tokenizer 进一步加剧映射复杂度。因此提示词必须显式给出起点、当前位置、目标与历史路径点的坐标,与图上的坐标轴刻度互相锚定以压掉空间歧义。
- 状态缓存与离散化:训练前预先离散化导航空间、缓存全部自视角深度图与碰撞布尔量,用直接采样代替仿真渲染,把 DQN 训练时间从数周压到数小时;再配合 100 GB 回放池、课程学习、随机回采与早停,缓解灾难性遗忘。离线 A* 则用于量化每条路径的难度并划分训练/验证/测试集。
视觉状态图的八层语义编码
$M_t$ 自下而上依次绘制:黑自由空间(可通行)、白障碍(不可通行)、灰未确定区域,随后是紫色历史轨迹线与圆点、红色三角表示此前生成过的航点(让模型记住哪些恢复尝试已失败,避免重复建议同样的解)、绿色十字起点、蓝色方块当前位姿 $\mathbf{p}_t$、黄色星形全局目标 $\mathbf{g}$。世界地图更新时用掩码保证只有新观测到的自由/占据单元才覆盖旧值,从而在持续更新的同时保留已探索区域的记忆。
实验设计与结果
评测协议
实验全部在 Microsoft AirSim 高保真物理与图形仿真器中完成,覆盖四张复杂度递增的地图:Blocks(最简,稀疏几何障碍、通视良好)、AirSimNH(城郊,含房屋、道路、树木、车辆,也是低层策略唯一的训练域)、CityEnviron(密集都市,含复杂路口与大型建筑)、Coastline(面积最大,含开阔海洋与海岸公路,与训练域分布偏移最严重)。评测集由离线 A算法生成静态留出集共4,000 条路径,每条都验证过存在可行解;评测固定随机种子,并把 MLLM 的 temperature 设为 0。为量化算力与可靠性的权衡,高层策略分别使用 Gemma 3 的4B / 12B / 27B* 三个参数规模。
主结果:完全可观测地图下的导航成功率
该设置直接使用 AirSim 的真值占据栅格,绕过射线追踪模块,为 MLLM 建立性能上界。
| 高层模型 | AirSimNH | Blocks | Coastline | CityEnviron |
|---|---|---|---|---|
| 无(纯低层基线) | 84.91% | 83.71% | 63.73% | 44.55% |
| Gemma3:4b | 92.91% | 89.57% | 69.64% | 57.91% |
| Gemma3:12b | 94.55% | 88.71% | 73.00% | 64.27% |
| Gemma3:27b | 96.09% | 92.43% | 77.73% | 70.73% |
| 27b 相对基线增益 | +11.18 pt | +8.72 pt | +14.00 pt | +26.18 pt |
低层 DQN 只在 AirSimNH 训练,因此基线在其他三张地图上退化明显(CityEnviron 仅 44.55%),这正是分布外泛化误差;加入零样本 MLLM 后四张地图全部提升,且随模型规模单调上升,说明推理能力与参数规模强相关。
部分观测地图:性能不降反升
把真值栅格换成由机载深度射线追踪在线构建的部分观测 $M_t$ 后,恢复率(成功恢复的 episode 占比)依然稳健,27B 甚至在若干地图上反超:
| 高层模型 | AirSimNH | Blocks | Coastline | CityEnviron |
|---|---|---|---|---|
| Gemma3:4b | +54.82% | +28.95% | +25.81% | +25.08% |
| Gemma3:12b | +65.06% | +36.84% | +41.60% | +36.07% |
| Gemma3:27b | +80.72% | +64.91% | +53.63% | +50.82% |
失败恢复率同样极低:27B 在 AirSimNH 仅-0.64%,最高的 Coastline 也只有-7.85%——而 Coastline 恰好是分布偏移最大、空间最开阔的地图。
消融研究:每条设计选择都被单独钉死
默认配置使用 Gemma 3 (27B)、部分观测 $M_t$ 与完整的路径/航点历史,聚合恢复率 56.79%,相对路径长度归一化为 1.00。
| 配置(默认:27B + 部分观测 $M_t$ + 全量历史) | 恢复率 | 相对路径长 |
|---|---|---|
| (I) WayFinder 默认设置 | 56.79% | 1.00 |
| (II) 换用 Gemma3:4b | 30.88% | 1.17 |
| (III) 换用 Gemma3:12b | 41.74% | 1.17 |
| (IV) 语言提示去掉坐标 | 12.26% | 1.46 |
| (V) 去掉航点历史 | 48.02% | 0.99 |
| (VI) 去掉视觉组件 | 55.62% | 1.10 |
| (VII) 去掉路径历史 | 52.37% | 1.12 |
| (VIII) 换用真值占据栅格 | 53.45% | 1.05 |
结果对比总结
图 4:结果对比总结(Mermaid 流程图)——零样本恢复层把基线 84.91%/44.55% 提升到 96.09%/70.73%,同时标出三项关键消融的恢复率下降
关键发现
- 零样本恢复层几乎抹平了分布外泛化误差:27B 模型把 AirSimNH 成功率从 84.91% 提到96.09%,把 CityEnviron 从 44.55% 提到70.73%,最大增益+26.18 个百分点。
- 部分观测地图不是短板:改用射线追踪 $M_t$ 后,27B 在 AirSimNH 的恢复率反而升到+80.72%,Blocks+64.91%,Coastline+53.63%,CityEnviron+50.82%。
- 失败率极低:27B 在 AirSimNH 的失败恢复率仅-0.64%,说明大模型给出的航点绝大多数是有效航点,而不是随机扰动。
- 语言坐标是硬约束而非可选项:消融 (IV) 去掉提示词中的显式坐标后,恢复率从 56.79%崩到 12.26%,相对路径长度从 1.00 涨到1.46,证明视觉与语言必须互相锚定。
- "更完美的地图"反而更差:消融 (VIII) 用真值占据栅格替换射线追踪地图,恢复率从 56.79% 降到53.45%——局部、带不确定性的机器人视角反而逼迫模型按机器人自身视角推理,是有益先验。
- 没有记忆就会打转:消融 (V) 去掉航点历史降到48.02%,原因是无记忆的 MLLM 会反复生成同一个已失败的航点,把机器人困在死循环里。
从创新模式的视角看,WayFinder 命中的是"异构分解差异化处理"(常规态交给 DQN、停滞态交给 MLLM)、"分解并委托求解器"(两个求解器各有明确适用边界,且能力边界被显式扫描)与"通过条件化适配而非重训练"(Gemma 3 权重全程冻结,适配全部由状态图 + 坐标提示这对条件承担)三条模式。它的贡献重心是造出别人能直接复用的东西:开源数据集、完整仓库,以及与具体机器人无关的分层契约。
局限性
- 仅仿真验证:全部结论来自 Microsoft AirSim,没有真机部署,且作者只从无人机视角考察;作者也坦承存在 sim-to-real 缺口。
- 动作空间离散:平移与偏航被量化为有限集合,连续执行依赖一个"被假设存在的"机载飞控固件,不同固件需要重新适配。
- 停滞检测有假阳性:机器人在绕行大型障碍时可能被误判触发 MLLM 查询。扩大时间窗 $N$ 可以缓解,但会延迟检测并需要放宽最大步数限制 $L$——最优 $N$ 取决于具体任务。
- 坐标映射脆弱:MLLM 的动态重缩放与分块会打断像素索引与空间坐标的对应,目前只能靠语言提示中的显式坐标兜底;只有最大的 27B 模型在使用真值栅格时才表现出稳定增益。
- 写作层面的瑕疵:原文存在若干拼写与语法问题,如 "Configuation"(应为 Configuration)、"datasets are no only highly specific"(应为 not only)、缺撇号的 "the robots egocentric depth sensors",以及 "between ... to ..." 的搭配错误;另有两处引用命令被注释掉(LeCun 2002 / Rumelhart 1986),导致句末出现孤立逗号。
常见问题(FAQ)
WayFinder 需要微调大模型吗?
不需要。Gemma 3 的权重在整条流水线中全程冻结,任务适配完全由"RGB 语义状态图 + 结构化坐标提示"这对条件承担。三个参数规模(4B/12B/27B)可以在零重训练的前提下直接互换。
为什么不每一步都问大模型?
两个理由。效率上,每步查询会带来无法承受的推理开销;效果上,作者明确观察到高频查询会诱发幻觉,使航点偏离良好轨迹。因此 WayFinder 采用稀疏触发:只在滚动窗口内的最大前进量 $\Delta\rho_t$ 低于阈值 $\epsilon$ 时才查询,并在查询后重置时间窗。
为什么用部分观测地图反而比真值地图更好?
真值栅格给出的是全局、完美但非自我中心的视图;射线追踪得到的是局部、带不确定性、以机器人为原点的视图。消融 (VIII) 显示前者使恢复率从 56.79% 降到 53.45%,说明后者的"机器人视角"本身就是一种有效的归纳偏置,迫使模型按机器人能看到什么来推理。
低层策略为什么用 DQN 而不是连续控制?
因为任务被显式设计为离散运动原语的选择问题:从有限的平移(米)与偏航(度)集合中选一个动作。离散化大幅压缩了探索空间,让 DRL 收敛更样本高效,同时连续的加速度执行交给机载飞控负责。这一分层也让高层的输出(一个航点坐标)天然可以复用。
这套框架能迁移到别的机器人上吗?
作者持乐观态度:因为 MLLM 始终零样本、只当故障恢复器,方法原则上可迁移到 DRL 之外的多种低层控制器。但需要两个前提——低层控制器本身足够可靠,且高层能获取构建状态图所需的深度/定位信息。
评估用了多少数据?
评测集是离线 A* 生成的静态留出集,共 4,000 条路径,每条都验证过存在可行解;评测固定随机种子并把 MLLM 温度设为 0。作者提到跑满全部样本(4,400 条路径)需要接近一整天,因此部分实验只比较恢复率这一维度。
参考链接
- 论文 arXiv 摘要页:arXiv:2609.37922
- 官方开源仓库(数据集 + 完整流水线):github.com/WreckItTim/OmniNaviPy
- 作者讲解视频:YouTube
- LM-Nav(分层零样本导航的直接前身):arXiv:2207.04429
- RT-2(首个 VLA,端到端范式起点):arXiv:2307.15818
- OpenVLA(开源 VLA 基础模型):arXiv:2406.09246
- NaVILA(分层 VLA 导航):arXiv:2412.04453
- VAMOS(可转向的分层视觉-语言-动作导航模型):arXiv:2510.20818
- FASTNav(机载实时指令跟随):IEEE RA-L 2024
- 综述:Foundation Models in Robotics: A Comprehensive Review(arXiv 2026)
- 综述:Large Model Empowered Embodied AI Survey(arXiv:2508.10399)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)