news 2026/10/2 7:06:07

【IROS 2026】WayFinder:分层视觉-语言-动作,零样本航点生成与低层运动控制|从无人机自主导航视角

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【IROS 2026】WayFinder:分层视觉-语言-动作,零样本航点生成与低层运动控制|从无人机自主导航视角

摘要

本文解读 IROS 2026 论文《WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control》。该论文提出WayFinder,一个端到端闭环的分层 VLA(Vision-Language-Action)自主导航框架,通过融合零样本多模态大模型(MLLM)的高层战略推理、高频深度强化学习(DRL)的低层运动控制与射线追踪构建的 RGB 语义状态图,让无人机在未知环境中脱困,其特别之处在于把大模型降级为只在进展停滞时才触发的恢复层。实验表明在四张 AirSim 地图上成功率提升 1.82~27.45 个百分点,AirSimNH 从 84.91% 提升到 96.09%,且恢复率随 Gemma 3 参数规模(4B/12B/27B)单调上升,为算力受限的具身智能部署提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
    • 为什么 VLA 一上机器人就"卡壳"?
    • 三条相关工作线的局限
  • 研究主线:从问题到结论
  • 基准/方法设计
    • 分层解耦:让谁负责什么
  • 分类全景
    • 状态图用强对比图元"迎合"视觉编码器
  • 方法细节
    • 触发、坐标接地与训练可行性
    • 视觉状态图的八层语义编码
  • 实验设计与结果
    • 评测协议
    • 主结果:完全可观测地图下的导航成功率
    • 部分观测地图:性能不降反升
    • 消融研究:每条设计选择都被单独钉死
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • WayFinder 需要微调大模型吗?
    • 为什么不每一步都问大模型?
    • 为什么用部分观测地图反而比真值地图更好?
    • 低层策略为什么用 DQN 而不是连续控制?
    • 这套框架能迁移到别的机器人上吗?
    • 评估用了多少数据?
  • 参考链接

论文基本信息

项目内容
标题(英文)WayFinder: Hierarchical Visual-Language-Action for Zero-Shot Waypoint Generation and Low-Level Kinematic Control
标题(中文)分层视觉-语言-动作:零样本航点生成与低层运动控制
作者Timothy K Johnsen, Marco Levorato
机构University of California, Irvine · San Diego State University
会议IROS 2026(IEEE/RSJ International Conference on Intelligent Robots and Systems)
arXivarXiv:2609.37922
项目网站github.com/WreckItTim/OmniNaviPy

背景与动机

为什么 VLA 一上机器人就"卡壳"?

视觉-语言-动作模型的开放世界泛化能力有目共睹,但把它真正部署到移动机器人上有两个绕不开的瓶颈:其一,算力开销与移动平台的硬件约束直接冲突,持续高频推理在轻型平台上难以维持;其二,大模型输出具有随机性与黑箱特性,而实时运动控制需要的是确定性的安全保证。

现有路线普遍依赖后训练、微调或蒸馏,把大模型知识绑定到特定机器人本体。但微调不仅计算昂贵,在专门的空中导航任务上还几乎不存在大规模高质量示范数据,损失函数对泛化指令本身也不友好。

三条相关工作线的局限

  • 经典无地图导航(人工势场、向量场直方图):有确定性的安全保证、计算高效,但容易陷入局部极小,在遮蔽严重的环境里难以脱困。
  • DRL 无地图导航:把导航建模为马尔可夫决策过程,用深度 Q 网络(DQN)把高维深度感知直接映射为运动指令,可扩展性强,但缺乏语义常识,分布外泛化误差明显。
  • VLA 基础模型(RT-2、OpenVLA):开放世界泛化能力突出,代价是持续推理开销与昂贵的微调。

与本文最接近的是 2023 年 CoRL 的LM-Nav:它同样把语言模型当作高层规划器,通过 CLIP 接地把指令转成视觉接地航点,再交给既有低层导航模块执行——但它依赖完全可观测的全局信息,也缺少针对停滞的恢复机制。WayFinder 的关键差异是把这条零样本分层范式做成闭环:状态图由机载深度射线追踪在线生成,并显式加入"停滞 → 恢复"的触发逻辑,从而消除人工接管。

从更大的历史脉络看,这条路线是两个范式线的竞争与合流:分层线(2023 年 LM-Nav:语言规划器 + 既有执行接口)与端到端线(2023 年 RT-2:首个把动作离散成 token 的 VLA,泛化跃升但微调成本高企)。2024–2025 年分层 VLA 重回导航任务——NaVILA 用中层语言动作驱动视觉运动强化学习策略,VAMOS 做成可转向的分层视觉-语言-动作模型,FASTNav 则用 LoRA 微调的小语言模型把指令跟随做到机载实时。2026 年的 WayFinder 是两条线的合流:既保留大模型式的推理能力,又保留分层架构的确定性控制,而且大模型全程零样本、只在停滞时触发。

研究主线:从问题到结论

图 2:WayFinder 研究主线(Mermaid 流程图)——从 VLA 部署双瓶颈出发,放弃微调、改走分层异步架构,由停滞触发零样本航点生成,最终在四张地图上取得 1.82~27.45 个百分点的成功率增益

基准/方法设计

分层解耦:让谁负责什么

WayFinder 的核心设计是把导航显式拆成默认模式与恢复模式:

  • 默认模式(低层 DQN):以长度 $\tau=3$ 的滑动时间窗为状态,包含 $144\times256$ 的深度图 $\mathbf{D}$、相对目标或当前航点的局部 GPS 坐标 $\mathbf{c}$ 与 IMU 航向 $\theta$,输出离散的平移与偏航指令,并配有确定性的短程碰撞规避机制——障碍物一旦被检出就立即中止本次运动,从物理上避免碰撞。
  • 恢复模式(高层 MLLM):当滚动窗口内的最大前进量 $\Delta\rho_t = d_{t-N} - \min_{k\in[t-N,t]} d_k$ 低于阈值 $\epsilon$ 时触发标志位 $T_t$,把在线构建的 RGB 状态图 $M_t$ 与结构化语言提示一起送给零样本 Gemma 3,返回的坐标替换当前目标;抵达航点后目标复位为全局终点,重新交回低层策略。

图 1:WayFinder 总体框架——闭环自主栈对传感器作出运动学响应;仅在检测到"停滞"时查询 MLLM 生成新航点(原论文 Fig. 1)

分类全景

状态图用强对比图元"迎合"视觉编码器

$M_t$ 是一张 2D 俯瞰 RGB 图,用强对比的基础图元编码全部语义。设计动机很直接:当代 MLLM 的视觉前端(如 SigLIP)对强对比、语义清晰的图元 token 化得更稳、更准,比直接送 RGB-D 原始观测更省 token。

图 3:WayFinder 的分层职责划分(Mermaid 树状图)——低层 DQN 消费深度图与相对 GPS/IMU 航向,高层零样本 MLLM 消费 RGB 语义状态图与结构化坐标提示

方法细节

触发、坐标接地与训练可行性

三个工程细节决定了这套设计能不能跑起来:

  1. 稀疏触发条件:大模型只在 $\Delta\rho_t < \epsilon$ 时被调用。作者明确指出每步查询既低效(算力开销大)又无效(会诱发偏离良好轨迹的幻觉),因此触发后还要重置时间窗,避免连续误触发。
  2. 语言坐标接地:MLLM 在视觉预处理阶段会做动态重缩放与分块(Pan & Scan),这会打断像素索引与空间坐标的对应关系,SigLIP 这类 tokenizer 进一步加剧映射复杂度。因此提示词必须显式给出起点、当前位置、目标与历史路径点的坐标,与图上的坐标轴刻度互相锚定以压掉空间歧义。
  3. 状态缓存与离散化:训练前预先离散化导航空间、缓存全部自视角深度图与碰撞布尔量,用直接采样代替仿真渲染,把 DQN 训练时间从数周压到数小时;再配合 100 GB 回放池、课程学习、随机回采与早停,缓解灾难性遗忘。离线 A* 则用于量化每条路径的难度并划分训练/验证/测试集。

视觉状态图的八层语义编码

$M_t$ 自下而上依次绘制:黑自由空间(可通行)、白障碍(不可通行)、灰未确定区域,随后是紫色历史轨迹线与圆点、红色三角表示此前生成过的航点(让模型记住哪些恢复尝试已失败,避免重复建议同样的解)、绿色十字起点、蓝色方块当前位姿 $\mathbf{p}_t$、黄色星形全局目标 $\mathbf{g}$。世界地图更新时用掩码保证只有新观测到的自由/占据单元才覆盖旧值,从而在持续更新的同时保留已探索区域的记忆。

实验设计与结果

评测协议

实验全部在 Microsoft AirSim 高保真物理与图形仿真器中完成,覆盖四张复杂度递增的地图:Blocks(最简,稀疏几何障碍、通视良好)、AirSimNH(城郊,含房屋、道路、树木、车辆,也是低层策略唯一的训练域)、CityEnviron(密集都市,含复杂路口与大型建筑)、Coastline(面积最大,含开阔海洋与海岸公路,与训练域分布偏移最严重)。评测集由离线 A算法生成静态留出集共4,000 条路径,每条都验证过存在可行解;评测固定随机种子,并把 MLLM 的 temperature 设为 0。为量化算力与可靠性的权衡,高层策略分别使用 Gemma 3 的4B / 12B / 27B* 三个参数规模。

主结果:完全可观测地图下的导航成功率

该设置直接使用 AirSim 的真值占据栅格,绕过射线追踪模块,为 MLLM 建立性能上界。

高层模型AirSimNHBlocksCoastlineCityEnviron
无(纯低层基线)84.91%83.71%63.73%44.55%
Gemma3:4b92.91%89.57%69.64%57.91%
Gemma3:12b94.55%88.71%73.00%64.27%
Gemma3:27b96.09%92.43%77.73%70.73%
27b 相对基线增益+11.18 pt+8.72 pt+14.00 pt+26.18 pt

低层 DQN 只在 AirSimNH 训练,因此基线在其他三张地图上退化明显(CityEnviron 仅 44.55%),这正是分布外泛化误差;加入零样本 MLLM 后四张地图全部提升,且随模型规模单调上升,说明推理能力与参数规模强相关。

部分观测地图:性能不降反升

把真值栅格换成由机载深度射线追踪在线构建的部分观测 $M_t$ 后,恢复率(成功恢复的 episode 占比)依然稳健,27B 甚至在若干地图上反超:

高层模型AirSimNHBlocksCoastlineCityEnviron
Gemma3:4b+54.82%+28.95%+25.81%+25.08%
Gemma3:12b+65.06%+36.84%+41.60%+36.07%
Gemma3:27b+80.72%+64.91%+53.63%+50.82%

失败恢复率同样极低:27B 在 AirSimNH 仅-0.64%,最高的 Coastline 也只有-7.85%——而 Coastline 恰好是分布偏移最大、空间最开阔的地图。

消融研究:每条设计选择都被单独钉死

默认配置使用 Gemma 3 (27B)、部分观测 $M_t$ 与完整的路径/航点历史,聚合恢复率 56.79%,相对路径长度归一化为 1.00。

配置(默认:27B + 部分观测 $M_t$ + 全量历史)恢复率相对路径长
(I) WayFinder 默认设置56.79%1.00
(II) 换用 Gemma3:4b30.88%1.17
(III) 换用 Gemma3:12b41.74%1.17
(IV) 语言提示去掉坐标12.26%1.46
(V) 去掉航点历史48.02%0.99
(VI) 去掉视觉组件55.62%1.10
(VII) 去掉路径历史52.37%1.12
(VIII) 换用真值占据栅格53.45%1.05

结果对比总结

图 4:结果对比总结(Mermaid 流程图)——零样本恢复层把基线 84.91%/44.55% 提升到 96.09%/70.73%,同时标出三项关键消融的恢复率下降

关键发现

  • 零样本恢复层几乎抹平了分布外泛化误差:27B 模型把 AirSimNH 成功率从 84.91% 提到96.09%,把 CityEnviron 从 44.55% 提到70.73%,最大增益+26.18 个百分点。
  • 部分观测地图不是短板:改用射线追踪 $M_t$ 后,27B 在 AirSimNH 的恢复率反而升到+80.72%,Blocks+64.91%,Coastline+53.63%,CityEnviron+50.82%。
  • 失败率极低:27B 在 AirSimNH 的失败恢复率仅-0.64%,说明大模型给出的航点绝大多数是有效航点,而不是随机扰动。
  • 语言坐标是硬约束而非可选项:消融 (IV) 去掉提示词中的显式坐标后,恢复率从 56.79%崩到 12.26%,相对路径长度从 1.00 涨到1.46,证明视觉与语言必须互相锚定。
  • "更完美的地图"反而更差:消融 (VIII) 用真值占据栅格替换射线追踪地图,恢复率从 56.79% 降到53.45%——局部、带不确定性的机器人视角反而逼迫模型按机器人自身视角推理,是有益先验。
  • 没有记忆就会打转:消融 (V) 去掉航点历史降到48.02%,原因是无记忆的 MLLM 会反复生成同一个已失败的航点,把机器人困在死循环里。

从创新模式的视角看,WayFinder 命中的是"异构分解差异化处理"(常规态交给 DQN、停滞态交给 MLLM)、"分解并委托求解器"(两个求解器各有明确适用边界,且能力边界被显式扫描)与"通过条件化适配而非重训练"(Gemma 3 权重全程冻结,适配全部由状态图 + 坐标提示这对条件承担)三条模式。它的贡献重心是造出别人能直接复用的东西:开源数据集、完整仓库,以及与具体机器人无关的分层契约。

局限性

  • 仅仿真验证:全部结论来自 Microsoft AirSim,没有真机部署,且作者只从无人机视角考察;作者也坦承存在 sim-to-real 缺口。
  • 动作空间离散:平移与偏航被量化为有限集合,连续执行依赖一个"被假设存在的"机载飞控固件,不同固件需要重新适配。
  • 停滞检测有假阳性:机器人在绕行大型障碍时可能被误判触发 MLLM 查询。扩大时间窗 $N$ 可以缓解,但会延迟检测并需要放宽最大步数限制 $L$——最优 $N$ 取决于具体任务。
  • 坐标映射脆弱:MLLM 的动态重缩放与分块会打断像素索引与空间坐标的对应,目前只能靠语言提示中的显式坐标兜底;只有最大的 27B 模型在使用真值栅格时才表现出稳定增益。
  • 写作层面的瑕疵:原文存在若干拼写与语法问题,如 "Configuation"(应为 Configuration)、"datasets are no only highly specific"(应为 not only)、缺撇号的 "the robots egocentric depth sensors",以及 "between ... to ..." 的搭配错误;另有两处引用命令被注释掉(LeCun 2002 / Rumelhart 1986),导致句末出现孤立逗号。

常见问题(FAQ)

WayFinder 需要微调大模型吗?

不需要。Gemma 3 的权重在整条流水线中全程冻结,任务适配完全由"RGB 语义状态图 + 结构化坐标提示"这对条件承担。三个参数规模(4B/12B/27B)可以在零重训练的前提下直接互换。

为什么不每一步都问大模型?

两个理由。效率上,每步查询会带来无法承受的推理开销;效果上,作者明确观察到高频查询会诱发幻觉,使航点偏离良好轨迹。因此 WayFinder 采用稀疏触发:只在滚动窗口内的最大前进量 $\Delta\rho_t$ 低于阈值 $\epsilon$ 时才查询,并在查询后重置时间窗。

为什么用部分观测地图反而比真值地图更好?

真值栅格给出的是全局、完美但非自我中心的视图;射线追踪得到的是局部、带不确定性、以机器人为原点的视图。消融 (VIII) 显示前者使恢复率从 56.79% 降到 53.45%,说明后者的"机器人视角"本身就是一种有效的归纳偏置,迫使模型按机器人能看到什么来推理。

低层策略为什么用 DQN 而不是连续控制?

因为任务被显式设计为离散运动原语的选择问题:从有限的平移(米)与偏航(度)集合中选一个动作。离散化大幅压缩了探索空间,让 DRL 收敛更样本高效,同时连续的加速度执行交给机载飞控负责。这一分层也让高层的输出(一个航点坐标)天然可以复用。

这套框架能迁移到别的机器人上吗?

作者持乐观态度:因为 MLLM 始终零样本、只当故障恢复器,方法原则上可迁移到 DRL 之外的多种低层控制器。但需要两个前提——低层控制器本身足够可靠,且高层能获取构建状态图所需的深度/定位信息。

评估用了多少数据?

评测集是离线 A* 生成的静态留出集,共 4,000 条路径,每条都验证过存在可行解;评测固定随机种子并把 MLLM 温度设为 0。作者提到跑满全部样本(4,400 条路径)需要接近一整天,因此部分实验只比较恢复率这一维度。

参考链接

  • 论文 arXiv 摘要页:arXiv:2609.37922
  • 官方开源仓库(数据集 + 完整流水线):github.com/WreckItTim/OmniNaviPy
  • 作者讲解视频:YouTube
  • LM-Nav(分层零样本导航的直接前身):arXiv:2207.04429
  • RT-2(首个 VLA,端到端范式起点):arXiv:2307.15818
  • OpenVLA(开源 VLA 基础模型):arXiv:2406.09246
  • NaVILA(分层 VLA 导航):arXiv:2412.04453
  • VAMOS(可转向的分层视觉-语言-动作导航模型):arXiv:2510.20818
  • FASTNav(机载实时指令跟随):IEEE RA-L 2024
  • 综述:Foundation Models in Robotics: A Comprehensive Review(arXiv 2026)
  • 综述:Large Model Empowered Embodied AI Survey(arXiv:2508.10399)

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 7:05:11

口碑好的团体冲锋衣定制公司有哪些推荐

团体冲锋衣定制怎么选?看懂这几点&#xff0c;采购少走三年弯路在为企业采购团体服装的过程中&#xff0c;冲锋衣是近年需求增长明显的品类。它既能满足户外作业、外勤差旅的功能需求&#xff0c;又能作为企业形象载体在日常通勤中穿着&#xff0c;适用范围非常广。但很多负责…

作者头像 李华
网站建设 2026/10/2 7:05:10

从零搭建AI工程体系:数据、特征、模型、服务与监控全链路实战

1. 从零搭建AI工程体系&#xff0c;为什么我劝你别一上来就调包"ai-engineering-from-scratch"这个标题&#xff0c;第一次看到的时候我愣了一下。市面上讲AI的教程铺天盖地&#xff0c;但绝大多数都是教你import torch然后跑个预训练模型&#xff0c;或者调个API接口…

作者头像 李华
网站建设 2026/10/2 7:04:48

海南景曜数字科技房地产geo优化机构综合实力推荐,广受信赖

海南房地产GEO优化怎么选?这家海南本地机构的综合实力值得一看买房前问AI&#xff0c;回答里没有你的楼盘&#xff0c;怎么办?越来越多海南购房者在到访售楼处之前&#xff0c;先问一句海口某片区哪个楼盘值得看某价位能买多大面积。如果AI回答里出现的是同片区其他项目名称&…

作者头像 李华
网站建设 2026/10/2 7:04:09

C++ map 底层与AVL 树

C map 底层、AVL 树与 LeetCode 692 高频单词 —— 学习大纲本文基于手写笔记整理&#xff1a;std::map 接口与插入语义、LeetCode 692 前 K 个高频单词、AVL 树的定义/旋转/失衡修复。 可作为 Feynman 复习入口&#xff1a;先看"核心知识链"&#xff0c;再用"主…

作者头像 李华