摘要
本文解读 CVPR 2025 论文《UniGoal: Towards Universal Zero-shot Goal-oriented Navigation》。该论文提出统一图表示下的通用零样本目标导向导航框架,通过融合在线场景图、目标图与图匹配打分,让同一个不训练任何策略网络的模型完成物体类别(ON)、示例图像(IIN)与文本描述(TN)三类导航任务,其特别之处在于把"探索到哪一步"变成可计算的匹配分数 $S=(S_N+S_E+S_T)/3$,再由多阶段策略与黑名单驱动大模型推理。实验表明单一零样本模型在 MP3D、HM3D 与 RoboTHOR 上全面领先:HM3D 图像目标成功率 60.2%,比最强零样本方法 Mod-IIN 高 4.1 个百分点,在图像目标上更超过有监督通用方法 GOAT 22.8 个百分点,为具身智能中的零样本导航提供了可复用、可解释的统一框架。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机:为什么零样本导航需要"目标无关"的推理框架
- 研究主线:从问题到结论
- 基准/方法设计:把"目标"也变成图
- 分类全景:三类目标的图构造与三个阶段
- 方法细节:图匹配打分与多阶段探索
- 实验设计与结果:三基准、三类任务、同台比较
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- UniGoal 和 SG-Nav 的核心区别是什么?
- 为什么一个不训练的模型能超过有监督方法?
- 三类目标是如何统一到同一个框架的?
- 三个探索阶段分别在解决什么问题?
- 黑名单机制为什么必不可少?
- 这套方法能直接用到真实机器人上吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | UniGoal: Towards Universal Zero-shot Goal-oriented Navigation |
| 标题(中文) | UniGoal:面向通用零样本目标导向导航 |
| 作者 | Hang Yin, Xiuwei Xu, Linqing Zhao, Ziwei Wang, Jie Zhou, Jiwen Lu |
| 机构 | 清华大学自动化系 · 南洋理工大学 |
| 会议 | CVPR 2025 |
| arXiv | https://arxiv.org/abs/2503.10630 |
| 项目网站 | https://bagh2178.github.io/UniGoal/ |
背景与动机:为什么零样本导航需要"目标无关"的推理框架
目标导向导航要求智能体在未知环境中移动到指定目标。按目标类型,主流研究分成三个子任务:物体类别目标(Object-goal Navigation, ON)、示例图像目标(Instance-image-goal Navigation, IIN)与文本描述目标(Text-goal Navigation, TN)。三类目标的信息形态差异极大——一个词、一张图、一段描述——因此长期以来的做法是"一个任务配一套推理流程",流程之间几乎没有可复用的部分。
有监督这条路依赖大规模仿真训练。SemEXP 用模块化语义地图加目标导向探索开创了 ON 主线,OVRL-v2 用自监督预训练视觉表征,IEVE 用实例级表征学习把图像目标成功率推到 70.2%。它们在同任务上表现不俗,但需要大量训练,且容易过拟合到仿真环境,迁移到真实世界时性能下降明显。
零样本这条路试图摆脱训练。CoW 基于 CLIP 特征做前沿探索,ESC、OpenFMNav 与 VLFM 进一步用大模型抽取物体之间的常识关联来推断目标位置——其中 SG-Nav 用在线层次化 3D 场景图配合思维链提示,在 MP3D 上把物体目标成功率做到 40.2%。图像目标上,Mod-IIN 用前沿探索配合关键点匹配,HM3D 成功率 56.1%。问题在于它们都只针对单一目标类型设计推理流程;文本目标在 UniGoal 之前甚至没有可比的零样本方案,InstructNav 虽然提出了面向多种语言导航任务的通用框架,却无法处理图像这类视觉目标。
还有一条"通用但有监督"的路线:GOAT 用强化学习训练统一的全局策略,PSL 用 CLIP 嵌入统一表示类别、图像与文本,但两者依然需要耗时的 RL 训练,且三个任务的表现差距很大(GOAT 在 HM3D 上物体目标 50.6%、图像目标 37.4%、文本目标仅 17.0%)。
论文的切入点是:真正的"通用"应该体现在推理框架上,而不是训练数据规模上。既然三类目标最终都是"在场景里找一个东西",那就把它们表示成同一种结构——图——让匹配与搜索逻辑完全共享。
研究主线:从问题到结论
图 9:UniGoal 的研究主线——从"三类目标各自定制流程"到"统一图表示加图匹配推理"(Mermaid 流程图)
基准/方法设计:把"目标"也变成图
UniGoal 的核心设计只有一句话:把目标也变成图。场景侧,智能体随移动增量构建在线 3D 场景图 $\mathcal{G}_t$,每收到一帧 RGB-D 观测就检测物体与其关系并合并进图;目标侧,三类目标被构造成统一格式的目标图 $\mathcal{G}_g$,节点与边全部以文本描述。于是"导航"被重新表述为"两个图的匹配程度",推理流程对三类任务完全一致。
这个设计要解决的关键矛盾是:三类目标的图结构复杂度差异很大。物体目标的 $\mathcal{G}_g$ 退化为单节点零边;图像目标先用 Grounded-SAM 分割参考图中的实例,再提示视觉语言模型判断实例间的空间关系,实例成为节点、关系成为边;文本目标则由大模型先从描述中抽取物体、再生成关系,构造出与图像目标同构的图。
相比把场景压成一段文字提示,图表示保留了层次与拓扑:物体、物体组、房间构成层级,空间关系构成边。这既减少了结构信息损失,也让"相似度计算、图匹配、图对齐"这类显式操作成为可能。
图 1:任务对比——已有零样本方法按目标类型各自定制,通用方法又需要大规模训练;UniGoal 用统一框架零样本处理三类目标
分类全景:三类目标的图构造与三个阶段
三类目标的差别被压缩到"节点与边怎么造",之后的匹配、打分与探索流程完全共享;而探索过程本身又被匹配分数切成三个异构阶段,每个阶段解决不同性质的问题。
图 10:UniGoal 的分类全景——三类目标的图构造方式 × 图匹配驱动的三个探索阶段(Mermaid 分类图)
方法细节:图匹配打分与多阶段探索
图匹配打分。对场景图和目标图分别做节点嵌入与边嵌入,节点嵌入为 $\mathrm{concat}(\mathrm{CLIP}(v),\mathrm{Degree}(v))$,边嵌入直接用 CLIP 文本编码器输出。相似度矩阵经阈值 $\tau$ 过滤后做二分匹配,得到匹配的节点对 $\mathcal{M}_N$ 与边对 $\mathcal{M}_E$,并取平均得到 $S_N$、$S_E$。拓扑项 $S_T$ 由两张图结构之间的归一化图编辑距离给出,最终匹配分数为 $S=(S_N+S_E+S_T)/3$。
Stage 1 零匹配。当 $S$ 很小时,目标是扩大探索范围。由于目标图可能是若干互不相关子图拼成的(例如"桌子、椅子、窗户、窗帘"其实分成两组),同时定位多个弱相关子结构非常困难。作者让大模型把 $\mathcal{G}_g$ 分解为内部高相关的子图,分别转成文本当作物体目标调用前沿选择,再按前沿分数与到智能体的距离加权挑一个前沿。
Stage 2 部分匹配。当 $\sigma_1 \le S < \sigma_2$ 且至少存在一对锚点时,进入部分匹配阶段。此时目标图没有任何坐标信息,作者把中心物体初始化到原点,沿边做深度优先遍历并提示大模型推断相对位置,把整个目标图投影到鸟瞰图;随后用已经精确匹配的锚点对求解尺度、旋转与平移组成的坐标变换矩阵 $\mathbf{P}$,把剩余节点映射到场景图坐标系,取投影点最小外接圆的圆心作为探索目标。
Stage 3 完美匹配。当 $S > \sigma_2$ 且中心物体 $o$ 已匹配,智能体直接接近该物体。为了对抗感知错误,只保留 $o$ 附近一定距离内的子图,仿照图卷积用邻接矩阵与关联矩阵聚合邻居信息,让大模型结合新观测修正节点与边;同时用一个置信度 $C_t=N_t+M_t+S_t-\lambda D_t$ 判断目标是否可信。
黑名单机制。图匹配总是返回相似度最大的解,因此失败匹配必须被记住。Stage 2 的所有锚点对都没能进入 Stage 3、或 Stage 3 的目标验证失败时,相关节点与边被加入黑名单,不再参与后续匹配;而被修正过的结构连同它的连接会被移出黑名单。消融显示这一步是方法里最不能省的部分。
超参数。相似度阈值 $\tau=0.9$,两个阶段阈值 $\sigma_1=0.5$、$\sigma_2=0.9$;最大步数 $T$ 在 ON 上取 500、在 IIN 与 TN 上取 1000;成功半径 $r$ 在 ON 上取 1.6 米、在 IIN 与 TN 上取 1.0 米。语言模型用 LLaMA-2-7B,视觉语言模型用 LLaVA-v1.6-Mistral-7B。
图 2:UniGoal 框架——三类目标统一为图,与在线场景图匹配;匹配分数驱动多阶段探索,黑名单避免重复探索
图 3:方法示意——(a) Stage 2 的坐标投影与锚点对对齐;(b) Stage 3 的场景图修正
实验设计与结果:三基准、三类任务、同台比较
评测在 Habitat 仿真器中进行。物体目标导航在 MP3D、HM3D 与 RoboTHOR 三套基准上做,沿用 SG-Nav 的设定;图像目标与文本目标都在 HM3D 上做,分别沿用 Mod-IIN 与 InstanceNav 的设定。指标为成功率(SR)与路径长度加权成功率(SPL)——前者衡量是否停在目标附近,后者额外衡量路径是否接近最优。
主表对比了不同设定下的成功率。UniGoal 是其中唯一的"零样本 + 通用"组合:它既不需要训练,也不需要为任务切换流程。
| 方法(SR,%) | 类型 | MP3D ON | HM3D ON | HM3D IIN | HM3D TN |
|---|---|---|---|---|---|
| SG-Nav | 零样本 · 专任务 | 40.2 | 54.0 | — | — |
| Mod-IIN | 零样本 · 专任务 | — | — | 56.1 | — |
| GOAT | 有监督 · 通用 | — | 50.6 | 37.4 | 17.0 |
| PSL | 有监督 · 通用 | — | 42.4 | 23.0 | 16.5 |
| UniGoal | 零样本 · 通用 | 41.0 | 54.5 | 60.2 | 20.2 |
| 较最优基线 | — | +0.8 | +0.5 | +4.1 | +3.2 |
在 HM3D 的图像目标任务上,UniGoal 的成功率 60.2%、SPL 23.7%;文本目标 SR 20.2%、SPL 11.4%;MP3D 物体目标 SR 41.0%、SPL 16.4%;HM3D 物体目标 SR 54.5%;RoboTHOR 物体目标 SR 48.0%、SPL 24.2%。相对 GOAT,它在三个任务上分别领先 3.9、22.8、3.2 个成功率百分点,在 SPL 上分别领先 1.0、7.6、2.6 个百分点。
三类目标的样例说明为什么图像与文本目标的增益更大:图像目标给出一张目标物体照片,文本目标给出一段含关系的描述,两者都能构造成多节点多边的图;而物体目标只是一个类别词,目标图退化成单节点。
图 4:IIN 图像目标样例之一——参考图中的中心物体为 chair(同类样例还包括 sofa 与 bed)
图 5:IIN 图像目标样例之二——中心物体为 sofa,智能体需要在场景中找到该实例
图 6:IIN 图像目标样例之三——中心物体为 bed
消融实验在 HM3D 的图像目标任务上做,下表每一行都比完整方法差,说明每个模块都在工作。
| 消融项(HM3D · IIN) | SR(%) | SPL(%) |
|---|---|---|
| 简化图匹配(去掉匹配分数的判定) | 54.9 | 20.7 |
| 移除黑名单机制 | 50.6 | 17.3 |
| 简化多阶段策略(去掉 Stage 2) | 59.0 | 23.2 |
| 完整 UniGoal | 60.2 | 23.7 |
论文还逐子模块做了消融:把 Stage 1 整体换成朴素前沿探索,成功率降到 55.1%;去掉目标图分解降到 59.2%;去掉前沿选择降到 57.4%;把坐标投影简化成随机猜点降到 59.1%;去掉锚点对对齐降到 58.9%;去掉场景图修正降到 59.5%;去掉目标验证降到 58.2%。七个子模块没有一个可以被省掉。
决策过程的时间线也很有说明性:匹配分数随探索逐步上升,穿越阈值时发生阶段切换——早期给出的长期目标指向未知区域的前沿,中期指向推断出的目标位置,后期直接指向候选物体。这条曲线正是引入匹配分数这个中间量的理由,否则切换时机只能靠固定规则,容易过早或过晚。
图 7:决策过程——UniGoal 通过图匹配逐步提升分数,Switch 标记阶段切换点,S-Goal 为各阶段预测的长期目标
图 8:HM3D 九个场景的导航路径——ON(绿)、IIN(橙)、TN(蓝)三类目标由同一模型完成
结果对比总结
图 11:从基线到 UniGoal——三类任务上的成功率变化与领先幅度(Mermaid 对比图)
关键发现
- 零样本胜有监督通用方法:相对 GOAT / PSL,UniGoal 在 ON、IIN、TN 上分别领先 $+3.9/1.0$、$+22.8/7.6$、$+3.2/2.6$(SR / SPL 百分点),而且完全不需要训练。
- 图像目标增益远大于物体目标:IIN 上超 Mod-IIN 4.1 个百分点,ON 上只超 SG-Nav 0.8 个百分点——原因是物体目标下目标图退化成单节点,图分解与锚点对齐都用不上,方法只发挥了一部分能力。
- 退化场景仍有增益:即使目标图只含单个节点,Stage 3 的场景图修正与目标验证仍让 UniGoal 在 MP3D、HM3D、RoboTHOR 上全部超过 SG-Nav,说明这两项机制是普适有效的。
- 黑名单是最关键的模块:移除后 HM3D 图像目标成功率从 60.2% 掉到 50.6%,降幅 9.6 个百分点;作者解释为重复匹配会让智能体卡住。
- 去掉任一阶段都会掉点:Stage 2 被移除后成功率降到 59.0%(−1.2 个百分点),说明直接从探索跳进接近会错过最优切换时机。
- 甚至超过部分有监督专用方法:MP3D 物体目标 41.0% 高于有监督的 SemEXP(36.0%)与 ZSON(15.3%)。
局限性
- 感知误差直接进入图匹配:节点与边都是文本描述,检测或描述出错会直接污染匹配结果;Stage 3 的图修正只在目标附近做局部补偿,无法挽回全局性错误。
- 阈值依赖人工设定:$\tau=0.9$、$\sigma_1=0.5$、$\sigma_2=0.9$ 由实验选定,论文未验证跨场景、跨仿真器的稳健性,换环境很可能需要重新调参。
- 计算开销未量化:每一步都要调用大模型与 CLIP 编码器,论文没有讨论实时性与计算预算,这在真实机器人上是绕不开的约束。
- 真机部署只有定性结论:论文声称把方法部署到真实机器人平台验证了泛化能力,但没有给出量化成功率或对照实验。
- 物体目标用不满全部设计:ON 下目标图退化为单节点,Stage 1 的子图分解与 Stage 2 的锚点对齐都失效,方法在该任务上的优势主要来自 Stage 3。
常见问题(FAQ)
UniGoal 和 SG-Nav 的核心区别是什么?
SG-Nav 只把场景表示为图,目标仍是一段文本,因此只能处理物体类别目标。UniGoal 让目标也成为图,并用图匹配分数驱动多阶段探索,从而把物体类别、示例图像、文本描述三类任务收进同一个推理框架。论文作者也是同一批人,UniGoal 是 SG-Nav 的直接泛化。
为什么一个不训练的模型能超过有监督方法?
因为收益来自结构化的显式推理而不是更大的模型。UniGoal 把"探索到什么程度"变成可计算的匹配分数 $S=(S_N+S_E+S_T)/3$,用图匹配、坐标投影、锚点对齐这些确定性操作承担几何与拓扑推理,大模型只负责常识层面的判断。有监督的通用方法依赖大规模 RL 训练,容易过拟合到仿真环境,因此在跨任务、跨场景时反而吃亏。
三类目标是如何统一到同一个框架的?
关键在于把三者都构造成同一种图:物体目标退化为单节点零边;图像目标用 Grounded-SAM 分割参考图实例、由视觉语言模型生成空间关系作为边;文本目标由大模型抽取物体与关系。表示一致之后,相似度计算、二分匹配、图编辑距离、坐标对齐这些操作就可以在三类任务上完全复用。
三个探索阶段分别在解决什么问题?
Stage 1 零匹配阶段要扩大探索范围,办法是把目标图分解成内部高相关的子图,当成多个物体目标分别做前沿选择;Stage 2 部分匹配阶段要推断目标位置,用坐标投影把目标图放到鸟瞰图,再用锚点对求解坐标变换矩阵;Stage 3 完美匹配阶段要确认并接近目标,用图卷积式的邻居聚合修正场景图,再用累积置信度验证目标是否可信。
黑名单机制为什么必不可少?
图匹配总是输出相似度最大的解,一旦某个匹配最终没能找到目标,同一组节点和边会在后续步骤被反复选中,智能体就会卡在同一处。黑名单把这些失败结构排除在匹配之外;被修正过的结构则会移出黑名单。消融显示移除它会让成功率下降 9.6 个百分点。
这套方法能直接用到真实机器人上吗?
论文给出了真机部署的定性验证,说明框架具备迁移能力,但没有报告量化成功率与对照实验。实际部署还要面对两个未解问题:一是每步都要调用大模型与 CLIP 编码器的计算开销,二是匹配阈值与阶段阈值需要按环境重新调整。
参考链接
- 论文 arXiv 摘要页:https://arxiv.org/abs/2503.10630
- 项目主页(含代码与可视化):https://bagh2178.github.io/UniGoal/
- SG-Nav(本文直接前作,NeurIPS 2024):https://arxiv.org/abs/2410.08189
- ESC:Exploration with Soft Commonsense Constraints for Zero-shot Object Navigation(ICML 2023):https://proceedings.mlr.press/v202/zhou23r.html
- VLFM: Vision-Language Frontier Maps for Zero-Shot Semantic Navigation(ICRA 2024):https://arxiv.org/abs/2312.03275
- GOAT: GO to Any Thing(RSS 2023 通用有监督导航基线):https://arxiv.org/abs/2311.06430
- B 站视频讲解:https://www.bilibili.com/video/BV1XvaB6yEGr
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)