news 2026/10/2 12:49:41

【CVPR 2025】UniGoal:面向通用零样本目标导向导航|从零样本导航统一框架视角

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【CVPR 2025】UniGoal:面向通用零样本目标导向导航|从零样本导航统一框架视角

摘要

本文解读 CVPR 2025 论文《UniGoal: Towards Universal Zero-shot Goal-oriented Navigation》。该论文提出统一图表示下的通用零样本目标导向导航框架,通过融合在线场景图、目标图与图匹配打分,让同一个不训练任何策略网络的模型完成物体类别(ON)、示例图像(IIN)与文本描述(TN)三类导航任务,其特别之处在于把"探索到哪一步"变成可计算的匹配分数 $S=(S_N+S_E+S_T)/3$,再由多阶段策略与黑名单驱动大模型推理。实验表明单一零样本模型在 MP3D、HM3D 与 RoboTHOR 上全面领先:HM3D 图像目标成功率 60.2%,比最强零样本方法 Mod-IIN 高 4.1 个百分点,在图像目标上更超过有监督通用方法 GOAT 22.8 个百分点,为具身智能中的零样本导航提供了可复用、可解释的统一框架。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机:为什么零样本导航需要"目标无关"的推理框架
  • 研究主线:从问题到结论
  • 基准/方法设计:把"目标"也变成图
  • 分类全景:三类目标的图构造与三个阶段
  • 方法细节:图匹配打分与多阶段探索
  • 实验设计与结果:三基准、三类任务、同台比较
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • UniGoal 和 SG-Nav 的核心区别是什么?
    • 为什么一个不训练的模型能超过有监督方法?
    • 三类目标是如何统一到同一个框架的?
    • 三个探索阶段分别在解决什么问题?
    • 黑名单机制为什么必不可少?
    • 这套方法能直接用到真实机器人上吗?
  • 参考链接

论文基本信息

项目内容
标题(英文)UniGoal: Towards Universal Zero-shot Goal-oriented Navigation
标题(中文)UniGoal:面向通用零样本目标导向导航
作者Hang Yin, Xiuwei Xu, Linqing Zhao, Ziwei Wang, Jie Zhou, Jiwen Lu
机构清华大学自动化系 · 南洋理工大学
会议CVPR 2025
arXivhttps://arxiv.org/abs/2503.10630
项目网站https://bagh2178.github.io/UniGoal/

背景与动机:为什么零样本导航需要"目标无关"的推理框架

目标导向导航要求智能体在未知环境中移动到指定目标。按目标类型,主流研究分成三个子任务:物体类别目标(Object-goal Navigation, ON)、示例图像目标(Instance-image-goal Navigation, IIN)与文本描述目标(Text-goal Navigation, TN)。三类目标的信息形态差异极大——一个词、一张图、一段描述——因此长期以来的做法是"一个任务配一套推理流程",流程之间几乎没有可复用的部分。

有监督这条路依赖大规模仿真训练。SemEXP 用模块化语义地图加目标导向探索开创了 ON 主线,OVRL-v2 用自监督预训练视觉表征,IEVE 用实例级表征学习把图像目标成功率推到 70.2%。它们在同任务上表现不俗,但需要大量训练,且容易过拟合到仿真环境,迁移到真实世界时性能下降明显。

零样本这条路试图摆脱训练。CoW 基于 CLIP 特征做前沿探索,ESC、OpenFMNav 与 VLFM 进一步用大模型抽取物体之间的常识关联来推断目标位置——其中 SG-Nav 用在线层次化 3D 场景图配合思维链提示,在 MP3D 上把物体目标成功率做到 40.2%。图像目标上,Mod-IIN 用前沿探索配合关键点匹配,HM3D 成功率 56.1%。问题在于它们都只针对单一目标类型设计推理流程;文本目标在 UniGoal 之前甚至没有可比的零样本方案,InstructNav 虽然提出了面向多种语言导航任务的通用框架,却无法处理图像这类视觉目标。

还有一条"通用但有监督"的路线:GOAT 用强化学习训练统一的全局策略,PSL 用 CLIP 嵌入统一表示类别、图像与文本,但两者依然需要耗时的 RL 训练,且三个任务的表现差距很大(GOAT 在 HM3D 上物体目标 50.6%、图像目标 37.4%、文本目标仅 17.0%)。

论文的切入点是:真正的"通用"应该体现在推理框架上,而不是训练数据规模上。既然三类目标最终都是"在场景里找一个东西",那就把它们表示成同一种结构——图——让匹配与搜索逻辑完全共享。

研究主线:从问题到结论

图 9:UniGoal 的研究主线——从"三类目标各自定制流程"到"统一图表示加图匹配推理"(Mermaid 流程图)

基准/方法设计:把"目标"也变成图

UniGoal 的核心设计只有一句话:把目标也变成图。场景侧,智能体随移动增量构建在线 3D 场景图 $\mathcal{G}_t$,每收到一帧 RGB-D 观测就检测物体与其关系并合并进图;目标侧,三类目标被构造成统一格式的目标图 $\mathcal{G}_g$,节点与边全部以文本描述。于是"导航"被重新表述为"两个图的匹配程度",推理流程对三类任务完全一致。

这个设计要解决的关键矛盾是:三类目标的图结构复杂度差异很大。物体目标的 $\mathcal{G}_g$ 退化为单节点零边;图像目标先用 Grounded-SAM 分割参考图中的实例,再提示视觉语言模型判断实例间的空间关系,实例成为节点、关系成为边;文本目标则由大模型先从描述中抽取物体、再生成关系,构造出与图像目标同构的图。

相比把场景压成一段文字提示,图表示保留了层次与拓扑:物体、物体组、房间构成层级,空间关系构成边。这既减少了结构信息损失,也让"相似度计算、图匹配、图对齐"这类显式操作成为可能。

图 1:任务对比——已有零样本方法按目标类型各自定制,通用方法又需要大规模训练;UniGoal 用统一框架零样本处理三类目标

分类全景:三类目标的图构造与三个阶段

三类目标的差别被压缩到"节点与边怎么造",之后的匹配、打分与探索流程完全共享;而探索过程本身又被匹配分数切成三个异构阶段,每个阶段解决不同性质的问题。

图 10:UniGoal 的分类全景——三类目标的图构造方式 × 图匹配驱动的三个探索阶段(Mermaid 分类图)

方法细节:图匹配打分与多阶段探索

图匹配打分。对场景图和目标图分别做节点嵌入与边嵌入,节点嵌入为 $\mathrm{concat}(\mathrm{CLIP}(v),\mathrm{Degree}(v))$,边嵌入直接用 CLIP 文本编码器输出。相似度矩阵经阈值 $\tau$ 过滤后做二分匹配,得到匹配的节点对 $\mathcal{M}_N$ 与边对 $\mathcal{M}_E$,并取平均得到 $S_N$、$S_E$。拓扑项 $S_T$ 由两张图结构之间的归一化图编辑距离给出,最终匹配分数为 $S=(S_N+S_E+S_T)/3$。

Stage 1 零匹配。当 $S$ 很小时,目标是扩大探索范围。由于目标图可能是若干互不相关子图拼成的(例如"桌子、椅子、窗户、窗帘"其实分成两组),同时定位多个弱相关子结构非常困难。作者让大模型把 $\mathcal{G}_g$ 分解为内部高相关的子图,分别转成文本当作物体目标调用前沿选择,再按前沿分数与到智能体的距离加权挑一个前沿。

Stage 2 部分匹配。当 $\sigma_1 \le S < \sigma_2$ 且至少存在一对锚点时,进入部分匹配阶段。此时目标图没有任何坐标信息,作者把中心物体初始化到原点,沿边做深度优先遍历并提示大模型推断相对位置,把整个目标图投影到鸟瞰图;随后用已经精确匹配的锚点对求解尺度、旋转与平移组成的坐标变换矩阵 $\mathbf{P}$,把剩余节点映射到场景图坐标系,取投影点最小外接圆的圆心作为探索目标。

Stage 3 完美匹配。当 $S > \sigma_2$ 且中心物体 $o$ 已匹配,智能体直接接近该物体。为了对抗感知错误,只保留 $o$ 附近一定距离内的子图,仿照图卷积用邻接矩阵与关联矩阵聚合邻居信息,让大模型结合新观测修正节点与边;同时用一个置信度 $C_t=N_t+M_t+S_t-\lambda D_t$ 判断目标是否可信。

黑名单机制。图匹配总是返回相似度最大的解,因此失败匹配必须被记住。Stage 2 的所有锚点对都没能进入 Stage 3、或 Stage 3 的目标验证失败时,相关节点与边被加入黑名单,不再参与后续匹配;而被修正过的结构连同它的连接会被移出黑名单。消融显示这一步是方法里最不能省的部分。

超参数。相似度阈值 $\tau=0.9$,两个阶段阈值 $\sigma_1=0.5$、$\sigma_2=0.9$;最大步数 $T$ 在 ON 上取 500、在 IIN 与 TN 上取 1000;成功半径 $r$ 在 ON 上取 1.6 米、在 IIN 与 TN 上取 1.0 米。语言模型用 LLaMA-2-7B,视觉语言模型用 LLaVA-v1.6-Mistral-7B。

图 2:UniGoal 框架——三类目标统一为图,与在线场景图匹配;匹配分数驱动多阶段探索,黑名单避免重复探索

图 3:方法示意——(a) Stage 2 的坐标投影与锚点对对齐;(b) Stage 3 的场景图修正

实验设计与结果:三基准、三类任务、同台比较

评测在 Habitat 仿真器中进行。物体目标导航在 MP3D、HM3D 与 RoboTHOR 三套基准上做,沿用 SG-Nav 的设定;图像目标与文本目标都在 HM3D 上做,分别沿用 Mod-IIN 与 InstanceNav 的设定。指标为成功率(SR)与路径长度加权成功率(SPL)——前者衡量是否停在目标附近,后者额外衡量路径是否接近最优。

主表对比了不同设定下的成功率。UniGoal 是其中唯一的"零样本 + 通用"组合:它既不需要训练,也不需要为任务切换流程。

方法(SR,%)类型MP3D ONHM3D ONHM3D IINHM3D TN
SG-Nav零样本 · 专任务40.254.0——
Mod-IIN零样本 · 专任务——56.1—
GOAT有监督 · 通用—50.637.417.0
PSL有监督 · 通用—42.423.016.5
UniGoal零样本 · 通用41.054.560.220.2
较最优基线—+0.8+0.5+4.1+3.2

在 HM3D 的图像目标任务上,UniGoal 的成功率 60.2%、SPL 23.7%;文本目标 SR 20.2%、SPL 11.4%;MP3D 物体目标 SR 41.0%、SPL 16.4%;HM3D 物体目标 SR 54.5%;RoboTHOR 物体目标 SR 48.0%、SPL 24.2%。相对 GOAT,它在三个任务上分别领先 3.9、22.8、3.2 个成功率百分点,在 SPL 上分别领先 1.0、7.6、2.6 个百分点。

三类目标的样例说明为什么图像与文本目标的增益更大:图像目标给出一张目标物体照片,文本目标给出一段含关系的描述,两者都能构造成多节点多边的图;而物体目标只是一个类别词,目标图退化成单节点。

图 4:IIN 图像目标样例之一——参考图中的中心物体为 chair(同类样例还包括 sofa 与 bed)

图 5:IIN 图像目标样例之二——中心物体为 sofa,智能体需要在场景中找到该实例

图 6:IIN 图像目标样例之三——中心物体为 bed

消融实验在 HM3D 的图像目标任务上做,下表每一行都比完整方法差,说明每个模块都在工作。

消融项(HM3D · IIN)SR(%)SPL(%)
简化图匹配(去掉匹配分数的判定)54.920.7
移除黑名单机制50.617.3
简化多阶段策略(去掉 Stage 2)59.023.2
完整 UniGoal60.223.7

论文还逐子模块做了消融:把 Stage 1 整体换成朴素前沿探索,成功率降到 55.1%;去掉目标图分解降到 59.2%;去掉前沿选择降到 57.4%;把坐标投影简化成随机猜点降到 59.1%;去掉锚点对对齐降到 58.9%;去掉场景图修正降到 59.5%;去掉目标验证降到 58.2%。七个子模块没有一个可以被省掉。

决策过程的时间线也很有说明性:匹配分数随探索逐步上升,穿越阈值时发生阶段切换——早期给出的长期目标指向未知区域的前沿,中期指向推断出的目标位置,后期直接指向候选物体。这条曲线正是引入匹配分数这个中间量的理由,否则切换时机只能靠固定规则,容易过早或过晚。

图 7:决策过程——UniGoal 通过图匹配逐步提升分数,Switch 标记阶段切换点,S-Goal 为各阶段预测的长期目标

图 8:HM3D 九个场景的导航路径——ON(绿)、IIN(橙)、TN(蓝)三类目标由同一模型完成

结果对比总结

图 11:从基线到 UniGoal——三类任务上的成功率变化与领先幅度(Mermaid 对比图)

关键发现

  • 零样本胜有监督通用方法:相对 GOAT / PSL,UniGoal 在 ON、IIN、TN 上分别领先 $+3.9/1.0$、$+22.8/7.6$、$+3.2/2.6$(SR / SPL 百分点),而且完全不需要训练。
  • 图像目标增益远大于物体目标:IIN 上超 Mod-IIN 4.1 个百分点,ON 上只超 SG-Nav 0.8 个百分点——原因是物体目标下目标图退化成单节点,图分解与锚点对齐都用不上,方法只发挥了一部分能力。
  • 退化场景仍有增益:即使目标图只含单个节点,Stage 3 的场景图修正与目标验证仍让 UniGoal 在 MP3D、HM3D、RoboTHOR 上全部超过 SG-Nav,说明这两项机制是普适有效的。
  • 黑名单是最关键的模块:移除后 HM3D 图像目标成功率从 60.2% 掉到 50.6%,降幅 9.6 个百分点;作者解释为重复匹配会让智能体卡住。
  • 去掉任一阶段都会掉点:Stage 2 被移除后成功率降到 59.0%(−1.2 个百分点),说明直接从探索跳进接近会错过最优切换时机。
  • 甚至超过部分有监督专用方法:MP3D 物体目标 41.0% 高于有监督的 SemEXP(36.0%)与 ZSON(15.3%)。

局限性

  • 感知误差直接进入图匹配:节点与边都是文本描述,检测或描述出错会直接污染匹配结果;Stage 3 的图修正只在目标附近做局部补偿,无法挽回全局性错误。
  • 阈值依赖人工设定:$\tau=0.9$、$\sigma_1=0.5$、$\sigma_2=0.9$ 由实验选定,论文未验证跨场景、跨仿真器的稳健性,换环境很可能需要重新调参。
  • 计算开销未量化:每一步都要调用大模型与 CLIP 编码器,论文没有讨论实时性与计算预算,这在真实机器人上是绕不开的约束。
  • 真机部署只有定性结论:论文声称把方法部署到真实机器人平台验证了泛化能力,但没有给出量化成功率或对照实验。
  • 物体目标用不满全部设计:ON 下目标图退化为单节点,Stage 1 的子图分解与 Stage 2 的锚点对齐都失效,方法在该任务上的优势主要来自 Stage 3。

常见问题(FAQ)

UniGoal 和 SG-Nav 的核心区别是什么?

SG-Nav 只把场景表示为图,目标仍是一段文本,因此只能处理物体类别目标。UniGoal 让目标也成为图,并用图匹配分数驱动多阶段探索,从而把物体类别、示例图像、文本描述三类任务收进同一个推理框架。论文作者也是同一批人,UniGoal 是 SG-Nav 的直接泛化。

为什么一个不训练的模型能超过有监督方法?

因为收益来自结构化的显式推理而不是更大的模型。UniGoal 把"探索到什么程度"变成可计算的匹配分数 $S=(S_N+S_E+S_T)/3$,用图匹配、坐标投影、锚点对齐这些确定性操作承担几何与拓扑推理,大模型只负责常识层面的判断。有监督的通用方法依赖大规模 RL 训练,容易过拟合到仿真环境,因此在跨任务、跨场景时反而吃亏。

三类目标是如何统一到同一个框架的?

关键在于把三者都构造成同一种图:物体目标退化为单节点零边;图像目标用 Grounded-SAM 分割参考图实例、由视觉语言模型生成空间关系作为边;文本目标由大模型抽取物体与关系。表示一致之后,相似度计算、二分匹配、图编辑距离、坐标对齐这些操作就可以在三类任务上完全复用。

三个探索阶段分别在解决什么问题?

Stage 1 零匹配阶段要扩大探索范围,办法是把目标图分解成内部高相关的子图,当成多个物体目标分别做前沿选择;Stage 2 部分匹配阶段要推断目标位置,用坐标投影把目标图放到鸟瞰图,再用锚点对求解坐标变换矩阵;Stage 3 完美匹配阶段要确认并接近目标,用图卷积式的邻居聚合修正场景图,再用累积置信度验证目标是否可信。

黑名单机制为什么必不可少?

图匹配总是输出相似度最大的解,一旦某个匹配最终没能找到目标,同一组节点和边会在后续步骤被反复选中,智能体就会卡在同一处。黑名单把这些失败结构排除在匹配之外;被修正过的结构则会移出黑名单。消融显示移除它会让成功率下降 9.6 个百分点。

这套方法能直接用到真实机器人上吗?

论文给出了真机部署的定性验证,说明框架具备迁移能力,但没有报告量化成功率与对照实验。实际部署还要面对两个未解问题:一是每步都要调用大模型与 CLIP 编码器的计算开销,二是匹配阈值与阶段阈值需要按环境重新调整。

参考链接

  • 论文 arXiv 摘要页:https://arxiv.org/abs/2503.10630
  • 项目主页(含代码与可视化):https://bagh2178.github.io/UniGoal/
  • SG-Nav(本文直接前作,NeurIPS 2024):https://arxiv.org/abs/2410.08189
  • ESC:Exploration with Soft Commonsense Constraints for Zero-shot Object Navigation(ICML 2023):https://proceedings.mlr.press/v202/zhou23r.html
  • VLFM: Vision-Language Frontier Maps for Zero-Shot Semantic Navigation(ICRA 2024):https://arxiv.org/abs/2312.03275
  • GOAT: GO to Any Thing(RSS 2023 通用有监督导航基线):https://arxiv.org/abs/2311.06430
  • B 站视频讲解:https://www.bilibili.com/video/BV1XvaB6yEGr

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 12:49:06

R语言向量语法的详细教程

在R语言中&#xff0c;向量&#xff08;Vector&#xff09;是最基础、最核心的数据结构。R语言中的几乎所有标量&#xff08;单个数字或字符&#xff09;在底层都是作为长度为1的向量存在的。理解向量的运作机制&#xff0c;是精通R语言的关键。 以下是R语言向量语法的详细教程…

作者头像 李华
网站建设 2026/10/2 12:47:28

MoveIt2

1,概述专门用来适配ROS2的机器人机械手或机械臂的运动规划软件框架&#xff0c;功能包括&#xff1a;运动规划&#xff08;生成可顺利通过杂乱环境的高自由度轨迹&#xff09;&#xff1b;机械臂操纵&#xff08;通过抓取生成对机器人环境进行分析&#xff0c;并与环境进行交互…

作者头像 李华
网站建设 2026/10/2 12:46:22

想拓展高性价比杭州人脉圈?这份实用指南别错过

对于扎根杭州的创业者、中小企业家来说&#xff0c;搭建高质量人脉网络从来都不是一件靠盲目参会就能完成的事&#xff0c;很多人都遇到过参会后加了满屏微信却迟迟无法转化、想找同频伙伴却找不到合适发声场合的痛点&#xff0c;而选对适配自身需求的人脉拓展路径&#xff0c;…

作者头像 李华
网站建设 2026/10/2 12:45:49

Webpack 文件指纹面试题整理

一、什么是文件指纹&#xff1f; 核心思路&#xff08;一句话&#xff09; 文件指纹就是将资源内容映射为 Hash&#xff0c;并将 Hash 写入资源 URL&#xff0c;使内容变化产生新 URL&#xff0c;从而实现静态资源长期缓存。 资源内容 → Hash → 文件名 → 长期缓存│┌───…

作者头像 李华