news 2026/9/24 17:54:37

相机之间的位置已知,为什么还要从头猜?浙大 G2G 用组内几何连接两组视觉观测(CoRL 2026)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
相机之间的位置已知,为什么还要从头猜?浙大 G2G 用组内几何连接两组视觉观测(CoRL 2026)

6%参数统一组间位姿估计

目录

01 已知每组内部的关系,不等于知道两组如何对齐

02 现有方法的缺口:关键不只是“有没有几何”,还有“在哪里使用几何”

1. 先估计图像对,再聚合成组级结果

2. 多视图基础模型能联合看图,但未必理解“两组”的结构

03 方法架构:让基础模型处理组内几何,让桥接模块学习跨组关系

1. 分组编码:先把每组“放回自己的几何里”

2. 重采样:用少量 token 承载组内信息

3. 跨组桥接:既告诉模型“来自哪里”,也告诉它“对齐到哪里”

4. 位姿输出:一次前向,将所有目标帧放进共同参考系

04 实验结果:从跨季节对齐到仿真训练、真机测试

1. 跨季节:难点究竟出在“看不懂场景”,还是“连不上两组”?

2. 多相机里程计:利用已标定的阵列,估计两个时刻之间的运动

3. 仿真到真实:仿真训练的几何能力,能否迁移到真实相机?

4. 输入几何有误差,模型会照单全收吗?

5. 轻量体现在哪里:少训练参数,也减少重复的图像对推理

05 从给定图像组到实际应用:先选出值得比较的两组


机器人在冬天记录了一段校园轨迹,到了夏天,又沿着附近的道路经过。树木、光照、路边物体都变了,如何把这两次观测对齐?

另一台机器人装有多个朝向不同的相机。相机之间的安装关系已经标定,如何根据前后两个时刻的图像,判断机器人移动了多少?

前者通常叫跨序列重定位,后者属于多相机里程计。一个跨越不同采集过程,一个估计平台运动,看起来需要两套不同的方法。

但把问题拆开,会发现它们有一个共同点:每组观测内部,相机之间的相对位置和朝向已经有了;真正未知的,是两组观测之间的关系。

浙江大学联合浙江人形机器人创新中心、杭州师范大学提出的G2G(Group-to-Group),从这一共同结构出发,研究如何让多视图基础模型利用已有的组内几何,完成跨组位姿估计。该工作已被CoRL 2026接收。

论文:G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation
论文链接:https://arxiv.org/abs/2606.08284
项目主页:https://weiyufei0217.github.io/G2G/
代码:https://github.com/WeiYuFei0217/G2G
第一作者:魏雨飞,浙江大学五年级博士生,研究方向为3D 视觉感知、世界模型与具身智能。

01 已知每组内部的关系,不等于知道两组如何对齐

理解 G2G,首先要分清两个层次的“已知”和“未知”。

对于一段图像序列,视觉里程计、SLAM 或 SfM 可以提供各帧在这段序列内部的相对位姿。对于一套多相机阵列,标定可以提供各相机相对于参考相机的外参。这些信息都属于组内几何

但两段独立记录的轨迹,通常各有自己的局部坐标系;同一套相机阵列在两个时刻的观测,也分别对应机器人当时的位置。知道两组内部如何排列,并没有告诉我们,第二组应该旋转、平移多少,才能放进第一组的坐标系。

可以把它想象成两块已经各自拼好的拼图:每块内部的相对关系已经确定,接下来的任务是找到两块之间的对齐关系。组内几何提供了结构,却没有提前给出跨组问题的答案。

G2G 将这两种情形写成同一个任务:输入两组 RGB 图像、相机内参和各自的组内外参,估计它们之间的六自由度刚体变换。

这样统一的意义,不只是换一个任务名称。它让两类应用共享相同的输入输出接口,也让同一模型的组级推理能力可以用于两种观测组织方式。

同时,G2G 并不假设输入几何绝对准确。里程计会漂移,标定也可能存在误差。因此,方法既要利用这些先验,也要保留纠正它们的能力。

02 现有方法的缺口:关键不只是“有没有几何”,还有“在哪里使用几何”

1. 先估计图像对,再聚合成组级结果

一种自然的做法,是先建立两组图像之间的局部特征对应,求出若干图像对的相对位姿,再通过几何求解或运动平均得到组级结果。Reloc3R 等方法也采用先进行图像对位姿预测、再利用已知位姿聚合的思路。

这条路线可以利用组内几何,但如果跨组外观差异已经破坏了前面的对应关系或位姿预测,后面的聚合就很难补救。

例如,同一片树木在冬夏两季仍处于相同空间位置,图像纹理却可能完全不同。几何上看到了同一片区域,并不意味着图像上容易找到可靠的对应。

2. 多视图基础模型能联合看图,但未必理解“两组”的结构

DUSt3R、MASt3R、VGGT 等工作推动了前馈几何估计的发展。其中,VGGT 可以联合处理多视图并预测相机参数;DUSt3R、MASt3R 则通常还需要将图像对结果进一步对齐。

然而,直接把两组图像交给这类模型,并不等于告诉它:哪些图像共享一套已知的局部几何,哪些关系才是需要求解的未知量。

已有研究也在引入几何先验,但方式并不相同:Reloc3R 在预测后的运动聚合中使用已知位姿;Rig3R 将相机阵列元信息用于前向推理;MapAnything 可以在特征编码阶段融合相机位姿和射线等条件。

G2G 要补上的,是“两组各自带有局部几何,但组间变换未知”这一接口。

这里存在一个容易忽略的坐标系问题:MapAnything 能接收位姿条件,但原生条件建立在统一参考系下。两组分别以自己的参考帧为原点时,不能把它们的局部外参直接当成同一个世界坐标系中的位姿。若先把第二组外参转换到第一组坐标系,又恰好需要那个尚未求出的组间变换。

G2G 因此选择:先在各自的局部坐标系中理解每一组,再学习两组之间的关系。

03 方法架构:让基础模型处理组内几何,让桥接模块学习跨组关系

G2G 采用“冻结—桥接”(Freeze-and-Bridge)设计:保留 MapAnything 已经学到的几何融合能力,在其上增加少量可训练模块。

冻结骨干约有5.39 亿参数,新增的三个可训练模块合计约3200 万参数,占完整模型不到 6%。这里的 6% 指需要训练的参数比例,完整骨干仍参与前向计算。

▲ G2G 总体架构:两组观测先由冻结骨干分别编码,再通过重采样、跨组桥接和位姿头,输出相对于公共锚帧的位姿。

1. 分组编码:先把每组“放回自己的几何里”

两组图像分别进入同一个冻结的 MapAnything 骨干。每一组都提供自己的相机内参和组内外参,并以本组参考帧作为局部原点。

骨干将图像内容、相机位姿和像素射线方向融合,再在组内交换多视图信息。输出的特征因此不仅描述“图里有什么”,也带有“这些观测在本组中是什么空间关系”的信息。

组内外参只在这一阶段显式输入。后面的可训练模块接收的是已经融合几何信息的特征,而不是另拿一份外参,在预测结束后才进行修补。

这也是冻结骨干的价值所在:已有模型已经学会如何把图像和相机几何联系起来,下游训练可以集中学习尚未具备的跨组关系,同时保留大规模预训练得到的表征。

2. 重采样:用少量 token 承载组内信息

每帧图像会产生大量图块特征。若全部送入后续注意力模块,训练时需要保存的中间状态会迅速增加。

G2G 使用 Perceiver Resampler,以可学习查询读取每帧特征,将默认配置下的256 个图块 token 压缩为 64 个潜在 token

它的主要作用是控制计算成本,而非直接提高精度。消融实验中,去掉重采样器甚至能改善部分结果,但训练显存和训练时间明显增加。这体现了方法对精度与资源开销的主动取舍。

3. 跨组桥接:既告诉模型“来自哪里”,也告诉它“对齐到哪里”

压缩后的两组特征被拼接起来,并加入三类标记:

  • 帧标记:说明这是组内的第几帧,或哪一个相机;
  • 组标记:区分特征来自 A 组还是 B 组;
  • 锚帧标记:指定 A 组的参考帧 A₀,作为所有输出的共同坐标原点。

随后,两层合并自注意力同时进行组内信息共享和跨组信息交换。

这一设计把两件事结合起来:模型可以利用同组其他视角理解当前观测,也可以据此推断它与另一组的关系。跨组推理不再只依赖某一张图与另一张图的独立判断。

4. 位姿输出:一次前向,将所有目标帧放进共同参考系

位姿头读取锚帧与目标帧的桥接后特征,分别预测旋转和平移。所有目标帧批量处理,一次前向即可得到它们相对于 A₀ 的位姿。

其中,B 组的输出用于完成跨组对齐;A 组非锚帧的输出则重新估计组内关系,使模型能够修正输入中的残余误差。需要其他帧之间的相对位姿时,可以从共同参考系下的结果组合得到。

训练时,G2G 使用旋转与平移损失,并提高跨组项的权重。课程学习先引入高共视样本,再逐步加入低共视的困难样本;对输入外参加入 SE(3) 扰动,则让模型学习如何利用不够准确的几何。

G2G 位姿模型只使用相对位姿监督,不需要深度预测损失。深度在可用时用于离线计算共视程度、构建训练样本;推理时,模型仍需 RGB、相机内参和组内外参。

04 实验结果:从跨季节对齐到仿真训练、真机测试

论文在 HM3D、TartanGround、NCLT 和 ZJH 四个数据集上评估跨序列重定位与多相机里程计,覆盖室内外仿真、真实跨季节和仿真到真实迁移。

各学习型对比方法按其原有监督方式在目标数据上重新训练或微调,包括适用时的深度监督;G2G 位姿模型仅使用相对位姿监督。以下结果均对应论文给定的评测协议。

1. 跨季节:难点究竟出在“看不懂场景”,还是“连不上两组”?

NCLT 反复采集同一校园,不同日期之间存在季节、光照和局部场景变化。在跨序列重定位中,G2G 的平均平移误差为0.692 m,平均旋转误差为2.47°

更能说明问题的是论文中的诊断实验:只输入 NCLT 同一次采集的五帧图像时,VGGT 的组内旋转误差中位数约为2.3°。但在其中加入一帧来自另一季节的图像后,若干诊断样例中的组内估计仍然准确,跨季节位姿却显著失准。

这表明,瓶颈并非简单的“模型无法处理校园图像”,而在于如何将外观变化明显、几何上仍有关联的两组观测连接起来。G2G 将组内几何提前融入特征,再进行跨组推理,正是在针对这一困难。

▲ 真实场景对齐结果:NCLT 展示不同季节之间的组间估计;ZJH 展示仿真训练后的真机测试。点云用于呈现对齐效果,并非 G2G 的输入。

2. 多相机里程计:利用已标定的阵列,估计两个时刻之间的运动

切换到多相机输入时,任务接口保持不变:每组是一个时刻的多相机观测,组内外参来自标定,需要估计的是两个时刻之间的运动。

在 NCLT 同日期阵列评测中,G2G 的平均误差为0.078 m / 1.02°;在更困难的跨日期阵列配对中,仍保持0.172 m / 1.97°,而 Reloc3R 对应为0.752 m / 4.47°

这些是给定观测组之间的相对位姿误差。G2G 提供的是可用于里程计的组间估计模块,完整长轨迹系统还需要帧选择、结果累积等环节。

▲ 不同阵列配置下的相对位姿估计。MA-AB 使用真值组间变换构造输入,是 oracle 参照;VGGT 的平移结果经过逐对最优 Sim(3) 真值对齐,需结合该评测条件阅读。

3. 仿真到真实:仿真训练的几何能力,能否迁移到真实相机?

在 ZJH 上,可训练模块只使用仿真数据训练,随后直接用于真实四相机采集,无需使用真实数据微调网络。

跨序列重定位的旋转正确率 RRA@5° 从仿真的96.5%保持到真实的95.0%;真实多相机里程计的平均旋转误差为2.82°,优于表中其他非 oracle 方法。在新域进行尺度对齐后,平移估计同样保持良好精度。

这表明,冻结骨干所保留的几何表征,以及在仿真中学到的跨组推理能力,可以迁移到真实观测。

4. 输入几何有误差,模型会照单全收吗?

论文在两组输入外参上施加旋转标准差1.5°、平移标准差0.1 m的扰动。五种评测设置中,G2G 的平均组间平移误差变化不超过0.015 m,平均旋转误差变化不超过0.05°;重新估计的组内平均旋转误差均低于0.85°

这说明,在所测试的扰动范围内,模型能够将输入几何作为有噪测量加以利用,并进行一定程度的校正。

这样的结果也解释了为什么“在哪里使用几何”很重要:如果外参只在最后的几何聚合中出现,噪声会直接进入求解;当外参已经融入特征,并在训练中经历过扰动,后续模块就有机会结合视觉信息学习纠偏。

5. 轻量体现在哪里:少训练参数,也减少重复的图像对推理

对于两组各五帧的输入,逐对处理需要评估5×5=25 个跨组图像对。G2G 在一次模型前向中统一输出所有目标位姿。

在论文报告的 RTX 4090、BF16、每组五帧、224×224 输入、推理 batch size 为 1 的设置下,G2G 推理延迟约为49.8 ms,推理显存约为2.33 GB;Reloc3R 完成 25 次成对推理及聚合约需461.6 ms

重采样器的收益则主要体现在训练:同一测试配置、训练 batch size 为 16 时,默认 64-token 版本的显存占用为5.44 GB,去掉重采样器、保留全部 256 个 token 时增至21.34 GB。相比之下,这两种配置的推理延迟只从约 49.8 ms 变为 52.1 ms。

因此,“不到 6% 可训练参数”和“64-token 压缩”分别解决不同层面的成本问题:前者减少需要更新的模型部分,后者显著降低跨组注意力的训练开销。

05 从给定图像组到实际应用:先选出值得比较的两组

前面的实验以两组观测已经给定为前提。真实机器人拿到的往往是一段当前视频,以及一条很长的历史轨迹。此时还需要先回答:哪两个窗口适合送进 G2G?

论文附录提供了一个可选的共视度预测前端。它复用冻结的 DINOv2 图像编码器,缓存逐帧特征,再用约184 万参数的解码器预测候选图像之间的共视程度。窗口级检索据此选择一对观测组,交给 G2G 估计位姿。

在 HM3D 验证中,用预测共视度选窗,与用真值共视度选窗,得到的下游 G2G 位姿精度没有显著差异。这为从长轨迹中自动构建输入组提供了一条路径。

这里两部分的职责需要区分:选窗前端在部署时仅看 RGB;G2G 位姿估计仍需要选中两组的内参和组内外参。前端训练所需的共视标签由深度投影构造,也与 G2G 的纯相对位姿监督分开。

▲ 可选的部署前端:从长序列中预测共视关系、选择窗口,再进行组间位姿估计。

G2G 为跨序列重定位和多相机里程计提供了共同的估计模块,也可以作为地图对齐、多机器人协同等系统中的一个组成部分。后面这些应用仍需结合检索、几何验证或后端优化等环节,并非本文已经完成的全套系统。

它的适用边界同样清晰:需要可用的组内几何,严重错误或缺失的先验会影响性能;低共视实验也不意味着任意两组毫无关联的图像都能被可靠对齐。论文在各数据集分别训练评估,并未宣称一个权重已经覆盖所有数据域。

G2G 最值得关注的启发,是如何围绕基础模型已有的能力划分任务:让成熟的几何表征继续处理组内关系,把新增的学习能力集中到尚未解决的跨组关系上。

对于已经具备里程计、地图或相机标定的机器人系统,这让已有的几何信息真正参与了视觉推理,也让重定位与多相机运动估计获得了一个共同接口。

项目主页提供更多定性结果及交互式三维对齐 Demo,欢迎试用与交流。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/24 17:54:12

DeepSeek LeetCode 103. 二叉树的锯齿形层序遍历 Golang实现

LeetCode 103. 二叉树的锯齿形层序遍历 Golang 实现 思路 与普通层序遍历一致,用队列逐层处理。区别在于需要交替改变每层的填充方向:维护布尔变量 leftToRight 表示当前层方向。每层预分配 level : make([]int, size):从左到右&#x…

作者头像 李华
网站建设 2026/9/24 17:54:00

系统分析师之信息化基础知识

知识点:信息工程方法信息工程是面向企业计算机信息系统建设,以数据为中心的开发方法。信息工程方法认为,与企业的信息系统密切相关的三要素是企业的各种信息、企业的业务过程和企业采用的信息技术。信息工程自上而下地将整个信息系统的开发过…

作者头像 李华
网站建设 2026/9/24 17:52:37

TCP协议栈管理、文件符表映射机制与TCP资源关闭流程介绍

文章目录 一、进程与内核 1.用户态的Java程序进程 2.内核态的操作系统内核 2.1操作系统 2.1.1内核 二、文件描述符与表引用 1.文件描述符 2.文件描述符表 3.引用比例 三、TCP资源管理与连接维护 1.TCP协议栈 1.1TCB 1.1.1端点 1.1.1.1TCP连接状态 四、Socket引用…

作者头像 李华
网站建设 2026/9/24 17:51:44

【n8n】AI驱动的短视频全自动生成应用

短视频内容的生产速度和创意质量已成为社交平台竞争的核心。借助AI与自动化技术,短视频的生成方式正从依赖人工转向全流程自动化生产模式。 该工作流以AI模型与自动化节点协作实现从创意到成品的短视频生成,涵盖文案构思、画面渲染、视频合成及语音配音等环节,适合批量化、…

作者头像 李华
网站建设 2026/9/24 17:50:39

【C#桌面客户端系列学习-1】打包exe,并根据版本号实现自动更新

目录 一、前言 二、主要用到的技术 1、AutoUpdater.NET 2、Fody.Costura 三、安装相关程序包 1、安装Autoupdater.NET.Official 2、安装Fody.Costura 四、配置版本号 五、准备更新用的XML文件 六、代码中调用 七、制作并上传更新包 八、测试是否成功 九、注意事项 …

作者头像 李华
网站建设 2026/9/24 17:50:04

浚县装修主材下单时点怎么反推?一张倒排表把采购和工序对齐

装修拖期比较隐蔽的一类原因,不是工人磨洋工,是材料没到。工序在前、材料在后,谁都救不回来——瓦工进场了砖还在路上,师傅只能先撤,下一个活儿排期一乱,整条链往后倒。这篇把主材下单时点的推导过程写下来…

作者头像 李华