「6%参数统一组间位姿估计」
目录
01 已知每组内部的关系,不等于知道两组如何对齐
02 现有方法的缺口:关键不只是“有没有几何”,还有“在哪里使用几何”
1. 先估计图像对,再聚合成组级结果
2. 多视图基础模型能联合看图,但未必理解“两组”的结构
03 方法架构:让基础模型处理组内几何,让桥接模块学习跨组关系
1. 分组编码:先把每组“放回自己的几何里”
2. 重采样:用少量 token 承载组内信息
3. 跨组桥接:既告诉模型“来自哪里”,也告诉它“对齐到哪里”
4. 位姿输出:一次前向,将所有目标帧放进共同参考系
04 实验结果:从跨季节对齐到仿真训练、真机测试
1. 跨季节:难点究竟出在“看不懂场景”,还是“连不上两组”?
2. 多相机里程计:利用已标定的阵列,估计两个时刻之间的运动
3. 仿真到真实:仿真训练的几何能力,能否迁移到真实相机?
4. 输入几何有误差,模型会照单全收吗?
5. 轻量体现在哪里:少训练参数,也减少重复的图像对推理
05 从给定图像组到实际应用:先选出值得比较的两组
机器人在冬天记录了一段校园轨迹,到了夏天,又沿着附近的道路经过。树木、光照、路边物体都变了,如何把这两次观测对齐?
另一台机器人装有多个朝向不同的相机。相机之间的安装关系已经标定,如何根据前后两个时刻的图像,判断机器人移动了多少?
前者通常叫跨序列重定位,后者属于多相机里程计。一个跨越不同采集过程,一个估计平台运动,看起来需要两套不同的方法。
但把问题拆开,会发现它们有一个共同点:每组观测内部,相机之间的相对位置和朝向已经有了;真正未知的,是两组观测之间的关系。
浙江大学联合浙江人形机器人创新中心、杭州师范大学提出的G2G(Group-to-Group),从这一共同结构出发,研究如何让多视图基础模型利用已有的组内几何,完成跨组位姿估计。该工作已被CoRL 2026接收。
论文:G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation
论文链接:https://arxiv.org/abs/2606.08284
项目主页:https://weiyufei0217.github.io/G2G/
代码:https://github.com/WeiYuFei0217/G2G
第一作者:魏雨飞,浙江大学五年级博士生,研究方向为3D 视觉感知、世界模型与具身智能。
01 已知每组内部的关系,不等于知道两组如何对齐
理解 G2G,首先要分清两个层次的“已知”和“未知”。
对于一段图像序列,视觉里程计、SLAM 或 SfM 可以提供各帧在这段序列内部的相对位姿。对于一套多相机阵列,标定可以提供各相机相对于参考相机的外参。这些信息都属于组内几何。
但两段独立记录的轨迹,通常各有自己的局部坐标系;同一套相机阵列在两个时刻的观测,也分别对应机器人当时的位置。知道两组内部如何排列,并没有告诉我们,第二组应该旋转、平移多少,才能放进第一组的坐标系。
可以把它想象成两块已经各自拼好的拼图:每块内部的相对关系已经确定,接下来的任务是找到两块之间的对齐关系。组内几何提供了结构,却没有提前给出跨组问题的答案。
G2G 将这两种情形写成同一个任务:输入两组 RGB 图像、相机内参和各自的组内外参,估计它们之间的六自由度刚体变换。
这样统一的意义,不只是换一个任务名称。它让两类应用共享相同的输入输出接口,也让同一模型的组级推理能力可以用于两种观测组织方式。
同时,G2G 并不假设输入几何绝对准确。里程计会漂移,标定也可能存在误差。因此,方法既要利用这些先验,也要保留纠正它们的能力。
02 现有方法的缺口:关键不只是“有没有几何”,还有“在哪里使用几何”
1. 先估计图像对,再聚合成组级结果
一种自然的做法,是先建立两组图像之间的局部特征对应,求出若干图像对的相对位姿,再通过几何求解或运动平均得到组级结果。Reloc3R 等方法也采用先进行图像对位姿预测、再利用已知位姿聚合的思路。
这条路线可以利用组内几何,但如果跨组外观差异已经破坏了前面的对应关系或位姿预测,后面的聚合就很难补救。
例如,同一片树木在冬夏两季仍处于相同空间位置,图像纹理却可能完全不同。几何上看到了同一片区域,并不意味着图像上容易找到可靠的对应。
2. 多视图基础模型能联合看图,但未必理解“两组”的结构
DUSt3R、MASt3R、VGGT 等工作推动了前馈几何估计的发展。其中,VGGT 可以联合处理多视图并预测相机参数;DUSt3R、MASt3R 则通常还需要将图像对结果进一步对齐。
然而,直接把两组图像交给这类模型,并不等于告诉它:哪些图像共享一套已知的局部几何,哪些关系才是需要求解的未知量。
已有研究也在引入几何先验,但方式并不相同:Reloc3R 在预测后的运动聚合中使用已知位姿;Rig3R 将相机阵列元信息用于前向推理;MapAnything 可以在特征编码阶段融合相机位姿和射线等条件。
G2G 要补上的,是“两组各自带有局部几何,但组间变换未知”这一接口。
这里存在一个容易忽略的坐标系问题:MapAnything 能接收位姿条件,但原生条件建立在统一参考系下。两组分别以自己的参考帧为原点时,不能把它们的局部外参直接当成同一个世界坐标系中的位姿。若先把第二组外参转换到第一组坐标系,又恰好需要那个尚未求出的组间变换。
G2G 因此选择:先在各自的局部坐标系中理解每一组,再学习两组之间的关系。
03 方法架构:让基础模型处理组内几何,让桥接模块学习跨组关系
G2G 采用“冻结—桥接”(Freeze-and-Bridge)设计:保留 MapAnything 已经学到的几何融合能力,在其上增加少量可训练模块。
冻结骨干约有5.39 亿参数,新增的三个可训练模块合计约3200 万参数,占完整模型不到 6%。这里的 6% 指需要训练的参数比例,完整骨干仍参与前向计算。
▲ G2G 总体架构:两组观测先由冻结骨干分别编码,再通过重采样、跨组桥接和位姿头,输出相对于公共锚帧的位姿。
1. 分组编码:先把每组“放回自己的几何里”
两组图像分别进入同一个冻结的 MapAnything 骨干。每一组都提供自己的相机内参和组内外参,并以本组参考帧作为局部原点。
骨干将图像内容、相机位姿和像素射线方向融合,再在组内交换多视图信息。输出的特征因此不仅描述“图里有什么”,也带有“这些观测在本组中是什么空间关系”的信息。
组内外参只在这一阶段显式输入。后面的可训练模块接收的是已经融合几何信息的特征,而不是另拿一份外参,在预测结束后才进行修补。
这也是冻结骨干的价值所在:已有模型已经学会如何把图像和相机几何联系起来,下游训练可以集中学习尚未具备的跨组关系,同时保留大规模预训练得到的表征。
2. 重采样:用少量 token 承载组内信息
每帧图像会产生大量图块特征。若全部送入后续注意力模块,训练时需要保存的中间状态会迅速增加。
G2G 使用 Perceiver Resampler,以可学习查询读取每帧特征,将默认配置下的256 个图块 token 压缩为 64 个潜在 token。
它的主要作用是控制计算成本,而非直接提高精度。消融实验中,去掉重采样器甚至能改善部分结果,但训练显存和训练时间明显增加。这体现了方法对精度与资源开销的主动取舍。
3. 跨组桥接:既告诉模型“来自哪里”,也告诉它“对齐到哪里”
压缩后的两组特征被拼接起来,并加入三类标记:
- 帧标记:说明这是组内的第几帧,或哪一个相机;
- 组标记:区分特征来自 A 组还是 B 组;
- 锚帧标记:指定 A 组的参考帧 A₀,作为所有输出的共同坐标原点。
随后,两层合并自注意力同时进行组内信息共享和跨组信息交换。
这一设计把两件事结合起来:模型可以利用同组其他视角理解当前观测,也可以据此推断它与另一组的关系。跨组推理不再只依赖某一张图与另一张图的独立判断。
4. 位姿输出:一次前向,将所有目标帧放进共同参考系
位姿头读取锚帧与目标帧的桥接后特征,分别预测旋转和平移。所有目标帧批量处理,一次前向即可得到它们相对于 A₀ 的位姿。
其中,B 组的输出用于完成跨组对齐;A 组非锚帧的输出则重新估计组内关系,使模型能够修正输入中的残余误差。需要其他帧之间的相对位姿时,可以从共同参考系下的结果组合得到。
训练时,G2G 使用旋转与平移损失,并提高跨组项的权重。课程学习先引入高共视样本,再逐步加入低共视的困难样本;对输入外参加入 SE(3) 扰动,则让模型学习如何利用不够准确的几何。
G2G 位姿模型只使用相对位姿监督,不需要深度预测损失。深度在可用时用于离线计算共视程度、构建训练样本;推理时,模型仍需 RGB、相机内参和组内外参。
04 实验结果:从跨季节对齐到仿真训练、真机测试
论文在 HM3D、TartanGround、NCLT 和 ZJH 四个数据集上评估跨序列重定位与多相机里程计,覆盖室内外仿真、真实跨季节和仿真到真实迁移。
各学习型对比方法按其原有监督方式在目标数据上重新训练或微调,包括适用时的深度监督;G2G 位姿模型仅使用相对位姿监督。以下结果均对应论文给定的评测协议。
1. 跨季节:难点究竟出在“看不懂场景”,还是“连不上两组”?
NCLT 反复采集同一校园,不同日期之间存在季节、光照和局部场景变化。在跨序列重定位中,G2G 的平均平移误差为0.692 m,平均旋转误差为2.47°。
更能说明问题的是论文中的诊断实验:只输入 NCLT 同一次采集的五帧图像时,VGGT 的组内旋转误差中位数约为2.3°。但在其中加入一帧来自另一季节的图像后,若干诊断样例中的组内估计仍然准确,跨季节位姿却显著失准。
这表明,瓶颈并非简单的“模型无法处理校园图像”,而在于如何将外观变化明显、几何上仍有关联的两组观测连接起来。G2G 将组内几何提前融入特征,再进行跨组推理,正是在针对这一困难。
▲ 真实场景对齐结果:NCLT 展示不同季节之间的组间估计;ZJH 展示仿真训练后的真机测试。点云用于呈现对齐效果,并非 G2G 的输入。
2. 多相机里程计:利用已标定的阵列,估计两个时刻之间的运动
切换到多相机输入时,任务接口保持不变:每组是一个时刻的多相机观测,组内外参来自标定,需要估计的是两个时刻之间的运动。
在 NCLT 同日期阵列评测中,G2G 的平均误差为0.078 m / 1.02°;在更困难的跨日期阵列配对中,仍保持0.172 m / 1.97°,而 Reloc3R 对应为0.752 m / 4.47°。
这些是给定观测组之间的相对位姿误差。G2G 提供的是可用于里程计的组间估计模块,完整长轨迹系统还需要帧选择、结果累积等环节。
▲ 不同阵列配置下的相对位姿估计。MA-AB 使用真值组间变换构造输入,是 oracle 参照;VGGT 的平移结果经过逐对最优 Sim(3) 真值对齐,需结合该评测条件阅读。
3. 仿真到真实:仿真训练的几何能力,能否迁移到真实相机?
在 ZJH 上,可训练模块只使用仿真数据训练,随后直接用于真实四相机采集,无需使用真实数据微调网络。
跨序列重定位的旋转正确率 RRA@5° 从仿真的96.5%保持到真实的95.0%;真实多相机里程计的平均旋转误差为2.82°,优于表中其他非 oracle 方法。在新域进行尺度对齐后,平移估计同样保持良好精度。
这表明,冻结骨干所保留的几何表征,以及在仿真中学到的跨组推理能力,可以迁移到真实观测。
4. 输入几何有误差,模型会照单全收吗?
论文在两组输入外参上施加旋转标准差1.5°、平移标准差0.1 m的扰动。五种评测设置中,G2G 的平均组间平移误差变化不超过0.015 m,平均旋转误差变化不超过0.05°;重新估计的组内平均旋转误差均低于0.85°。
这说明,在所测试的扰动范围内,模型能够将输入几何作为有噪测量加以利用,并进行一定程度的校正。
这样的结果也解释了为什么“在哪里使用几何”很重要:如果外参只在最后的几何聚合中出现,噪声会直接进入求解;当外参已经融入特征,并在训练中经历过扰动,后续模块就有机会结合视觉信息学习纠偏。
5. 轻量体现在哪里:少训练参数,也减少重复的图像对推理
对于两组各五帧的输入,逐对处理需要评估5×5=25 个跨组图像对。G2G 在一次模型前向中统一输出所有目标位姿。
在论文报告的 RTX 4090、BF16、每组五帧、224×224 输入、推理 batch size 为 1 的设置下,G2G 推理延迟约为49.8 ms,推理显存约为2.33 GB;Reloc3R 完成 25 次成对推理及聚合约需461.6 ms。
重采样器的收益则主要体现在训练:同一测试配置、训练 batch size 为 16 时,默认 64-token 版本的显存占用为5.44 GB,去掉重采样器、保留全部 256 个 token 时增至21.34 GB。相比之下,这两种配置的推理延迟只从约 49.8 ms 变为 52.1 ms。
因此,“不到 6% 可训练参数”和“64-token 压缩”分别解决不同层面的成本问题:前者减少需要更新的模型部分,后者显著降低跨组注意力的训练开销。
05 从给定图像组到实际应用:先选出值得比较的两组
前面的实验以两组观测已经给定为前提。真实机器人拿到的往往是一段当前视频,以及一条很长的历史轨迹。此时还需要先回答:哪两个窗口适合送进 G2G?
论文附录提供了一个可选的共视度预测前端。它复用冻结的 DINOv2 图像编码器,缓存逐帧特征,再用约184 万参数的解码器预测候选图像之间的共视程度。窗口级检索据此选择一对观测组,交给 G2G 估计位姿。
在 HM3D 验证中,用预测共视度选窗,与用真值共视度选窗,得到的下游 G2G 位姿精度没有显著差异。这为从长轨迹中自动构建输入组提供了一条路径。
这里两部分的职责需要区分:选窗前端在部署时仅看 RGB;G2G 位姿估计仍需要选中两组的内参和组内外参。前端训练所需的共视标签由深度投影构造,也与 G2G 的纯相对位姿监督分开。
▲ 可选的部署前端:从长序列中预测共视关系、选择窗口,再进行组间位姿估计。
G2G 为跨序列重定位和多相机里程计提供了共同的估计模块,也可以作为地图对齐、多机器人协同等系统中的一个组成部分。后面这些应用仍需结合检索、几何验证或后端优化等环节,并非本文已经完成的全套系统。
它的适用边界同样清晰:需要可用的组内几何,严重错误或缺失的先验会影响性能;低共视实验也不意味着任意两组毫无关联的图像都能被可靠对齐。论文在各数据集分别训练评估,并未宣称一个权重已经覆盖所有数据域。
G2G 最值得关注的启发,是如何围绕基础模型已有的能力划分任务:让成熟的几何表征继续处理组内关系,把新增的学习能力集中到尚未解决的跨组关系上。
对于已经具备里程计、地图或相机标定的机器人系统,这让已有的几何信息真正参与了视觉推理,也让重定位与多相机运动估计获得了一个共同接口。
项目主页提供更多定性结果及交互式三维对齐 Demo,欢迎试用与交流。