news 2026/8/9 20:10:32

【ICML 2025】SAM2Act 论文解读|从视觉基础模型记忆迁移视角

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【ICML 2025】SAM2Act 论文解读|从视觉基础模型记忆迁移视角

摘要

本文解读 ICML 2025 论文《SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation》。该论文提出SAM2ActSAM2Act+两代机器人操作策略,通过融合SAM2 视觉基础模型的多分辨率嵌入级联多分辨率上采样空间记忆架构,让基于 RVT-2 的 6-DoF 3D 模仿学习策略同时获得高精度、强泛化与空间记忆能力,其特别之处在于把 SAM2 的视频分割记忆机制(记忆库 + 记忆编码器 + 记忆注意力)直接迁移为操作策略的"海马体",并配套新建打破马尔可夫假设的 MemoryBench 评测基准。实验表明RLBench 18 任务平均成功率 86.8% 刷新 SOTA(超 RVT-2 达 5.4pp)、MemoryBench 记忆任务 94.3%(比无记忆基线 +37.6pp)、The Colosseum 扰动掉点仅 -4.3%,为机器人空间记忆型通用操作策略提供了重要借鉴。

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
    • 评测协议
    • 主结果
    • MemoryBench 任务设计(附录 A)
    • 分析实验与消融(附录 C)
    • 真机结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • SAM2Act 和 SAM2Act+ 有什么区别?
    • MemoryBench 为什么能"打破马尔可夫假设"?
    • 为什么记忆组件能带来 +37.6pp 的提升?
    • 训练需要多少算力和数据?
    • SAM2Act 只能做关键帧位姿级别的操作吗?
    • 代码和项目开源了吗?
  • 参考链接

论文基本信息

项目内容
标题(英文)SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
标题(中文)SAM2Act:视觉基础模型 × 记忆架构的机器人操作
作者Haoquan Fang, Markus Grotz, Wilbert Pumacay, Yi Ru Wang, Dieter Fox, Ranjay Krishna, Jiafei Duan
机构University of Washington · NVIDIA · Allen Institute for AI · Universidad Católica San Pablo
会议ICML 2025
arXivhttps://arxiv.org/abs/2501.18564
项目网站https://sam2act.github.io/

背景与动机

机器人操作策略需要同时应对三大挑战:多任务交互对未见场景的泛化以及空间记忆。现有行为克隆(BC)策略在这三方面各有短板——在环境扰动(光照、桌面颜色等)下成功率大幅掉点,而在"同一视觉观测却需要不同动作"的隐式记忆任务上更是几乎失效。

从研究脉络看,这项工作沿着PerAct(体素化 3D 关键帧 BC)→ The Colosseum(泛化评测基准)→ Manipulate-Anything → SAM2Act的主线推进。3D 操作 transformer 阵营中,PerAct 使用体素表示,RVT / RVT-2 使用 2.5D 多视图表示(RVT-2 在 RLBench 上已达 81.4% 平均成功率),PolarNet / M2T2 / Manipulate-Anything 则走点云重建路线;视觉表示方向,SAM / SAM2、DINOv2 等基础模型被用作预训练或冻结编码器(SAM-E 即 RVT × SAM 编码器);机器人记忆方向,从导航语义地图,到 VLM/LVM 的体素图与神经特征场,再到 SAM2 的视频级流式记忆,记忆机制的粒度与通用性不断提升。

关键差距在于:已有工作用 SAM 提升感知精度,却从未把 SAM2 的流式记忆机制迁移到操作策略——分割与操作共享同一套空间表征,而记忆正是它们之间缺失的桥梁。基线对比也印证了这一差距:在 MemoryBench 记忆任务上,无记忆的 SAM2Act(55.0%)与 RVT-2(54.0%)几乎持平,一旦接入记忆组件,SAM2Act+ 一跃达到 94.3%。从历史视角看,视觉基础模型经历了 2023 年 SAM(ICCV)的提示驱动通用分割、2024 年 RVT-2 / SAM-E 把多视图 transformer 确立为 3D 操作骨干、2025 年 SAM2Act 完成"从感知到决策"的技术迁移,直至 2025–2026 年被 FoundModels 等综述列为机器人视觉基础模型核心——SAM2Act 正是这条迁移弧上的关键节点。

研究主线:从问题到结论

**图 6:SAM2Act 研究主线(Mermaid 流程图):从机器人策略泛化与空间记忆缺失的问题出发,经动机、设计与方法,到四大基准评测并得出结论。

基准/方法设计

图 1:SAM2Act 概览:语言指令驱动的多视图行为克隆策略,可执行高精度任务(旋转台灯小旋钮)、泛化到光照等环境变化;经记忆架构升级为 SAM2Act+ 后,可求解需要隐式空间记忆的任务(记住钳子存放在哪)。

SAM2Act 的设计建立在三条核心决策之上:

  • 基于 RVT-2 的 6-DoF 3D 模仿学习骨干:以 RVT-2 的多视图 transformer 为基底,coarse 分支生成缩放热图定位兴趣区,fine 分支精化为精确动作热图,语言用 CLIP 编码对齐空间坐标。
  • SAM2 多分辨率视觉嵌入:点云重建后渲染 3 个虚拟视角,RGB 通道复制送入 SAM2 图像编码器,产出 object-centric 的多分辨率分层嵌入;用LoRA(rank 16)微调做域适配,避免大规模重训。
  • 记忆能力的显式设计:SAM2Act+ 在 coarse 分支注入 SAM2 的记忆库(Memory Bank,每视角独立 FIFO 队列)、记忆编码器(Memory Encoder)与记忆注意力(Memory Attention),让策略依据历史热图进行记忆驱动的推理;预测热图扮演 SAM2 中 object mask 的角色,同一套记忆机制从视频分割无缝迁移到动作预测。

评测体系覆盖四个维度:RLBench 18 个仿真任务(精度)、MemoryBench 3 个空间记忆任务(记忆)、The Colosseum 20 个任务 × 13 类扰动(泛化)以及 4 个真机任务(落地验证)。

分类全景

**图 7:SAM2Act 技术构成全景(Mermaid 结构图):视觉编码(SAM2 嵌入 + LoRA)、动作解码(coarse→fine 多视图 transformer + 级联上采样)、记忆三件套与四类评测基准。

方法细节

图 2:SAM2Act(上)与 SAM2Act+(下)架构总览:SAM2 编码器产出 prompt-conditioned 多分辨率嵌入,多视图 transformer 对齐语言与空间坐标,级联上采样生成平移热图;SAM2Act+ 在 coarse 分支加入记忆编码器、记忆注意力与记忆库,依据历史热图进行记忆驱动的推理。

方法的核心设计要素有四:

  • 多分辨率上采样:三个凸上采样器级联,逐级 2 倍提升空间分辨率,每一步与 SAM2 的对应层级嵌入做元素相加并接 LayerNorm,公式为 $X^{l+1}=\mathrm{LayerNorm}(U(X^l)\oplus E^l)$,其中 $E^l$ 是 SAM2 第 $l$ 层嵌入——以最小化信息损失的方式把分层视觉特征直接注入热图解码。
  • 记忆组件适配:记忆编码器融合 MVT(多视图 transformer)特征 + 平移热图下采样结果(而非 SAM2 的图像嵌入),使记忆表示同时包含语言指令与多视角语义,而不仅是原始像素。
  • 冻结-微调范式:SAM2Act 预训练完成后,冻结 SAM2 编码器、MVT 与整个 fine 分支,只微调 coarse 分支——因为 coarse 分支的热图承载最丰富的记忆上下文,这一设计也大幅降低了适配成本。
  • 时空一致采样:按连续关键帧序列采样 batch 并逐帧顺序前向,避免新采样法导致的收敛缓慢;训练采用先标准采样预训练、再新采样微调的两阶段策略。

图 3:SAM2Act 模块与多分辨率上采样:三个凸上采样器级联,逐级把 SAM2 多分辨率嵌入经元素相加与 LayerNorm 注入特征图,空间分辨率逐级翻倍,生成精确平移热图。

训练与实现细节同样值得关注(附录 B):模型在32 块 H100/A100上训练,batch size 256(记忆窗口 8 时)或 320(记忆窗口 10 时),学习率 3.2e-3(按 $1.25\times10^{-5}\times$ batch size 线性缩放),优化器为LAMB + cosine decay,共 90 epochs / 56.25K steps;SAM2 编码器用 LoRA rank 16 适配;MemoryBench 各任务按单任务设置训练,不同 GPU 配置下保持总 batch size 一致以保证对比公平。

实验设计与结果

评测协议

仿真环境为 CoppeliaSim + PyRep,7-DoF Franka Panda 机械臂,5 个 128×128 RGB-D 相机;动作表示为关键帧位姿 + OMPL 运动规划。数据规模:RLBench 18 任务(249 个变体),每任务 100 条演示训练 / 25 条测试;MemoryBench 3 任务;The Colosseum 20 任务 × 13 类扰动;真机 4 任务各 10–15 条动觉示教演示。基线为 PerAct、RVT、RVT-2、SAM-E;RLBench 报 4 次评估统计,Colosseum 报 3 次;真机另对比 RVT-2(10 ID + 10 OOD 次试验)。

图 4:MemoryBench 仿真任务(上)与真机任务(下):三个空间记忆任务在按钮干扰后场景视觉不可区分,必须靠记忆;真机任务含 OOD 扰动测试。

主结果

方法RLBench 平均Colosseum 扰动掉点MemoryBench 平均
RVT-281.4%-19.5%54.0%
SAM-E70.6%--
SAM2Act86.8%-4.3%55.0%
SAM2Act+--94.3%
提升+5.4pp15.2pp 更稳+37.6pp

结论非常清晰:记忆组件带来决定性差距——无记忆的 SAM2Act 与 RVT-2 在 MemoryBench 上均约 54–55%,SAM2Act+ 一跃至 94.3%。

MemoryBench 任务设计(附录 A)

MemoryBench 的核心设计是打破马尔可夫假设:构造"两条动作历史 → 同一观测 $o_t$ → 却需要不同动作"的场景,迫使策略回忆动作历史;语言指令标准化以防止信息泄漏。三个任务覆盖 2D / 3D 空间与前向 / 反向推理,用按钮中断制造记忆需求:

任务记忆维度流程随机基线
reopen_drawerz 轴(3D)关抽屉 → 按按钮 → 重开原抽屉(按钮后三抽屉视觉不可区分)33%
put_block_backxy 平面(2D)块移中心 → 按按钮 → 放回原位(4 个红贴片)25%
rearrange_block反向推理中心块移空位 → 按按钮 → 把未动过的块移向中心(2 块)50%

分析实验与消融(附录 C)

作者还系统拆解了方法各部分对结果的贡献(即 Oral 信号中的逐项受控消融):

  • P2 替换算子/表示:用 SAM2 多分辨率嵌入 + 级联上采样替换 RVT-2 的原始凸上采样输入——去掉多分辨率嵌入使 RLBench 掉 1.1pp、Colosseum 掉点恶化 14.8pp(相对 -344%);换回 SAM 编码器掉 6.0pp;替换为 DINOv2 / Depth Anything V2 均更低。
  • P4 混淆隔离诊断:MemoryBench 每次只隔离一个记忆维度(z 轴 / xy 平面 / 反向推理)并给出随机基线 33% / 25% / 50%——无记忆 SAM2Act(55.0%)≈ RVT-2(54.0%),SAM2Act+ 达 94.3%,提升可归因于记忆机制本身。
  • P13 条件化适配而非重训练:冻结 SAM2 编码器与 MVT / fine 分支,仅 LoRA(rank 16)+ coarse 分支微调——低成本适配仍获 86.8% RLBench SOTA,且 Colosseum 13 类扰动掉点最小。

真机结果

图 5:真机设置:Franka Panda + Robotiq 2F-85 夹爪 + exocentric RealSense D455 深度相机;4 个真机任务各 10-15 条动觉示教演示。

真机指标SAM2ActRVT-2
4 任务总成功率75%43%
高精度灯旋钮任务60%0%
记忆任务(同一按钮按两次)70%40%

结果对比总结

**图 8:SAM2Act 结果对比总结(Mermaid 流程图):RVT-2 → SAM2Act → SAM2Act+ 在 RLBench、Colosseum 与 MemoryBench 上的数字对比,记忆组件贡献 +37.6pp。

关键发现

  • RLBench 刷新 SOTA:SAM2Act 在 18 个 RLBench 任务上平均成功率 86.8%,超 RVT-2 达 5.4pp,且 9/18 任务排名第一。
  • 高精度任务增益最大:Insert Peg 超 RVT-2 达 44%(约 2.1 倍),Sort Shape 提升 29%——多分辨率嵌入对精细操作的价值最显著。
  • 环境扰动鲁棒性:光照、桌面颜色等扰动下 Colosseum 掉点仅 -4.3%±3.6(RVT-2 为 -19.5%),比 RVT-2 稳 15.2pp,个别扰动类别甚至出现正增益。
  • 记忆是决定性组件:MemoryBench 上无记忆 SAM2Act(55.0%)与 RVT-2(54.0%)持平,SAM2Act+ 以 94.3% 大幅领先,+37.6pp 全部来自记忆架构本身。
  • 真机泛化可落地:总成功率 75% vs RVT-2 的 43%;高精度灯旋钮任务 60% vs 0%;记忆任务(同一按钮按两次)70% vs 40%。
  • 消融验证每处设计:去多分辨率嵌入 RLBench -1.1pp、Colosseum -14.8pp;SAM 编码器替换 -6.0pp;SAM2 → DINOv2 / Depth Anything V2 均更低。

局限性

  • 不支持灵巧连续控制:仅覆盖关键帧位姿级 6-DoF 操作,难以扩展到连续、灵巧操控场景。
  • 固定记忆窗口:记忆窗口长度因任务手工设定(8 或 10),无法自适应不同长度的任务。
  • 记忆限于空间信息:记忆编码器只吃平移热图,无法保留语义信息(如颜色)。
  • 单任务训练设置:MemoryBench 上各任务独立训练并选择最优 epoch,尚未验证多任务记忆泛化。

作者展望是迈向具备空间记忆能力的 generalist manipulation policies,并扩展记忆窗口与语义维度。

常见问题(FAQ)

SAM2Act 和 SAM2Act+ 有什么区别?

SAM2Act 是把 SAM2 的多分辨率视觉嵌入 + 级联上采样融入 RVT-2 骨干,解决精度与泛化;SAM2Act+ 额外把 SAM2 的记忆库、记忆编码器、记忆注意力迁入 coarse 分支,让策略具备空间记忆,解决需要回忆历史动作的任务。

MemoryBench 为什么能"打破马尔可夫假设"?

它构造了"两条不同动作历史 → 同一视觉观测 → 却需要不同动作"的场景:例如关抽屉、按按钮后三个抽屉视觉上不可区分,策略必须回忆"刚才关的是哪个抽屉"才能重开原抽屉。纯马尔可夫策略只看当前观测必然失败,随机基线仅 33%。

为什么记忆组件能带来 +37.6pp 的提升?

无记忆的 SAM2Act(55.0%)与 RVT-2(54.0%)在 MemoryBench 上几乎持平,说明基线方法在记忆任务上已到瓶颈;SAM2Act+ 通过记忆注意力在历史热图序列上做检索,把"当前观测 + 动作历史"共同作为决策依据,直接补上了缺失的信息维度。

训练需要多少算力和数据?

模型在 32 块 H100/A100 上训练 90 epochs / 56.25K steps,RLBench 每任务 100 条演示;SAM2 编码器仅用 LoRA rank 16 适配,且预训练后冻结编码器与 fine 分支,只微调 coarse 分支,适配成本很低。

SAM2Act 只能做关键帧位姿级别的操作吗?

是的,当前局限正在于此:它输出关键帧位姿 + OMPL 运动规划,不支持连续灵巧操控;这也是作者列出的首要局限与未来方向。

代码和项目开源了吗?

官方项目页 https://sam2act.github.io/ 提供论文、项目介绍与代码仓库链接,arXiv 全文见 https://arxiv.org/abs/2501.18564。

参考链接

  • SAM2Act 论文(arXiv):https://arxiv.org/abs/2501.18564
  • SAM2Act 官方项目页:https://sam2act.github.io/
  • SAM 2: Segment Anything in Images and Videos(ICLR 2025):https://arxiv.org/abs/2408.00714
  • RVT-2: Learning Precise Manipulation from Few Demonstrations(CoRL 2024):https://arxiv.org/abs/2406.08545
  • Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation(CoRL 2023):https://arxiv.org/abs/2209.00151
  • SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation:https://arxiv.org/abs/2405.19586
  • Segment Anything(ICCV 2023):https://arxiv.org/abs/2304.02643

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/9 20:09:10

Electron+Python构建金融算法工具OpenClaw实战

1. 从零到一:金融算法工程师的OpenClaw开发实录春节假期对大多数人意味着团圆和休息,但对技术人来说,这可能是难得的"闭关开发"黄金期。去年春节我就用10天时间,从零构建了一个名为OpenClaw的金融算法分析工具。作为在量…

作者头像 李华
网站建设 2026/8/9 19:56:42

AH股溢价监测系统实战:用Python构建跨市场套利预警

AH 股溢价监测系统实战:用 Python 构建跨市场套利预警 做跨市场量化这几年,AH 股溢价数据一直是观察 A 股估值的重要参考。但实际数据拉下来后才发现,普通行情软件显示的"恒生 AH 股溢价指数"严重失真——145 只 AH 股的实际溢价水…

作者头像 李华
网站建设 2026/8/9 19:56:19

2026年Vue3组件库生态全景与企业级选型指南

1. 2026年Vue3组件库生态全景扫描三年前Vue3正式发布时的青涩早已褪去,如今的生态圈就像东京秋叶原的电器街——琳琅满目的组件库让人挑花眼。作为从Vue2时代一路走来的老司机,我完整经历了Element UI到Element Plus的迁移阵痛,也见证了无数新…

作者头像 李华
网站建设 2026/8/9 19:55:39

nile.js部署最佳实践:解决P2P直播中的NAT穿透与网络优化问题

nile.js部署最佳实践:解决P2P直播中的NAT穿透与网络优化问题 【免费下载链接】nile.js Scalable peer to peer live video streaming built on torrents and webRTC 项目地址: https://gitcode.com/gh_mirrors/ni/nile.js nile.js作为基于torrents和webRTC构…

作者头像 李华
网站建设 2026/8/9 19:55:31

LangGraph智能体技能集成实战:从原理到生产级应用

1. 项目概述:为什么要在LangGraph中集成Skills?如果你正在用LangGraph构建智能体,大概率遇到过这个场景:你的智能体在聊天、总结文档上表现不错,但一旦需要它去查一下实时的天气、发一封邮件,或者从数据库里…

作者头像 李华