📖标题:RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
🌐来源:arXiv, 2607.14187v1
🛎️文章简介
🔸研究问题:如何弥合视觉语言模型擅长抽象推理但缺乏物理状态想象,与世界模型擅长预测未来但缺乏因果逻辑之间的鸿沟,从而实现真正的具身认知?
🔸主要贡献:论文提出了RxBrain,一种具备联合语言-视觉推理与想象能力的具身认知基础模型,通过统一的混合Transformer架构,在单一规划序列中互补地结合文本逻辑与视觉状态预测。
📝重点思路
🔸采用模态感知的混合Transformer(MoT)架构,包含语言和视觉两个专用分支。视觉分支中,理解与生成Token共享注意力投影但路由至不同的前馈网络专家,实现了感知与想象的内部交互及语义对齐。
🔸设计了自动化的联合规划数据构建流水线,将具身视频分解为以动作为中心的片段,通过关键帧采样、候选步骤提议和边界细化,将视频转化为文本描述与视觉状态转换对齐的监督数据,涵盖从单步状态变化到最终任务目标的四个层级。
🔸引入交错生成机制,模型自回归地交替输出文本推理步骤和对应的视觉状态想象。文本提供任务分解、约束和决策逻辑,视觉想象则通过流匹配在VAE潜空间中预测中间及最终物理状态,形成闭环规划。
🔸扩展了动作生成能力,通过门控专家融合机制复用预训练的生成专家知识,无需大规模动作数据预训练即可直接生成连续机器人动作,并在真实机器人上验证了其有效性。
🔎分析总结
🔸在通用图像生成基准GenEval上,RxBrain得分与专用生成模型相当,证明了其在保持强大生成能力的同时未牺牲多模态理解能力。
🔸在具身空间理解方面,RxBrain在多视图和3D理解基准上表现优异,但在细粒度空间定位和轨迹推理上仍有提升空间,显示出其在宏观任务结果判断和多轮模拟规划上的优势。
🔸在RxBrain-Bench基准测试中,RxBrain在联合子目标规划任务上显著优于模块化基线和统一基线模型。其文本推理能力强于视觉生成,视觉想象的质量(如时间连贯性和物理合理性)仍是主要瓶颈。
🔸在真实机器人部署实验中,基于RxBrain的动作生成策略在摆放餐具、折叠眼镜等复杂操作任务上的成功率高于π0和π0.5基线,验证了从多模态预训练中迁移世界知识用于动作控制的可行性。
💡个人观点
论文打破了传统具身AI中“理解”与“生成”分离的范式,将文本的逻辑结构与视觉的物理状态预测耦合在同一个自回归规划序列中。