机器人基础模型的演进
对通用机器人策略的追求,通常被称为机器人基础模型或视觉-语言-动作(VLA)模型,是现代人工智能的核心主题。这些模型旨在为机器人提供与大型语言模型相同的广泛能力和推理水平,使其能够在多样化的环境和机器人平台上操作。尽管π0\pi_0π0、π0.5\pi_{0.5}π0.5和π0.6\pi_{0.6}π0.6等早期版本通过集成预训练的视觉-语言架构和分层规划取得了一些进展,但它们往往在组合泛化能力上表现不佳——即以新方式组合已知技能来解决不熟悉问题的能力。大多数现有模型需要针对特定任务进行微调才能可靠运行,这限制了它们在实际场景中的灵活性。
π0.7模型代表了该领域的进步,它侧重于“可控性”和上下文条件设定,以克服这些限制。通过扩展在训练和推理过程中提供给模型的信息,研究人员开发了一种策略,该策略无需专门的后期训练即可展现出涌现能力。这种方法使机器人能够遵循复杂的、开放式的指令,并“开箱即用”地在不同机器人本体之间转移灵巧技能(跨实体转移)。这项工作的意义在于它从僵化的任务定义转向了一种新的范式,即机器人可以通过语言和视觉目标进行“指导”。
架构与多尺度记忆系统
π0.7\pi_{0.7}π0.7模型是一个拥有50亿参数的VLA,建立在一个强大的架构基础之上。它利用一个40亿参数的视觉-语言模型(VLM)骨干网络,该骨干网络从Gemma3初始化,包含一个4亿参数的视觉编码器。这个骨干网络负责处理视觉观察和高级指令,提供复杂交互所需的语义理解。
为了处理时间上下文——这对于需要记住过去状态或序列的任务至关重要——π0.7\pi_{0.7}π0.7整合了一个名为多尺度具身记忆(MEM)的系统。MEM系统可以处理来自多个摄像机角度(包括前视图和腕部安装视图)的最多六个历史帧。这些帧被压缩成固定数量的令牌,使模型能够在不以原始数据淹没主Transformer的情况下保持情节的连贯历史。
实际的运动控制由一个8.6亿参数的“动作专家”Transformer处理。该专家通过流匹配目标进行训练以预测连续动作,这是一种通过学习对动作序列去噪来生成平滑精确轨迹的技术。训练过程的一个关键特性是“知识隔离”(KI)。在此设置中,VLM骨干网络受到离散令牌的监督,但来自动作专家的梯度不会回流到骨干网络中。这可以防止运动控制的高频噪声降级VLM中存储的稳定语义知识。
通过多模态上下文实现可控性
π0.7\pi_{0.7}π0.7的核心创新在于其扩展的上下文条件设定策略。模型不再只接收简单的语言命令,而是在每个时间步ttt接收一个丰富、多模态的提示CtC_tCt作为条件。这个提示定义为:
Ct=(ℓ^t,gt,m,c) C_t = (\hat{\ell}_t, g_t, m, c)Ct=(ℓ^t,gt,m,c)
其中:
- ℓ^t\hat{\ell}_tℓ^t代表子任务指令,是中间语义步骤(例如,“去拿把手”而不是仅仅“开门”)。
- gtg_tgt表示子目标图像,描绘了环境的期望未来状态。
- mmm代表剧集元数据,包括质量评分和速度。
- ccc指定控制模式(例如,关节级别或末端执行器控制)。
通过包含子目标图像gtg_tgt,模型接收到空间接地的目标。这些图像在运行时由一个单独的拥有140亿参数的世界模型gψg_\psigψ生成,该模型接收当前观测oto_tot和指令,生成目标的视觉表示:
gt=gψ(ot,ℓ^t,m) g_t = g_\psi(o_t, \hat{\ell}_t, m)gt=gψ(ot,ℓ^t,m)
这种“目标条件化”(GC)使得模型即使在语言指令模糊不清时也能理解任务的物理要求。在训练过程中,采用了一种名为“提示丢弃”(prompt dropout)的技术,随机省略CtC_tCt的部分内容。这确保了π0.7\pi_{0.7}π0.7保持鲁棒性,即使人类教练或世界模型只提供部分信息也能正常工作。
从次优和多样化数据中学习
机器人学习面临的一个主要障碍是高质量演示数据的稀缺。大多数模型都是在“专家”数据上训练的,这使得它们在遇到错误或异常状态时变得脆弱。π0.7\pi_{0.7}π0.7通过有意地整合次优和异构数据来解决这个问题,包括失败的剧集、来自先前模型的自主运行以及以自我为中心的人类视频。
为了防止这些质量较低的数据混淆模型,研究人员使用了剧集元数据mmm。每个训练剧集都标记有“整体质量”(1到5分)、“整体速度”和“错误”等属性。在训练过程中,模型学习这些标签与由此产生的动作之间的相关性。在推理时,模型会收到“质量:5”和“错误:false”的提示,有效地“引导”它以专家的精确度执行任务,即使它已经见证了许多失败。
这种元数据策略还允许无分类器引导(CFG)。通过对比模型在提示“高速”与“低速”时的输出,研究人员可以在动作生成过程中放大期望的行为,从而实现更高效、更果断的机器人运动。
涌现的灵巧性和指令遵循能力
研究人员在各种机器人系统上评估了π0.7\pi_{0.7}π0.7,包括双臂移动机械手和静态六自由度机械臂。最引人注目的发现之一是,π0.7\pi_{0.7}π0.7匹配或超越了“专家”模型的性能——这些模型是专门为洗衣折叠或浓缩咖啡制作等单一任务进行微调的。
在涉及多种语言遵循能力的测试中,π0.7\pi_{0.7}π0.7显著优于其前身π0.5\pi_{0.5}π0.5和π0.6\pi_{0.6}π0.6。它展示了遵循“复杂指代指令”的能力,例如“拿起最大盘子里的水果”。这种能力得益于世界模型;当π0.7\pi_{0.7}π0.7被赋予一个生成的子目标图像(被称为π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7(GC))时,它在这些复杂任务上的成功率显著提高。
此外,该模型还展示了它能够克服强大的数据集偏差。例如,在“反向冰箱到微波炉”任务(将物品从冰箱放入微波炉)中,这与常见的训练模式相悖,π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7(GC)成功了,而标准 VLA 模型则失败了。子目标图像提供了必要的视觉“锚点”,以覆盖模型执行更常见反向动作的统计趋势。
零样本跨载体迁移
真正的基础模型的一个标志是能够将技能迁移到不同的物理形式上。π0.7\pi_{0.7}π0.7实现了复杂双手任务的零样本迁移。例如,它可以在双手 UR5e 机器人系统上折叠毛巾和衬衫,尽管它从未针对该特定硬件进行过洗衣数据的训练。
该模型不仅仅模仿了其他机器人的动作;它还根据新的载体进行了调整。在 UR5e 上折叠时,π0.7\pi_{0.7}π0.7自然地采用了更适合 UR5e 运动学的垂直抓取方式,而不是在其他机器人的源数据中观察到的倾斜抓取方式。在这些设置中,π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7(GC)的表现被发现与首次操作 UR5e 的经验丰富的人类远程操作员相当。
组合泛化和人类指导
π0.7\pi_{0.7}π0.7的灵活性允许“通过提示教学”的工作流程。对于模型从未见过的长程任务——例如“烤面包圈”或“装载空气炸锅”——人类可以充当教练,提供分步的子任务指令。
由于模型理解这些语义子步骤,它能够执行任务每个阶段所需的物理动作。有趣的是,研究人员发现,在模型通过某个任务进行几次指导后,生成的数据可以用于训练一个高级语言策略。然后,该策略会自动提供子任务指令ℓ^t\hat{\ell}_tℓ^t,从而使π0.7\pi_{0.7}π0.7能够完全自主地执行曾经未见过的长程任务。
结论
π0.7\pi_{0.7}π0.7的开发标志着机器人学界处理通用智能方式的转变。通过专注于利用多模态上下文和多样化(甚至是次优的)数据的可控架构,研究人员创建了一个在任务和载体之间以高成功率泛化的模型。
虽然零样本任务的成功率(60-80%)目前低于训练分布内的任务(>90%),但模型通过语言和视觉目标进行指导的能力为改进提供了明确的途径。用户无需收集数千个新的机器人演示,而是可以通过简单的提示和高级指导来潜在地完善机器人行为。这种向更具交互性和灵活性的基础模型迈进,使该领域更接近能够适应人类环境不可预测性的机器人。