news 2026/8/31 16:13:25

STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics–Physics Dual System

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics–Physics Dual System

原文链接:https://arxiv.org/pdf/2605.16137
项目链接:https://lan555.github.io/stable/【无code】
发表:ICML 2026

一、研究动机

1. 领域背景

在具身AI领域,合成数据因成本低、易扩展的优势,已成为机器人操作模型训练与评估的核心数据来源。其中,生成与任务指令对齐的多样化桌面场景,可以为机器人仿真提供丰富的环境,是当前备受关注的研究方向。该任务的核心挑战在于:既要准确理解高层任务指令的语义,又要保证生成场景的物理合理性,使其可以直接用于物理仿真(即 simulation-ready)。

2. 现有方法的核心缺陷

现有任务到场景的生成方法存在两类难以解决的问题:

  1. LLM主导的生成方法存在空间推理短板
    无论是零样本LLM、多轮提示策略还是数据集微调的LLM,都只能将高层语义转化为结构化布局,但无法精准建模连续3D几何关系,生成的场景普遍存在物体穿透碰撞、悬空漂浮等非物理现象,无法直接用于仿真。本质原因是LLM存在幻觉问题,且3D空间推理能力存在固有局限。

  2. 事后物理优化存在语义漂移与鲁棒性问题
    现有事后优化方法虽能一定程度改善物理合理性,但存在明显缺陷:

  • 计算开销大,且当初始布局碰撞严重时,往往无法找到可行解;
  • 优化会强行移动物体以消除碰撞,破坏原始布局的语义关系,导致场景偏离任务指令(例如指令要求“苹果放在香蕉左边”,优化后可能被移到右边);
  • 容易产生杂乱、不符合真实分布的布局。
  1. 方法间的固有权衡
    LLM类方法语义对齐性好但物理合理性差;事后优化类方法能消除碰撞但会损失语义对齐。现有方法始终无法同时兼顾“严格符合任务指令”和“物理仿真就绪”两个目标。

基于此,论文受认知科学“双系统”思路启发,提出STABLE语义-物理双系统框架,将语义布局生成与物理位姿校正解耦,在保证语义对齐的前提下实现物理可信的场景生成。

二、方法概述

STABLE是一个渐进式语义-物理双系统的桌面布局生成框架,核心设计是交替执行“语义扩展”与“物理校正”两个步骤,从任务核心物体到背景物体逐步构建完整场景。

  • 语义推理器(Semantic Reasoner):基于微调的大语言模型,负责理解任务指令,分阶段生成粗略的结构化场景布局,保证场景与任务语义对齐;
  • 物理校正器(Physics Corrector):基于几何感知的流匹配去噪模型,接收粗略布局后,仅通过调整物体的位置与旋转来消除碰撞、漂浮等物理问题,不改变物体的身份、尺寸和语义关系。

通过三轮“语义推理器添加物体 → 物理校正器修正位姿”的循环,STABLE可以逐步生成任务对齐、物理合理、可直接用于仿真的桌面场景。

三、方法详细说明

1. 整体框架与训练流程(对应图(a))

STABLE采用模块化解耦设计,两个模块基于同一套分级场景数据分别独立训练,整体训练流程如图(a)所示。

(1)共享输入数据:三级渐进式场景标注

训练数据基于MesaTask-10K数据集,将每个桌面场景的物体拆分为三级,形成序列化的子布局:

  • 任务导向物体(( O t (O^t(Ot)):指令中明确指定、完成任务必需的核心物体;
  • 重要背景物体(( O B (O^B(OB)):与任务物体有直接物理接触或距离极近的关联物体;
  • 次要背景物体(( O b (O^b(Ob)):剩余的环境点缀物体。

每一级都对应“任务prompt + 已有物体集合”的输入形式,用于训练模型的渐进生成能力。

(2)语义推理器训练(左侧)
  • 模型基底:基于Qwen3-8B大语言模型进行有监督微调(SFT);
  • 输入:分级的prompt与物体上下文(任务级:仅prompt;重要背景级:prompt+(Ot);次要背景级:prompt+(Ot+O^B));
  • 输出:结构化JSON格式的布局,包含每个物体的类别、包围盒尺寸、3D位置、偏航角、文本描述;
  • 设计要点:移除长推理链,让模型直接输出结构化布局,大幅减少token长度与生成延迟;三级序列化训练让模型学会“先核心后背景”的渐进式构图逻辑,强化任务指令的语义锚定效果。
(3)物理校正器训练(右侧)

物理校正器是一个以几何特征为条件的流匹配去噪模型,训练目标是学习从“有物理缺陷的粗略位姿”到“物理合理位姿”的修正过程。

  • 几何条件编码

    1. 根据语义布局的物体描述,从3D资产库检索对应网格模型;
    2. 对每个物体的网格采样表面点云;
    3. 通过冻结的PVT-3(PointVoxel Transformer v3)编码器提取几何嵌入,作为校正模型的条件输入。
      这种几何感知设计让模型可以处理堆叠、容纳等复杂空间关系,而不仅依赖粗糙的包围盒信息。
  • 流匹配生成目标
    将所有物体的3D位置+偏航角拼接为位姿向量,在粗略位姿上加高斯噪声作为起点,以真实合理位姿为终点,用线性插值构造中间状态,训练U-Net结构的速度场网络预测位姿修正的速度。这种设计让模型学习到“围绕粗略布局做局部修正”的行为,不会大幅改动语义布局。

  • 物理约束损失
    为了严格保证仿真就绪性,训练中加入了三类网格级有向距离场(SDF)损失:

    • 物体-物体SDF损失:惩罚任意两个物体之间的网格穿透;
    • 物体-桌面SDF损失:惩罚物体穿入桌面的现象;
    • 支撑接触损失:检测每个物体的支撑面(桌面或其他物体),约束物体底部与支撑面的距离在容差内,消除漂浮现象,同时保证堆叠结构的稳定性。
2. 渐进式推理流程(对应图(b))

推理时采用三轮交替循环的渐进式生成范式,时间线与模块对应关系如图(b)所示:

  • Loop 1((t 0 t_0t0→ \tot 1 t_1t1)):任务核心物体生成
    语义推理器接收任务指令与桌面规格,先生成任务核心物体集合(O t O^tOt)的粗略布局;检索对应3D资产后,送入物理校正器修正碰撞与漂浮,得到第一版物理合理的子布局。

  • Loop 2((t 3 t_3t3$\tot 4 t_4t4)):重要背景物体补充
    以上一轮校正后的布局为上下文,语义推理器补充重要背景物体(O B O^BOB);再次检索资产后,物理校正器对新增后的全部物体重新做位姿修正,消除新增物体带来的碰撞。

  • Loop 3((t 5 t_5t5$\tot 6 t_6t6)):次要背景物体补充
    继续补充次要背景物体(O b O^bOb),最终经过物理校正后,输出完整的、可直接用于仿真的桌面场景布局。

这种“每加一层物体就做一次物理校正”的设计,既避免了误差累积导致的严重碰撞,又天然支持增量式的场景编辑与调整。同时由于两个模块解耦,推理时可以采用批处理流水线调度:一个场景做物理校正时,其他场景可以并行做语义扩展,提升整体生成吞吐量。

3. 核心设计优势
  • 语义不漂移:物理校正器只调整位置和旋转,不改变物体身份、数量和相对语义关系,保证严格对齐任务指令;
  • 物理高可信:网格级SDF约束+流匹配连续优化,相比传统迭代优化鲁棒性更强,即使初始碰撞严重也能生成无碰撞、无漂浮的布局;
  • 生成渐进式:从核心到背景的分级生成,既强化了任务关键物体的优先级,又能生成丰富自然的杂乱桌面场景。
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 16:13:08

Hermes桌面端全自动安装失败排查:从环境预检到模型联调完整指南

“全自动安装”这四个字,看起来是最省心的,实际上往往是事故高发的开始。尤其是在 Hermes 这类桌面端智能体工具上,一条 install.sh 或 setup.bat 跑完,你以为万事大吉,结果启动时不是缺依赖,就是连不上…

作者头像 李华
网站建设 2026/8/31 16:07:00

从Scrum迭代到测试闭环 —— 一个测试新人的完整执行笔记

前言:关于Scrum迭代开发模型 我们用的开发模式我们团队用的是Scrum敏捷迭代开发模型。简单说就是: 每轮版本固定周期(我们一般是2周),规划好本次迭代要做的需求需求拆成用户故事,排进迭代 backlog待办池开发…

作者头像 李华
网站建设 2026/8/31 16:04:58

LangGraph实战:从Chain到Graph构建AI-Agent

如果你是从传统 LLM 应用开发转过来的,最近一定有一个很强烈的感受:LangChain 的教程变了,代码写法也变了,过去把几个 Prompt、一个模型、一个 Python 函数串起来的 Chain 方式,正在被一种叫 LangGraph 的图结构替代。…

作者头像 李华
网站建设 2026/8/31 16:04:30

视频生成模型服务化:MiniMax H3与H3 Max的本地部署和API选择指南

过去半年,做视频生成的人普遍有一种感觉:模型越来越强,但把模型真正用到自己的项目里,越来越难。生成一段 5 秒的视频,本地要准备高显存显卡、要折腾 ComfyUI 工作流、还要接受漫长的推理等待;如果走线上服…

作者头像 李华
网站建设 2026/8/31 16:03:24

C语言网络编程必知:winsock2.h头文件与ws2_32.lib链接完全指南

简介:本资源为Windows平台网络编程核心头文件 WINSOCK2.H 的标准C语言头文件,面向C/C初学者、嵌入式开发人员及Windows系统级程序员,用于支持TCP/IP socket编程、网络通信初始化与底层套接字操作。资源包仅含1个.h头文件,体积精简…

作者头像 李华
网站建设 2026/8/31 16:03:24

米家智能肩颈仪NFC一碰连原理与NDEF标签解析

长时间伏案工作后,脖子和肩膀总有一种说不出的酸胀感,相信很多办公族都有同感。最近入手了一台米家智能肩颈仪,除了传统的多模式按摩和温感热敷之外,最吸引我的是它支持 NFC 一碰连功能:手机靠近设备,就能直…

作者头像 李华