目录
- 研究前沿
- 机器人必须在仿真中试错,才能学会技能
- 1.现代仿真优先机器人训练技术发展脉络
- 2.整套解决方案分为两大模块
- 第一部分:Niantic Spatial 的 real2sim 技术——单次实景扫描即可生成适配机器人训练的虚拟场景
- 1.仅需单次场地步行采集,即可完成数据录入
- 2.基于同一套重建数据生成物理几何层
- 3.导出适配 NVIDIA Isaac Sim 的 USDZ 文件
- 4.重建场景的能力边界与局限
- 第二部分:Flexion 的 sim2real 技术方案——从仿真像素到可落地实体机器人
- 1.数字孪生环境内大规模并行机器人训练
- 2.实体机器人实测:重建场景训练的RGB策略实现零样本迁移
- 3.仿真环境多方案对照实验
- 4.RGB视觉可处理立体深度传感器典型失效场景
- 技术闭环与未来研发方向
- 商业落地层面深远价值
研究前沿
想要教人形机器人掌握移动、导航等基础能力,强化学习(RL) 是具备最高可扩展性的方案。但在真实物理世界运行RL训练困难重重:机器人几乎没有试错机会。判断空间失误、撞上玻璃门这类事故不仅成本高昂,重置流程耗时漫长,还可能直接损坏硬件。因此绝大多数机器人学习过程都在仿真环境中完成。
每家企业都需要思考一个核心问题:在机器人实体进驻现场前,如何提前验证在仿真中训练得到的控制策略,能在部署场地稳定生效?答案是:在该场地高精度数字孪生环境中完成训练、测试与评估;同时这套方案也能快速为全新场景适配机器人技能。
【Niantic Spatial 与 Flexion 联合推出一套完整流程】:工作人员使用普通RGB相机扫描目标部署场地,由Niantic Spatial 重建高保真数字孪生场景。开发者依托NVIDIA Isaac Sim与Isaac Lab开源仿真、学习框架完成机器人仿真训练。Flexion 输出适配指定硬件的控制策略与部署软件,实现zero-shot 从仿真迁移至真实世界。
仅依靠RGB图像的本地导航控制策略,全程基于Gaussian splatting生成的照片级真实渲染图像完成仿真训练,可零样本部署至真实办公场景。实验结果证明,该渲染方案的速度与画质足以支撑数小时内完成基于RL的控制策略训练;同时这套方案具备拓展潜力,未来可用于训练包含逻辑推理、机械操作在内的完整垂直机器人系统。
机器人必须在仿真中试错,才能学会技能
仿真环境是机器人可以无成本试错的空间。强化学习的核心逻辑是,通过反复试错迭代优化控制策略:执行动作、获取奖励反馈、经过数百万次迭代调整参数,绝大多数尝试都会出现失误,直到行为模式稳定可靠。实体机器人根本无法承受如此高频的损坏,但仿真环境能提供高速、安全、可大规模并行的训练环境——数千台虚拟机器人可同时训练,运行速度远超真实世界,且不会产生任何硬件损耗。但仿真训练只有实现行为可迁移至实体设备,才具备实际价值,这也是机器人领域Sim2Real 的核心难题。
1.现代仿真优先机器人训练技术发展脉络
机器人强化学习高度依赖GPU加速仿真,物理引擎与训练流程可在数千个并行环境中扩展运行。NVIDIA Isaac Sim、Isaac Lab 等平台为此类大规模机器人训练提供核心底层基础设施。
在仿真环境内,随着传感器输入信息愈发丰富,机器人控制策略性能持续迭代:早期强化学习系统主要依靠本体感知(Proprioception),通过关节反馈、接触力数据完成地形通行;下一阶段引入外部感知(Exteroceptive Sensing):高度扫描图、深度图、激光雷达(LiDAR),让控制策略可在接触地形前预判路况。这一变革实现了不规则地形稳定行走、高速灵活机动、仿真环境端到端导航等能力。
一套典型、大规模并行的人形机器人原始深度信息导航训练环境:导航目标位置以红色箭头可视化展示。该仿真场景仅由随机无纹理基础几何体搭建。
RGB视觉是下一阶段技术路线,而人形机器人本身已标配相机设备。相机成本低廉、普及度高、视场角更广,同时可同步还原空间几何与场景语义信息,相比立体深度传感器故障更少。这些额外信息为算法性能提升预留充足优化空间。
现阶段训练环境仍普遍采用随机无纹理几何场景搭建,这是行业通用方案——因为深度图像仿真精度更容易把控。但该方案存在局限:机器人仅能识别物体轮廓,无法分辨材质、语义、物体类别。
这正是RGB视觉成为新一代机器人感知控制策略核心的原因:只要仿真图像足够真实,RGB方案就能同时为人形机器人导航系统提供空间几何与场景语义双重信息。
2.整套解决方案分为两大模块
- real2sim:将真实世界完整复刻至仿真器,同步还原视觉外观与物理运动特性。Niantic Spatial 的核心优势是将实景拍摄数据转化为可渲染、可物理仿真的高精度复刻场景。
- sim2real:让在存在一定误差的仿真环境中训练完成的控制策略,在实体机器人上稳定运行。弥合这一鸿沟是 Flexion 的核心技术方向。
视觉还原是 real2sim 与 sim2real 两大环节中最难攻克的部分。历史上深度图像仿真难度更低:无论渲染生成还是传感器实测,深度图像视觉效果大体接近,噪声也可直接建模。而RGB图像要求严苛:色彩、光照、纹理微小偏差,都可能让仿真场景与真实环境视觉割裂,大幅提升高保真仿真、控制策略跨域迁移的难度。既然RGB仿真难度更高,为何还要基于重建场景训练RGB视觉控制策略?
第一,相机是人形机器人主流标配传感器。摄像头造价低、通用性强,视场角通常优于立体深度传感器;RGB图像可同时编码几何与语义信息。相比仅依靠深度信息的算法,RGB视觉控制策略拥有更大性能优化空间,尤其在语义信息与空间轮廓同等重要的真实场景中。
第二,场景专属化训练可解锁更强能力。在部署场地专属数字孪生内训练控制策略,算法可适配该环境独有的视觉特征、材质、空间约束,实现通用控制策略难以达成的动作效果。
但想要实现 sim2real 成功迁移,仿真训练图像必须高度还原真实环境。落地路径分为两种:使用照片级真实感人工素材,或是直接高精度重建实景。实景重建是RGB视觉控制策略训练的最优载体。这也把整套技术拆解为两大核心问题:搭建足够逼真、可供训练的虚拟场景;训练具备强鲁棒性、可跨仿真/真实环境迁移的控制策略。
第一部分:Niantic Spatial 的 real2sim 技术——单次实景扫描即可生成适配机器人训练的虚拟场景
控制策略的训练效果,完全取决于训练环境提供的观测数据质量。想要实现 sim2real 稳定迁移,重建场景必须同时满足两大保真要求:视觉上与实景完全一致(几何结构、材质、光照),物理交互行为贴合真实世界。
想要同时满足两点,通常需要照片级真实渲染层,搭配物理碰撞网格;重建质量取决于两层数据匹配度。若渲染墙面与物理碰撞墙面存在数厘米偏差,视觉训练得到的算法会出现两类致命问题:无视障碍物直接穿过,或是避让不存在的虚拟障碍;该误差会直接传导至实体机器人运行阶段。
Niantic Spatial 整套流程从同一套重建数据生成视觉层与物理碰撞层,从底层保证二者完全对齐。
1.仅需单次场地步行采集,即可完成数据录入
操作人员手持普通360°全景相机,在场地内步行拍摄数分钟视频,无需激光雷达、三脚架,也无需专业采集流程,即可生成可直接用于训练的场地数字孪生。整套流程会根据视频数据重建具备标准公制尺度的场景,机器人可基于米级单位学习距离、运动速度,避免尺度误差传导至全部动作指令。
同一套采集数据将直接作为仿真视觉素材:Niantic Spatial 算法估算相机位姿,训练3D Gaussian splat模型,可从任意视角输出照片级真实RGB画面,完整还原拍摄时的光照、材质、环境杂物。这对RGB机器人训练至关重要:相比通用人工合成素材,实景重建画面提供 sim2real 迁移必需的视觉真实度。同时该方案具备极强落地扩展性——新建仓库、办公场地采集流程标准化,远优于为每个场地手动搭建高精度人工模型。
2.基于同一套重建数据生成物理几何层
Niantic Spatial 从重建数据中直接生成物理碰撞网格,无需独立建模流程;配套MVSAnywhere 零样本多视图立体匹配模型估算深度信息。该方案生成的平面、曲面更平滑整洁,针对白墙等弱纹理区域优势显著:传统多视图算法极易出现空洞、噪点几何,甚至丢失相机位姿,本方案可有效规避。
视觉渲染层与物理碰撞网格同源生成,天然完全对齐,无需额外跨模块配准步骤,从根源消除 sim2real 一大核心误差来源。渲染墙面与碰撞墙面微小错位,都会导致人形机器人训练出穿墙、避让虚拟障碍物等错误行为;同源重建设计从底层规避该故障,而非训练后再修正误差。
3.导出适配 NVIDIA Isaac Sim 的 USDZ 文件
高斯泼溅视觉数据与物理网格打包为单一 USDZ 文件,完全兼容 NVIDIA NuRec 体积规范,可直接载入 NVIDIA Isaac Sim、Isaac Lab。运行流程中,高斯泼溅通过RTX管线渲染生成视觉场景,网格作为不可见物理代理,供机器人站立、碰撞检测使用。导出文件已完成重力对齐、公制尺度标定、碰撞体预设,无需人工转换、重新定向、手动配置碰撞体,开箱即可启动训练。
端到端完整流程:360°实景采集 → 机器人仿真训练专用数字孪生
1.采集:操作人员手持商用360°全景相机,完整步行遍历目标部署场地,采集重建所需视觉数据。
2.重建:流程自动估算相机位姿,训练照片级真实3D高斯泼溅模型,同步生成对齐的物理碰撞网格,构建场地高精度数字孪生。
3.导出:视觉泼溅数据与物理网格整合为单份 NuRec 体积 USDZ 文件,已完成重力对齐、公制尺度标定、碰撞参数预设,直接适配仿真平台。
4.训练:USDZ 文件载入 NVIDIA Isaac Sim、Isaac Lab,作为场景基底开展大规模机器人仿真训练。
4.重建场景的能力边界与局限
所有实景重建方案都存在固有局限,训练前需充分认知:
1.重建仅捕捉拍摄瞬间状态,光照、反射、物体摆放位置均固化为拍摄时的状态;
2.输出静态场景,人员、机器人、其他动态交互物体需在仿真软件内额外添加;
3.重建精度取决于拍摄覆盖完整度,步行采集遗漏的区域重建效果会大幅下降。
但实际实验证明,上述局限并未阻碍控制策略零样本迁移至实体机器人。
第二部分:Flexion 的 sim2real 技术方案——从仿真像素到可落地实体机器人
搭建完成高精度虚拟场景后,即可开展各类机器人任务训练。本文中 Flexion 聚焦本地导航任务:短距离运动能力,机器人从当前位置移动至附近目标点位,同时规避障碍物,无需预构建全局地图。
控制策略输入数据:机器人机载相机画面、本体传感器数据、以机器人自身坐标系表达的目标点位;输出速度控制指令。配套独立预训练行走控制策略,将速度指令转化为机器人实际动作。
算法直接基于相机视觉画面做决策,因此仿真视觉真实度至关重要。当前绝大多数基于相机的机器人控制策略仍以深度图像为主输入,而 Flexion 采用差异化路线:在部署场地专属重建场景内训练RGB视觉策略,让算法适配真实运行环境特征。
1.数字孪生环境内大规模并行机器人训练
重建场景以NuRec 体积格式载入 Isaac Lab,高斯泼溅渲染RGB图像效率极高,单张GPU即可支撑同一虚拟场景内大规模并行机器人训练。每台虚拟机器人随机生成初始点位,分配随机目标点位。导航控制策略基于RL迭代优化:抵达目标获得正向奖励,碰撞、摔倒施加惩罚。
为弥合 sim2real 鸿沟,Flexion 采用两套配套技术:
1.在仿真参数域内执行域随机化(domain randomization);
2.采用大规模离线预训练图像编码器,在真实图像上输出高鲁棒特征。
编码器同时适配海量并行仿真训练环境与实体机器人机载部署。整套方案可在场地专属数字孪生内完成数百万次轨迹生成(rollout),让控制策略积累充足经验,学习适配部署场地的专属导航行为。
2.实体机器人实测:重建场景训练的RGB策略实现零样本迁移
控制策略并非仅适用于仿真环境。全程在重建场景内训练的RGB网络,可直接部署至实体机器人,完成真实办公室环境导航;即便现场家具摆放调整、与拍摄重建场景存在差异,算法仍可稳定运行。标准测试场景内导航性能与深度图像基线算法持平,证明仅依靠RGB图像、纯仿真训练的控制策略,足以提取空间感知信息完成可靠导航
实拍演示:纯仿真训练RGB视觉控制策略,在真实办公环境内依次前往三条指定目标点位。
3.仿真环境多方案对照实验
在两套重建场景(Flexion 办公区、Niantic Spatial 办公区)内,对四种本地导航策略开展仿真对照测试。变量分为传感器模态、训练环境两类:
基线方案:无纹理人工网格训练、深度图像输入控制策略;
方案二:同一无纹理人工网格、RGB图像输入控制策略;
方案三:人工制作带纹理办公室模型、RGB图像输入控制策略;
方案四:场地实景3D高斯泼溅重建场景、RGB图像输入控制策略。
实验统计三类仿真指标:任务成功率、120秒超时失败率、机器人摔倒率。每种策略重复1024次轨迹生成(rollout),所有方案共用同一套机器人初始点位、目标点位,仅改变训练环境与传感器输入,精准隔离两类变量带来的性能差异。
两套仿真场景实验结果统一显示:仅方案四(3D高斯泼溅重建场景训练RGB策略)性能持平或超越传统深度基线算法:难度更低的Flexion办公区:RGB重建方案成功率97.8%,深度基线93.8%;难度更高的Niantic Spatial办公区:RGB重建方案成功率75.0%,深度基线70.9%。其余两类RGB训练方案(人工纹理办公室、无纹理网格)性能均低于深度基线,场景难度越高,性能差距越明显。仿真实验证明,实景重建场景是RGB视觉策略达到深度算法同等可靠性的核心前提,否则性能会大幅落后。
4.RGB视觉可处理立体深度传感器典型失效场景
实验中深度数据来自ZED X相机神经网络模式。该传感器性能优秀,但仍存在大量立体深度算法难以处理、或是深度转换丢失关键信息的场景。以下三类典型难点场景实测对比:
- 语义特征主导、几何特征微弱的危险障碍物
蓝色防滑地垫在RGB画面中清晰可辨,但深度图像几乎无法识别;但其凸起边缘极易导致无感知行走机器人绊倒。
- 语义特征主导、几何特征微弱的危险障碍物
三脚架、栏杆、线缆对深度算法极不友好,极易完全漏检,或是边缘模糊。虽可优化缓解,但需要大量场景定制开发、精准深度噪声建模。
- 语义特征主导、几何特征微弱的危险障碍物
玻璃门、玻璃窗是深度传感器长期以来的典型短板。
上述三类场景(蓝色地垫、三脚架、玻璃隔断)在场地重建采集阶段均未出现,算法训练阶段从未见过对应物体布局。为何重建场景训练的RGB策略仍能在真实环境稳定处理这类障碍物?仿真训练过程中,机器人会反复与同类语义物体发生碰撞,算法自主建立交互失败与物体特征的关联逻辑。例如训练场景包含玻璃窗,机器人多次撞击透明表面获得惩罚,自主学习将带边框透明平面判定为障碍物,并将该逻辑泛化至从未见过的玻璃隔断。
该泛化机制同时存在性能上限:RGB视觉并非万能,算法仅能对训练阶段见过的同类语义物体稳定泛化;若物体视觉特征与训练素材差异过大,导航性能会明显下滑。因此RGB视觉策略长期优化路线为:先开展大规模通用感知预训练,再在场地重建场景内微调,兼顾通用泛化能力与场地专属适配性,进一步强化sim2real迁移效果。
技术闭环与未来研发方向
仅有高精度重建场景、无成熟策略部署方案,只能实现演示效果;仅有高性能sim2real算法、无高保真虚拟训练场景,可学习信息严重受限。real2sim与sim2real两大技术结合,完成「实景→虚拟训练场→实体可用控制策略」完整闭环。后续研发路线规划:
1.规模化数据采集:拓展iPhone、鱼眼相机等通用硬件采集渠道,搭建更大规模真实环境数据集,为下一代机器人控制策略提供丰富训练素材。
2.场景语义理解:为重建场景内物体、平面绑定开放词汇标签,让数字孪生支持语义查询,而非仅提供视觉渲染。
3.场景可控变换生成:对采集场景做可控变体生成——视觉维度:光照、昼夜变化;场景状态维度:门开关、家具移位,让控制策略在更多工况下完成训练,提升交互鲁棒性。
4.仿真端完整任务评估:将评估范围从本地导航拓展至重建场景内全流程任务性能。Flexion 推出的 Reflect v1.0 是该方向落地实例,整合导航、交互、规划、故障恢复模块,构建长时序自主机器人系统。
5.VLM与智能体训练:跳出导航任务范畴,基于同一重建场景训练具备语言条件控制的复杂行为智能体。
商业落地层面深远价值
过往机器人控制策略部署至全新场地,通常需要数月现场调试适配。real2sim + sim2real 整套流程将周期压缩至数天,兼顾开发速度与实体环境运行鲁棒性。对于需要在多厂房、多场地规模化部署自主机器人的运营方,这套标准化流程提供可复制、稳定落地的技术路径。