世界人形机器人运动会上,最绝望的画面不是机器人走得太慢,不是动作完成度扣分,而是操作员双手正握着遥控设备,遥控指令已经发出去了,机器人还是当着所有人的面摔了。更绝望的是,摔下去之后,它没有能力靠自己站起来——遥操也没办法。
这个画面比任何参数表都说明问题。人形机器人这几年的进步肉眼可见,能跑、能跳、能翻跟头,实验室 Demo 一个比一个漂亮。但一旦进入赛制固定的运动会场景,连续多轮、现场计时、场地随机、观众围观、一次失误就出局,机器人真实的技术水位就藏不住了。你会发现,真正限制人形机器人落地的,根本不是“能不能做出某个动作”,而是“在没人帮忙、没有排练、环境不完全可控的情况下,能不能稳定地完成任务”。
这篇内容不聊具体的比分和奖项,而是从技术角度拆解这场“绝望”是怎么发生的。重点看四件事:遥操作系统的延迟和控制边界、双足平衡与摔倒恢复的难点、关节与功耗等硬件物理瓶颈、以及“比赛表现”和“Demo能力”之间的真实差距。如果你是做人形机器人、强化学习控制、遥操作或者具身智能相关工作的,这篇内容里有一些可以直接迁移的观察方法和测试思路。
1. 为什么一场运动会比一百次 Demo 更能说明技术上限
先说一个行业里心照不宣的事实:大多数机器人演示视频,是“拍一百次,把最好的三次剪成一条”。这不算造假,但在技术评估上是严重失真的。因为一段 30 秒的稳定行走视频,根本无法回答一个最关键的问题:这个机器人连续执行十次同样任务,成功率是多少?
运动会提供的就是这个答案。不管赛制怎么设置,核心考核其实是同一件事——人形机器人在非受控环境中的连续运动能力。它和实验室测试有四个本质区别:
第一,不可重来。比赛只有一次机会,摔了就淘汰。实验室里可以反复调参、重启、清场,比赛不行。
第二,环境干扰多。场地光照、地面硬度、地毯纹理、周围人员走动、裁判站位,这些因素都是模型训练时很难完整建模的分布外输入。
第三,连续负载。不是跑一步就休息,而是多个项目连环进行。关节电机、电池、散热系统长时间工作后,性能会下降。很多机器人前两轮表现正常,第三轮突然出现动作变形,这是典型的硬件热疲劳或者电池压降问题。
第四,操作员状态。遥操作机器人的表现不只看机器人本身,还看操作员的手感和状态。比赛压力之下,操作员的反应速度、操作精度都和实验室自由测试时完全不同。
所以,运动会本质上是一场“极限鲁棒性测试”。它暴露出来的问题,比一百个精心剪辑的 Demo 更有研究价值。对工程师来说,看到一台机器人在赛场上摔倒后挣扎着无法起身,比看它在平滑地砖上完美行走十分钟,更能判断这个系统的真实水平。
2. 遥操系统,也救不回来的失控瞬间
很多人会有个疑问:既然有人遥控,为什么机器人快要摔倒的时候,操作员不赶紧让它调整姿态?答案很简单:因为从“机器人开始失稳”到“机器人倒地”的时间尺度,比人的反应速度快得多。
要理解这件事,得先看一条完整的遥操作链路。一套典型的全身遥操作系统由三部分组成:
- 操作端:操作员穿戴动作捕捉设备或使用操作手柄,通过人体动作、摇杆、按键下发期望动作。
- 通信链路:将操作指令编码、压缩,通过网络传输到机器人端,同时把机器人的传感器数据、视频流回传到操作端。
- 机器人端:接收指令后,由机载控制器做运动规划、状态估计、平衡控制,最终驱动关节电机执行。
这个链路里每一级都有延迟。大概的量级是这样的:
| 延迟环节 | 典型量级 | 说明 |
|---|---|---|
| 动作捕捉/操作手柄采集 | 1-10 ms | 取决于设备类型,惯性动捕通常更高 |
| 数据编码压缩 | 1-5 ms | 低延迟场景使用轻量压缩或直传 |
| 上行网络传输 | 20-100 ms | 取决于网络环境,无线波动更大 |
| 机器人端解码与状态估计 | 5-20 ms | 包含滤波、状态估算 |
| 控制算法计算 | 1-10 ms | MPC 或强化学习策略推理 |
| 关节电机响应 | 20-50 ms | 机械时间常数,越大的关节越慢 |
| 传感器采集与下行传输 | 20-100 ms | 视频流回传通常是大头 |
| 操作员视觉认知与决策 | 100-300 ms | 人眼到大脑再到手指的闭环 |
| 操作员肌肉动作响应 | 50-200 ms | 按下按钮或移动摇杆 |
可以算一笔账:哪怕每一级都做到很低的延迟,整个闭环下来,人在回路的总延迟普遍在 200ms 以上。如果中间网络有抖动,冲到 500ms 以上也不奇怪。
那这 200ms 意味着什么?这意味着操作员看到的画面,是机器人 200ms 之前的状态。等到操作员意识到“它要倒了”,再发出修正指令,机器人接收到指令已经是 400ms 之后了。而双足机器人的失稳过程,从质心移出支撑多边形到完全倒地,往往只有几百毫秒。很多情况下,操作员的手还没来得及动,机器人已经摔完了。
这就是“遥操也没办法”的第一层原因:人的反应速度,跟不上双足机器人的失稳速度。
还有第二层原因。即使操作员反应足够快,遥操作也不适合做底层平衡控制。原因在于,人的操作指令是“期望动作”,而机器人的底层平衡是“基于状态反馈的实时闭环”。如果操作员直接介入关节层面的姿态控制,很容易和机载平衡算法打架。操作员以为自己在帮忙扶正,实际效果可能是在给平衡控制器增加扰动。
更隐蔽的问题在于力反馈缺失。遥操作时,操作员只能看到画面,感受不到机器人脚底的地面反力、关节的实际力矩、脚下地面是硬是软。人形机器人落地瞬间的缓冲、支撑脚的发力调整,很大程度上依赖触觉和力觉。没有这些反馈,操作员就只能“看着它摔”。
所以,正确的遥操设计思路是分层控制:操作员只负责高层决策,比如目标方向、步态频率、上半身动作;底层平衡、落地缓冲、扰动抑制全部交给机载控制器。一旦机器人在运动中失稳,遥操系统基本帮不上忙。这就是为什么我们看到赛场上操作员一脸无奈——不是不想救,是真的救不了。
3. 双足平衡:人形机器人最残酷的公开考试
如果运动会里只能选一个最能体现技术实力的项目,双足项目的含金量一定最高。因为它直接考核的是人形机器人控制系统的看家本领:动态平衡。
双足行走在控制论里是一个典型的高维、欠驱动、非线性问题。机器人只有两个脚掌接触地面,支撑多边形面积小,质心高,系统本身是不稳定的。想要稳定行走,控制器必须持续不断地调整全身每一个关节的力矩输出。
目前主流的双足平衡控制方案大致有三条技术路线:
第一种是基于模型预测控制(MPC)的方案。控制器基于机器人动力学模型,预测未来一段时间内的运动状态,在线求解最优控制量。这个方案的理论基础扎实,典型代表是 MIT 的 Cheetah 系列和波士顿动力的 Atlas。但它的问题是计算量较大,对模型精度要求高,真实机器人和模型之间的误差都会影响控制效果。
第二种是基于强化学习的方案。在仿真环境里训练神经网络策略,通过 Domain Randomization、课程学习等技巧,让策略在仿真中适应各种扰动,再通过 Sim-to-Real 迁移到真实机器人。宇树、小脑等国内团队的机器人在动态行走、跑步、跳跃上表现突出,很多都采用了这类方案。它的优势是策略灵活、适应性强,问题是对训练数据和仿真真实度要求极高。
第三种是混合方案。用强化学习生成参考轨迹或步态,用 MPC 或传统控制算法做底层跟踪和稳定控制,两者结合。这是目前很多团队实际采用的做法,兼顾了强化学习的表达能力和传统控制的可解释性。
但不管用哪种方案,平衡控制都绕不开同一个核心问题:当机器人受到意外扰动时,控制器能不能在极短的时间内做出正确的反应。
这里有一个经典的平衡恢复策略分级框架:
- 踝策略:当扰动较小时,机器人主要通过踝关节发力,让质心回到支撑多边形内。
- 髋策略:当扰动较大、踝策略不够用时,通过髋关节发力配合躯干摆动恢复平衡。
- 跨步策略:当扰动很大,质心已经移出支撑多边形,机器人必须主动跨出一步,重新建立支撑多边形。这也是人应对大扰动时的自然反应。
问题在于,这些策略在仿真里很容易实现,到了真实赛场上就完全不同。因为策略的有效性高度依赖状态估计和动力学模型的精度。赛场上的地面摩擦系数、地面硬度、地毯纹理,和训练环境不可能完全一致。强化学习策略是直接从训练分布里采样决策的,一旦遇到分布外输入,就可能输出一个完全错误的行为。
另一个残酷的现实是摔倒恢复。人形机器人摔倒后自己站起来,比行走本身难得多。因为摔倒后的构型不确定性极高,机器人可能侧躺、仰躺、俯卧,每种姿态都需要不同的起身策略。而且单腿、双手触地的接触状态非常复杂,控制器很难准确估计当前状态。很多机器人能跑能跳,但一旦摔倒,就只能等待人工救援。这也是“最绝望的输法”中让人最难受的部分:它不是输在某个高难度动作上,而是输在“跌倒了,自己起不来”。
4. “绝望输法”背后的物理瓶颈:关节、功耗与散热
除了算法层面的问题,人形机器人在运动会上的表现,还大量受制于硬件物理极限。很多时候,不是控制策略不想做,是硬件已经到极限了。
第一个瓶颈是关节电机的峰值扭矩与持续扭矩。人形机器人的关节通常采用“无框力矩电机+谐波减速器”的方案,部分高性能机型会再加入行星减速器或直线执行器。这类关节有一个关键参数:峰值扭矩只能维持几秒钟,之后会因为过热而降额到持续扭矩。在跑步、跳跃、急停这类高负载动作中,关节很可能在峰值扭矩区间工作,一旦连续多个动作没有间歇,电机会迅速升温,输出扭矩下降,动作就开始变形。
这就解释了为什么赛场上常看到“前两轮很猛,第三轮突然疲软”的现象。不是算法突然出了问题,是关节热了。
第二个瓶颈是电池放电能力。大功率运动时,机器人瞬时功率可能非常高,对电池的瞬间放电能力提出极高要求。如果电池的放电倍率不够,母线电压会在大电流抽取时明显跌落。电压一旦低于关节控制器的欠压保护阈值,控制器会直接关断功率输出。表现就是:机器人跑着跑着,“腿突然软了”。
第三个瓶颈是散热系统。人形机器人体积有限,无法带大型散热器。很多机型的关节电机是自然冷却,甚至靠外壳被动散热。连续比赛对散热系统的考验,往往比单次 Demo 大得多。
第四个瓶颈是机构强度与抗冲击能力。机器人摔倒瞬间对关节减速器、结构件、外壳的冲击力非常大,而且冲击载荷的主要承受点通常在膝关节、髋关节和肩关节。摔倒一次,即使外观看起来没事,内部减速器可能已经产生齿隙或损伤。这就导致一个很麻烦的问题:二次上场时,机器人的运动精度已经下降,动作表现和摔倒前判若两机。
这些物理瓶颈叠加在一起,形成了一个在实验室里很难复现的衰减曲线:
| 观察维度 | 实验室单次演示 | 运动会连续多轮 |
|---|---|---|
| 关节温度 | 正常,动作间有足够休息 | 持续升温,扭矩随温度下降 |
| 电池电压 | 满电,单轮测试 | 多轮消耗,电压跌落影响输出 |
| 机械状态 | 全新或维护良好 | 多次冲击后存在隐性损伤 |
| 控制策略 | 针对当前场地微调 | 无法完全适配未知场地 |
| 故障恢复 | 可停机重启、手动复位 | 现场无法快速修复 |
所以,“最绝望的输法”本质上不是输在某个动作,而是输在了工程系统的整体余量上。
5. 从赛场表现看人形机器人的真实技术水位
把赛场上观察到的现象和技术细节放在一起,可以得出几个比较冷静的判断。
人形机器人已经具备“展示级”运动能力,但还不具备“连续稳定执行”能力。你能看到机器人完成高难度动作,也能看到它有不错的运动表现,但如果你让它“连续十次都稳定走过同一段复杂路面”,成功率仍然不乐观。这不是某一家的问题,而是整个行业当下的普遍状态。
从“能跑能跳”到“能干活”,中间隔着的恰恰是摔倒率这一项指标。工业场景、商用场景对机器人的核心要求不是动作好看,而是可控、可靠、可预期。一个动作成功率 99% 的机器人,连续执行 1000 次,预计会失败 10 次。如果这 10 次中恰好有一次发生在人旁边,安全性就会成为事故。当前人形机器人最大的问题,恰恰是“长尾失败”太难消除:99% 的情况下很稳,但剩下 1% 的意外情况,往往就是致命的。
“演示能力”与“可商用能力”是两个物种。商业采购方如果只看 Demo 视频,很容易对人形机器人现状产生误判。比较靠谱的方法,是在类似运动会这种赛制下连续跑多轮,记录成功率、摔倒率、平均恢复时间、故障类型分布,用这些数据来做采购决策。这种做法值得所有做技术评估的人参考。
运动会的价值,更多在于暴露问题,而不是证明实力。哪家跑得快、跳得高,这些信息参考价值有限。真正有价值的信息是:哪家机器人在摔倒之后有自主起身能力?哪家机器人在第三轮比赛里动作仍然不变形?哪家团队能在场边快速诊断和修复故障?这些才是决定人形机器人能否走出实验室的关键能力。
6. 用工程化指标,重建对机器人的观察方式
如果你不是参赛者,而是一个正在做技术调研或者评估的工程师,与其看比赛直播的解说和比分,不如自己建立一套观察框架。推荐从这几个维度记录和评估:
| 观察指标 | 说明 | 为什么重要 |
|---|---|---|
| 连续任务成功率 | 10 次任务中成功完成几次 | 直接反映系统的可靠性 |
| 平均无故障运行时间 | 机器人两次故障之间能工作多久 | 反映硬件和软件的稳定性 |
| 摔倒后自主恢复率 | 摔倒后能否自己站起来 | 代表系统的闭环完备性 |
| 遥操干预率 | 机器人在执行任务中需要人工介入操作的次数 | 反映自主控制能力 |
| 关节温度漂移 | 连续运行后关节输出扭矩的变化 | 反映散热与热管理设计 |
| 电池电压跌落 | 高负载动作期间母线电压变化幅度 | 反映电源系统余量 |
| 故障分布 | 故障集中在算法、通信还是硬件 | 帮助定位研发优先级 |
这套框架不仅能用来评估赛场上的机器人,也可以直接迁移到自己的机器人开发测试中。很多实验室团队只顾着追求“跑得好看”,却很少系统性记录这些工程指标。从赛场的情况来看,谁把这些指标管理得好,谁在真实场景中的表现就会更稳。
7. 给机器人团队的测试建议:建立自己的“烂场地”清单
回到工程实践角度。哪怕你的项目不参加任何比赛,也建议在研发流程里引入类似运动会的压力测试思路。核心原则很简单:不要只在理想环境下自测,要主动制造“烂场地”。
一、建立环境干扰测试集。包括不同摩擦系数的地面(光滑地砖、粗糙地毯、草地、湿滑地面)、不同光照条件(强光逆光、暗光)、不同地形(斜坡、台阶、障碍物)。强化学习训练时做 Domain Randomization,测试时也要真的去各种环境里跑。
二、建立连续负载测试。让机器人以比赛强度连续运行 10 轮,每轮之间只保留非常短的休息时间。重点记录关节温度曲线、电池电压曲线、动作变形出现的时间点。这能帮你提前发现散热和电源余量问题。
三、建立遥操作链路压测。在无线网络不稳定、多人共享带宽的情况下,测试遥操作的延迟抖动和丢包表现。真实场景的通信链路永远比实验室理想,不要在实验台前自我感动。
四、建立摔倒恢复专项测试。主动让机器人在不同姿态下摔倒,然后记录它自主起身的成功率和平均耗时。如果这个数字很低,说明系统离自主作业还差得很远。
五、建立长尾失败记录库。每次测试中出现的失败,都要记录故障类型、触发条件、持续时间、恢复方式。积累一段时间后,你会发现真正影响可靠性的往往不是高频问题,而是层出不穷的长尾小问题。
这些做法不需要额外设备,只需要把测试流程改得更严格一些。但很多人形机器人团队恰恰缺少这一环,因为“追求好看”比“记录失败”更有成就感。而赛场上的现实已经证明了:真正拉开差距的,正是对失败的处理能力。
8. 安全与合规边界
讨论人形机器人运动会,必须明确几条安全与伦理边界。这些不是套话,而是实际研发和比赛组织中的硬性要求。
第一,所有公开测试和比赛,都必须在受控场地内进行。人形机器人质量大、关节扭矩高、运动速度快,一旦失控可能对操作员、观众和周边设备造成伤害。比赛场地必须设置隔离带、急停机制、安全围栏,操作员也必须经过培训并佩戴必要的防护装备。
第二,数据记录要真实可信。比赛过程中记录的性能数据、成功率、故障信息,是技术评估的重要依据。任何一方都不应该为追求传播效果而剪辑、篡改、选择性发布数据。真实性是这类赛事对产业产生价值的前提。
第三,传播内容要严谨。对公众传播机器人视频和比赛结果时,要避免“机器人已经全面超越人类”“人形机器人即将取代劳动力”这类夸大表述。当前人形机器人的实际水平,距离通用场景和连续可靠运行还有明显差距。夸大宣传不仅误导公众,也会干扰产业投资和技术路线判断。
第四,涉及真实场景应用时,必须评估法律法规和隐私边界。如果人形机器人未来进入家庭、办公、生产场景,涉及数据采集、人脸识别、行为记录等功能,必须明确授权范围和数据使用边界,避免在真实场景中引发隐私风险。
9. 接下来重点观察什么
世界人形机器人运动会这类赛事,未来还会有很多。它最值得关注的,不是简单的输赢和排名,而是一个核心指标:摔倒之后,机器人需要多久才能站起来。
这个数字,是人形机器人从“展示能力”走向“可靠能力”的最直接体现。当前大多数机器人在这个指标上的表现都很挣扎,而这恰恰是行业的真实水位。如果哪天你看到一场运动会里,大多数机器人摔倒后都能在几秒内自主起身并继续比赛,那才是比任何 Demo 都更有说服力的产业里程碑。
另外可以关注三个具体技术方向的进展:一是强化学习策略的 Sim-to-Real 泛化能力是否能在不同场地间稳定迁移;二是遥操作系统中力反馈和触觉传感能否缩小人与机器之间的感知鸿沟;三是关节散热和电池放电能力能否支撑更长的高强度连续运动。这三个方向,每一项都比“谁能跑得更快”更接近人形机器人的商用边界。
下次再看类似的比赛,建议你换个视角:别只盯计分板,看那些失败的瞬间。那里面的技术信息量,比满分动作多得多。