过去三年,生成式人工智能最耀眼的能力是“理解语言”。它可以写文章、回答问题、写代码、分析数据。随后,AI开始理解图片、声音和视频。但真正改变工业世界的下一步,很可能是理解三维世界。
9月28日,AMD宣布以约82亿美元全股票方式收购World Labs。这家AI公司由著名计算机视觉研究者李飞飞参与创立,主要研究空间智能和三维世界模型。交易完成后,李飞飞将加入AMD,担任执行副总裁兼首席科学家。这笔交易的意义,不只是AMD收购了一家AI公司。它意味着全球芯片产业正在追逐新的AI计算场景:Physical AI,也就是物理世界中的人工智能。
一、为什么“理解世界”比“理解文字”更难?
语言本身是抽象的。我们说:“把杯子放到桌子上。”人类很容易理解。但真正让机器人执行这句话,至少需要知道:什么是杯子?什么是桌子?杯子在哪里?桌子在哪里?手从哪里伸过去?杯子有多重?抓在哪里不会掉?桌子的边缘在哪里?整个任务其实涉及大量三维空间信息。
所以,从语言模型进入物理世界,实际上跨越了一道巨大的技术鸿沟:从符号理解走向空间理解。这就是所谓的空间智能。
二、为什么AMD现在开始重视它?
因为传统AI芯片市场已经高度集中。Nvidia在数据中心AI训练和推理领域拥有极强优势。AMD虽然正在通过Instinct系列加速器扩大市场,但如果只是继续在GPU层面竞争,就需要面对非常强的既有生态壁垒。
所以AMD需要寻找新的AI计算入口。World Labs的空间智能技术恰好提供了另一种方向。AI如果真正进入机器人、自动驾驶、工业仿真和设计领域,计算需求会发生巨大变化。过去模型主要处理、文字、图片、Token。未来模型还要处理三维场景、物理状态、运动轨迹、环境变化、模拟结果。这意味着新的算力需求。
三、机器人为什么需要“世界模型”?
机器人最大的问题一直不是“会不会走路”。而是能不能理解为什么这么走。例如一个人类机器人走进厨房。如果只是让它重复训练动作,那么换一个厨房环境之后,很可能需要重新训练。但人类不是这样。人看到新的厨房,可以迅速理解:炉子大概在哪里;水槽大概在哪里;杯子可以从哪里拿;哪些地方不能碰。人脑依靠的是一个内部世界模型。我们并不是逐帧计算环境。而是在脑中形成对物理世界的大致理解。如果AI也能够建立类似能力,那么机器人就可能从“动作机器”进入“通用执行者”。
四、这就是为什么物理AI可能比聊天机器人更难商业化
聊天机器人面对的是数字世界。数字世界里的错误可以通过:重新生成;重新计算;重新运行。物理世界不行。机器人拿杯子时抓错了,杯子可能摔碎。自动驾驶判断错误,可能造成事故。工业机器人执行错误,可能损坏设备。
所以Physical AI需要更高的可靠性。这意味着机器人不会因为一个Demo很惊艳,就马上进入大规模商业化。真正决定市场的,是长期稳定性。
五、中国机器人产业正在经历类似过程
路透社近期分析认为,中国在人形机器人硬件制造方面进展明显,Unitree、UBTECH等企业已经展示出较强的运动控制和机械能力,但真正的瓶颈仍然是能够理解真实世界并自主执行任务的具身AI软件。
这其实非常值得关注。因为机器人产业已经完成了一部分最困难的硬件工程。电机更小了,关节更轻了,电池更好了,传感器更便宜了。
但下一步真正的竞争是:机器人能不能理解环境?能不能学习?能不能泛化?能不能把一个视频里的动作转移到真实场景?如果这些问题解决,人形机器人可能迎来真正意义上的产业化。
六、Physical AI会重新定义芯片需求
AI芯片过去主要优化:矩阵乘法;Transformer;大规模并行计算。但机器人需要更多:低延迟;多模态融合;实时推理;传感器数据处理;3D空间计算。
因此未来AI芯片可能出现新的架构。机器人芯片不一定追求绝对最大算力。它更看重单位功耗性能;响应速度;本地推理;传感器融合。这意味着AMD收购World Labs的意义,也可能不仅是获得一家AI公司的技术。更重要的是提前布局下一代计算负载。
七、空间智能还有一个巨大的潜在市场:工业设计
很多人想到Physical AI,只想到机器人。其实三维智能的价值远不止机器人。它可以进入:汽车设计;建筑设计;工业仿真;游戏;电影制作;数字孪生;AR/VR;工程训练。
例如,一个汽车设计团队可以先构建虚拟工厂,然后让AI模拟:人员如何移动;机器人如何工作;零部件如何运输;设备可能出现什么问题。这样很多生产问题在真正建厂之前,就可以通过AI发现。因此世界模型可能成为工业软件的新基础设施。
八、为什么“世界模型”可能成为下一代大模型基础能力?
过去的大模型学习的是互联网世界。它们通过文本、图片和视频学习人类知识。但现实世界还有一个维度:物理规律。如果AI真正理解世界,它不仅要知道:“杯子是什么。”还要知道杯子掉下来会怎样。桌子倾斜以后杯子会怎样。机器人触碰杯子以后会怎样。这实际上涉及物理模拟。因此未来可能出现:语言模型+世界模型+物理模型。这一组合的能力可能远超今天的聊天机器人。
九、这也是为什么AI产业正在从“数字经济”进入“实体经济”
生成式AI第一阶段主要改变内容生产。第二阶段改变软件生产。第三阶段可能改变实体生产。当AI进入工厂、仓库、物流、汽车、机器人、建筑。AI的经济价值会真正扩大。因为它开始直接影响:劳动生产率;制造成本;设备利用率;库存效率。因此Physical AI很可能是未来AI最重要的增量市场之一。
十、AMD真正押注的不是一家初创公司,而是一种计算未来
AMD用82亿美元收购World Labs,本质上是在购买一种长期能力:让芯片理解未来AI会计算什么。如果AI计算仍然主要是文本和图像,那么GPU竞争仍然是核心。但如果AI开始理解三维世界、控制机器人、模拟工业系统,那么计算架构也会改变。
因此未来AI芯片的真正竞争,不只是谁能训练最大模型。更是谁最早知道下一代模型将计算什么。语言智能解决的是“知道”。空间智能解决的是“在哪里”。物理智能解决的是“怎么做”。而AI真正走进现实世界,需要三者结合。