news 2026/8/5 11:14:51

120毫秒的决策:面壁智能MiniCPM-Robot如何攻克机器人记忆短板

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
120毫秒的决策:面壁智能MiniCPM-Robot如何攻克机器人记忆短板

7月19日的上海世博展览馆,WAIC 2026的现场人声鼎沸。

在面壁智能的展台前,一只机器狗正在灵活地跟随一位参观者穿梭于人群之中。没有网络连接,没有遥控器,机器狗就像一条训练有素的导盲犬,紧紧跟随着主人的步伐。

围观的人群中有人小声议论:"这是怎么做到的?不用联网?"

面壁智能的工程师笑了笑,指着屏幕上的模型介绍:"这是我们刚刚开源的MiniCPM-Robot系列模型。"

[图片:article2_img1.jpg] WAIC 2026面壁智能展台机器狗演示

两个模型,一次突破

MiniCPM-Robot不是单个模型,而是一个系列。它包含两个核心成员:MiniCPM-RobotManip和MiniCPM-RobotTrack。

MiniCPM-RobotManip是一个通用的VLA模型,也就是视觉-语言-动作模型,参数量为1.5B。别看参数不大,它的任务是理解人类的语言指令,看懂周围的环境,然后输出机器人可以执行的动作。简单说,它就是机器人的"大脑",负责"想"。

MiniCPM-RobotTrack则是一个跟踪导航模型,参数量更小,只有0.9B。它的任务是让机器人能够跟随特定目标移动。如果说Manip是"大脑",那Track就是"小脑",负责"跟"。

[图片:article2_img2.jpg] MiniCPM-Robot两个模型架构对

两个模型各司其职,又相互配合。这种分工设计背后,是面壁智能对具身智能的深刻理解:机器人不需要一个无所不能的巨型模型,它需要的是在特定任务上足够快、足够准的专用模型。

攻克记忆短板:视觉Token的极致压缩

具身智能领域一直有个老大难问题:机器人的"记忆"太差。

传统的VLA模型在处理视觉信息时,会把每一帧图像转化成大量的视觉Token。这些Token占用了模型的上下文窗口,导致机器人很难记住之前发生了什么。就像一个人只能看到眼前这一秒的画面,之前的一切都忘了。

面壁智能的突破在于"视觉Token的极致压缩"技术。通过这项技术,机器人可以在不丢失关键信息的前提下,大幅减少视觉Token的占用。这意味着机器人终于有了"长期记忆",能够记住之前的操作步骤和环境变化。

[图片:article2_img3.jpg] 视觉Token压缩技术原理示意图

这项突破的意义怎么强调都不过分。在实际应用中,很多机器人任务都需要多步操作。比如组装一个零件,你需要先拿起A部件,再拿起B部件,然后把它们拼在一起。如果机器人记不住"我已经拿起了A部件",它就会反复做无用功。记忆问题的解决,让多步操作真正成为可能。

53.5对10.4:实力说话

数据是最诚实的裁判。

在业内权威的RMBench榜单上,MiniCPM-RobotManip拿到了53.5分。作为对比,Physical Intelligence的π0.5模型只得了10.4分。两者之间的差距,不是一点半点。

[图片:article2_img4.png] RMBench榜单MiniCPM-Rob

更关键的是速度。MiniCPM-RobotManip的单步决策仅需120毫秒,而π0.5需要234毫秒。在机器人控制领域,每缩短一毫秒都意味着更流畅的操作体验。120毫秒意味着什么?人类眨一次眼大约需要300毫秒,也就是说,机器人在你眨眼的时间里已经做了两次以上的决策。

这种速度优势在实际场景中至关重要。想象一个机器人在流水线上分拣零件,每秒钟需要做出好几次决策。如果每次决策都要等234毫秒,流水线就得放慢速度。但120毫秒的决策速度,足以跟上大多数工业流水线的节拍。

更值得关注的是,MiniCPM-RobotManip在保持高速度的同时并没有牺牲精度。在RMBench的多个子任务中,包括抓取、放置、推拉等基本操作,它的表现都远超同级别模型。这说明面壁智能在模型架构上做出了正确的取舍——不是简单地压缩参数换取速度,而是通过更高效的架构设计实现了速度和精度的双赢。

有业内专家分析,MiniCPM-RobotManip之所以能以1.5B的参数量碾压参数量数十倍的π0.5,关键在于训练策略的创新。面壁智能在数据质量和训练效率上做了大量优化,用更少但更精准的数据训练出了更强的模型。这颠覆了行业内"大力出奇迹"的固有认知。

纯无网部署:跟踪模型的新标杆

MiniCPM-RobotTrack的亮点在于另一个关键词:纯无网部署。

这是业内首个提供真实本地纯无网部署的跟踪模型。什么意思?大多数机器人跟踪模型都需要依赖云端计算,也就是说机器人得时刻联网。但在很多场景下,网络是不可靠的——地下车库、偏远工厂、野外作业,这些地方要么没有网络,要么信号极差。

MiniCPM-RobotTrack原生适配了宇树Go2 Edu机器狗,在无网或弱网环境下依然能够流畅跟随。文章开头那个在WAIC现场自如穿梭的机器狗,正是搭载了这款模型。

[图片:article2_img5.jpg] 宇树Go2 Edu机器狗无网环境跟随演示

想象一个应用场景:在一个地下矿井中,巡检机器狗需要跟随矿工穿越复杂的巷道。没有WiFi,没有5G,但机器狗依然紧紧跟在矿工身后,遇到障碍物自动绕行,遇到岔路口自动判断方向。这种能力在应急救援、野外勘探等场景中有着巨大的应用价值。

再想一个仓储物流的场景。大型仓库的角落往往信号薄弱,传统依赖云端的AGV小车经常会因为断网而停机。搭载了MiniCPM-RobotTrack的机器狗则完全没有这个顾虑,它可以在货架之间自如穿行,跟随拣货员到达指定货位,等待指令完成取货动作。整个过程不需要任何网络支持,大大提高了系统的可靠性。

在农业场景中,这款模型同样大有用武之地。广袤的农田几乎没有网络覆盖,但搭载MiniCPM-RobotTrack的农业机器人可以跟随农民在田间巡逻,辅助完成播种、施肥、采摘等工作。农民不需要操控遥控器,机器人会自动保持跟随距离,在需要时停下来等待指令。

PhyAI加速:硬件软件的协同进化

好的模型还需要好的硬件来跑。

面壁智能同时发布了PhyAI加速方案,在RTX 5090显卡上,对π0模型实现了2.85倍的加速,对英伟达的GR00T模型实现了2.28倍的加速。这意味着即使是竞争对手的模型,也能通过PhyAI获得显著的性能提升。

这种"我做好地基,大家都能盖楼"的思路,体现了面壁智能作为开源社区参与者的格局。你不必非得用我的模型,但我的加速方案可以让你的模型跑得更快。

2500万次下载:开源的力量

MiniCPM-Robot并不是面壁智能的第一个开源项目。

此前,MiniCPM-V和MiniCPM-O系列模型的开源下载量已经突破了2500万次。这个数字在全球开源模型中都是名列前茅的。面壁智能走的是一条"小模型、大能力"的路线——不追求参数规模上的军备竞赛,而是在有限参数下把性能压榨到极致。

这种策略在具身智能领域尤其有效。机器人上的计算资源是有限的,你不可能在一只机器狗背上放一台服务器。1.5B和0.9B的参数量意味着这些模型可以在边缘设备上本地运行,不需要依赖云端。

具身智能的下一站

MiniCPM-Robot的开源,对整个具身智能行业来说是一个重要的里程碑。

它证明了一件事:小模型也能做好具身智能。你不需要几百亿参数的巨型模型,只需要在架构设计和技术路线上做对选择,1.5B的参数就能在榜单上碾压大几十倍的对手。

更重要的是,开源意味着更多开发者可以参与进来。当一个研究生可以在自己的机器狗上跑起MiniCPM-RobotTrack时,具身智能的创新就不再被大公司垄断。每一个有想法的人,都可以为这个领域贡献自己的力量。

面壁智能选择开源这条路,背后是一种长远的眼光。具身智能行业目前还处于早期阶段,技术路线远未收敛。与其关起门来自己摸索,不如开放出来让全社区的智慧汇聚在一起。开源不是慈善,而是一种更高效的研发模式——当全世界的研究者都在你的模型上做实验时,你能获得的反馈和改进速度,远远超过任何一家公司闭门造车。

WAIC现场的机器狗演示结束了,但围观的观众久久没有散去。有人拿出手机拍照,有人蹲下来仔细观察机器狗的运动方式。在他们的眼中,你能看到一种熟悉的表情——那是对未来的期待。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/5 11:14:27

Adobe-GenP破解工具:3分钟免费解锁Adobe全家桶的终极指南

Adobe-GenP破解工具:3分钟免费解锁Adobe全家桶的终极指南 【免费下载链接】Adobe-GenP Adobe CC 2019/2020/2021/2022/2023 GenP Universal Patch 3.0 项目地址: https://gitcode.com/gh_mirrors/ad/Adobe-GenP Adobe Creative Cloud的订阅费用让许多创意工作…

作者头像 李华
网站建设 2026/8/5 11:14:15

Video2X深度解析:现代C++视频超分辨率架构解密与技术实现策略

Video2X深度解析:现代C视频超分辨率架构解密与技术实现策略 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/…

作者头像 李华
网站建设 2026/8/5 11:12:56

上传照片10秒出拼豆图:免费试用

上传照片10秒出拼豆图:免费试用 想做拼豆却卡在画图纸?拼拼乐(FunBead)是你上传照片就能自动生成像素图纸、品牌色号和用豆清单的拼豆助手,头像、宠物、游戏角色、钥匙扣都能做。现在就能免费试用,兼容 Pe…

作者头像 李华