news 2026/9/6 2:12:16

前字节腾讯AI核心孙鹏加盟星尘智能,机器人强化学习后训练成焦点

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
前字节腾讯AI核心孙鹏加盟星尘智能,机器人强化学习后训练成焦点

重磅!前字节跳动、腾讯AI核心研发孙鹏加盟星尘智能,加码机器人强化学习后训练

就在行业普遍把目光聚焦在基础大模型参数竞赛时,一条关于“具身智能”人才流动的消息进入了我的视野:前字节跳动、腾讯AI核心研发孙鹏,正式加盟星尘智能,出任机器人强化学习后训练负责人

先别急着把这当普通人事公告。这件事放在当前“AI + 机器人”的交叉节点上,释放的信号比表面信息要浓厚得多:当基础模型逐渐收敛,业界对“后训练”环节的重视已经从前沿实验室传导到了具身智能公司。换句话说,今年的机器人战场,关键词不再是“能感知”,而是“会学习”。孙鹏的加入,恰恰印证了这一技术重心的迁移。

这篇文章我们不谈八卦,我结合自己部署机器人仿真环境、跑强化学习算法的经验,帮大家拆解三件事:为什么是孙鹏、为什么是后训练、以及星尘智能这步棋对整个行业的技术风向有什么影响。如果你是做具身智能、RL算法部署、仿真迁移或机器人产品的开发者,这篇内容值得花几分钟读完。


一、强力援军:孙鹏到底什么来头?

在讨论技术布局之前,我们先把人的能力图谱弄清楚。从公开信息来看,孙鹏的履历属于典型的“算法+工程+大厂实战”组合型人才,这种背景在具身智能领域尤其稀缺。

从职业足迹来看,孙鹏此前在字节跳动和腾讯AI Lab均担任过核心技术研发角色。涉及的领域包括但不限于:大规模深度学习模型的训练与优化、强化学习算法在复杂任务中的落地、多模态感知与决策系统的工程化实现等。

为什么说这种背景和星尘智能的需求高度匹配?

第一,强化学习后训练严重依赖对“预训练+微调”范式的深度理解。孙鹏在大厂接触的往往是千万级甚至亿级参数的模型训练任务,对数据流水线、分布式训练、奖励模型设计有实操层面的经验积累。

第二,字节系的工程文化强调极致效率和结果导向。这种背景的人加入机器人公司,往往不只带来算法方法论,还会带来一整套工程落地规范。对于星尘智能这样强调“产品级机器人”的公司来说,这直接决定了技术能不能从仿真走向真机。

第三,腾讯AI Lab的科研底色又提供了方法论深度。腾讯AI Lab在强化学习、AI游戏博弈、机器人控制等方面有深厚积累,孙鹏在这种环境下形成的“先建模再求解”的思维习惯,在应对机器人操作中的不确定性时,有实际价值。

综合来看,星尘智能不是在请一个单纯刷论文的算法专家,而是在请一个能把后训练 Pipeline 从 0 到 1 搭起来、并跑得通的系统工程负责人。这跟当前行业“缺的不是模型,是能落地的模型”的痛点高度同频。


二、技术主战场:为什么机器人强化学习“后训练”成了香饽饽?

如果说 2023-2024 年的重点是“通用基础模型”,那么 2025 年往后的技术焦点显然已经转移到了“如何让模型在特定领域变得可靠且可控”。在具身智能赛道,这个焦点就叫后训练(Post-training)

通俗地讲,后训练就是在大规模预训练模型的基础上,利用高质量的下游数据、对齐技术和环境反馈,把“通才”变成“专才”。对机器人而言,它包含两层关键步骤:

第一步是人类对齐(指令微调):让机器人理解“拿左边那个红色杯子”和“把杯子放到托盘中间”这类具象指令行为。第二步是环境自适应(强化学习):让机器人在真实的物理世界中,通过反复试错,把成功的高频动作稳定输出。

为什么这一步现在特别关键?一个残酷的现实是,很多机器人在实验室里能跑通,但到了客户现场就“翻车”。原因就在于预训练模型虽然见多识广,却没见过客户现场那个特定按钮的按压力度、那扇门的阻尼系数。而后训练,尤其是强化学习后训练,正是用来解决这个“最后一米”问题的。

孙鹏此番加入,核心要做的,大概率就是将这套“预训练 + 强化学习后训练”的范式,从 NLP 大模型迁移到物理世界的机器人操作任务上。这个技术动作,比单纯堆算力训练视觉模型,要复杂得多。


三、星尘智能的软肋与破局点:从“有机”到“无机”的AI新物种

我们先暂时跳出孙鹏先生个人的履历,来看星尘智能这家公司。如果在机器人圈提起星尘智能,很多人第一反应是它推出的 Astribot S1,这台机器人在演示视频里展现出的操作细腻度——比如叠衣服、开瓶倒水、操作电脑——确实一度刷新了行业对“仿生操作”的认知。

但这里有一个行业里心照不宣的关键点:大多数机器人公司的 demo 视频,和产品级泛化能力之间,存在巨大的鸿沟。基于 SIM(仿真) 到 REAL(真机) 的迁移能力,决定了机器人到底是“演员”还是“工人”。

此前星尘智能的优势主要体现在“本体设计”和“遥操作数据采集”环节。但要想让机器人真正进入家庭或通用场景,就必须具备强大的“大脑决策系统”。而这个大脑,恰恰不是靠堆叠视觉模型能解决的,它需要的是强化学习后训练,尤其是基于真实物理反馈的 RL 训练。

引入孙鹏,等于给这个本体强悍的机器人,插上了一块“决策大脑”的最关键拼图。这不仅仅是团队增加一个高管,更像是在高声宣告:星尘智能的技术栈要从“有机体(机械结构)”向“无机体(智能决策)”全面进化。


四、对行业的三个直接影响:门槛、范式与人才战

孙鹏加盟的涟漪效应,一定会扩散到整个机器人行业。我在这里给出三个明确的技术预判:

影响一:具身智能的人才评价标准开始“后训练化”。以前招机器人算法工程师,大家看的是你发过多少篇顶会,或者调过多少遍 PID。从这波招聘开始,行业会把“能否设计奖励函数、能否搭建 RL 训练环境、能否压榨出 100 万条有效轨迹数据”作为核心评估维度。后训练经验将取代模型结构设计经验,成为具身智能岗位的硬通货。

影响二:强化学习后训练将彻底摆脱“仿真花瓶”的尴尬。很多时候,强化学习在仿真环境里表现得宛如神助,一上真机就变成人工智障。孙鹏这类有深厚大模型后训练背景的人入场,会极大地推动Sim-to-Real(仿真到现实)的域随机化技术和在线 RL 微调的发展。说白了,就是让机器人不再只会“纸上谈兵”。

影响三:机器人公司的竞争将从“Demo 竞赛”转向“泛化竞赛”。过去发布会比的是“谁能叠好一件衬衫”,未来比的是“谁能在没见过的 100 件衬衫里叠好其中 90 件”。后者靠的正是强化学习后训练的泛化能力。星尘智能此举,等于把行业 PK 的终点线,往后硬生生拉长了 500 米。


五、工程师视角:如果我们要部署一套“机器人强化学习后训练”,该关注什么?

既然聊到这儿了,我再写点能落地的东西。虽然我们可能没机会去星尘智能上班,但技术范式的迁移是大家可以共享的。如果你也想在自己的机器人项目里引入“强化学习后训练”,可以把下面几步纳入你的技术规划:

5.1 数据采集与增强(这是地基)
  • 不仅要采集成功数据,还要刻意保存大量失败数据,以便在奖励模型设计时告诉机器人“什么叫不对”。
  • 引入大模型辅助的自动标注,让自然语言指令和机器人的传感器数据对齐。
  • 构建高质量的数据闭环:真实遥操作数据为主,仿真数据为辅。
5.2 奖励模型设计(这是灵魂)

这是强化学习后训练最核心的部分。我见过很多项目死在奖励函数上——不是太稀疏(导致模型不收敛),就是太稠密(导致模型钻规则漏洞)。理想情况下,奖励模型本身也应该由大模型来打分,即采用RLHF(基于人类反馈的强化学习)的具身版本。

# 伪代码示例:结合 LLM 先验的奖励打分概念 class RewardModel: def score(self, trajectory, instruction): # 1. 用 VLM 评估是否完成了指令 # 2. 用安全规则检测是否出现异常碰撞 # 3. 加权融合作为最终的 reward task_reward = vlm_judge(trajectory, instruction) safety_penalty = safety_rule_check(trajectory) return task_reward - safety_penalty
5.3 算力与训推框架选型(这是底座)

当涉及后训练,你不能用一张消费级显卡跑完所有环节。实践中可以采用混合方案:

  • 小模型微调(7B-13B级别)用单机多卡(如2-4张A800/H800)。
  • 大模型推理打分(如 VLM 模型)可以通过 API 方式并行调用,借此减小显存压力。
  • 使用vLLMSGLang作为推理引擎,提高后训练中 rollouts 的吞吐量。
5.4 部署验证闭环(这是终极目标)

后训练的好坏,最终要在真机上见真章。因此,需要一个扎实的自动化评估集,包括几十种“需要泛化的新场景”,每周跑一遍回归,看成功率是提升还是下降。


六、冷静观察:这件事的“重音”到底在哪?

最后说点个人判断。

从行业视角看,孙鹏加盟星尘智能,既是一个人才的胜利,也是一个技术趋势的缩影。它标志着,机器人行业正式告别“堆硬件”的时代,全面跨入了“卷智能后训练”的新周期。从大模型跨界到机器人,看起来是赛道切换,实则是技术复利——同样的强化学习后训练方法论,正在从 Token 世界复制到物理世界。

对于从业者来说,我最大的建议是:不要只盯着今天这个消息,开始认真积累后训练相关的工程能力。正如 2022 年大家一窝蜂学大模型推理部署一样,当下正是学习机器人强化学习后训练与数据流水线的窗口期。等到所有公司都要求“精通机器人 RLHF”时,再动手就晚了。

我们可以把孙鹏的这次加盟,当成行业发出的技术风向标,至于星尘智能最终能把这面旗插到哪个高度,值得长期跟踪。也欢迎各位在评论区分享你们对机器人后训练技术难点与解决方案的看法。如果这篇文章对你有启发,建议收藏并转发给同样关注具身智能的朋友。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 2:11:44

在线Linux环境真实配置核查:15G内存与10PB存储的真相

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 2:10:38

myAIcademy 使用指南:围绕你的岗位打造个性化 AI 培训体系

myAIcademy 使用指南:围绕你的岗位打造个性化 AI 培训体系 市面上的通用 AI 课程和提示词库往往几个月就过时。myAIcademy 围绕你的岗位职责、目标和实际使用的工具,生成专属学习路径,内容每 72 小时更新一次——让你的 AI 技能跟得上技术演进…

作者头像 李华
网站建设 2026/9/6 2:08:24

过拟合不只是正则化的事:我从数据层面根治了模型的泛化问题

过拟合不只是正则化的事:我从数据层面根治了模型的泛化问题 那个用户留存预测模型,训练集 AUC 0.98,验证集直接掉到 0.72--这差距我调了整整一周,加了 L2、换了 dropout 比例、试过早停,全是白忙。leader 一句话点醒我:“你是不是在调参数,而不是看数据?” 那天下午我才第一次…

作者头像 李华
网站建设 2026/9/6 2:06:25

2026 年 GPT-6 Astra 接入 Agent 完整指南:从 ChatBot 到自动执行智能体

GPT-6 Astra 最大的变化,不是回答问题更快,而是 AI 开始真正参与完成任务。过去几年,我们使用大模型基本都是: 用户↓ 输入问题↓ GPT↓ 返回答案例如: 帮我写一个 Spring Boot 登录接口AI 给你代码。 但是 Agent 时代…

作者头像 李华