作者|黄楠
编辑|袁斯来
36氪获悉,9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中⼼负责⼈孙鹏博⼠正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。
孙鹏博士毕业于清华大学,此后先后在康奈尔大学和罗格斯大学从事博士后研究。他长期专注强化学习(RL)、智能体(Agent)及多智能体强化学习(MARL)研究,拥有横跨机器人强化学习、大规模分布式RL系统与大模型强化学习的研究与产业实践经历,兼具算法研究与系统工程的技术积累。
早前在腾讯 AI Lab 及 Robotics X 机器人实验室期间,孙鹏曾担任智能体中心负责人,开展深度强化学习与机器人控制研究。他曾利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随;同时研发《星际争霸》AI智能体TStarBots、TStarBotX,在多智能体强化学习(MARL)复杂博弈环境研究中取得重要成果。
加入字节跳动后,孙鹏将其技术实践由算法全面拓展至大规模RL系统工程。他主导开发了核心强化学习基础设施 ByteRL,支撑多款自研游戏AI高效训练。其团队曾夺得IEEE CoG 2023策略卡牌AI竞赛冠军,所研发的《炉石传说》AI具备击败行业顶尖选手的竞技水平。
随着大语言模型技术快速迭代,孙鹏将多年深耕的强化学习技术积累,顺利延伸至大模型后训练领域。任职字节AI Lab/ByteResearch期间,他以项目负责人身份主导研发并落地强化微调方法ReFT、数学推理智能体 DeltaProver;在Seed团队深度参与模型预训练及RLHF对齐工作,在模型对齐、推理能力增强、智能体Agent研发等前沿方向,积累了扎实的技术积累与落地经验。
孙鹏博士(图源/企业)
从机器人控制到大规模RL系统工程,再到大模型后训练,此前十余年,孙鹏的技术积累始终围绕一个核心问题展开:如何让智能体通过环境交互与反馈不断学习,并持续优化自身策略。
如今,AI能力从数字世界进一步进入真实物理世界,“交互-反馈-迭代”的强化学习逻辑,也在具身智能领域找到新的落点。过去行业比拼的是机器人“能不能做任务”,靠仿真榜单验证模型能力;而当机器人走出实验室走向真实部署,评判标准正从“能不能做”切换为“能不能稳定反复做好”。真实环境的长尾干扰、长时间自主决策的鲁棒性、故障异常恢复能力,才是决定商业价值的关键。
一个被反复验证的认知正在成为共识:模仿学习解决“怎么做”,强化学习解决“做错了怎么改”。当任务成功率推进到60%以后,继续优化动作复现的边际贡献急剧递减,真正的瓶颈在于开放环境下的自适应与纠偏能力。强化学习后训练,正是在这个节点上成为具身智能不可绕开的核心环节。
这正是星尘智能推进全栈技术体系建设必须解决的关键命题。从成立之初,星尘智能就坚持Design for AI,认为机器人身体、数据与AI模型不应被割裂设计。这一思路逐步演变为一套完整的技术闭环:基座模型、前端Agent与强化学习后训练三者协同运转。
基座模型Lumo系列负责机器人对环境与动作的理解、预测和生成。Lumo-1让机器人理解动作背后的意图逻辑,不止于“怎么做”,更关注“为什么这么做”;Lumo-2作为首个家庭隐式世界动作模型,引入Latent World Dynamics,在隐空间中先推演未来状态,再生成动作,相当于让机器人“先想后做”。前端Agent Philia则承担长期记忆、任务管理、多机器人协同与自然交互等面向用户的智能化能力。
而强化学习,正是这个体系中连接“模型能力”与“真实部署”的关键一环。它解决的是机器人在真实环境中如何通过持续交互与任务反馈不断学习、优化自身行为策略的问题。
基于“AI模型+具身OS+绳驱本体”全栈技术体系,孙鹏加入星尘智能后,将进一步强化星尘智能在机器人强化学习方向的布局,并与AI模型、具身OS和绳驱机器人本体形成协同,以实现机器人在真实世界中持续学习、不断进化。此外,公司也将继续扩充机器人强化学习团队,推动相关技术能力提升和应用部署。
对于此次加入星尘智能,孙鹏表示:“过去十多年,我一直在做强化学习和智能体,亲历了强化学习从机器人控制、复杂博弈走向大模型后训练的过程。这套逻辑在数字世界里被验证了,现在我想把这些积累带回物理世界。星尘智能已经具备从机器人本体、具身OS到AI模型的完整技术基础,接下来我们要做的,是一起把强化学习真正融入真实机器人的训练与部署,让机器人不只是‘学会一个任务’,而是能够在一次次真实执行和反馈中,把任务越做越好。”