文章摘要
当前具身智能迈向规模化商用,机器人强化学习重新受到产业关注。9月2日,拥有十余年全链路强化学习研发经验、曾任职腾讯、字节跳动的孙鹏博士正式加盟星尘智能,他将牵头负责机器人强化学习方向技术研发与团队建设,推动相关技术在真实机器人场景落地,完善星尘智能全栈技术布局。

当前,具身智能的发展正从实验室演示阶段迈向规模化商用落地,行业核心命题也从“机器人能不能完成任务”转向“能否稳定、持续地完成任务”。在此背景下,如何让机器人通过真实执行中的反馈不断迭代优化自身策略,让强化学习技术重新成为产业关注的焦点。

9月2日,深耕强化学习领域十余年的孙鹏博士正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索,同时牵头扩充相关技术团队,推动核心能力升级与落地实践。

十余年技术深耕:覆盖RL全链路的复合经验

孙鹏博士毕业于清华大学,之后先后在康奈尔大学与罗格斯大学完成博士后研究,其技术生涯始终围绕强化学习与智能体技术展开,逐步完成了从机器人强化学习到大规模分布式RL系统,再到大模型后训练的全链路技术积累。

早期在腾讯相关实验室期间,他担任智能体中心负责人,聚焦深度强化学习与机器人控制技术研究。期间他主导利用深度强化学习结合对抗博弈训练轮式机器人,实现了端到端的主动目标跟随功能;同时带领团队研发《星际争霸》AI智能体TStarBots与TStarBotX,在多智能体强化学习复杂博弈环境研究领域取得了突破性成果。

加入字节跳动后,孙鹏的技术实践从算法研发拓展至大规模RL系统工程领域,主导开发了核心强化学习基础设施ByteRL,为多款自研游戏AI的高效训练提供了底层支撑。其带领的团队曾斩获IEEE CoG 2023策略卡牌AI竞赛冠军,研发的《炉石传说》AI系统展现出了匹敌行业顶尖选手的竞技水平。

随着大语言模型技术兴起,他进一步将强化学习的技术积累延伸至LLM后训练环节,在相关团队期间,作为项目负责人参与研发并发布了强化微调方法ReFT(Reinforced Fine-Tuning)与数学推理智能体DeltaProver;同时深度参与模型RLHF与预训练工作,在模型对齐、推理增强及智能体方向积累了深厚的前沿探索经验。

纵观孙鹏十余年的技术路径,始终围绕一个核心命题展开:如何让智能体通过与环境的交互和反馈实现持续学习,不断优化自身决策策略。如今随着AI技术从数字世界向物理世界渗透,这套技术体系也在具身智能领域找到了全新的落地场景。

加盟星尘智能:补齐全栈布局的关键一环

星尘智能自成立以来便坚持“Design for AI”的研发理念,认为机器人本体、数据与AI模型不应被割裂设计,经过多年技术积累,已经搭建起覆盖基座模型、商用模型、前端共生智能体、强化学习后训练的完整技术闭环。

其推出的Lumo系列基座模型,持续推进机器人对环境与动作的理解、预测与生成能力,其中Lumo-1让机器人能够理解动作背后的逻辑原因,Lumo-2作为行业首个家庭隐式世界动作模型,率先引入Latent World Dynamics技术,通过在隐空间中先预测未来世界状态,再生成对应动作。而前端智能体Philia则面向长期记忆管理、多任务调度、多机器人协同与自然交互场景打造。

作为基础模型迈向规模化真实部署的核心环节,强化学习承担着让机器人从真实环境的持续交互与任务反馈中学习,不断优化行为策略的关键作用。孙鹏在机器人强化学习、大规模RL系统以及大模型RLHF、强化微调和智能体方向的长期技术积累,将进一步强化星尘智能在强化学习后训练环节的技术实力。

未来,他将参与星尘具身模型、机器人强化学习及后训练体系的建设工作,探索如何将大模型时代验证有效的强化学习后训练方法,与真实机器人执行、数据闭环和长期部署场景深度结合。

对于此次加盟,孙鹏表示:“过去十多年,我一直在深耕强化学习与智能体技术,也亲眼见证了这项技术从机器人控制、复杂博弈场景逐步延伸至大模型后训练领域。如今我期待能够将这些积累重新带回物理世界,星尘智能已经具备从机器人本体、具身操作系统到AI模型的完整技术基础,接下来我最期待的,便是和团队一起将强化学习技术进一步融入真实机器人的训练与部署流程,让机器人不再只是单次学会一项任务,而是能够在每一次真实执行与反馈中,不断精进任务完成的质量与稳定性。”

以上内容不代表本平台立场,仅供读者参考