李飞飞团队发布R2S2R引擎,打通机器人仿真到现实闭环

由李飞飞主导的空间智能团队World Labs,近期借助收购的机器人初创公司SceniX的技术,推出了全新的机器人策略训练与评估引擎——Real-to-sim-to-real (R2S2R)。
这套系统将World Labs的空间智能版图,从生成可交互的虚拟世界进一步延伸到真实机器人的训练、评估与部署环节,首次打通了从仿真训练到真实运行的完整闭环。
从技术架构来看,R2S2R主要包含两大核心模块:Real-to-Sim与Sim-to-Real。
其中Real-to-Sim负责将现实中的机器人本体、传感器配置、周边物体以及实际交互过程完整迁移到虚拟仿真环境中,构建与真实任务高度对齐的虚拟场景。
而Sim-to-Real模块则让机器人在这些虚拟环境中完成策略训练与效果评估,最终将训练好的执行策略直接部署到真实硬件平台中运行。
李飞飞在相关社交平台上分享表示,基于这套方法训练出的机器人策略,即便全程没有使用真实世界的训练数据,也能够实现连续1小时的自主运行,全程无需人工干预。
除此之外,R2S2R还让机器人策略的规模化评估变得更加高效。通过对齐仿真与真实环境中的策略运行过程,真实场景中机器人的成功、失败案例及其触发条件,都可以在虚拟世界中被完整复现并深入分析。
从技术布局来看,R2S2R不仅打通了世界模型从生成虚拟世界,到训练、评估再到部署真实机器人的完整闭环,也补齐了李飞飞此前提出的世界模型三分法中最关键的一环——仿真器。
在她的经典划分中,世界模型主要承担三类功能:渲染器负责生成视觉观察数据,仿真器负责模拟真实世界的状态变化,规划器则负责输出机器人的执行动作。
而R2S2R的核心价值,就是让World Labs生成的虚拟世界,不再仅仅是“看起来真实”,而是真正成为机器人可以进入、交互并开展学习的标准化训练场。
那么,为什么要为机器人扩展仿真学习环境?World Labs在官方博客中指出,当前机器人技术发展的主要瓶颈,已经不再局限于模型架构本身,而是缺乏能够规模化获取的训练经验与标准化评估手段。
当前机器人发展的主要瓶颈,已经不只是模型架构,而是缺少能够规模化获取的经验和评估。
一方面,真实世界中的物体位置、光照条件、物理属性以及交互过程始终处于动态变化中。要让机器人真正走出实验室落地应用,就需要提前覆盖足够丰富的场景,并反复测试其在不同条件下的成功率与失败触发点。
另一方面,与训练大模型可依托海量公开互联网数据不同,机器人的每一条训练经验都需要在真实物理世界中实际发生。每一轮实验都需要占用实体硬件,人工重置场景、恢复失败状态并维护系统运行,即便拥有海量人类演示视频,也很难系统性覆盖不同环境、物体属性、机器人状态以及各类失败场景。
因此,仿真技术的最大价值,并不只是节省真实数据采集的成本,更在于可以主动制造现实中昂贵、危险或难以重复的训练场景,让机器人能够反复经历成功与失败的训练过程。
不过传统仿真技术也存在明显短板:不仅需要为每项真实任务单独搭建虚拟环境,导致成本高、搭建速度慢,而且仿真与真实物理世界之间往往存在视觉、几何以及物理动态特性的差距。更关键的是,机器人在仿真环境中学到的执行策略,迁移到真实硬件后往往效果不佳,仿真环境中的测试结果也未必能准确反映真实表现。
基于上述行业痛点,World Labs推出了R2S2R这套从现实到仿真再到现实的闭环训练引擎,用于机器人策略的训练与评估。
两大模块结合起来,形成了完整的技术闭环:从真实世界中提取任务场景,在仿真环境中规模化生成训练经验、开展策略训练并主动寻找失败场景,再将优化后的策略部署回真实硬件;而真实硬件运行产生的新数据,又会反过来修正世界模型、训练数据与机器人策略,实现持续迭代优化。
简单来说,R2S2R并非简单地用仿真替代真实数据采集,而是将单个真实任务扩展为大量可控制、可复用的虚拟学习场景,让机器人能够以更低的成本反复开展训练、评估与迭代升级。
具体来说,R2S2R的技术流程首先从Real-to-Sim环节开始。
研发团队会先采集机器人本体、传感器配置、运行环境、周边物体以及任务演示等多维度数据,再通过生成式世界建模系统将其重建为可交互的虚拟世界。这个虚拟场景不仅需要还原真实环境的外观与几何结构,还要尽可能复现物体的物理与动力学特性。
举个例子,在双机械臂装箱任务中,仿真环境与真实环境会执行完全一致的动作序列,最终产生高度匹配的视觉观测结果、物体运动状态以及任务完成效果。
这一环节的核心难点在于,真实物理环境并不会提供一套精准的建模参数:物体的重量、摩擦系数难以精确测量,机器人与摄像头的实际参数可能与标称规格存在偏差,电缆、包装等柔性物体的形变更是难以用简单模型描述。因此R2S2R会根据不同任务的需求,组合使用多种表示方法与建模技术来解决这些问题。
完成虚拟场景重建后,团队会让机器人在真实环境与仿真环境中执行完全相同的动作,直接对比两侧的视觉观测、物体反应与最终任务结果,以此验证虚拟与真实环境是否真正对齐。
进入Sim-to-Real阶段后,完成对齐的虚拟仿真世界会进一步升级为可扩展的训练与评估引擎。
机器人首先会在仿真环境中学习新的执行策略,评估系统会主动寻找策略容易失败的状态,并围绕这些薄弱点生成新的交互训练数据,形成“发现问题—补充训练数据—改进执行策略”的闭环,最终将优化后的策略部署到真实硬件中运行。
相比于真实数据采集流程,仿真环境可以系统性调整物体位置、机器人状态、拍摄视角、物体外观、物理属性以及任务难度,让机器人反复经历现实中成本高昂、难以复现甚至存在安全风险的训练场景,同时还能获取硬件难以直接采集的物体状态、接触力、受力情况等监督信号。
此外,一套重建完成的虚拟任务场景并不局限于单个模型或某款机器人平台。同一套仿真环境可以适配不同的执行策略、传感器配置以及机器人硬件,从一次性的实验场景转变为可复用的标准化训练基础设施。
根据官方测试报告,仅通过仿真环境训练得到的机器人策略,可以直接迁移到ALOHA、RB-Y1、YAM、Flexiv、xArm等多款机器人平台,完成装箱、绕线、试管转移以及杂乱环境单件抓取等多项任务。其中电源线绕行、线缆插拔、试管转移以及马克笔、铅笔抓取等任务,均实现了连续1小时的自主无失败运行,全程无需人工接管。
这一结果表明,完成对齐的仿真环境未来或许不再只是真实数据的补充,而是会成为机器人训练经验的核心来源之一。
在机器人策略评估方面,R2S2R同样展现出显著优势。
传统的真机测试受制于物理世界的运行速度,每测试一个模型 checkpoint 都需要重新布置场景、启动机器人并处理失败案例,不仅测试成本高昂,能够覆盖的测试场景也非常有限。
而R2S2R可以先在数千种受控条件下主动寻找策略的失败场景,提前筛选掉表现不佳的模型 checkpoint,只将最具潜力的策略留给真机测试。
这里的关键并非要求仿真与真实环境的成功率完全一致,而是需要两侧能够得出相同的判断:即哪些策略表现更优、策略的成功与失败场景分布,以及训练过程中的性能提升能否顺利迁移到真实硬件。
在ALOHA双臂方块交接任务测试中,团队对比了GR00T N1.6和π₀.₅两种策略架构,以及不同训练配置、ID和OOD场景下的表现。每个模型 checkpoint 分别开展了2000次仿真试验与100次真机试验。
测试结果显示,仿真环境中表现更好的checkpoint,在真机测试中通常也能取得更优的结果。仿真环境不仅保留了不同策略之间的相对性能排名,还呈现出与真实环境高度相似的成功与失败分布。
更重要的是,这种环境对齐并非仅仅让仿真画面看起来与真实环境相似。研发团队会让机器人在仿真与真实环境中执行完全相同的动作,对比两侧的视觉画面、物体反应与最终任务结果,确保即使是线缆、柔性关节等难以模拟的任务场景,也能尽可能复现真实的物理变化过程。
以方块交接任务为例,当方块被放置在机器人不太熟悉的边缘位置时,机械臂会抓取得更靠近方块边缘,出现险些失手的情况。这种“险些失败”的过程不仅出现在真机测试中,也能在仿真环境中被完整复现。
这意味着,仿真环境还原的不只是机器人最终的成功或失败结果,还能复现其成功或失败的背后原因。因此R2S2R可以成为机器人开发流程中的高通量评估层,用于筛选模型checkpoint、发现性能退化问题,并指导下一轮训练需要补充的数据类型。
事实上,在正式发布R2S2R的前一周,World Labs就已经宣布收购SceniX这家机器人仿真领域的初创公司。
SceniX的技术方向聚焦于将真实机器人任务迁移到数字虚拟世界,让原本昂贵、缓慢甚至存在安全风险的数据采集与模型评估流程,可以在仿真环境中规模化完成。
SceniX的联合创始人李昀烛目前是哥伦比亚大学助理教授,她曾在MIT获得博士学位,随后在斯坦福跟随李飞飞开展博士后研究工作。
有趣的是,两家公司的合作并非始于这段师生关系。最初SceniX只是World Labs的生成式世界模型Marble的客户,直到李飞飞发现该公司由李昀烛创办,双方才意识到彼此的技术互补性,进而展开收购合作。
具体来看,World Labs擅长生成模型、计算机视觉与3D重建技术,可以从稀疏输入数据中快速生成具备空间一致性的虚拟世界;而SceniX则更精通机器人技术、仿真系统、学习算法与硬件系统,能够让虚拟世界真正服务于机器人策略的训练、评估与部署。简单来说,前者解决“虚拟世界如何生成”的问题,后者解决“机器人如何在虚拟世界中学习”的问题。
在相关访谈中,李昀烛表示,此次收购并不意味着World Labs要亲自研发制造机器人。团队真正想要打造的,是一套与机器人形态和模型架构解耦的标准化基础设施:无论客户使用单臂、双臂还是移动机器人,也无论采用不同的模型架构,都可以在同一个虚拟世界中开展训练与测试。
未来,双方将围绕仿真技术、基础模型与动作条件模型逐步完成技术整合,并计划首先在仓库、实验室与电子装配等半结构化场景中,与客户共同完成真实部署验证。
参考链接:
[1] https://www.worldlabs.ai/blog/real-to-sim-to-real
[2] https://www.worldlabs.ai/blog/taxonomy-of-world-models
[3] https://x.com/drfeifei/status/2082137342824075357


