从生成空间到模拟行动:世界模型的机器人进化之路

一笔收购,揭示了世界模型开始从“生成空间”走向“模拟行动后果”。
今年7月21日,专注世界模型技术的企业宣布收购机器人仿真公司SceniX,仅一周后,双方就共同推出了Real-to-Sim-to-Real(简称R2S2R)的最新技术成果。这起看似普通的行业动作,背后折射出全球物理AI领域的重要转向。
这套系统的核心逻辑看似简洁:先将真实环境中的机器人任务迁移到虚拟仿真环境中,在放大后的任务场景里完成策略训练与效果评测,最终将验证有效的策略部署回实体机器人上运行。但项目团队想要证明的绝非“仿真环境可以运行机器人策略”这么简单,更关键的是两个核心验证:一是虚拟环境中策略的相对性能表现,能否准确预测其在实体机器人上的最终效果;二是仿真中发现的策略失败场景,是否可以提前预判真实部署时可能遇到的问题。
该团队将这套系统定义为可反复运行的机器人训练与评测引擎:只要输入一个真实任务,就能将其扩展为大量可控制、可复用的虚拟训练世界。而这起收购的真正价值,也绝非只是某家企业进入机器人行业那么表面——企业的发布会和采访可以传递愿景,但真金白银的收购,代表的是资本、人才与组织资源的真实战略配置。
World Labs本次收购背后的核心判断是:世界模型的下一站,不只是生成一个看起来逼真的世界,而是要让机器人能够在虚拟世界中行动、试错和学习。
在过去两年里,主流世界模型的核心进展集中在虚拟空间的生成能力上:通过文本、图片或视频输入,就能构建出可自由浏览、编辑的三维环境,从任意角度观察都能保持空间一致性,不会出现结构突变、物体凭空消失这类不符合现实逻辑的问题。但当世界模型落地机器人领域时,核心命题却发生了根本变化。
就像一个外观逼真的纸箱,如果无法模拟箱盖的弯曲动作,就无法支撑装箱任务的训练;一根纹理光影都精准的线缆,如果不能模拟受力滑动、弯折缠绕的物理特性,那么机器人在仿真中学会的操作逻辑,也很难直接迁移到真实场景中。这也让世界模型的核心命题发生了转向:从“这个虚拟世界看起来是什么样?”,变成了“当机器人执行某个动作后,虚拟世界会产生怎样的变化?”
而SceniX的价值,正在于填补了这一领域的关键短板:它能够完成真实任务的三维重建、物理属性的精准还原、复杂交互场景的模拟,同时支持机器人策略的训练与效果评测。至此,世界模型开始从单纯生成视觉观察的渲染工具,进化为能够预测状态变化的物理模拟器。该企业也将这类模拟器视为连接虚拟世界生成与智能实体行动的关键中间层。
深入拆解R2S2R技术路径会发现,它绝非单个世界模型、一套物理引擎或是单一仿真平台可以独立完成的。这套流程需要将真实数据采集、世界场景重建、虚拟场景生成扩展、物理模拟、模型训练、能力评测以及实体机器人反馈整合进一个完整闭环中。而这一真实-虚拟-真实的闭环技术路径,与无问智科此前提出的“采集世界—生成世界—模拟世界”三位一体技术路线不谋而合,后者通过世界模型、数据工厂与世界模拟器的协同,完整打通了从真实场景到虚拟训练再回归实体的全流程。
长期以来,机器人行业对数据的关注点多集中在“数据量是否足够”,通过训练场部署、实体机器人遥控采集、第一视角数据收集或仿真合成等方式解决数据来源问题。但无问智科团队注意到一个被忽视的核心矛盾:即便采集到了足够多的数据,机器人模型也未必能稳定提升性能——相同体量的数据集,由于输入模态、任务动作、场景覆盖范围、交互质量以及失败样本的差异,对模型能力的提升效果可能天差地别。
正因如此,行业真正的挑战不再是单纯生产数据集,而是要持续解决三个核心问题:
- 机器人模型当前到底缺失哪些类型的数据?
- 如何为全行业规模化生产这些高价值数据?
- 如何让采集到的数据真正推动模型能力的持续提升?
在无问智科的定义中,物理AI数据基础设施并不是一座更大的数据仓库。它是一个把数据、场景、工具和测评结合在一起的、持续运转的循环系统:模型在训练、测评和真机运行中暴露问题;系统根据这些问题重新定义数据需求;再通过真实采集、世界生成和仿真补充数据,进入下一轮训练与验证。
基于这一认知,无问智科构建了“采集—生成—模拟”的独特世界模型技术路线:从真实世界获得物理先验知识,在生成世界中放大数据分布,再在模拟世界中完成训练、评测和反馈。如果说相关企业的收购让R2S2R从一条技术路线走到了产业聚光灯下,那么无问智科的这套路线,则是试图将这一技术路径落实为一套完整闭环的基础设施。
三个“世界”共同构成了一套完整的闭环技术体系:真实世界为虚拟世界提供真实锚点,生成式模型将有限数据扩展成更大的分布,物理规律模拟再让虚拟世界“动起来”。数据由此不再是一次性交付的产品,而成为模型持续迭代的起点。
所谓“采集世界”,并非像传统方式那样将机器人集中到训练场,反复执行预先设计好的标准化动作。无问智科采用的是大规模无感野采模式:让采集设备进入工厂、商业空间、家庭等真实环境,记录自然作业过程中真实发生的物理交互。这种方式保留下来的不只是标准化的动作轨迹,还包括真实环境中的物体差异、空间变化、操作习惯、任务中断、异常状态和失败过程——这些看似杂乱的真实交互,恰恰构成了现实世界的真实复杂度。
但真实场景中持续回传的海量数据,不会天然变成可以训练模型的高质量数据集。从原始采集数据到可直接用于模型训练的标准化数据之间,还隔着一长串复杂的数据处理管线。大量长时序记录中可能混杂着无效动作、重复片段、遮挡、传感器误差和信息缺失,如果依赖人工处理,采集规模越大,后端处理成本也会越高。
因此,无问智科将世界理解模型引入数据生产链路,对回传数据进行自动化清洗、筛选、时空对齐、标注、数据集构建和跨格式、跨本体转换。系统需要理解物理交互中发生了什么、任务处于哪个阶段、人与什么物体发生了交互、人与物体如何运动,以及最终为什么成功或失败,再将连续的真实作业数据转换成可以用于训练、重建和评测的结构化资产。
在这套体系里,采集硬件也不再是一款孤立的设备。无问智科以算法模型反向定义了Capture系列硬件:不同任务需要采集哪些模态、达到怎样的时空精度、如何完成多传感器同步,以及数据怎样进入后端处理链路,共同决定设备的传感器组合与产品形态。由此形成覆盖不同采集范式、不同数据模态和不同真实场景的Capture产品体系。
无问智科要解决的,不只是“怎样采到更多数据”,而是如何让真实物理交互能够以更自然的方式发生,再以更自动化的方式转化为模型可用的数据。这些来自真实世界的交互数据,一方面经过治理,成为了可用于训练机器人大脑的数据资产,另一方面也会进入无问智科的世界模型训练体系,成为后续世界重建、生成扩展和虚实校准的现实锚点,通过源源不断真实世界的交互数据,构成了无问智科世界模型持续迭代的数据飞轮。
仅仅将真实世界采集下来,还不足以支撑通用机器人的训练。现实世界里的物体、布局、材质和任务组合近乎无限,即便能够持续扩大真实采集,也很难低成本覆盖模型可能遇到的所有状态,尤其是低频异常、危险工况和难以重复制造的失败边界。“生成世界”要解决的,正是有限数据分布如何被规模化放大的问题。
在无问智科的技术路径中,通过Scan2Sim和Gen2Sim两大技术,既保证了生成的精度,又实现了生成的广度。首先通过Scan2Sim技术,将真实物体、场景和任务重建为可交互、可编辑的高精度物理孪生资产。这里的重建并不只是复刻物体外观:一扇门除了纹理和几何结构,还需要具备铰链、运动范围和碰撞关系;一个抽屉需要恢复滑轨和可操作区域;柔性物体则需要具备与真实材料相符的形变与交互属性。只有当现实场景被转化为能够直接参与机器人任务的可训练虚拟世界,真实经验才真正具备进一步扩展的基础。
在此之上,Gen2Sim再围绕物体和场景的几何、外观、结构、类别、布局、材质、光照、物理属性,生成更多可控变化。一个现实中只出现过有限次数的工业搬运任务,可以被扩展为不同货物类型、不同摆放位置、不同遮挡关系和异常工况下的一组任务分布。机器人不必等待每一种情况在现实中自然发生,就可以提前在虚拟世界中经历这些变化。
这种扩展也不只是简单地“多生成一些场景”。围绕真实场景进行受控变化,可以形成与现实分布接近的“物理表亲”;进一步面向未知环境和长尾状态进行扩展,则可以构造更远分布的“物理远亲”。更重要的是,生成什么不完全由工程师事先决定:当评测发现模型总是在某类材质、某种空间关系或者某个任务阶段失败,系统便可以针对这些能力缺口,反向生成新的物体、环境和任务组合。由此,生成世界不再只是生产3D资产,而是把一次真实经验扩展成可以持续训练模型的任务世界。
真实数据提供种子和约束,生成模型负责放大规模与覆盖范围。两者共同解决机器人数据生产中“真实性”和“丰富度”难以兼得的问题。
场景被重建和生成之后,还必须真正“动起来”。机器人采取一个动作后,物体怎样运动,接触如何发生,线缆如何弯曲,柔性材料如何形变,液体如何流动,都决定了仿真中的策略能否最终迁移到现实。这也是“模拟世界”与普通三维内容生成的根本区别。
无问智科开创了由显式DPE可微分物理求解器+PINN物理信息神经网络,结合隐式因果动力学模型构建的双空间世界模拟器“无穹”,让虚拟世界能够对物理交互实现更广范围、更高精度的模拟。真实交互数据在其中仍然发挥关键作用:系统可以对比同一物理变化在现实和仿真中的状态,持续修正虚拟世界中的几何、参数、拓扑、状态和边界物理量。换言之,模拟世界并不是一次搭建完成后便固定不变,而是会随着采集到的真实世界数据进行不断校准。
但模拟的目标不只是让物理效果看起来更真实。当虚拟世界具备足够可信的交互能力后,它将成为机器人的训练场和考场。决策器可以通过在世界模拟器生成的海量丰富场景和任务中进行数百万次的强化学习训练和评测。机器人最终回到真实场景后,任务中产生的新数据、失败案例和分布外状态,又会重新进入系统。这些结果可以修正物理参数,更新场景资产,改变下一轮生成方向,也可以形成新的评测任务。
至此,“采集世界—生成世界—模拟世界”才真正形成闭环:采集世界提供真实锚点,生成世界放大数据分布,模拟世界完成物理推演;模型在现实中暴露的新问题,再重新定义下一轮需要采集和生成的数据。
无问智科要建设的,是能够不断提升模型能力的物理AI基础设施。
相关企业收购SceniX的动作,让R2S2R站到了世界模型行业的聚光灯下。但这次收购真正揭示的,是物理AI数据基础设施的定义正在收敛。
未来行业衡量物理AI数据基础设施的核心标准,将不再局限于采集数据时长、3D资产数量或虚拟场景的画面逼真度,而是转向三个更关键的指标:
- 一个真实任务能拓展出多少有效的训练世界?
- 数据的堆叠是否真的提升了模型的能力?
- 模型的失败又能否快速变成下一轮迭代的数据输入?
相关企业从3D生成模型出发,开始补齐物理仿真、机器人训练与真实反馈能力。无问智科则从真实场景数据出发,把世界重建、生成扩展、物理模拟和训练评测打通形成闭环。两者隔着一个太平洋,但正在回答同一个问题:如何把现实世界转化成物理AI可以反复学习和训练使用的计算资源。
这起收购将这一行业命题推到了台前,而无问智科此前提出的“采集世界—生成世界—模拟世界”路线,也因此获得了更清晰的产业坐标。过去,数据公司交付的是一批数据。下一阶段,物理AI数据基础设施要交付的,是让模型持续进化的能力。双方对此判断不谋而合,正在全球范围内同步加速布局。

