生数科技发布通用世界模型五级进化路线,覆盖前三层级

在近期举办的世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”上,相关技术团队发布了最新研究成果,并系统阐述了通用世界模型的五级发展路线。
与会技术专家指出,从大模型的发展趋势来看,行业需要构建的并非仅服务于单一任务或场景的专用模型,而是能够理解世界、预测未来并主动采取行动的通用基座模型。
通用世界模型的核心内涵与必备能力
当前世界模型的应用已经延伸至视频生成、环境模拟、机器人决策与动作控制等多个领域,但行业内尚未对“通用世界模型”的标准形成统一共识。
就像人类学习骑行或驾驶时,大脑会在与外部世界的持续互动中,逐步建立起一套关于世界运行规律的内部认知模型,最终实现从生疏到熟练的转变。通用世界模型同样需要三项相互关联的核心能力,形成闭环反馈系统:
- 理解世界:准确感知环境状态,清晰判断当前所处的场景与条件;
- 预测未来:推演后续可能发生的变化,以及不同行动将带来的具体结果;
- 采取行动:对数字或物理环境产生影响,并通过真实反馈持续修正对世界的理解与预测能力。
专家强调,通用世界模型绝非单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的简单拼接或线性串联,而是将理解、预测与行动三大能力深度耦合的闭环反馈系统。行动不仅是模型的输出,更会反过来改变环境、产生新的信息,推动模型进入下一轮的理解、预测与决策循环。
构建通用世界模型的三大核心要素
要搭建通用世界模型,依然离不开大模型研发的三大基础要素:数据、架构与算力。
在数据层面,通用世界模型需要一套从观察逐步过渡到行动的多层数据金字塔。数据层级从最底层的海量网络视频开始,逐步向上扩展至特定领域视频、第一视角人类视频、带有动作记录的人类示范数据,最终延伸至真实机器人交互数据。
数据金字塔的底层规模更大、覆盖范围更广,而越靠近顶层的数据则越稀缺、获取成本越高,但却能更直接地建立任务、动作与物理结果之间的关联。合成数据可以覆盖金字塔的所有层级,同时“不完美数据”也具备重要的学习价值:比如失败尝试、纠正动作以及恢复过程中,都包含有效的学习信号,能够帮助机器人掌握从失误中恢复的能力。
架构层面上,通用世界模型需要能够统一处理图像、视频、语言以及机器人动作等多种模态的信息。MoT(Mixture-of-Transformers)架构通过为不同模态配置专属参数,并借助共享注意力机制实现跨模态信息交互,让环境理解、世界状态预测与动作生成能够在同一个模型中协同完成。相关团队研发的世界动作模型Motubrain正是基于这一架构,将理解、预测与行动统一建模,打破了传统分模块方案的能力割裂问题,同时提升了异构数据的利用效率与跨任务迁移能力。
算力则同时影响大规模预训练与实时部署两个环节。离线视频生成可以容忍一定的等待时长,但实时交互场景与机器人控制则需要在环境发生变化前完成预测与决策。因此,训练基础设施、推理加速技术、模型蒸馏方法以及高效注意力机制,都是通用世界模型走向实际应用的重要支撑条件。
五级进化路线:从世界生成到全局统筹
从通用基座模型的目标出发,通用世界模型可以划分为五个逐级演进的层级。这些层级并非彼此割裂的产品方向,而是随着对世界的理解不断加深、与世界的交互持续增强,模型自主性逐步提升的完整过程。目前相关团队的研发与落地实践已经覆盖了前三个层级。
L1:世界生成阶段
该阶段的核心目标是让模型学会生成连贯的世界演化过程,视频是最典型的训练载体。通过视频生成,模型可以学习对象属性、运动规律、空间关系与时序变化,为后续的世界理解与预测奠定基础。2024年,相关团队推出视频生成大模型Vidu,通过持续优化视频质量、时序一致性与世界动态建模能力,完成了L1阶段的初步实践。
L2:与世界交互阶段
在L1的生成能力基础上,模型开始接收实时输入,并根据语言、语音或控制信号动态调整后续内容,从“单次静态生成”转向“持续动态交互”。2026年7月发布的Vidu S1,将这一能力推进到实时交互阶段,用户可以通过语音实时介入生成过程,持续影响世界演化的方向,让模型能够根据外部输入动态调整内容。
L3:在世界中行动阶段
进入L3阶段,模型开始从数字世界延伸至物理世界。此时,环境理解、未来预测与动作生成需要真正实现统一,让模型不仅能够判断世界发生的变化,还能直接生成机器人可执行的动作,并通过真实反馈持续修正自身的认知与决策能力。
Motus与Motubrain标志着相关团队从视频生成领域进一步走向物理行动落地:Motus于2025年12月发布并全面开源;2026年4月推出的Motubrain,则进一步将环境理解、世界状态预测与动作轨迹生成整合到同一个模型中,推动通用世界模型从“视觉推演”迈向“物理决策”。
相较于Motus,Motubrain的推理速度提升约10倍,在适配新的机器人本体时,仅需要50至100条人类示范数据即可完成适配。在RoboTwin 2.0基准测试中,Motubrain取得了96.1分的优异成绩,位居榜首。目前,该模型已经在近十种机器人本体上完成验证,包括银河通用、星尘智能、千寻智能等机型,展现出在长程任务、多任务场景以及不同机器人形态之间的出色泛化能力。
L4:自主世界智能体阶段
当模型具备真实行动能力后,还需要进一步向自主决策方向演进,能够围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动路径。
L5:世界组织者阶段
在最高层级的L5阶段,模型不再仅控制单个智能体,而是能够统筹机器人、数字智能体、人类、工具及其他各类资源,完成复杂的任务分配与多智能体协作。
从L1到L5,各个层级的能力层层递进。没有对世界演化规律的学习与预测,就无法形成稳定连续的交互能力;而没有真实行动带来的环境反馈,也难以进一步发展出自主学习、长期规划与复杂协同的高阶能力。
迈向高阶智能:需突破六大核心挑战
目前L1至L3已经形成了较为具体的技术实践,但距离L4、L5的高阶世界智能仍存在不小差距。当前的视频模型仍需要持续提升生成质量、可控性与时序一致性;世界动作模型则需要在更复杂、更开放的真实环境中,进一步提升运行稳定性、泛化能力与执行效率。
要继续迈向L4与L5阶段,还需要突破六项关键技术挑战:
- 建立覆盖理解、预测、行动与迁移能力的联合评测体系;
- 学习接触、摩擦、作用力与干预后果等真实物理世界的规律;
- 形成持久且可修订的长期记忆机制;
- 通过真实交互实现在线学习与自我进化;
- 完成满足现实延迟与资源约束的高效闭环部署;
- 进一步强化系统的安全性与可控性。
相关团队表示,未来将持续强化世界生成、与世界交互、在世界中行动三个核心层级的能力,并进一步补齐目标形成、主动探索、持续学习与长期记忆等关键能力,为高阶自主世界智能体的落地奠定基础。其更长远的目标,是构建一个能够持续理解世界、预测不同行动的后果、在明确约束下自主行动,并从真实反馈中不断学习进化的通用基座模型。
当理解、预测与行动真正形成闭环,通用世界模型将不再局限于生成内容或执行单一任务的工具,而是成为连接数字世界与物理世界、迈向通用具身智能的核心基础。

