文章摘要
流形空间完成近10亿Pre - A轮融资后,推出V2系列全栈技术成果。发布的WorldScape 2.0实现主流控制信号共同学习,解决梯度冲突;WorldScape Policy 2.0让机器人有记忆和多模态交互能力;WorldArena 2.0升级评测维度,还发起挑战赛。此外,流形空间与优必选合作,推动世界模型商用。

我们常常思考,是否真的存在能像人类一样持续推理执行的机器人大脑?国内专注具身自研世界模型的团队,梳理了当前行业的诸多发展瓶颈:此前的世界模型大多仅聚焦单一控制维度,比如相机轨迹、机械臂动作或手部位姿,没有能将多模态控制统一在同一物理世界框架中的方案;现有机器人推理能力多局限于简单抓取放置,面对整理桌面、折叠衣物、制作咖啡等长程任务时,极易出现进度遗忘、动作重复的问题;多数世界动作模型仅支持文本指令下发,难以通过目标图片、人类示教视频等多模态信息完成交互;主流评测体系也无法同时覆盖世界模型作为强化学习训练环境、策略模型真机精度、多模态视触觉扩展能力的全栈测试需求。

围绕这些行业痛点,完成近10亿Pre-A轮融资的流形空间,在不到半年的时间里接连推出V2系列全栈技术成果,从世界模型多专家混合、世界动作模型记忆增强到世界模型多模态评测三个维度实现全栈破局。据了解,该团队年内还将发布原生统一世界模型,真正将世界模型带入GPT时刻。

WorldScape 2.0:业内首个世界模型MoE框架开源,统一异源控制训练

此次开源的WorldScape 2.0,首次实现了移动控制、机械臂操作、手部自主动作等主流控制信号在同一世界模型中共同学习,让模型严格遵循物理一致性与动作因果逻辑。该方案将MoE架构引入Diffusion Transformer,共享专家模块负责沉淀跨控制维度的通用世界知识,专属专家模块则用于解释特定控制接口下的细粒度动作含义。与普通的密集混合训练不同,这种架构将不同控制接口的异源监督从“互相拉扯的训练噪声”转化为“共同放大的世界知识”,彻底解决了传统训练中的梯度冲突问题。

这一架构彻底改变了世界模型的扩展方式:过去需要为每种控制类型单独开发模型,现在只需要在统一的世界模型中接入新的控制接口即可。未来无论是单臂机器人、灵巧手、移动底盘还是人形机器人动作,亦或是触觉、力反馈、工具轨迹等复杂监督信号,都可以通过这一路径快速扩展。实测数据显示,多专家混合训练让单个专家模块也能达到最优性能,WorldScape 2.0长期占据通用世界模型权威评测榜单榜首位置,项目主页为https://worldscape-moe.com。

WorldScape Policy 2.0:让机器人拥有记忆和多模态Prompt交互能力

现有世界动作模型大多仅依赖当前观测或短时窗口信息,面对长程任务时极易遗忘执行进度。为此流形空间推出WorldScape Policy 2.0,核心突破包括三个方面:一是推理增强的长短期记忆模块,统一整合短期视觉动态、长期事件进度与隐式子目标推理,让机器人可以从高层指令出发完成长时程自主规划;二是统一的自主推理与多模态prompt实时交互能力,单个模型同时支持高层任务自主推理、细粒度文本控制、目标图片控制以及视频示范等多模态实时交互;三是构建了ManipEvent-5M事件级多模态数据集,包含近500万事件片段,对齐动作轨迹、高层任务、细粒度子任务、目标图片与视频示范,为可控世界动作模型提供了规模化预训练基础。

该方案在仿真与真机实战评测中均表现领先,其价值不仅在于延长了模型的上下文窗口,更将局部视觉动态、全局任务进度、隐式子目标推理与多模态意图统一整合到一个世界动作模型中,让世界动作模型不再只是被动预测未来的工具,而是成为能够记忆、推理并持续行动的机器人“强大脑”。项目主页为https://manifoldai-research.github.io/WorldScape-Policy/。

WorldArena 2.0 Challenge:构建世界模型的多模态全功能“真考场”

此前的WorldArena 1.0定义了世界模型的评测核心问题:世界模型不应仅通过“视频相似度”打分,更需要验证生成结果是否符合物理约束、能否服务于数据合成、策略评估与动作规划。但1.0版本仅能在离线与仿真环境下完成测试,无法回答三个关键问题:模型遇到分布外场景是否会失效?能否作为策略反复交互的训练环境?仿真中验证的能力能否在真实机器人上落地?这些正是WorldArena 2.0的升级方向。

流形空间联合清华大学、CMU、斯坦福、普林斯顿、香港大学、新加坡国立大学、中科院自动化所等顶尖高校发布了WorldArena 2.0,其升级体现在三个维度:模态上从纯视觉扩展到视觉-触觉联合建模;功能上从离线任务评测升级为闭环在线强化学习环境;平台上从纯仿真器拓展至真实机器人平台。这意味着流形空间不仅是世界模型技术的探索者,更在主动定义行业评测标准,让世界模型在真机、闭环、多模态的真实压力下接受检验。

同时,团队发起了IROS2026 WorldArena 2.0 Challenge,面向全球研究者与开发团队开放,围绕视频质量评测、世界模型在线强化学习环境、真实机器人世界动作模型任务三大方向展开,旨在探索世界模型从预测未来到支撑智能体学习与执行的关键能力。项目主页为http://v2.world-arena.ai。

上述三项技术成果共同指向一个明确的方向:我们不仅需要世界模型能够“生成新世界”,更需要它能够“影响世界”——支持不同物理模态的指令输入、准确理解物理规律、稳定记忆并执行长程任务。此外,流形空间还与优必选正式签署业务战略合作协议,推动世界模型从技术验证走向规模化商用,让每一次技术进步都能被看见、被检验、被复用。

以上内容不代表本平台立场,仅供读者参考