智象具身世界模型登顶RoboColiseum扰动适应榜首

近期,国内AI企业智象未来推出的具身世界模型HiDream-O1-Embodied,在国际具身智能模型评测平台的核心扰动适应子榜单中以0.692的平均分登顶榜首,首次参评就交出了硬核的性能答卷。这一成果标志着该公司在原生全模态世界模型的布局上又迈出了关键一步。
当前通用世界模型正迎来重要的技术拐点。此前的视觉世界模型已经通过Genie、Sora等作品将像素级视觉生成能力推到了新的高度,但这类模型本质上仍是统计驱动的视觉模拟器,擅长还原像素排列规律,却无法真正理解物理规则与因果逻辑。如今,具身世界模型赛道快速升温,成为全球AI大厂竞相布局的新方向。
具身世界模型的核心在于与物理世界的规则直接对齐,将视频生成能力转化为实际的动作控制能力——比如预判抛出去的球的下落轨迹、计算抬起水杯时的液体晃动幅度、确定抓取生鸡蛋所需的合适力度。这种对物理规律的本质抽象能力,正是连接数字仿真与物理现实的关键桥梁。目前谷歌、英伟达、特斯拉等全球科技巨头已经纷纷入局,要么投入仿真训练平台建设,要么自研机器人基座模型,试图抢占这一技术赛道的先机,而中国的AI企业也在这场全球竞速中展现出了强劲的竞争力。
智象未来正式推出的HiDream-O1-Embodied具身世界模型,秉承原生全模态的技术理念,重点强化了机器人物理感知与动态预判能力,能够帮助具身智能实现更高阶的物理交互。该模型的发布,标志着智象已经逐步打通了图像、视频、3D、动作等多模态数据的融合,实现了从理解、推演到执行的全流程贯通,完成了统一世界模型基座的技术闭环。
登顶核心榜单:用扰动适应能力交出硬核答卷
本次参评的评测平台是专注于具身智能的常态化仿真评测体系,该平台通过高保真的仿真环境还原真实世界,围绕指令跟随、空间理解、扰动适应、通用操作四个维度设置了78个评测任务,面向全球高校、科研机构、企业和研究者开放,旨在建立一套可信、可复现的具身模型评测标准。其中,扰动适应子榜单被认为是最具挑战性的评测环节,它通过改变背景、光照、材质、机器人初始状态、相机位置和图像质量,同时对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力——这并非在实验室的理想环境中测试,而是在各种真实场景的“意外”中检验模型的真实实力。
HiDream-O1-Embodied能以0.692的平均分登顶该榜单,离不开其原生全模态的技术底座。原生全模态世界模型天然具备跨模态理解与生成的基础优势,而为了保证模型在真实世界的各类复杂场景中保持稳定运行,该模型在三个核心能力上实现了突破性创新,让理解更精准、感知更稳健、抗干扰能力更强。
语言理解:突破关键词匹配的局限
传统的机器人语言指令理解往往停留在关键词匹配层面,比如能听懂“把杯子拿过来”,但换成“给我拿个杯子”或者“帮我递一下杯子”就可能出现执行故障。HiDream-O1-Embodied覆盖了多元动词、句式和表达方式的等价指令空间,不会被固定的句式束缚,而是直接锁定用户的真实意图,无论指令如何变换,都能穿透字面直达核心需求。
视觉感知:多视角协同避免全局失效
在真实物理场景中,机器人的视觉通道往往无法保持理想状态:相机位置可能偏移、标定精度随时间变化、单路画面可能被遮挡或受到干扰。HiDream-O1-Embodied综合多个视角的视觉信息,让不同的视觉通道相互补充,而非依赖单一固定视角。当部分视觉信息出现偏差或暂时不可用时,模型仍能借助其他视角理解场景、判断任务并继续执行,让系统从“一处失灵、全局失效”转变为“局部受限、整体仍可运行”。
高容错机制:在不完美环境中稳定执行
多数主流模型的训练依赖于“完美数据”,比如清晰的图像、完整的画面、标准的拍摄视角,但真实世界的运行环境从来不是理想的——光照变化、画面污损、视野遮挡、信号波动都是机器人实际运行时的常见情况。HiDream-O1-Embodied在训练阶段就主动引入了多种非理想条件,让模型反复面对不完整、不稳定的信息,学会从有限的线索中做出可靠判断。这种训练方式让模型不再只追求理想条件下的最佳表现,而是更加重视复杂环境中的持续稳定运行,无论是光照变化、外观差异还是场景干扰,模型都能灵活利用已有信息,减少环境变化对任务执行的影响,真正做到“条件不理想时,依然能够稳稳完成任务”。
模型与数据双轮驱动:构建真实基座结合生成增强的数据生产体系
这种在复杂环境中展现出的强鲁棒性并非凭空而来,而是源于智象打造的“模型+数据”双驱动策略。高质量的数据是具身智能训练中最稀缺也最关键的变量,而智象探索出的“真实基座+生成增强”的数据生产范式,让数据生产本身成为模型迭代的有机一环。
该范式的核心在于让模型不再被动接收数据,而是主动参与数据的创造。以与动作捕捉领域合作伙伴的合作为例,团队先以高精度真人动作捕捉数据作为真实底座,再借助原生全模态能力完成百倍级的数据精细化扩增。基于单段真实动作样本,模型可以生成大量变体视频:在严格恪守物理约束的前提下,切换背景环境、光照条件、物体形态等变量,产出海量多元的训练样本。这种机制让模型既作为“考生”进行能力训练,又作为“出题人”生成针对性的训练数据,形成数据与模型互相驱动的增长飞轮,最终让HiDream-O1-Embodied在面对现实世界的强扰动时,展现出超乎寻常的鲁棒性。
原生全模态模型矩阵日渐完善
事实上,这并非智象在世界模型赛道的首次突破。就在不到一个月前,该公司刚刚发布了交互式世界模型HiDream-O1-World,并在交互式视频世界模型评测基准的Navi分榜中以80.9的平均分登顶榜首。交互式世界模型聚焦于“理解与推演”,让AI在数字世界中具备对空间、时间、运动与物体关系的完整认知;而具身世界模型则聚焦于“操作与执行”,让AI在物理世界中完成真实任务。两者形成了有力的互补,为原生全模态世界模型的发展筑牢了根基。
该公司相关负责人表示,下一代大模型的竞争关键不在于单一模态能力的增长,而是从单模态走向多模态,并最终走向原生统一的全模态。从HiDream-O1-Image到HiDream-O1-World,再到本次发布的HiDream-O1-Embodied,智象已经逐步形成了覆盖视觉模型、交互式世界模型及具身世界模型的完整模型家族矩阵,这既是原生全模态技术在多领域铺展的成果,更体现了其强大的内生进化能力。
具身世界智能的核心,是让AI真正踏入现实世界,在充满不确定性的物理环境中获得持续学习与自适应能力。从早期的符号推演,到数据驱动的大模型爆发,再到面向实体交互的具身范式,通用人工智能正完成从虚拟走向现实的关键演进。AI不再仅仅停留在“看懂世界”,而是走向“在世界中行动,在交互中成长”。世界模型的下一场竞争,终将发生在真实物理场景之中,而中国的AI企业也将在这场竞争中占据一席之地。

