智象发布具身世界模型 登顶RoboColiseum扰动榜

近期,智象未来正式推出具身世界模型HiDream-O1-Embodied。这款产品依托原生全模态的技术理念,重点强化了机器人的物理感知与动态预判能力,能够帮助具身智能实现更高阶的物理交互操作。该具身模型的发布,也标志着智象逐步完成了打通图像、视频、3D、动作等多模态数据,贯通理解、推演、执行全流程,构建统一世界模型基座的技术闭环。
该模型在发布同期首次参评具身智能模型评测平台RoboColiseum,便在核心的扰动适应(Robustness)子榜单中,以平均分0.692的成绩拿下榜首位置。
智象未来CTO姚霆表示,围绕真实世界的表达、理解和生成,只有构建同时具备全模态表达、因果推演与物理世界构建三大核心能力的基座,才能建立完整的世界模型体系。智象的原生全模态世界模型技术理念,从最初的架构设计阶段就规划了面向包括动作在内的全模态统一表征构建方向。HiDream-O1-Embodied的发布,是该技术战略从“模拟世界”迈向“真实世界”的关键里程碑。
登顶RoboColiseum:0.692分背后的硬核评测逻辑
作为常态化的具身智能仿真评测平台,RoboColiseum旨在搭建多维度的系统评测体系,通过与真机表现高度一致的仿真测试,帮助开发者清晰识别模型的能力优势与短板,从而持续迭代优化模型性能。该平台面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果,致力于打造一套结果可信、过程可复现的具身模型评测标准。
平台基于高保真仿真环境搭建,高度还原真实世界的运行逻辑,围绕指令跟随、空间理解、扰动适应与通用操作四个核心维度,设置了4类能力子榜共计78个高保真仿真评测任务。自内测上线以来,已经吸引了海内外数十款重量级模型参与评测。其中,扰动适应环节被公认为最具挑战性的测试项,它通过调整背景、光照、材质、机器人初始状态、相机位置与图像质量,同时对指令进行多样化改写,以此检验模型在非理想环境中的稳定性与泛化能力——这并非在实验室的理想环境中测试,而是在各类真实场景的“意外”状况下检验模型的真实实力。
HiDream-O1-Embodied能以0.692分登顶该榜单,核心得益于其原生全模态底座。原生全模态世界模型天生为跨模态的理解与生成提供了坚实基础,而为了保证模型在真实世界的各类“意外”场景中保持稳定运行,该模型在三项核心能力上实现了突破性创新,让理解更精准、感知更稳健、抗干扰能力更强。
语言理解:跳出关键词匹配的固化思维
传统机器人对语言指令的理解往往仅停留在关键词匹配层面,比如能听懂“把杯子拿过来”,但换成“给我拿个杯子”或者“杯子递我一下”这类相近表述时,就容易出现执行障碍。而HiDream-O1-Embodied覆盖了多元动词、句式与表达方式的等价指令空间,不会被固定句式束缚,而是直接锁定用户的真实意图。无论指令如何变换,模型都能穿透字面表述,精准直达用户的核心需求。
视觉感知:多视角协同补全,告别单点失效
在真实物理场景中,机器人的视觉通道很难始终处于理想状态:相机位置可能发生偏移,标定精度会随使用时间出现变化,单路画面也可能出现遮挡或受到外界干扰。HiDream-O1-Embodied会综合多个视角的视觉信息,让不同视觉通道互相补充,而非依赖某一个固定视角。当部分视觉信息出现偏差或暂时无法正常获取时,模型依然可以借助其他视角完成场景理解、任务判断,并继续执行操作,让系统从“一处失灵、全局失效”的脆弱状态,转变为“局部受限、整体仍可运行”的稳健形态。
高容错设计:在非理想环境中打磨稳定执行能力
多数主流模型的训练都是基于“完美数据”——比如清晰的图像、完整的画面、标准的拍摄视角,但真实世界的运行环境从来都不是理想化的。光照变化、画面污损、视野遮挡、信号波动,都是机器人实际运行时可能频繁遇到的日常状况。
HiDream-O1-Embodied在训练阶段就主动引入了多种非理想条件,让模型反复面对不完整、不稳定的信息输入,并从中学习如何从有限线索中做出可靠判断。经过这样的训练,模型不再只追求理想条件下的最优表现,而是更加重视复杂环境中的持续稳定运行。这种容错能力并不局限于某一种视觉异常,当面对光照、外观和场景变化时,模型可以更灵活地利用已有的信息,减少环境变化对任务执行的影响。对这款模型而言,真正重要的不只是“看得清时做得好”,更是“条件不理想时,依然能够稳稳完成任务”。
模型与数据双驱动:构建“真实基座+生成增强”的数据生产体系
HiDream-O1-Embodied在训练中具备的“见过足够多不完美场景”的能力,并非凭空形成,这背后触及了一个行业底层命题:模型的认知边界,由它所接触的数据范围和质量决定。而高质量的训练数据,正是具身智能训练中最稀缺也最具决定性的变量。智象打造的“模型+数据”双驱动策略,正是其能够登顶具身世界模型榜单的核心护城河。
该策略的关键突破口,在于让数据生产本身成为模型迭代优化的有机组成部分。为此,智象探索出了“真实基座 + 生成增强”的数据生产范式,让模型不再被动接收数据,而是主动参与到数据的创造过程中。
以与合作伙伴的合作为例:高精度真人动作捕捉数据作为真实数据底座,智象借助原生全模态能力完成了百倍级的数据精细化扩增。基于单段真实动作样本,模型可以生成大量变体视频:在严格恪守物理约束不变的前提下,切换背景环境、光照条件、物体形态等变量,从而产出海量多元的训练样本。
这一机制的核心在于,模型同时扮演“考生”和“出题人”两个角色:它可以根据自身的能力缺口主动生成针对性的训练样本,形成数据与模型互相驱动的增长飞轮,最终让HiDream-O1-Embodied在面对现实世界的强扰动时,展现出远超同类模型的鲁棒性。
原生全模态世界模型矩阵持续完善
就在不到一个月前,智象刚刚发布了交互式世界模型HiDream-O1-World,并在交互式视频世界模型评测基准WBench的Navi分榜中以平均分80.9的成绩拿下榜首。
交互式世界模型主要解决的是“理解与推演”问题,让AI在数字世界中具备对空间、时间、运动与物体关系的完整认知能力;而具身世界模型则聚焦“操作与执行”,让AI能够在物理世界中完成真实的任务。两者将形成有力互补,为原生全模态世界模型的进一步发展筑牢根基。
正如智象未来创始人兼CEO梅涛博士此前所言,下一代大模型竞争的关键,不在于单一模态能力的增长,而是从单模态走向多模态,并最终走向原生统一的全模态。从HiDream-O1-Image到HiDream-O1-World,再到HiDream-O1-Embodied,智象作为创新型大模型企业,正逐步形成覆盖视觉模型、交互式世界模型及具身世界模型的完整模型家族矩阵。这既体现了原生全模态技术在多领域的落地能力,也展现了其强大的内生进化能力。
站在世界模型前沿技术加速发展的时代拐点,智象正持续加速创新步伐,推动相关技术不断向前落地。

