文章摘要
近期,国内团队研发的HiDream - O1 - World世界模型发布,在实际体验和关键指标上媲美甚至超越海外领先产品Genie 3。它提供漫游和编辑两种交互模式,综合得分高。其核心技术有原生全模态UiT架构等三方面创新。未来可应用于游戏、影视、机器人训练等领域,为国内团队在世界模型领域突围奠定基础。

就在近期,一款名为HiDream-O1-World的世界模型正式对外发布,这款产品的出现,标志着国内在交互式世界模型领域终于实现了对海外领先产品的追赶,甚至在实际体验和关键指标上实现了超越。

从AGI路线看世界模型的价值

实现通用人工智能(AGI)是AI领域长期追求的目标,但目前行业内主要存在两条技术路线。一派以OpenAI、Anthropic为代表,包括学者Andrew Ng在内的研究者也长期支持该方向,他们认为大模型路线仍有巨大潜力,通过持续扩大模型规模、优化推理能力、结合强化学习与智能体(Agent)技术,就能不断提升智能水平。

另一派则以LeCun和李飞飞为代表,他们认为语言虽然重要,但并非世界本身——真实世界在人类语言诞生之前就已经存在,儿童通过在现实中观察、行动逐渐建立对空间、物体和因果关系的理解,而非通过阅读物理教材。因此,真正的智能必须建立在对物理世界的理解之上,这也是世界模型路线的核心逻辑。

这一观点近年来得到了越来越多企业的认可,比如DeepMind的Demis Hassabis去年就明确表示,正在将Gemini向世界模型方向扩展,希望通过模拟现实世界实现规划和想象。而Google推出的Genie 3更是实现了突破性进展,能够根据一句话生成可实时交互的动态世界,用户可以控制角色移动,世界会跟随动作持续生成,且能在较长时间内保持空间一致性。

正是看到Genie 3带来的震撼效果,当HiDream-O1-World正式发布时,其表现让不少行业观察者感到惊喜——这款国内团队研发的世界模型,在实际体验和关键指标上已经可以媲美甚至超过Genie 3。

核心交互能力展示

HiDream-O1-World提供了两种核心交互模式。第一种是漫游模式,用户可以通过键盘直接控制虚拟角色前进、后退、转向,更关键的是,当角色移动时,整个虚拟世界会根据动作实时生成后续内容,而非提前录制的视频片段,这也是它和传统生成式视频模型的核心差异。

第二种是编辑模式,支持通过文字、语音甚至图片输入指令,实时调整虚拟世界的状态和角色行为:用户可以让角色完成奔跑、下蹲、跳跃等动作,也可以修改环境,比如让天空降雨、让杯子掉落,甚至直接调整场景布局,真正实现用户对虚拟世界的直接参与。

根据专业交互式世界模型评测平台WBench的测试数据,HiDream-O1-World的综合得分为80.9,这一成绩使其成为国内首款能够与Genie 3直接竞争的世界模型。当然,目前世界模型领域尚未形成统一的评测标准,不同平台的测试维度也存在差异,但这一成绩已经足以证明国内团队在该领域的突破。

这款模型背后的研发团队智象未来,近期刚刚完成15亿元C轮融资,过去三个月内连续完成三轮融资,累计金额超过21亿元,充足的资金为产品的迭代和落地提供了坚实支撑。

核心技术创新点

HiDream-O1-World的核心技术创新主要体现在三个方面。首先是原生全模态UiT架构,不同于多数多模态模型将不同模态数据分开处理后再拼接的思路,该架构从底层就实现了视觉、听觉、动作、空间关系等多模态信息的统一学习,更贴合真实世界的信息交互逻辑。

其次是Memory+TTT一致性保障机制,其中3D先验记忆模块会记录虚拟场景的空间结构,包括物体位置、墙面布局等信息,避免生成过程中出现空间错位;而Test-Time Training模块则会在模型运行时根据当前场景实时校正生成内容,进一步减少误差积累,保证长时间交互下的世界一致性。

最后,团队在训练过程中加入了大量复杂物理场景数据,包括刚体碰撞、流体流动、柔性物体形变等,让模型能够学习并遵循真实世界的物理规律,避免出现不符合常识的生成结果。

落地场景与未来潜力

当世界模型技术成熟后,其应用场景远超我们的想象。首先是游戏领域,未来的游戏世界将不再需要开发者提前预设所有场景和剧情,玩家走到哪里,虚拟世界就会实时生成对应的内容,甚至推开一扇未设计的门,背后也会自动生成合理的空间。

其次是影视行业,传统电影是导演提前拍摄好的固定内容,而交互式世界模型将让电影变成可进入的虚拟空间,不同用户可以做出不同选择,体验专属的故事线。

除此之外,世界模型还将在机器人训练、自动驾驶等领域发挥重要作用:比如机器人可以在虚拟场景中反复训练各种动作,无需在现实世界中进行高成本的试错;自动驾驶系统也可以在虚拟危险场景中进行测试,避免真实环境中的风险。智象未来已经与相关机器人团队展开合作,通过采集高精度的人类动作数据,再利用生成模型将动作扩展到不同人物、背景和环境中,大幅提升训练数据的丰富度和效率。

目前世界模型领域仍处于早期发展阶段,不同团队的技术路线差异巨大,尚未形成统一的行业标准。但可以预见的是,当代码代理的能力逐渐趋同后,世界模型将成为明年AI领域的核心竞争赛道,而HiDream-O1-World的发布,无疑为国内团队在该领域的突围打下了坚实的基础。

以上内容不代表本平台立场,仅供读者参考