智象HiDream V1:以物理规律驶向世界模型

近期,智象推出的HiDream-O1-Video-1.0(下称HiDream V1)视频模型再次引发了行业关注,这款产品的实际表现确实可圈可点。不少同行都会将它和Seedance 2.5、MiniMax H3、阿里Wan 3.0、Kling等主流视频生成模型放在一起比较,从表面看它们确实属于同类产品,核心逻辑都是通过输入图片、文本或其他素材生成一段视频。
但如果深入观察就会发现,智象走出了一条完全非共识的路线:行业内多数玩家比拼的是生成视频的画质、时长与生成成本,但智象却始终将研发重心放在物理规律的理解和模型智能水平的提升上。从官方发布的技术文档不难看出,智象的目标绝非仅仅打造一款能和竞品一较高下的视频生成工具。
这家公司的真正逻辑,是通过一套统一的底层架构,逐步串联起图像、视频、3D空间和动作理解能力,最终的研发方向是通用世界模型。此次推出的视频模型,更像是他们在通往世界模型道路上的阶段性成果。
事实上,在推出HiDream V1之前,智象已经陆续发布了Image、World和Embodied三款模型,这三款产品都是其迈向世界模型过程中的重要铺垫。
Image模型主要解决静态图像的理解问题,让模型能够识别画面中的人物、物体、位置关系以及彼此间的互动逻辑,本质上是让模型学会理解现实世界某一个瞬间的状态。而HiDream V1作为Video模型,则补上了动态演化理解的短板:让模型从单纯识别静态二维画面,进阶到理解包含时间维度的动态世界,不仅能知晓画面中的元素,还能推演事物的运动轨迹、状态变化以及前后事件的物理逻辑。这一步也是从图像模型迈向世界模型的关键转折点。
在HiDream V1发布同期,其在Artificial Analysis Image to Video Leaderboard(With Audio)榜单中位列全球第四,跻身全球视频模型第一梯队,这一成绩也进一步印证了智象在动态世界建模与音画一体化生成上的技术积累。
再往前的World交互式世界模型,目标是让模型能够理解三维空间关系,知晓空间内的前后左右方位,甚至支持在虚拟空间内移动和交互。而Embodied模型则聚焦物理世界与动作理解,毕竟通用世界模型最终需要为具身智能提供底层支撑,不仅要理解空间,还要掌握动作逻辑。要真正理解动作及其带来的反馈,模型首先需要明白世界如何随时间变化,以及变化背后的物理规律,这正是Video模型为整个模型体系补上的核心能力。
举个简单的例子,一个球从手中掉落至桌面,不会凭空从一个位置跳到另一个位置,而是会先下落、撞击桌面后反弹,随后振幅逐渐减小直至静止。如果模型想要真正理解这个过程,就需要明白变化的因果关系和底层物理逻辑,这也是智象始终强调物理规律的核心原因。在全行业都在比拼生成时长和单价的当下,将核心研发资源投入到物理规律的理解上,无疑是一步极具前瞻性的非共识选择。
我们可以通过几个实际生成案例感受HiDream V1对物理细节的把控。比如拉拉链的生成场景,多数模型虽然能完成动作,但整体效果略显生硬,而HiDream V1生成的视频中,拉链头移动时会轻轻带动包身,已经拉开的区域会自然分开,甚至连摩擦声都贴合日常经验。
再比如撕包装袋的场景,模型需要准确还原袋子受力后的形变细节:手指用力时包装袋会自然起皱,撕开的边缘纹理也足够真实,即便是近景特写也没有明显的破绽,手指和铝箔的质感都还原得相当到位。
还有一个生活化的生成案例,用户仅用一段口语化的描述作为提示词:“拍一个15秒的轻松生活短片:一个短发、戴圆框眼镜、穿橙色上衣的人在家偷偷练舞,越跳越觉得自己特别帅。跳舞时自然转了一次身,随后发现自家的猫一直坐在旁边看着自己,瞬间有点尴尬,假装若无其事地整理了一下衣服。在15秒内把这个小故事讲完整,自行安排各阶段节奏和镜头,可以自然切换全身、中景和面部近景。人物表演和猫的反应自然,笑点靠前后反差与短暂的停顿,不要夸张表演。全程保持同一个人的面部、发型、眼镜和服装,保持同一只猫、同一个房间。声音配合情绪变化,无旁白。”
用户没有给出具体的分镜脚本,也没有指定镜头切换的时间点,但模型能够自行理解故事的笑点和节奏,自主安排人物表演、猫咪入镜等细节,最终生成的短片完整且自然,完成了整个叙事逻辑。
还有一个考验物理规律的案例:抽走最下方的支撑书本,观察中间的书本和橡皮的下落过程。这个场景对模型的重力和受力变化理解能力要求极高,多数模型在这类细节上很容易出现逻辑破绽,但HiDream V1生成的视频中,物体的运动轨迹和交互逻辑都贴合真实物理规则。
不难发现,当模型真正理解物理规律后,生成视频的运动轨迹、物体交互和前后状态都会更加自然连贯,这带来的不只是画质提升,更是让视频生成从“看起来像真的”进阶到“事情真的会这样发生”,这才是决定视频模型能力上限的核心关键。
还有一个值得关注的细节,智象始终在强调“原生全模态”的概念,在过往的产品发布中也多次提及这一理念。而行业内更多听到的是“原生多模态”,一字之差却体现了智象的又一次非共识布局。
两者的核心差异在于:传统的多模态更多指模型能够同时处理多种类型的信息,比如同时理解文本、图片、视频和音频,只要支持两种以上的模态就可以被称为多模态模型。而智象的UiT架构设想,则是让图像、视频、声音、3D空间、动作等信号从底层就接入同一套Transformer架构,让模型直接学习不同模态之间的关联关系,最终目标是实现Any to Any的能力:输入任意一种模态的数据,都可以输出任意其他模态的内容,比如输入文字生成视频、输入图片生成视频、输入视频生成文字,未来还可以实现输入动作或空间信息生成其他类型的内容。简单来说,多模态强调“能处理多种信息”,而原生全模态则强调“多种信息从底层统一学习,实现双向转换”。
回到世界模型的赛道,目前行业尚未形成统一的标准路线。Yann LeCun提出的JEPA路线更侧重预测后续状态,即在给定当前状态的前提下,让模型预测世界接下来的变化,但该路线更关注抽象表示空间内的预测,而非逐像素生成下一帧画面。李飞飞团队的路线则更强调空间智能,以3D空间为核心,让模型能够生成、重建和模拟一个可以持续存在、支持交互的虚拟世界。而智象走出的是第三条路线:在JEPA和空间智能两条热门路线之外,从视频数据出发,直接通过学习海量真实世界的视频内容来掌握底层物理规律,这条路线的追随者相对更少。
智象的创始人梅涛博士在视觉和视频生成领域拥有近20年的研究经验,是国内少数同时拥有ACM、IEEE、IAPR和CAAI四大顶级学会Fellow头衔的专家,这也让智象在视频生成领域拥有深厚的技术积累。2024年1月,智象率先实现了超15秒的视频生成技术突破;同年7月推出全球首个商用DiT大模型HiDream 2.0;12月发布采用扩散自回归架构的HiDream 3.0,持续推动视频模型从单纯的生成能力向深层理解演进。此次推出的HiDream V1,则是在面向世界模型的新一代UiT架构上的再次升级。
智象之所以如此重视Video模型,核心判断在于视频是当前规模最大、内容最丰富的真实世界数据之一,其中既包含大量第三人称拍摄的日常内容,也有越来越多的第一人称数据,比如佩戴头显或摄像设备记录的操作过程。当模型学习过足够多的这类数据后,就有机会从中提炼出更底层、更通用的物理规律,最终获得更强的泛化能力。
智象始终将图片作为交互入口:图片解决的是“如何理解单个瞬间的世界”,而视频则让模型进阶到“理解世界如何随时间变化”。但真实世界显然不只有画面和时间,还包含声音、空间、动作以及动作带来的反馈,因此智象选择了原生全模态的路线,希望将这些不同类型的信息逐步整合到同一套底层架构中进行统一学习,只有当这些能力完全串联起来,才有可能真正迈向通用世界模型。
整体来看,智象在视频生成赛道接连走出了几步非共识的棋:当行业都在比拼时长和价格时,它专注于物理规律的理解;当大家都在谈论多模态时,它坚持原生全模态的路线;当多数玩家将视频模型作为最终产品时,它将视频视为通往世界模型的铺路石。通用世界模型的赛道还处于早期阶段,跟随共识可以避免掉队,但真正能拉开竞争差距的,从来都是那些具有前瞻性的非共识判断。

