物理语言:AI连接真实世界的新接口——PhiZero模型探秘

当人工智能从纯数字空间走向真实物理世界,一个关键的空白逐渐显现:自然语言是人类和数字世界交互的核心接口,但物理世界的运行逻辑,是否也能拥有一套属于自己的“语言”?
PhiZero是一款围绕物理语言构建的世界模型,相关研究论文题为《PhiZero: A World Model Built Around Physical Language》。
PhiZero的核心应用能力
在深入解释物理语言之前,我们可以先看看PhiZero已经实现的多项核心能力:
物理真实的视频世界建模
PhiZero可以精准建模海浪拍击岩石、液体注入容器、物体落入热油、金属罐爆炸等复杂物理过程,并生成连贯且符合物理规则的后续演化画面。与仅追求单帧视觉逼真的模型不同,它更关注事件的完整性和物理后果的连续性。
跨形态的运动迁移
物理语言的核心是描述“如何变化”而非“谁在变化”,因此同一段状态转移逻辑可以被复用在不同的载体上。比如,PhiZero可以直接将人类运动视频中的动作逻辑,迁移到人形机器人上,整个过程不需要人类和机器人的成对训练数据;类似地,人手的抓取、腕部运动等动作,也可以无缝迁移到灵巧机械手上。这种能力还可以用于仿真到现实的转换,保留仿真场景中的交互过程,替换为真实视觉外观后重新渲染。
可交互的图像到世界探索
PhiZero支持连续可修改的控制输入,用户可以通过移动、视角调整等指令,让模型动态更新未来的世界场景,同时尽可能保留原有场景的地标、空间关系和整体一致性。
带动作条件的场景建模
针对驾驶场景,PhiZero可以根据初始场景和不同的转向控制轨迹,生成对应不同驾驶方向和幅度的未来画面;对于机器人交互场景,它可以将抓取、舀取、双臂协作等动作轨迹转换为物理语言,再渲染出细粒度的机器人交互细节。
为什么物理语言是必要的?
当前的视频世界模型已经可以生成视觉效果逼真的未来画面,但“看起来像”并不等于“物理上对”。比如网球撞击玩具鸭后鸭子是否会被推开?物体落入热油后液体如何飞溅?金属罐爆炸后火焰、碎片和阴影会如何连续变化?这些问题考验的不是模型生成清晰像素的能力,而是它对状态转化、动作后果和因果链的理解能力。
传统的视频世界模型通常直接在高维像素空间中预测未来,物理规律被隐含在庞大的视觉预测器中,模型更像是在“猜测下一段画面”,而非显式推理“接下来会发生什么”。PhiZero的设计正是为了改变这一点。
什么是物理语言?
PhiZero通过自监督学习从海量真实视频中,提取出一种紧凑且离散的物理语言。它不会描述物体的颜色、纹理等外观细节,也不会对每一个像素进行冗余编码,而是专注于记录物体如何运动和交互、世界状态如何从当前时刻演化到下一刻。
举个例子,场景中物体的静态外观可以由初始画面直接提供,而液体的倾倒、扩散和流动等动态过程,则由物理语言来表达。这种设计将“世界的样子”和“世界的变化方式”在表示层面分离,让运动和交互的模式可以被保留、组合和迁移,即使场景外观、物体形态发生改变,核心的变化逻辑依然可以复用。
先推理,再渲染的建模范式
PhiZero采用了先推理、再渲染的世界建模流程,整体分为两个核心步骤:
第一步是学习物理语言:Tokenizer会从视频中提取相邻世界状态之间的变化,将其压缩为离散的符号序列。初始画面负责提供场景和物体的静态外观,预训练的扩散解码器则负责补全视觉细节,因此有限的符号容量可以更专注地记录“发生了什么变化”。
第二步是用物理语言推理未来:Reasoner以当前画面和动作意图为输入,先自回归地预测未来的物理语言序列,再由扩散解码器将这段世界演化过程渲染为完整的视频。
现在的世界是什么状态 → 接下来会怎样变化 → 这种变化在画面中如何呈现
这种流程将未来视频的生成拆解为三个清晰的环节。在一个4秒、8FPS、分辨率512×896的视频中,PhiZero仅使用256个离散物理语言符号来表示第一帧之后的状态转移,而常规视频模型则需要数倍的连续视觉token,展现出极高的压缩效率。实验显示,这种高度压缩的编码依然能保持领先的重建质量,保留的是支撑世界演化的关键物理信息,而非冗余的外观细节。
从海量视频中学习世界的变化规律
物理语言的学习依赖大量的真实经验。PhiZero的训练数据经过了多层筛选:首先从海量真实世界视频中进行去重、质量过滤和镜头筛选,得到无标注视频用于预训练Tokenizer;随后结合真实和仿真数据,构建大量短时长视频片段,进一步学习更丰富的状态转移模式;最后筛选出运动显著、物理过程清晰的视频片段,强化Reasoner对物理演化的推理能力。
整个过程没有预先定义特定物理概念对应的符号,物理语言是模型通过压缩、重建和预测大量视频数据,从观看世界的过程中自发涌现的:模型逐渐学会识别哪些变化模式值得被记录,以及它们如何组合成连续的世界演化。
物理语言助力世界模型理解真实世界
PhiZero在多项物理视频生成和理解基准任务上进行了系统评测。在多项视频生成基准中,PhiZero分别在物理结果一致性、物理规律遵循和综合世界建模指标上取得了领先表现,相比直接生成像素的视频模型,它能更精准地捕捉碰撞后的位移、重力导致的形变、连续链式反应以及随物体运动变化的阴影等物理细节。
在多项视频理解基准中,PhiZero同样展现出有竞争力甚至领先的结果,它可以比较两段视频在物理语言空间中的合理性,从而识别出违反直觉物理或因果关系的事件。这说明物理语言不仅是视频生成的压缩编码,更是模型判断“什么更可能在真实世界中发生”的核心依据。
打造AI与物理世界的新接口
自然语言的价值不仅在于描述世界,更在于提供了一种抽象、组合、推理和交流知识的方式,物理语言的愿景也与此类似。PhiZero是这条路线上的早期探索:当世界的演化过程被压缩为一种可预测、可传递的中间语言后,生成、理解、控制和迁移可以在同一个框架中建立联系。
未来,物理语言可以进一步服务于多模态模型的时空理解、具身智能体的规划以及跨机器人形态的技能迁移。更大规模的训练数据、更强的模型架构和更长时间跨度的推理能力,也将帮助物理语言描述更丰富的真实世界场景。正如自然语言连接了人工智能与数字知识,我们期待物理语言能够成为连接AI智能与真实物理世界的新接口,让AI不仅能看见世界,更能用世界自己的语言理解它的演化逻辑。

