ODEWorld:连续时间物理模型重构视频预测

想象让机械臂完成夹虾入锅的动作:识别目标物体、定位操作区域其实并非最难的环节,真正的挑战在于精准把握夹爪闭合的临界时刻——夹得太早会抓空,夹得太晚又会让虾被推离预定位置;而夹住之后,还需要持续微调夹爪的力度、移动方向与动作速度,整个操作没有暂停的余地,也无法等待摄像头逐帧拍完再推进。
但当前多数视觉世界模型对时间的理解,都建立在摄像头截取的离散帧画面之上:模型只能看到第1帧、第2帧、第3帧,并学习如何在这些固定采样的画面之间跳转。至于两帧之间真实发生的物理过程、更换帧率后的预测逻辑,或是关键帧缺失时的状态还原,这类模型往往没有一条可直接查询的连续轨迹,也就无法应对夹虾这类需要精准把握瞬时动作的任务。
针对这一痛点,来自清华大学智能产业研究院与加州大学伯克利分校BAIR实验室的研究团队提出了ODEWorld——全球首个连续时间具身世界模型。这套方案不再局限于预测“下一帧画面是什么”,而是直接学习世界在每个真实物理时刻的变化方向与速度,进而还原出一条随实际时间连续演化的潜空间轨迹。
研究团队将这套预测范式命名为Physical-Time Flow(简称PT-Flow),基于该范式构建的连续时间潜空间世界模型即为ODEWorld。与传统离散模型不同,PT-Flow不再学习固定步长的状态转移,而是直接建模潜状态关于真实物理时间的导数,也就是潜空间的速度场,用于描述当前状态在下一时刻的变化方向与快慢。给定初始参考状态z0后,未来任意时刻的状态都可以通过常微分方程求解器积分得到。
传统离散建模的固有局限
传统离散建模的核心局限在于,其预测能力被绑定在预先设定的时间步长上:训练视频按照固定频率采样,模型学习的也只是相邻采样点之间的跳转逻辑。当需要查询的时刻落在两个训练帧之间,或是输入序列存在观测缺失时,这类模型无法提供显式的连续轨迹来支撑预测。
静动态分离的潜空间构建
要将视频转化为连续的常微分方程模型,首先需要构建适合ODE描述的状态空间。在机器人操作的视频场景中,绝大多数视觉内容其实保持静止:桌面、墙壁、物体纹理可能连续数秒都没有变化,真正推动任务进程的只有机械臂、夹爪、目标物体以及它们之间的接触关系。如果直接让速度网络同时拟合静态背景与少量运动区域,动态信号会被大量零变化的特征与噪声淹没。
因此ODEWorld没有直接在像素空间或原始视觉特征上构建速度场,而是先通过冻结的DINOv2编码器将图像压缩为视觉特征,再通过一组以初始状态为条件的动态编码器与解码器,提取出真正负责描述变化的潜变量。编码器与解码器都可以直接访问初始参考状态s0,因此静态场景的信息可以直接从参考状态中获取,动态潜变量zt无需重复保存背景信息,只需要概括当前状态相对于s0发生的变化。
这种静动态解耦的设计带来了极高的表征压缩效率:原始DINO特征的尺寸为16×16×768,而ODEWorld的动态潜变量仅使用一个1×768的token。基于这个单token,速度场只需要一个轻量的三层MLP进行参数化,时间信息通过FiLM技术注入,zt、z0与目标条件c共同决定速度网络的输出结果。
直接监督状态的时间变化率
拥有紧凑的潜空间并不意味着模型一定能学到稳定的连续动力学,潜空间世界模型长期面临的一个典型问题是表征坍缩:如果编码器将不同画面映射到过于相似的向量,预测器可以轻松获得较低的训练损失,但这些向量将不再包含足够的状态信息来支撑准确预测。
ODEWorld的关键设计之一,就是不再仅比较预测状态与目标状态是否一致,而是直接监督潜状态的一阶时间导数。根据链式法则,由于初始参考状态s0在一次预测过程中保持不变,其关于时间的导数为零。尽管训练数据仅提供离散帧,研究团队可以利用相邻帧的特征估算变化速度,并通过雅可比向量积(JVP),无需显式构建巨大的雅可比矩阵,就能将视觉特征空间中的变化速度投影到动态潜空间,得到所需的速度场监督信号。
速度网络的训练目标围绕这一监督信号构建,其中sg表示停止梯度,用于稳定速度场的优化过程。实验显示,即使移除停止梯度,模型仍然可以有效训练,说明一阶速度约束本身已经为潜空间提供了较强的结构性约束,能够有效避免表征坍缩。与典型的JEPA式训练不同,后者通常需要预测潜变量接近目标编码器生成的潜变量,并依赖EMA、停止梯度或额外的方差与协方差约束来防止坍缩,ODEWorld将“状态如何沿时间移动”直接写入了监督目标:如果所有状态都坍缩到相同的表示,模型将无法解释非零的真实变化速度。
论文通过RankMe指标衡量表征的有效秩,在相同采样协议下,ODEWorld的768维动态潜变量平均有效秩为425.2,而DINOv2 CLS特征为376.1,V-JEPA 2的1024维表征仅为203.7。更高的有效秩意味着潜空间保留了更多彼此独立的变化维度,也证明了单token的动态潜变量并不等同于信息贫乏。
噪声抑制的平滑处理
理论上,最简单的状态速度可以通过相邻帧的特征差分得到,但ODEWorld使用的冻结DINOv2图像编码器主要为单帧视觉表征设计,并未专门保证连续视频中的时间一致性。即便像素仅发生轻微变化,相邻帧的特征也可能包含高频抖动,直接将这些差分作为物理速度会将视觉编码的噪声一并传递给速度场。
因此研究团队使用Savitzky–Golay导数滤波器来估计潜状态的变化速度。该滤波器会在局部窗口内进行多项式平滑与求导,在抑制高频噪声的同时,尽可能保留接触、抓取与物体移动等关键的任务相关变化。潜轨迹可视化结果显示,ODEWorld生成的轨迹比原始DINO特征以及离散下一步预测基线更加平滑,同时仍保留了原特征空间的主要几何结构。
这一设计也揭示了PT-Flow的重要边界:模型学习的并非已知的解析物理方程,而是从数据中寻找一个适合连续积分、同时能保留任务语义的潜空间动力系统。它追求的是可用于未来预测的连续表征,而非从视频中恢复唯一的真实控制方程。
统一的生成能力体系
完成训练后,ODEWorld的未来预测不再需要重复调用固定步长的下一帧模型,而是可以直接使用RK4等现成的ODE求解器沿速度场进行积分。查询的时间点可以自由选择,由此自然衍生出三类核心生成能力:
第一类是任意时间分辨率生成:如果希望模拟更缓慢的动作,可以在轨迹上查询更多更密集的时刻;如果需要快速推进任务,则可以减少采样点。模型无需为不同的播放速度单独进行训练。
第二类是时间补全:研究团队将训练序列降采样到原始帧率的三分之一,ODEWorld仍能查询训练数据未提供的中间时刻并生成连贯的状态。这里的“补帧”并非简单的像素插值,而是从学习到的潜空间动力学轨迹中解码对应时刻的状态。
第三类是反向生成:只需要将积分方向反转,即令时间导数取反,同一套速度场就能生成物理上合理的反向序列。这并不意味着模型能够还原任意系统唯一真实的历史,也不代表所有现实过程严格可逆,而是说明模型学习到的潜空间流可以在相反方向上进行稳定的数值积分。
高效且稳定的长程预测
ODEWorld的高效性首先来自表征空间的压缩:它没有在高维像素或完整视觉特征上反复预测,而是将与运动相关的信息集中到一个动态token中,在紧凑的潜空间中求解状态随时间的变化,大量与当前运动无关、在相邻帧中基本保持不变的背景与外观信息,无需在每一步预测中重复计算。
第二层效率来自速度场本身:由于动态状态已经被压缩到单token,负责描述潜状态变化率的网络只需要一套三层MLP,无需依赖庞大的逐帧生成网络。ODE求解器先在低维潜空间中完成整条轨迹的积分,只有需要输出具体画面时,模型才通过动态解码器与图像解码器恢复视觉结果。换言之,ODEWorld将主要计算资源用于“世界如何变化”的建模,而非在每个时间点重新生成一整个完整的世界。
在LIBERO视频预测实验中,各方法的短时与长时预测结果表现如下:PSNR指标衡量预测画面与真实画面在像素层面的接近程度,数值越高代表效果越好;LPIPS指标更关注人眼感知到的结构与语义差异,数值越低代表效果越好。
在短时16帧预测任务中,ODEWorld达到了20.53的PSNR与0.109的LPIPS;当预测范围延长到64帧后,两项指标仍保持在19.46与0.134,均优于LDP与V-JEPA 2。速度上的差距则更为直观:生成64帧画面时,LDP的延迟为3.953秒,V-JEPA 2为0.619秒,而ODEWorld仅需0.072秒,约为LDP的1/55、V-JEPA 2的1/8.6。将动态表示压缩到单token,并用轻量速度场完成连续积分,不仅减少了模型内部的表示规模,更切实转化为了端到端预测的效率提升。
范式升级:从帧预测到变化建模
ODEWorld最重要的意义,并非仅仅是极致压缩带来的性能提升,而是将世界模型的学习对象从“离散状态之间的映射”转向“状态随物理时间的变化率”。静动态解耦为连续动力学清理了表征空间,雅可比向量积将离散视频中的变化速度投影为可监督的潜空间导数,单token与轻量速度网络则让ODE积分能够以低成本运行。任意时间采样、缺帧恢复与反向生成,由此不再是彼此独立的功能,而成为同一条潜空间速度场的不同使用方式。
对具身智能而言,这种范式升级或许比“多预测几帧”更具价值。机器人真正需要理解的,并非静态世界由哪些像素组成,而是当它接近、接触并移动一个物体时,世界正在如何变化,以及这种变化接下来会将它带向何处。当世界模型开始直接学习这种变化,对未来的预测才能从逐帧的简单模仿,进一步走向连续的动态推演。
相关研究的论文链接:https://arxiv.org/abs/2607.27924


