视频生成→4D几何:Latent-to-4D突破先解码后重建瓶颈

当前的视频生成模型已经具备了类似专业导演的创作能力,只需简单的文本提示就能编排角色动作与镜头语言,输入单张图像就能补全后续动态画面,结合姿态、轨迹或外观控制还能精准匹配创作意图。但这类模型生成的依然是固定视角的二维视频,无法让用户绕到物体背后自由切换观察视角,更不能直接将其中的角色和场景导入游戏引擎、机器人仿真器或VR/AR系统中进行交互操作。
看起来逼真的视频更像一个虚拟世界的残影,而非真正可被观察和操作的三维空间。那么,视频模型在生成过程中学习到的外观、运动与空间线索,能否跳过像素层面,直接转化为动态的三维几何内容?
来自相关研究机构的团队给出了全新的解决方案:Beyond Pixels,即越过像素,直接从视频的latent空间走向完整的4D动态世界。
论文:https://arxiv.org/abs/2608.10744
项目主页:https://hayd-zju.github.io/Beyond-Pixels/
GitHub:https://github.com/hayd-zju/Beyond-Pixels
Hugging Face:https://huggingface.co/papers/2608.10744
目前利用视频生成先验构建4D内容主要有两条主流路径。第一种是“先生成再重建”:先通过视频DiT在latent空间完成去噪,再用VAE Decoder将latent解码为RGB视频,最后由独立训练的4D重建模型读取像素信息,还原相机轨迹与动态几何。这条路径看似顺理成章,却存在多次不必要的“翻译往返”:生成latent→RGB视频→重建特征→4D几何,每一次跨表示的转换都可能造成信息损失。
更棘手的是,视频生成器与4D重建模型的训练数据分布差异极大:前者面向开放世界的海量内容,后者则多在规模更小、场景更集中的重建数据上训练。当生成视频出现闪烁、遮挡错误、局部形变或时间伪影时,重建模型还会将这些像素层面的问题固化为几何孔洞、破碎表面和不稳定的运动轨迹。
第二种路径是直接改造现有视频生成模型,让其原生输出深度、点云或动态高斯内容。这种方式虽然跳过了独立的重建步骤,但往往将4D能力绑定在特定的生成架构上:更换DiT的模型架构、参数规模或条件输入形式,都需要重新进行成本高昂的几何监督训练。
一边是可组合但容易出现误差传递,另一边是效果直接却难以迁移适配,这两种方案都陷入了两难的困境。Latent-to-4D正是为解决这个问题而提出的全新思路。
研究团队注意到一个关键细节:不同的视频DiT未必拥有相同的架构、参数量和条件输入方式,但它们很可能共享同一个VAE模型。只要VAE的检查点、latent归一化规则、张量布局、压缩规范和latent形状保持一致,不同DiT最终生成的latent就处于完全相同的表示空间中。
换句话说,即使使用不同的视频DiT,只要遵循同一套VAE规范,在完成去噪步骤后,它们生成的latent都使用同一种“latent语言”。而这个最终的latent已经包含了上游条件决定的全部信息:画面中的主体内容、运动方式、镜头变化等,更重要的是,它还处于RGB解码之前的阶段。
基于这个发现,团队找到了一个此前未被充分利用的接口:将视频模型最终去噪后的VAE latent,直接作为显式4D预测的输入。基于这个思路,研究团队提出了Latent-to-4D框架,以及负责连接两种表示空间的核心网络——Latent-to-4D Alignment and Refinement,简称L4AR。
视频VAE生成的latent并不能直接送入预训练的4D解码器,虽然两者都具备时空结构,但时间分辨率、空间网格与特征维度都存在差异。L4AR的核心任务就是完成这场跨表示的“同声传译”,整个过程可以拆分为三个关键步骤:
第一步:对齐时空网格与特征维度
L4AR首先通过三线性重采样,将视频latent调整到4D解码层级所需的时空分辨率。随后,一个可学习的3D卷积会同时观察局部空间区域和相邻帧的内容,将视频latent投影到4D token所需的特征维度。这个步骤不仅是调整形状,还会在初始对齐阶段聚合局部的运动与外观信息。
第二步:兼顾单帧细节与全局时空逻辑
完成局部对齐后,模型还需要推理长距离的特征对应、视角变化与整体动态结构。L4AR交替使用两种注意力机制:Frame Attention负责在单帧内部整理空间结构,守住物体轮廓和局部几何细节;Global Attention则在全部时空token之间交换信息,建立跨帧运动、镜头变化与长距离特征的对应关系。
第三步:从4D latent解码出动态三维世界
经过多层细化处理后,4D Decoder会预测每一帧的相机参数、深度信息和世界空间射线,并将这些信息组合为统一坐标系下的动态点图。最终的结果不再局限于原始视频的固定镜头,用户可以自由改变观察视角,查看场景和物体在时间维度上的三维变化。
Latent-to-4D还有一个非常巧妙的训练设计:在训练阶段根本不需要运行视频DiT模型。研究团队先用冻结的Wan VAE对已有的重建视频进行编码,得到observed-video latent,再利用这些视频自带的相机与几何标注信息,训练从latent到4D的下游路径。
在整个训练过程中,视频生成器、VAE和预训练4D模型的原始Transformer权重全部保持冻结,需要更新的只有三个部分:latent对齐模块、基于LoRA的轻量时空细化参数,以及相机与几何预测头。
到了推理阶段,只需要进行一次简单的替换:将真实视频编码得到的latent,替换为兼容的视频DiT生成的最终去噪latent。后续的L4AR和4D Decoder完全保持不变,也不需要进行测试时的适配调整。
那么为什么文本、图像、姿态和轨迹等多种输入条件,可以共用同一条处理路径?这是因为这些条件的效果已经被视频模型整合到了最终的latent中,对于L4AR来说,它不需要额外知道上游执行的究竟是哪一种生成任务。
4D几何监督数据一向十分稀缺,但这项工作并没有重新采集一套全新的巨型数据集。Latent-to-4D的最终训练阶段仅使用了约1000条已有的重建视频。在此基础上,同一个模型检查点可以原样接入三种不同的视频DiT:Wan2.1-T2V-14B、Wan2.1-T2V-1.3B和Wan2.2-I2V-A14B。
这三款模型覆盖了不同参数规模的文本转视频模型和图像转视频模型,但它们共享同一套Wan VAE。在切换不同的DiT时,不需要重新训练,不需要为不同的条件任务增加分支,也不需要进行测试时的微调。视频模型负责“想象内容和运动”,而Latent-to-4D则提供了一个统一的4D输出接口。
为了清晰验证方案的提升效果,团队设计了严格的same-latent对比实验。Latent-to-4D与Wan+4RC基线模型使用完全相同的生成latent,二者的唯一区别在于:Wan+4RC遵循传统路径:latent→RGB→4D重建;而Latent-to-4D则直接通过L4AR完成latent→4D解码。
评测分别在两个测试集上进行:由200个文本条件案例构成的Text4D-200,以及由200个图像条件案例构成的I4D-200。在Image-to-4D测试中,Latent-to-4D在论文报告的全部指标上都排名第一。
更值得关注的是,当14B和1.3B两个不同参数规模的Text-to-Video DiT接入同一个模型检查点后,最终的DINO-F1指标分别为57.01和57.09,结果非常接近。这为“共享VAE的latent可以作为统一接口”提供了直接的实验证据。
定性的对比结果更加直观。在机械师检修汽车、火与水元素互动、阳台衣物摆动以及植物叶片等案例中,传统重建方法容易遗漏背景、细长结构或大面积表面。而Latent-to-4D则保留了更完整的主体和周围场景。
在Image-to-4D测试中,测试场景进一步覆盖了室内瀑布、真实人物、自然景观与相机运动等多种类型。除了自动量化指标外,团队还邀请了50名参与者进行匿名、多视角的人类评估。每位参与者可以播放动态结果,并主动改变观察视角。评估结果显示:
- Text-to-4D任务的几何与完整度偏好率达到66.8%,总体质量偏好率为65.7%;
- Image-to-4D任务的几何与完整度偏好率达到72.1%,总体质量偏好率为70.6%。
如果Latent-to-4D只能支持文本和图像输入,那么它仍然只是两个任务的简单组合。真正具有想象力的地方在于:L4AR读取的是条件已经完全生效后的最终latent。因此,当兼容的视频模型获得新的控制方式时,这些能力也有机会沿同一接口进入4D世界。
论文展示了多种控制结果:通过运动控制生成滑板运动的动态4D场景,通过外观控制为蒙娜丽莎戴上墨镜,通过姿态序列驱动机器人厨师完成动作,以及让角色沿指定路线移动。研究团队还测试了更贴近现实世界动作建模的案例:机器人用勺子舀取物体、把衣服放入篮筐、打开收纳箱,以及关闭消防柜门。
需要明确的是,这项方案也存在清晰的边界。首先,Latent-to-4D的统一性建立在shared-VAE convention之上,不同的视频模型需要共享VAE检查点、归一化规则、张量布局、压缩规范,并支持兼容的latent形状。因此,它并不是可以无条件接入任意视频DiT的通用方案。
其次,论文中使用的投影DINO指标衡量的是从新视角观察时的可见几何一致性与完整性,并不等同于生成场景已经达到了度量级的4D精度。机器人操作、导航和轨迹案例验证的也只是接口的兼容性,而非动作的成功率或物理正确性。
这些限制并没有削弱这项工作的核心价值,反而让结论更加明确:Latent-to-4D解决的是如何将视频生成先验以统一、直接的方式转化为显式4D预测的问题,而非一次性解决所有的世界建模难题。
长期以来,我们习惯将RGB作为不同视觉模型之间最通用的接口。它直观可展示,也方便后续模型读取,但RGB同时也是一道信息瓶颈:生成模型已经压缩在latent中的运动与结构线索,需要先还原为像素,再由另一个模型重新推测一遍。
Beyond Pixels提出了另一种可能:将共享的最终去噪latent,作为视频生成和4D几何预测之间的统一接口。这样一来,视频DiT不需要被改造成专门的几何模型,4D解码路径也不需要跟随每一种生成条件反复训练。
当视频模型继续获得更强的角色动画、相机控制、轨迹控制、世界动作和交互生成能力时,一个共享的latent-to-4D接口,将成为这些能力进入动态三维空间的高速出口。视频生成的终点或许从来不只是更逼真的一帧帧像素,而是让像素背后的那个虚拟世界,真正拥有完整的空间与时间维度。

