文章摘要
交互式视频世界模型可实时生成后续画面,但长轨迹交互推理成本攀升。联合研究团队提出Light Interaction方案,从自适应上下文管理、轻量级去噪缓存复用、软硬件协同的3D稀疏注意力优化三方面优化。实验显示其能加速推理、降低显存,还提出全新推理范式。

当前交互式视频世界模型正迎来关键升级:不再局限于一次性生成固定时长的短片,而是可以像游戏引擎一样,根据用户的前进、转向、回看等操作实时生成后续画面,让虚拟场景在长时间探索中保持视觉与空间的一致性。但这类长轨迹交互的推理成本会快速攀升——上下文缓存压力、注意力计算量和多步去噪开销都会随交互时长线性放大。

以HY-WorldPlay模型为例,在单张NVIDIA A100 GPU上生成约10秒的交互视频,模型主干推理耗时就超过200秒。为了维持长时场景的一致性,模型需要保留大量历史上下文信息,同时每生成一段视频都要经过多轮Transformer去噪,整体成本难以控制。

联合研究团队提出的Light Interaction方案,无需修改模型参数或重新训练,而是在推理阶段通过交互状态动态调度计算资源:探索新区域时减少不可靠历史的依赖,回访旧场景时充分利用历史约束,局部动态剧烈时精简上下文,状态稳定时复用已有计算结果。

长交互场景下的推理困境

传统视频生成通常在给定文本或图像后一次性生成固定长度的片段,自回归视频生成则会缓存历史片段并按时间顺序逐块延展。而交互式视频世界模型更进一步:用户的相机控制会持续改变需要生成的视角,模型必须在流式生成过程中不断调用历史记忆。当交互轨迹变长时,系统面临的不再只是「多生成几帧」的问题,三类基础推理开销会被显著放大:

  • 历史信息压力陡增:为保持长时场景的一致性,模型需要保留足够的上下文信息,KV缓存的显存占用会成为显著负担;
  • 注意力计算量攀升:当前生成的视频片段需要参考更长的历史内容,上下文越长,模型主干中的注意力模块计算开销越高;
  • 多步去噪成本增加:每生成一段视频片段,模型都需要多次运行Transformer完成逐步去噪,进一步推高整体延迟。

Light Interaction的核心优化思路

这项工作的核心观察在于:交互状态决定了哪些历史信息真正有用,也决定了哪些计算可以被安全省略。探索新区域时,检索到的空间记忆未必可靠;回访已见区域时,历史视角可以提供强约束。局部动态越强,固定保留长时间上下文的收益越有限;而在回访阶段,去噪过程的相邻步骤更稳定,更适合缓存复用。基于这些观察,Light Interaction从三个维度实现了优化:

一、自适应上下文管理

交互式视频模型的上下文主要分为两类:短期时间上下文用于维持画面的运动连续性,空间记忆则用于在用户回访旧场景时保证几何与外观的一致性。Light Interaction通过相机位姿相似度判断当前视角是否存在可靠的历史参考:当最大位姿相似度低于阈值时,系统判定当前处于探索新区域的状态,会丢弃可能误导生成的空间记忆;当相似度达到阈值时,相关历史视角会被保留,作为生成的约束条件。同时,时间上下文不再使用固定窗口,而是根据近期隐向量的变化程度自适应调整——局部动态较强时缩短窗口以减少冗余,状态平稳时保留更多上下文以增强连续性。

二、轻量级去噪缓存复用

去噪缓存的有效性取决于模型输出的稳定性,研究团队通过统计发现,回访旧场景时相邻去噪步骤的相对L1距离整体低于探索阶段,说明在有可靠历史参考的情况下,模型输出更稳定,更适合复用早期去噪结果。因此Light Interaction仅在存在可靠历史参考的回访状态下启用缓存:第一步正常完成去噪计算,中间步骤复用第一步的输出,最后一步仍保留完整计算以校正累计误差;而在探索阶段则保持完整的去噪流程,避免不稳定的输出被反复放大。

三、软硬件协同的3D稀疏注意力优化

稀疏注意力的核心难点在于,理论FLOPs的减少并不一定能带来实际延迟的下降,在自回归视频生成中,当前生成块、历史KV缓存、文本Token和因果布局相互交织,Q/KV长度高度不对称,直接套用通用稀疏注意力方案,很容易被数据重排、内存搬运等额外开销抵消收益。Light Interaction针对自回归视频生成的结构做了针对性优化:保留文本条件KV缓存和当前生成块的稠密计算,仅对历史视觉KV进行3D块的稀疏选择;同时通过Triton算子融合,将Q预处理、KV预处理和张量分发等操作合并,减少中间张量的生成和重复内存搬运。

实验效果与性能表现

研究团队在HY-WorldPlay和Matrix-Game-3.0两个开源交互式视频世界模型上进行了对比测试,同时与Sparse VideoGen、LongCat-Video Block Sparse Attention、TeaCache等无需重新训练的加速基线进行了比较,实验硬件采用NVIDIA A100 80GB GPU,需要说明的是,实验中统计的延迟仅包含模型主干推理部分,不包含固定的VAE解码开销。

测试数据显示,在HY-WorldPlay上生成约10秒的视频,Light Interaction将主干推理延迟从228.60秒降至88.24秒,实现2.59倍的加速,同时峰值显存从76.57GB降至54.66GB;在Matrix-Game-3.0上生成约20秒的视频,延迟从59.70秒降至37.07秒,实现1.61倍的加速。

在质量指标方面,团队报告了PSNR、SSIM、LPIPS、VBench等多维度结果,整体来看Light Interaction并非以牺牲画质换取速度:在HY-WorldPlay上,它在保持较好视觉质量的同时显著降低了显存占用;在Matrix-Game-3.0上,它在保证竞争性质量的前提下实现了最低的推理延迟。

技术意义与未来方向

Light Interaction的核心价值不在于单一模型上的性能提升,而在于提出了一种适配交互式视频生成的全新推理范式:交互轨迹不再仅仅是生成的条件,更可以成为系统的调度信号。相机的移动状态告诉系统当前是探索还是回访,局部场景的动态程度决定了上下文窗口的长度,历史参考的可靠性决定了空间记忆是否参与生成,去噪过程的稳定性决定了哪些计算可以被复用。这让视频世界模型的推理流程从固定的流水线,转变为随交互状态动态调整的自适应系统。

从工程实践的角度来看,这项工作也揭示了算法稀疏化与实际系统加速之间的差距:对于自回归视频生成来说,单纯的稀疏策略不足以保证性能提升,KV缓存布局、算子融合、内存访问路径等细节都会直接影响最终的延迟表现。对于游戏模拟、虚拟场景探索、机器人具身智能训练等应用场景,推理延迟和显存成本是决定技术能否落地的关键门槛,Light Interaction提供了一条现实的优化路线:无需重新训练模型,只需在推理阶段充分利用交互状态来调度计算资源。

结语

如果说早期的视频生成技术关注的核心是「生成内容是否逼真」,那么交互式视频世界模型还需要解决另一个关键问题:如何实现持续、可控且低延迟的实时生成。Light Interaction给出的答案是,让模型根据用户的交互状态自适应分配计算资源。随着视频世界模型朝着更长时序、更复杂控制和更高分辨率的方向发展,这类基于状态感知的推理优化方法,有望成为推动技术落地的重要方向。

相关资源:

论文链接:https://arxiv.org/abs/2605.31158

项目主页:https://2843721358l-del.github.io/Light-Interaction-Project/

GitHub:https://github.com/2843721358l-del/Light-Interaction-Project

以上内容不代表本平台立场,仅供读者参考