文章摘要
LightX2V团队针对Wan2.2 - A14B推出LightWan2.2 - A14B方案,实现14B视频模型加速。其通过Phased DMD和SGMD将去噪从40步压缩至4步,采用NVFP4量化等手段优化单卡性能;多卡并行采用Ulysses风格序列并行及四层优化。最终8卡使720p的T2V和I2V端到端生成短于播放时长,单卡I2V也有大幅提速。还提供官方镜像与运行脚本。

现在,14B级视频生成模型已经可以在消费级GPU上实现实时生成。LightX2V团队针对Wan2.2-A14B推出的LightWan2.2-A14B方案,将5秒720P分辨率的文生视频(T2V)时间压缩到3.8秒,图生视频(I2V)仅需4.5秒,相比原始40步模型实现了最高705.8倍和599.3倍的加速。

当你想要生成一段5秒的720P分辨率视频时,为什么往往需要等待数十分钟?对于14B级别的视频生成模型来说,高分辨率、长时序和强运动一致性在提升画质的同时,也拉长了Token序列,放大了注意力计算量和显存峰值,让消费级GPU同时面临速度和显存两大挑战。

一方面是生成速度慢:Wan2.2通常需要40步去噪,每一步都要执行大规模矩阵乘法,随着分辨率和帧数增加,视频Token序列迅速变长,自注意力开销随序列长度平方增长,当序列长度约120K时,自注意力可占单次DiT延迟的80%以上,等待时间随之累积。另一方面是显存不足:14B模型的权重、长视频Token、注意力缓冲区和中间激活同时占用显存,峰值容易超过约30GB消费级GPU的容量,直接触发OOM错误。

从40步到4步:核心步数优化

最直接的提速方式是减少去噪步数。LightX2V采用Phased DMD,将完整信噪比区间拆分为多个阶段,让不同专家学习不同噪声区间内的去噪行为。训练时每个阶段只为一个采样步保留梯度,既避免完整多步反向带来的巨大显存开销,也缓解激进一阶蒸馏容易出现的多样性下降和运动弱化问题。

此外,团队还引入了SGMD来加快训练速度,通过推动fake score向teacher score对齐,并用teacher stop-gradient Fisher构建稳定的分布匹配目标,再通过NR/RC双势能分别进行外循环修正和内循环跟踪,让fake score跟上持续更新的生成器。最终,Wan2.2的去噪流程从40步压缩到4步,形成“两步高噪声专家 + 两步低噪声专家”的推理流程,在保留视频生成所需的运动动态、视觉细节与输出多样性的同时,大幅减少了计算量。

单卡适配:把14B模型装进消费级GPU

仅仅减少步数还不够,要让14B模型真正跑在单张RTX 5090上,还需要进一步压缩每一步的计算量、访存流量和显存峰值。

首先是NVFP4量化感知训练:NVFP4采用E2M1 4比特数值,以每16个连续元素共享FP8 E4M3块级缩放、全张量配合FP32全局缩放,在接近FP4的存储与带宽成本下保留更强动态范围。团队将量化感知训练直接融入步数蒸馏,让学生模型在训练阶段就适应4比特误差,再通过CUTLASS内核映射到Blackwell Tensor Core执行,降低线性层的显存流量与GEMM延迟。

其次是动态稀疏量化注意力:团队先用Query/Key块级均值快速估计注意力重要性,再在运行时选择关键块,仅计算被激活的注意力Tile,典型稀疏率达到80%—90%,即只保留最重要的10%—20%块,被选中的块内部仍保持稠密计算,兼顾稀疏收益与GPU吞吐。稀疏注意力算子进一步接入SageAttention2,形成更快的FP8稀疏注意力路径。

第三是高效推理算子:面向Blackwell架构协同优化视频DiT的两大计算热点,在线性层、MLP和MoE中,采用权重与激活双NVFP4的Block-Scaled Tensor Core GEMM,以FP32累加和BF16输出兼顾吞吐与数值稳定性,并在CUTLASS Epilogue中融合列偏置,显著降低显存占用和带宽开销,同时减少额外Kernel启动。在长序列自注意力中,Dynamic Sparse SageAttention根据当前Q/K动态评估块级相关性,仅保留约10%的关键注意力块,并结合Q/K INT8、V FP8低精度计算,同时削减密集矩阵乘和注意力计算开销。此外,将3D RoPE、RMSNorm等操作替换为高效并行或融合内核,减少Python调度、临时张量和内存往返,避免外围开销拖慢整条链路。

最后是异步折叠Offload:除模型级卸载外,团队还提供Block级卸载,按Transformer块细粒度搬运权重,并通过计算与权重搬运的异步折叠,将数据传输开销隐藏在计算过程中,以更低的峰值显存承载14B模型和长视频序列。

单卡优化后的性能表现为:T2V 720p从2668.0秒降至22.5秒,提速118.7倍;I2V 720p从2685.0秒降至26.7秒,提速100.5倍。相同单卡条件下,I2V 480p与720p分别约为TurboWan2.2的3.5倍和2.4倍速度,让14B视频生成进入消费级GPU的单卡可运行范围。

多卡并行:实现720P实时生成

如果想要实现720P视频的实时生成,还需要多卡并行优化。实时生成的标准是生成一段5秒视频的端到端时间短于5秒,LightX2V在单卡优化栈之上采用Ulysses风格序列并行,并围绕All-to-All通信、QKV布局和Head级流水做系统级优化。

基础Ulysses先把长视频Token序列切分到多张GPU,再通过All-to-All在序列维和Head维之间完成数据重排,让每张卡只计算部分注意力。LightX2V围绕这条主链路做了四层优化:一是通信数据直接采用FP8,压缩QKV交换和注意力输出回传的数据量;二是QKV张量融合将Q、K、V打包成一个All-to-All载荷,减少Collective调用和重复布局变换;三是Triton前后处理融合内核把QKV打包、布局转换、FP8量化/反量化和输出重排放到一组高效GPU内核中;四是Head Parallel按本地Head异步发起All-to-All,在当前Head计算注意力时并行传输后续Head,并在输出阶段继续流水化回传。这些优化共同减少了通信量、算子启动和同步等待,把基础序列并行改造成面向视频长序列的高吞吐执行路径。

8卡优化后的性能表现为:T2V 720p端到端延迟降至3.8秒,最高加速705.8倍;I2V 720p降至4.5秒,最高加速599.3倍,两类任务的5秒视频生成时间均短于播放时长,实现了720P实时生成。

787秒→2.4秒
I2V 8卡480p

2668秒→3.8秒
T2V 8卡720p

705.8×
8卡最高加速

787秒→10.7秒
I2V 单卡480p

2668秒→22.5秒
T2V 单卡720p

118.7×
单卡最高加速

从整体性能来看,T2V方面,单卡480p与720p分别实现80.7倍和118.7倍加速,8卡720p进一步达到3.8秒与705.8倍加速。I2V方面,单卡480p与720p分别为10.7秒和26.7秒,与同为4步、同为单卡的TurboWan2.2-I2V-A14B相比,分别约快3.5倍和2.4倍。8卡I2V在720p下达到4.5秒,跨过实时生成线。

快速上手:官方镜像与运行脚本

想要直接复现上述单卡与多卡性能,建议从LightX2V官方Docker镜像开始,镜像提供更稳定的依赖环境。进入LightX2V工程后,可运行以下脚本:

拉取官方镜像

docker pull lightx2v/lightx2v:26052801-cu130-5090

单卡:文生视频 / 图生视频

bash scripts/wan22/extreme/run_wan22_moe_t2v_extreme.sh
bash scripts/wan22/extreme/run_wan22_moe_i2v_extreme.sh

多卡SP:文生视频 / 图生视频

bash scripts/wan22/extreme/run_wan22_moe_t2v_extreme_sp_parallel.sh
bash scripts/wan22/extreme/run_wan22_moe_i2v_extreme_sp_parallel.sh

多GPU脚本已启用前述序列并行配置,并可按实际GPU数量设置seq_p_size。手动安装用户也可从LightX2V源码构建,并基于NVIDIA CUTLASS编译NVFP4 Kernel。相关脚本的详细链接如下:

  • 单卡T2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_t2v_extreme.sh
  • 单卡I2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_i2v_extreme.sh
  • 多卡T2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_t2v_extreme_sp_parallel.sh
  • 多卡I2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_i2v_extreme_sp_parallel.sh

总结

LightX2V将14B视频生成的优化目标归纳为三个关键词:少算、少占、少等。通过Phased DMD结合SGMD将去噪过程从40步压缩至4步,通过NVFP4量化感知训练和动态稀疏注意力降低每一步的计算量,通过CUTLASS/Triton融合内核和Block级异步Offload减少算子开销与显存峰值,让14B模型可以在单张RTX 5090上运行。多卡推理则以Ulysses为主线,整合FP8通信、QKV张量融合、Triton前后处理融合和Head级异步流水,进一步降低长序列注意力的通信量和同步等待。最终,8卡RTX 5090上5秒720p视频的端到端生成延迟降至T2V 3.8秒、I2V 4.5秒,均短于视频播放时长,单卡I2V在480p和720p下也分别达到TurboWan2.2约3.5倍和2.4倍的速度,让720p实时生成成为可复现的工程结果。

以上内容不代表本平台立场,仅供读者参考