免训练2-bit KV量化框架破解评测假象

在视频世界模型的生成任务中,评测指标往往无法完全反映实际生成效果,尤其是在使用低比特KV缓存压缩的场景下。
视频世界模型需要生成连续画面,并在用户指定动作的控制下维持场景一致性。对于基于自回归生成的视频世界模型,KV Cache中保存着历史画面,使得生成时能够检索并重复利用此前生成的相似场景。然而随着生成的不断进行,KV Cache的显存成本十分高昂,例如LingBot-World-v2生成约5秒、93帧的视频,KV Cache就需要超过21 GiB显存。
将KV Cache量化到2-bit是缓解这一问题的重要方向,目前已有方法将2-bit KV Cache量化应用于自回归视频生成,并取得接近BF16的评测表现。但研究团队发现,当将这些方法应用于视频世界模型时,即使评测分数几乎不变,生成画面仍可能出现明显的闪烁、模糊和细节失真。
有研究团队针对这一现象展开了深入分析,并提出了面向视频世界模型的免训练2-bit KV Cache量化框架QuantWM。该方法从注意力保护角度出发,在多款模型上显著改善量化后的视频质量,同时实现最高6.20倍的KV Cache压缩。
看似相近的评测分数,掩盖了严重的视觉退化
现有方法Quant-VideoGen(QVG)已将2-bit KV Cache量化应用于自回归视频生成,并在视频基准上取得接近BF16模型的表现。但研究团队发现,在视频世界模型上,这些分数并不能充分反映量化带来的视觉退化。以HY-World 1.5为例,BF16与QVG的VBench Temporal flickering分数分别为95.62%与95.85%,但观看生成的视频,仍然可以观察到量化引入的严重画面闪烁与视觉退化。这说明,即使是与闪烁相关的评测指标,也未能充分捕捉视频世界模型上的量化性能退化。因此,团队结合视频可视化,以及相对BF16生成结果的逐帧PSNR、SSIM和LPIPS,进一步分析量化造成的偏差。
为何量化误差更小的Key,反而带来了更严重的画质损失?
研究团队进一步分析这一现象来源。KV缓存包含Key和Value,可以把Key理解为检索历史信息的“索引”,Value则是检索后读取的“内容”。分别量化两者后发现,仅将Key压缩到2-bit比仅量化Value带来更明显的视觉退化。更值得注意的是,相比于Value,Key自身的量化误差往往更小,却仍造成了更大的输出误差,这意味着视频质量的差异并不是因为Key更难量化,单看量化误差大小无法解释时序闪烁和画质下降。
为解释这一现象,研究团队进一步分析了视频世界模型中的注意力计算。当前Query与历史Key的匹配分数,决定了模型如何分配对历史信息的关注。因此,量化Key引入的量化误差可能改变这些分数的相对排序,让模型转而关注另一帧、另一个空间位置。对于连续生成而言,这种偏移可能扰动模型对历史场景的利用,进而影响画面稳定性,造成时序闪烁和画质下降。因此,研究团队指出当压缩KV Cache时,也要保护模型查找历史信息的方式,并以此为基础提出了QuantWM框架。
核心设计一:量化敏感性感知聚类优化
QuantWM的第一个设计是量化敏感性感知聚类(QSAC)。在QVG中,每个Key被分配给一个聚类中心,中心保留较高精度,两者之间的残差则进行2-bit量化。研究团队认为,距离最近的中心,不一定能得到量化后最合适的结果,残差的动态范围,以及误差落在哪些通道上,都会影响最终的注意力分数。QSAC先利用Query敏感性加权的距离筛选候选中心,再结合各残差组的动态范围及其敏感性,估计INT2量化可能引入的注意力扰动,并据此选择中心。这样,聚类中心分配充分考虑残差压缩到INT2后可能产生的注意力扰动,从量化阶段减少更有影响的误差。
核心设计二:主子空间注意力补偿
即使经过QSAC,2-bit量化仍不可避免存在误差,最直接的方案是对注意力logits进行误差补偿,但是保存全量的量化误差非常昂贵。团队观察到,历史Query的能量往往集中在少数方向上,例如LingBot-World-v2的一个层仅用前8个主方向,就覆盖了约71%的Query能量,这使得补偿可以重点保留其在这些主方向上的分量。基于此,QuantWM进一步引入主子空间注意力补偿(PSAC),PSAC以低秩形式保存Key量化误差在这些主方向上的分量,并在缓存重构时补偿Key,从而修正后续计算的注意力分数。实验中采用8个主方向,并将补偿系数量化为INT8,以控制额外存储开销。两项设计均使用已经生成内容的历史Query统计,不需要重新训练模型,能够直接接入视频世界模型的生成流程。
多模型验证:性能提升与缓存压缩效果
团队在Matrix-Game-2、LingBot-World-v2、HY-World 1.5三个视频世界模型上验证QuantWM,并进一步在LongCat-Video和Causal-Forcing两种视频生成模型上验证其泛化能力。在480p、93帧生成视频对比中,QuantWM的PSNR、SSIM和LPIPS上均优于QVG与KIVI,同时可视化内容显示QuantWM生成视频的质量显著提升,时序闪烁、模糊等现象得到改善。在VBench的五个评估维度上,QuantWM在各模型中均取得所比较量化方法的最佳平均排名。此外,研究还进一步报告了720p和1分钟长视频的评估结果,分别验证了更高分辨率下的生成质量和长视频生成下的视频基准表现。
注意力分析进一步表明QuantWM能够减少量化引起的历史时空位置选择偏移。在Matrix-Game-2上,最高分历史token相对BF16的选择变化比例,从53.88%降至10.19%,HY-World 1.5上则从61.36%降至13.92%。
系统实现方面,QuantWM设计专属Triton内核,在考虑聚类中心、量化参数及补偿信息等额外开销后,实际KV Cache压缩最高达到6.20倍。
结语
QuantWM揭示了视频世界模型低比特KV Cache压缩中容易被忽视的问题。即便视频评测分数接近,并不意味着量化后仍能稳定利用历史场景信息。因此,面向视频世界模型的压缩研究,需要结合基准指标、实际视频表现,以及模型对历史信息的利用方式进行多方位评估。

