文章摘要
针对视觉语言模型边缘部署中,现有串联蒸馏加量化方案在4比特压缩下性能大幅下滑的痛点,研究者提出联合优化蒸馏与量化感知训练的GRACE框架。实验证实该框架4比特模型性能反超全精度学生基线,效果已在真实推理环境验证,相关论文被ICML 2026接收,代码与模型已开源。

视觉语言模型想要高效部署到手机、车机等边缘设备,通常需要同时完成两项优化:通过知识蒸馏压缩模型体量,通过量化降低权重的存储与计算开销。

目前行业内主流的做法是将两个步骤串联执行:先用大模型蒸馏得到小型学生模型,再对其进行训练后量化(PTQ)。这种流水线式的方案在8-bit量化下尚能保持不错的精度,但当比特数压缩到4-bit时,模型性能会出现明显下滑。

这类方案的核心问题在于两个优化环节彼此割裂:蒸馏阶段的学生模型完全 unaware 后续的量化约束,在全精度下学到的特征分布往往尖锐且动态范围大,存在大量离群值,这类特征恰恰最难适配低比特的量化表示;而量化阶段已经没有教师模型可以提供监督信号,仅靠少量校准数据无法修正量化误差带来的特征偏移,之前蒸馏得到的知识无法有效保留在低比特模型中。两个环节各自的最优解组合在一起,并非全局的最优方案。

针对这一痛点,我们提出了GRACE框架,这是一个将量化感知训练(QAT)与知识蒸馏进行联合优化的统一框架,让两个环节在同一个目标下完成协同训练。

核心设计思路

GRACE的核心设计思路来自信息瓶颈视角:低比特的权重限制了学生模型能够承载的特征复杂度,因此学生不需要复刻教师模型的全部输出,而是应该有选择地保留那些真正影响最终决策的关键信息。围绕这一思路,我们梳理了三个核心设计问题,并针对性提出了四个模块来解决这些问题。

GDKD:基于教师置信度的蒸馏信号加权

教师模型在简单样本上的输出分布尖锐可靠,而在困难样本上则接近均匀分布甚至给出错误预测。GDKD模块通过教师输出分布的归一化熵来构造门控权重:教师对样本的预测越确定,蒸馏的监督权重就越高;反之如果教师自身存在犹豫,对应的蒸馏权重就会降低,避免学习到噪声信号。

这一门控机制并非经验性设计:根据Fano不等式,条件熵与预测错误率存在直接关联,熵越高意味着模型可达到的错误率下界越高,因此以归一化熵作为置信度代理,从理论上与“高熵样本的监督信号可靠性更低”的直觉保持一致。在此基础上,蒸馏损失被拆分为目标类别与非目标类别两部分分别加权,避免高置信样本上的目标类别概率主导整个梯度更新。

RCKA:对齐视觉Token的关系结构而非单一数值

量化操作会扰动每个视觉Token的激活数值,但同一张图像中Token之间的相对关系结构相对稳定,且更接近模型实际利用的语义信息。RCKA模块从大模型的倒数第二层提取视觉Token的特征,计算Token之间的Gram矩阵,通过中心核对齐(CKA)来度量师生两侧特征关系结构的一致性。

CKA对特征的正交变换和整体缩放不敏感,非常适合学生模型维度低于教师、且特征数值被量化扰动的场景。我们通过消融实验发现,选取倒数第二层的特征效果最佳:更浅层的语义信息不足,而最后一层特征已经过度贴合词表输出,无法很好保留视觉交互的核心信息。

这种关系对齐的效果可以通过注意力图直观体现:针对“这个人在喂羊驼吃什么”这类需要定位交互对象的问题,标准KD训练出的学生模型注意力较为发散,而GRACE训练的模型注意力更集中在胡萝卜与喂食交互区域,视觉定位能力得到明显提升。

自适应IB控制器:无需手动调参的损失平衡机制

任务损失、蒸馏损失与关系对齐损失三者的固定权重配比,在训练过程中往往会出现失衡:训练早期蒸馏项会主导更新,后期则偏向任务损失,很难通过一次固定配比适配全训练周期。

GRACE将这个问题转化为带约束的优化问题:在蒸馏损失不超过阈值τ的前提下最小化任务损失,并通过拉格朗日对偶上升动态更新乘子β。当蒸馏损失超出阈值时,β会自动上升以压紧对齐约束;当损失满足约束时,β会回落,将优化预算让给任务本身。需要说明的是,这一设计仅受信息瓶颈视角启发,并非对IB目标的严格实现,相关细节可参考论文附录的完整讨论。

分组LSQ:将量化融入训练全流程

传统的量化感知训练会在训练中以可微形式引入权重量化,GRACE的分组LSQ模块通过LSQ方法学习量化步长,采用对数空间参数化保证步长的正性,并使用分位数初始化避免训练早期步长出现震荡。该模块支持W8G128与W4G128两种量化粒度,让学生模型从训练第一步开始就处于量化约束下向教师模型对齐,而非先完成全精度训练再被压缩。

实验结果

在Qwen2-VL 7B→2B的设置下,GRACE框架的三档量化精度全面超过BF16精度的学生基线:其中4-bit版本的八项基准平均分为68.0,比全精度学生基线高出4.0个点,同时比此前最强的4-bit方法SPEED-Q高出5.7个点,与7B全精度教师模型的性能差距仅压缩在3.7个点以内。

从BF16到4-bit量化的过程中,GRACE仅出现1.2个点的性能下滑,而其他PTQ方法在相同的4-bit设置下平均得分仅在61附近。在Qwen3-VL 8B→2B的设置下,实验结论保持一致,三档量化精度相对BF16基线(67.3)分别提升9.4、8.6与7.7个点。

值得注意的是,多数量化研究仅报告仿真量化下的精度,并未在真实推理栈上进行验证。我们在真实推理环境中进行了端到端测试:INT4量化使用AWQ内核,INT8量化使用GPTQ内核,实测精度与仿真结果完全一致。

在A100设备上,我们对比了LLaVA-1.5 7B FP16与GRACE 7B INT4的部署表现,覆盖显存占用、模型体积与推理吞吐三项指标:INT4版本在显存与模型体积上有数倍的收益,对于7B规模的模型,解码阶段以访存受限为主,权重位宽的下降直接转化为推理吞吐的提升。需要说明的是,这一结论与模型规模相关:2B量级的模型解码时更偏向计算受限,量化的收益主要体现在显存占用而非推理速度上。

论文与项目信息

论文标题:GRACE: Gated Relational Alignment via Confidence-based Distillation

论文链接:https://arxiv.org/abs/2601.22709

项目代码:https://github.com/GRACE-framework/GRACE

模型权重:https://huggingface.co/GRACE-team/GRACE

该论文已被ICML 2026接收。

总结

GRACE框架的核心主张可以概括为:模型压缩的两个环节不应该彼此割裂,因为它们优化的是同一个特征表示。将量化约束提前引入蒸馏过程,让学生模型在低比特的表示预算下自主决定需要向教师学习的内容,4-bit的2B模型就能逼近全精度7B教师模型的性能水平。

整个框架不需要额外的教师模型微调,也不依赖专有校准集,四个模块都可以单独插入现有的QAT或KD流程中。目前,完整的训练代码、评测脚本与量化后的模型权重已经开源,欢迎试用与交流。

以上内容不代表本平台立场,仅供读者参考