打破语言先验!清华团队破解多模态模型视觉源幻觉

多模态大模型在日常交互中常会出现令人困扰的物体幻觉问题:比如当用户询问一张仅包含小狗的图片里有没有椅子时,模型可以准确回答没有;但换一张图,当被问到是否有餐桌时,模型却会编造出“有一张餐桌,还有一个男孩站在前面”的描述,可画面里根本不存在这些物体。
长期以来,这类幻觉被普遍归因于语言先验:模型在训练语料中频繁看到“餐桌”和“男孩”一同出现,因此即便图像中没有对应物体,也会顺着语言统计规律生成错误内容。不过清华大学的研究团队指出,这一解释并不完整。他们在第34届ACM国际多媒体会议上发表的论文显示,当模型输出为简短的Yes/No类型回答时,推理过程会更依赖视觉模态,此时会出现另一套独立于语言先验的幻觉机制,根源在于视觉特征提取本身的问题。研究人员将这类幻觉命名为视觉源幻觉,并提出了对应的解法ACFT。
问题的提出
物体幻觉一直是制约多模态大模型可靠性落地的核心障碍,此前的相关研究大多围绕语言侧偏置展开:有的认为模型过度依赖文本共现统计,有的定位到专门关注文本token的幻觉注意力头,还有的指向细粒度推理监督不足。基于这些发现的缓解方法也分为几类:比如在解码阶段做输入干预的VCD、OPERA,借助外部 grounding 模块做后处理的Woodpecker,以及RLHF、DPO这类后训练对齐方法。
不过这些方法都有一个共同前提——幻觉主要来自文本侧的偏置,这一假设在长文本输出场景下确实成立,因为丰富的上下文会放大语言偏见。但当模型输出简化为简短的是非判断时,语言先验的影响被大幅削弱,这类方法的效果也会大打折扣,此时的幻觉究竟来自何处,成为了新的研究空白。
核心研究方案
第一步:视觉源幻觉的诊断验证
研究团队首先在LLaVA v1.5模型上开展了两组互补分析,为视觉源幻觉的存在提供了量化证据。
发现一:图文嵌入错位
幻觉样本的图像-文本嵌入余弦相似度显著低于正确样本。正确样本的平均相似度为0.158,而幻觉样本仅为-0.122,说明跨模态对齐出现了系统性崩塌。
发现二:注意力模式反转
研究人员使用Smooth Grad-CAM可视化模型注意力,并设定了语义合理的注意力分布标准——当目标物体存在时,注意力应聚焦于目标区域;当目标物体不存在时,注意力应当分散。在500个幻觉样本和500个非幻觉样本的对比中,幻觉模型系统性违反了这一标准:当物体存在时,熵值高出5.1%,说明注意力过度分散,漏掉了目标;当物体不存在时,熵值低了6.2%,说明模型错误地聚焦在无关区域,从而触发幻觉。
为了确认这不是单纯的相关性,研究团队还对视觉编码器做了干预:施加高斯噪声、降采样或更换更弱的编码器后,POPE平均准确率从0.842降至0.739到0.822;反之更换更强的SigLIP-SO400M编码器后,准确率升至0.864,这为“视觉特征质量驱动物体存在性幻觉”提供了因果层面的支撑。
第二步:AHAF——对抗幻觉属性翻转
既然问题指向视觉特征错位,对比学习本应是最直接的修正思路,但研究团队发现普通对比微调效果并不理想——因为正负样本之间的特征差异不可控,也没有聚焦在目标物体上,模型很难学到究竟是哪些视觉特征触发了幻觉。
为此,研究团队提出了AHAF:通过PGD算法在极小的ℓ∞球内对原图施加定向对抗扰动,将一张不会引发幻觉的图像“翻转”为会引发幻觉的图像,由此构造出的正负样本对完全对齐,唯一差异就是这个受控的扰动。
AHAF还有一个额外的价值:它可以作为诊断探针,极小的像素级扰动就能翻转模型的答案,说明多模态大模型的视觉表征即便在干净图像上,也已经危险地贴近幻觉决策边界,这反过来印证了视觉源幻觉的诊断结论。
第三步:ACFT——对抗对比微调
基于AHAF生成的对齐样本对,研究团队设计了ACFT:在嵌入空间中最大化文本锚点与正样本图像的相似度,同时最小化其与负样本图像的相似度。这套方法有三个显著的工程优势:不依赖特定的骨干架构,仅需要极少的训练数据,且完全在训练阶段完成,推理时不会带来任何额外开销。
效果验证
研究团队在LLaVA v1.5-7B、MiniGPT-4 13B、Qwen2.5-VL-7B三个模型上开展了系统评估,选择的基准测试POPE和MME全部采用Yes/No的短回答形式,正好匹配本次研究关注的场景。
主实验结果
在LLaVA模型的三个子集上,ACFT分别取得了0.841、0.906、0.897的准确率,比次优基线高出3.3%、2.0%、0.5%;在MiniGPT-4上分别领先次优基线3.0%、5.3%、2.5%;即便是基线表现已经很强的Qwen2.5-VL,准确率也从0.864、0.875、0.884分别提升到0.877、0.900、0.916。
关键消融实验
研究团队使用相同的3000张COCO图像分别训练普通对比微调与ACFT,结果ACFT在三个子集上的准确率分别高出普通对比微调35.8%、7.4%、17.6%。尤其在Adversarial子集上,普通对比微调的准确率仅为0.483,甚至远低于未经微调的原始LLaVA模型,说明不对齐的负样本不仅无益,反而会损害模型表现。
进一步的相似度差距分析解释了这一差异:在ACFT训练的模型中,目标物体的正负样本相似度差距明显区别于非目标物体,而普通对比微调的模型完全不具备这一特性,说明ACFT让模型学到了关注目标物体自身特征差异的一致规则。
可视化结果也直观展示了ACFT的修正效果:图文嵌入余弦相似度显著提升,Grad-CAM注意力也回归到语义合理的分布,即物体存在时聚焦,物体不存在时分散。熵分析进一步确认了这一修正:物体存在的案例熵值分别下降8.7%和2.6%,物体不存在的案例熵值分别上升7.4%和6.4%。
研究价值与未来方向
这项研究在已有的“语言先验”解释基础上,识别并系统刻画了一类由视觉特征提取错误与图文嵌入错位驱动的幻觉机制——视觉源幻觉。研究团队提出的AHAF和ACFT,前者既是揭示多模态大模型视觉表征脆弱性的诊断探针,也是高效生成对齐对比训练数据的工具;后者则是一种仅需0.9% COCO数据、零推理开销的数据高效微调方法。
这项工作的意义不止于刷新模型性能指标,它提醒我们:多模态大模型的可靠性问题,不能只盯着语言侧。当模型的视觉表征在干净图像上就已经紧贴幻觉决策边界时,任何仅在文本侧或解码阶段做的补救,都可能是治标不治本的,让模型“看得更准”,或许才是通向可信多模态感知的必经之路。
论文作者
本次论文的共同一作为清华大学本科生徐沛阳、水木学者朱小佩,合作导师为朱军教授,通讯作者为清华大学朱军教授和胡晓林副教授。

