文章摘要
多模态大模型在复杂视觉推理上存在挑战,现有方案有算力成本高、精度崩塌等问题。研究团队提出 ProLaViT 框架,采用内生自蒸馏、双推理范式和多样性损失等方法。实验显示其表现全面优于基线方案,未来有望拓展到视频推理等领域。

如今多模态大模型已经能够轻松识别图像内容,但要让模型完成复杂的多步空间感知、几何分析与逻辑推理,依旧是行业内的核心挑战之一。很多模型虽然能“看懂”图片,却无法真正“想清楚”,容易出现“看得到却想不对”的问题。

为了解决这类问题,学界尝试在推理链中引入视觉信息,但目前的两类主流方案都存在明显硬伤:一类是显式生成中间图像,这类方法虽然效果不错,但需要极高的算力成本;另一类是直接在隐空间中一步完成目标定位的隐式推理,这类方法往往会出现精度崩塌的问题,模型注意力容易被无关背景分散。除此之外,纯文本思维链还存在天然的模态鸿沟,无法保留细粒度的空间关系,很容易出现逻辑通顺但结果错误的情况。

针对这些痛点,相关研究团队提出了ProLaViT(Progressive Latent Visual Thought)全新框架,其核心思路是避免直接生成图像或盲目预测,而是在结构化的连续隐空间中逐步推导,就像人类思考一样一步步收紧注意力,最终精准锁定目标。该框架遵循「定位→聚焦→分离」的因果链条,让模型逐步聚焦视觉线索。目前该论文已被ECCV 2026接收。

现有方案的核心痛点

目前主流的视觉推理路径主要存在两类问题:

  • 纯文本思维链:通过文字逐步呈现推理过程,但文本本质是抽象的,天然丢失了细粒度的空间关系,比如模型可能会把“电视下方的家具”错误脑补为“木地板”,逻辑通顺但结果错误。
  • 一步隐空间预测:跳过文本直接在隐空间中一次性定位目标区域,但单步预测超出了模型的表征容量,容易出现注意力跑偏,最终导致错误结果。

而ProLaViT的解决方案则避开了这两类陷阱,既不生成额外的像素图像,也不进行盲目预测,而是将复杂的视觉推理拆分为结构化的隐式思维链,让模型每一步只完成小幅度的推导。

无需外部依赖的内生自蒸馏方案

训练多步隐空间模型的核心难题之一,是中间推理步骤没有现成的标准图像作为监督信号。以往的方法通常会引入SAM、DINO等外部视觉工具作为“老师”,但这类方式容易带来域偏移和更高的工程复杂度。

ProLaViT采用了内生自蒸馏的思路,不依赖外部工具,直接使用预训练的多模态视觉编码器作为监督信号。具体的实现流程分为三步:

  • 针对每个训练样本,通过代码自动生成多幅辅助图像,分别对应推理链的每一个步骤,比如裁剪目标区域、分割目标物体等,这些图像由几何变换算法生成,精度由代码保证,无需人工标注。
  • 冻结预训练的视觉编码器,从每一张辅助图像中提取“教师特征”,训练过程中不会回传梯度到这个编码器。
  • 通过跨模态注意力机制,将大语言模型生成的隐式思维对齐到教师特征,最小化蒸馏损失,让模型的隐空间表征逐步内化渐进式的视觉证据。

通过这种方式,模型在训练阶段就将渐进式的视觉推理逻辑内化到自身的隐空间中,推理过程完全不需要依赖任何外部工具。

适配不同任务的双推理范式

ProLaViT针对不同类型的视觉推理任务,设计了两种不同的隐式思维链范式:

由粗到细因果链:面向视觉搜索、目标定位等空间感知任务,遵循「定位→聚焦→分离」的渐进路径:

  • 首先通过叠加空间网格建立全局上下文,为后续推理提供基础语境;
  • 通过边界框定位初步框选出目标所在的大致区域;
  • 对框选的目标区域进行裁剪,实现注意力的聚焦;
  • 最后通过分割操作精细勾勒出目标物体的边界,完成最终的精确定位。

辩证推理链:面向拼图复原这类逻辑推理任务,采用「假设→批判→验证」的反事实思辨路线:

  • 通过边缘增强突出图像的高频边界,找到潜在的拼接面,形成初步的拼接假设;
  • 通过叠加箭头可视化拼接的移动方向,引导模型关注空间变换关系;
  • 生成看似合理但错误的拼接状态,触发模型的批判机制,让模型学会辨别细微的视觉逻辑错误;
  • 最终给出正确的拼接结果,验证整体逻辑与视觉表征的一致性。

每一个推理步骤都由大语言模型嵌入空间中的一组可学习token来表示,确保整个思维链的连贯性。

缓解隐空间坍缩的多样性损失

多步隐空间推理常见的问题是隐空间坍缩,也就是后续推理步骤的表征越来越相似,导致整个隐式思维链退化。为了解决这个问题,研究团队借鉴度量学习的思路,提出了距离加权多样性损失

该损失函数首先通过带间隔的形式,允许隐式思维链的中间状态合理相似,只惩罚过度坍缩的情况。更关键的是,该损失会根据推理步骤的因果距离设置权重:因果距离越远的两个步骤,越应该保持表征的差异性。通过这种方式,既保留了相邻推理步骤之间的语义连续性,又强制拉开了远距离步骤的表征,有效防止了隐空间坍缩。

整体的训练目标将语言建模任务与隐空间监督结合在一起,并配合四阶段的训练流程:隐锚初始化→内生知识蒸馏→结构化链演化→全局能力整合,让渐进式的视觉推理能力稳定涌现。

实验效果验证

研究团队基于Qwen2.5-VL-7B-Instruct实现了ProLaViT,并在MMVP、VisPuzzle、VStar、ChartQA、BLINK、CV-Bench等多个视觉推理基准上进行了广泛测试,整体表现全面优于现有基线方案。

具体来看,ProLaViT的优势主要体现在三个方面:

  • 准确率更高:完整版的ProLaViT(搭配距离加权多样性损失)取得了75.11%的平均准确率,全面超越基线模型。在VisPuzzle和BLINK-Jigsaw这类复杂任务上,相比一步隐空间预测方案分别提升了2.25%和10.00%。
  • 表现更稳定:通过内生自蒸馏保持了域一致性,在ChartQA任务上取得了78.99%的准确率。在最考验逻辑验证的BLINK-Jigsaw任务上,相比基座模型提升了16.67%,验证了辩证推理范式的有效性。
  • 具备可解释性:研究团队将各推理步骤token表征的余弦相似度绘制成热力图,可以清晰看到,加入距离加权多样性损失后,相邻步骤的表征保留了适度的相似性以承接上下文,而远距离步骤的表征则被有效拉开,模型确实学到了渐进式的推理路径。

通过消融实验进一步验证了ProLaViT各个模块的有效性:

  • 渐进式分解不可或缺:将所有视觉线索压缩到单个隐状态的一步预测存在明显瓶颈,换成ProLaViT的多步推导后,ChartQA任务提升15.97%,BLINK-Jigsaw提升10.00%,平均提升7.45%,证明结构化的推理链能够有效分摊认知负担。
  • 内生蒸馏优于外生蒸馏:将原生视觉编码器替换为外部专家模型时,DINOv2尚能达到不错的效果,但在细粒度感知任务如VStar上表现落后;而SDXL-VAE在VisPuzzle任务上甚至出现了灾难性的失败,这是因为VAE的隐空间是为像素重建设计的,几何与空间逻辑被压缩为噪声,原生编码器提供的监督信号才是天然对齐的。
  • 推理步顺序至关重要:将四步推理的顺序随机打乱后,模型的平均准确率下降了6.24%,其中VisPuzzle下降6.25%,CV-Bench下降8.52%,这说明渐进式的因果结构是有效视觉推理的核心前提,违背信息的自然流向会严重降低模型表现。

未来展望

ProLaViT提出的结构化隐空间渐进推导范式,打破了“显式生成成本高、隐式推理精度差”的两难困境。通过内生自蒸馏让模型从可编程合成数据中内化算法级的精度,摆脱对外部视觉工具的依赖,再通过距离加权多样性损失缓解隐空间坍缩,让每一步推理都独特且连贯。

这项工作不仅在视觉搜索、拼图复原等重感知任务上取得了有竞争力的结果,更重要的是将视觉推理从离散的文本空间拓展到了连续的结构化隐空间,为弥合传统思维链的模态鸿沟提供了兼顾准确率、可解释性与效率的可行路径。未来,将这类结构化隐式推导拓展到视频时序推理、引入更复杂的几何变换,将为通用化、可解释的多模态智能发展铺平道路。

以上内容不代表本平台立场,仅供读者参考