文章摘要
针对现有多模态长推理中视觉证据支撑逐步弱化的问题,美国埃默里大学研究团队提出DLR(拆解-观察-推理)框架,相关成果已被EMNLP 2026主会接收。该框架每步推理动态提取对应视觉证据,经三阶段训练优化,在多个多模态推理基准数据集上性能获得稳定提升。

当前大模型的通用推理能力已经有了显著提升,但当面对需要结合视觉信息进行复杂推理的任务时,一个核心争议始终存在:模型究竟是真正基于视觉证据完成思考,还是仅在初始阶段浏览图像后,全程依靠文本逻辑链进行推测?

针对这一行业关注的问题,来自美国埃默里大学的研究团队提出了Decompose, Look, and Reason(简称DLR)框架,相关研究成果已被EMNLP 2026 Main Conference接收。

DLR的核心设计目标是解决多模态思维链中普遍存在的问题:随着文本推理链条不断延长,视觉证据的支撑作用会被逐步弱化。该框架的核心思路非常直观,模拟人类处理复杂视觉问题的过程:先拆解问题,再针对当前子问题提取视觉信息,最后基于获取到的视觉证据完成推理,即遵循Decompose → Look → Reason的循环流程。

多模态推理中的视觉信息瓶颈

目前视觉语言模型已经能够在视觉问答、数学图表理解、跨学科多模态任务等场景中执行较长的推理链。但与纯文本推理不同,多模态推理需要在离散语言序列与高维连续视觉表示之间反复交互,这带来了新的挑战:当模型进入较长的语言推理链条后,后续的推理过程是否仍然能由充分且准确的视觉证据支撑?

现有的多模态推理方法大致可以分为三类:第一类是纯文本多模态CoT,将视觉信息压缩为文本描述后,主要在语言空间中完成后续推理,这不可避免会造成视觉信息的损失;第二类是交错式CoT或「结合图像思考」方法,在中间步骤引入图像patch、边界框、裁剪、缩放或外部视觉工具,能够增强显式的视觉锚定,但会引入额外的工具调用成本,且受限于预定义的操作空间;第三类是隐式视觉推理,将中间视觉信息投影到连续嵌入空间,但现有方法通常依赖局部ROI或单个patch,或是仅在整个推理链中注入一次视觉隐变量。

研究团队指出,固定的局部ROI往往无法与当前推理步骤真正需要的语义证据匹配:要么包含过多无关上下文,要么无法覆盖跨区域关系、全局布局或抽象视觉概念。同时,多步推理通常需要模型在不同阶段检查不同的视觉证据,单次视觉注入难以支撑完整的推理轨迹。

核心推理框架:拆解-观察-推理循环

DLR将复杂的视觉推理过程拆解为多个中间步骤组成的轨迹,每一步都包含文本前提、连续视觉隐变量和基于该视觉证据生成的推理依据,最终得到答案。其核心是将「提出需要验证的问题」和「从图像中提取对应证据」进行显式耦合,具体分为三个关键步骤:

Decompose:动态生成需要视觉验证的前提:视觉语言模型根据当前的推理上下文,确定下一步需要确认的视觉事实,生成明确的前提或子问题,回答「接下来需要验证什么」这一问题。

Look:提取基于前提的视觉隐变量:视觉锚定器以前提结束位置的隐藏状态为条件,对图像特征执行交叉注意力操作,输出一组连续的视觉隐变量。与固定的ROI或单个patch不同,这些隐变量可以编码局部细节、跨区域关系以及非局部的视觉语义。

Reason:基于视觉隐变量生成锚定的推理依据:视觉语言模型在注入视觉隐变量后,生成当前步骤的推理依据,并据此启动下一轮的问题拆解,直到得到最终答案。通过这一流程,视觉证据不再只是推理开始时的一次性输入,而是成为整个推理轨迹中可动态更新的条件。

从概率建模的角度来看,DLR将文本生成策略与视觉隐变量策略共同纳入推理过程。更准确的文本拆解可以为视觉锚定器提供更明确的条件,而更贴合任务的视觉隐变量又能反过来改善后续的推理依据,因此二者形成了相互依赖的联合优化过程。

分阶段训练流程

DLR的训练分为三个阶段,从跨模态对齐逐步过渡到连续隐空间的强化学习:

第一阶段:视觉锚定器预训练:冻结预训练的视觉语言模型主干,训练轻量的视觉锚定器。模型使用一组可学习的隐变量查询对图像特征进行条件化提取,并通过双向InfoNCE对比学习,使聚合后的视觉隐变量与目标答案的文本语义对齐。这一阶段的作用是建立稳定的跨模态初始化,让隐变量能够在给定文本条件时提取对应的视觉语义。

第二阶段:监督微调:通过监督微调学习结构化的DLR推理轨迹,训练样本显式包含标准推理结构。视觉语言模型学习何时提出新的视觉前提,视觉锚定器则根据前提的隐藏状态生成连续隐变量,并通过后续推理依据与答案的语言建模损失获得梯度。这一阶段可以让模型内化DLR的格式,但此时隐变量的提取仍主要是确定性的特征提取,缺乏显式的探索空间。

第三阶段:连续隐变量的强化微调:将强化学习从离散的文本token扩展到连续的视觉隐变量。标准的GRPO可以直接优化文本token的离散策略,但对于连续隐变量缺少天然的token级概率分布。DLR因此构建了一个可以显式计算策略密度与重要性权重的视觉隐变量策略,并与文本策略联合优化。

超球面上的语义探索

视觉-语言表示通常使用余弦相似度衡量语义相似性,因此语义信息更多编码在向量的方向而非模长中。研究团队据此将视觉表示视为近似位于单位超球面上的语义流形,并提出了Spherical Gaussian Latent Policy(SGLP)。

视觉锚定器首先预测经过L2归一化的平均方向,在其附近加入高斯扰动,再将采样结果重新投影到单位超球面。这一设计可以将探索的重点放在语义方向上,减少将语义变化与模长变化混合在一起的风险。在强化学习阶段,DLR基于群体相对优势,同时优化文本策略与隐变量策略。

实验设置与主要结果

实验以Qwen3-VL-8B-Thinking作为基准模型主干,评测覆盖了四个以视觉为中心的基准测试集:V* Bench(细粒度属性与空间关系推理)、MathVista(视觉数学推理)、MMMU-Pro(跨学科多模态推理)和MMStar(综合多模态能力)。为保证公平对比,多款开源方法均适配到同一基准主干上。

实验结果显示,DLR在四个数据集上分别达到83.8、82.7、63.5和76.2的准确率,相较于原始基准主干,分别提升了4.2、3.5、2.6和3.9个百分点。在MathVista数据集上,DLR相比同类方法从77.3提升至82.7,研究团队将这一优势归因于多步基于前提的视觉锚定:数学视觉推理往往需要模型反复检查图表、几何关系或局部细节,并在多步过程中累积证据,而非依赖一次性的隐变量表示。整体实验结果表明,在相同的模型主干下,将视觉锚定显式嵌入多步推理轨迹,能够稳定提升多类视觉推理任务的性能。

消融实验:隐变量策略优化的作用

消融实验结果显示,预训练、聚焦奖励与隐变量策略优化均对最终模型性能有贡献。其中最显著的是隐变量策略目标:移除隐变量优化目标后,MathVista数据集上的准确率从82.7降至57.1,V* Bench上的准确率也从83.8降至81.5。这一结果说明,仅依靠监督微调学习确定性的视觉表示,难以充分发挥隐空间推理的能力,显式的连续隐变量探索是该框架的重要组成部分。

忠实性分析

在V* Bench上进行的定量忠实性分析显示,当随机遮挡同等数量的图像区域时,模型准确率从83.8降至77.7;而当遮挡模型注意力最高的区域时,准确率降至36.5,下降了47.3个百分点。这一干预结果为视觉锚定器识别的区域与模型预测之间的功能相关性提供了定量证据,而非仅停留在直观的可视化层面。

案例研究

论文中的案例进一步展示了弱视觉锚定可能导致的过度推理问题。在一道图形规律推理题中,原始基线模型反复尝试计数绿色扇区、检查角度关系和行列规律,并多次修改假设,最终生成超过15000个token后仍给出了错误答案。而DLR则先明确提出需要验证「绿色扇区的相对位置规律」,再根据该前提获取视觉隐变量,并据此生成锚定的推理依据,顺利完成了推理。

在另一个房间主色判断的案例中,基线模型受到大面积蓝色壁画的显著性影响,将房间主色判断为蓝色;而DLR通过分步的视觉锚定,综合考虑墙壁、桌椅与整体布局,最终判断白色为房间主色。模型的交叉注意力热力图会随推理前提变化调整关注区域,这与DLR「每一步重新获取任务相关视觉证据」的设计理念一致。

主要贡献总结

  • 提出了Decompose–Look–Reason多步视觉推理框架,在每一步动态生成推理前提,并提取对应的基于前提的视觉隐变量。
  • 构建了三阶段训练流程,将视觉锚定的跨模态对齐预训练、结构化监督微调与连续隐空间强化学习相结合。
  • 提出了球面高斯隐变量策略,使得强化学习能够直接优化连续视觉隐变量,并与文本策略联合更新。
  • 在四个基准数据集上进行了系统评测,并通过消融实验、案例研究与忠实性分析验证了各组件的作用。
以上内容不代表本平台立场,仅供读者参考