Remember-R1:后训练缓解多模态视觉遗忘

在大语言模型推理能力不断升级的当下,延长思考步数、增加生成token已经成为提升性能的常见思路,尤其是在新一代模型推出之后,这种模式几乎成了行业共识。不过对于多模态大模型来说,更长的推理序列并不等同于更充分的视觉推理——很多模型在推理初期还能准确描述图像内容,但随着生成内容不断累积,反而会越来越依赖自己之前输出的文字,逐渐脱离原始视觉证据。
如果早期的视觉描述出现细微偏差,错误就会沿着自回归的链条不断被放大,最终得到一个语言上通顺但视觉上完全失真的答案。这并非简单的“没看见”,而是“看见之后没能一直记住”。
从后训练的角度分析,在典型的自回归多模态模型中,视觉条件在推理开始时就已经固定,但语言上下文却会随着生成过程持续增长。如果强化学习只奖励最终的正确答案,训练目标就无法区分两种推理轨迹:一种是全程都以图像为依据的正确路径,另一种是中途丢失视觉证据、仅靠语言先验碰巧答对的捷径。长此以往,模型的策略优化会倾向于分配更多概率给“答案正确但证据失真”的轨迹,这种由rollout数据分布、序列结构与稀疏结果奖励共同诱发的系统性视觉衰减,被研究者称为“分布性视觉遗忘”。
来自多所高校的研究团队提出了Remember-R1方法,尝试从根源上修正这种偏差。与常见的推理阶段补救方案不同,该方法没有修改已有的推理流程,而是在强化学习后训练阶段加入三种过程奖励,让模型不仅要最终答对,还要在整条推理链中持续表达、保留并准确调用视觉证据。
三重过程奖励的设计逻辑
Remember-R1的总奖励由答案正确性奖励加上三种过程奖励组成,答案正确性奖励决定模型是否完成任务,而三种过程奖励则约束模型完成任务的方式,三者共同构成了行为层面的奖励正则化,通过提高视觉忠实轨迹的相对收益,缩小可接受策略的范围,阻止模型沿着纯文本捷径继续优化。
第一层:视觉词汇奖励,约束“说了什么”
研究团队会从训练图像中提取物体类别、颜色、大小、数量和空间关系等视觉词组,通过严格的词或短语匹配统计回答覆盖的视觉事实。奖励不仅取决于匹配的视觉词数量,还取决于这些词最后一次出现的位置——视觉证据覆盖越充分、在推理链中保留越久,得分越高。这一设计约束了视觉证据的语义分布,避免模型只在开头提一下图像就进入纯语言推理,确保关键视觉事实持续出现在后续的推理轨迹中。
第二层:视觉记忆奖励,约束“看了多久”
仅仅要求模型反复提及视觉词还不足以证明它真的在使用图像,因此Remember-R1会从模型最后一层提取每个生成步骤对视觉token的注意力,对比推理早期和后期的平均注意力水平。如果后期视觉注意力快速下降,奖励就会降低;如果模型在整条推理链中保持相对稳定的视觉依赖,奖励就会提高。这一设计约束了视觉依赖的时间分布,直接惩罚“越想越不看”的系统性衰减。
第三层:视觉关键区域奖励,约束“看向哪里”
模型持续关注图像并不代表它看对了地方,无差别关注整张图像可能制造虚假的视觉忠实。研究团队将训练样本中的关键区域映射到对应的视觉token,计算注意力落在问题相关区域的比例,并对推理后期的注意力分配赋予更高权重,要求模型不仅要保持视觉注意力,还要把有限的注意力预算持续分配给真正决定答案的区域。这一设计约束了视觉注意力的空间分布,防止模型通过“形式上看图、实际上看错位置”来获取奖励。
三种奖励形成了完整的闭环:视觉词汇奖励确保证据进入语言轨迹,视觉记忆奖励确保证据贯穿推理全程,视觉关键区域奖励确保调用的是有效证据,它们与答案正确性奖励共同进入训练流程,让依据视觉证据完成推理的轨迹获得更高相对优势,逐渐占据更多策略概率,而中途滑向纯文本推理的轨迹则被压低。
本次训练集包含38657个经过筛选的样本,每个样本都带有视觉关键词和关键区域标注。这些标注并非为了向模型灌输视觉知识,而是为奖励函数提供过程锚点,让后训练能够识别“模型何时开始忘记、忘记了什么、注意力又偏向哪里”。
实验验证:性能提升与能力保留
给推理过程增加约束,最直接的风险是过度正则化:模型可能为了反复提及图像而生成冗余描述,也可能因为注意力被强行拉回视觉token,损害原有的推理和感知能力。因此,Remember-R1需要回答两个核心问题:奖励正则化能否跨任务提升推理,以及这种提升是否以牺牲基础视觉能力为代价。
实验覆盖了数学与逻辑推理、综合多模态能力和视觉感知三类任务,Remember-R1-7B在七项基准上均优于对应的基座模型,与其他视觉遗忘缓解方法相比也展现出更具竞争力的整体表现:
- MathVista从62.30提升至69.80,提升7.50分;
- MMVet从59.44提升至72.37,提升12.93分;
- RealWorldQA从69.28提升至69.67,基础视觉感知能力没有因过程约束而下降。
前两项结果表明,过程奖励带来的收益并未局限在一种推理任务上;RealWorldQA的结果则说明,在测试范围内,Remember-R1不是通过牺牲“看见”的能力来换取“推理”的提升,而是在重新组织模型调用既有视觉能力的方式。这组实验为“后训练可以纠偏视觉轨迹分布”提供了实证支持,不过这并不等于视觉遗忘已经被彻底消除,更准确的说法是:三种过程奖励显著降低了长链推理向纯文本分布漂移的倾向。
范式升级:从结果监督到过程校准
Remember-R1表面上解决的是视觉遗忘问题,但背后触及的是大模型后训练中更普遍的问题:当结果奖励无法唯一确定正确行为时,模型究竟会学到哪一种策略?
常见的理解认为强化学习后训练主要负责激发基础模型中已有的潜在能力,但Remember-R1进一步表明,即使模型已经具备视觉感知能力,在长轨迹推理中何时调用、持续调用多久、依据哪些证据调用,仍然取决于奖励函数如何分配优势。后训练优化的不只是能力上限,也在塑造能力的调用策略——只有当视觉依赖被纳入奖励函数,策略优化才会把“持续看图”变成高概率行为。
过程奖励的本质,是给正确性增加了“证据条件”:最终答案奖励只定义模型是否答对,而过程奖励定义的是模型是否依据正确证据答对。这看似只是奖励工程的调整,实际上缓解了结果监督中的不可辨识性,让原本能获得相同结果奖励的多条轨迹在策略更新中被重新排序,视觉忠实的轨迹被上调,脱离观测的语言捷径被下调。奖励正则化并非额外教给模型一个答案,而是在改变答案背后的轨迹分布。
延伸思考:从视觉推理到长程智能
这种分布偏置并非图像问答独有。在长视频理解中,早期帧会被后续文本摘要覆盖;在屏幕操作中,智能体可能逐渐相信自己的动作描述而非最新界面状态;在机器人导航中,内部计划也可能压过实时环境反馈。这些任务都有共同的结构:外部观测相对固定或稀疏,模型内部生成的语言状态持续增长,推理越长,策略越可能从“依据环境行动”滑向“依据自身叙事行动”。
Remember-R1提供的普遍启示是:与其等模型遗忘后再增加检索、回看或验证步骤,不如在后训练阶段直接奖励“持续依据环境”的轨迹。只要能够把证据表达、记忆保持和关键区域注意力转化为可计算信号,奖励函数就有机会纠正rollout数据中固有的分布漂移。
结语
在长链推理的时代,人们习惯将更多token、更长思考和更强能力画上等号,但Remember-R1提醒我们,对于多模态模型来说,推理长度只有在证据没有中途退出时才有价值。这项工作的关键贡献不只是设计了三种视觉奖励,更是把“视觉遗忘”从推理阶段的表面故障,重新表述为可以通过后训练干预的策略分布问题。答案奖励负责告诉模型终点在哪里,过程奖励则不断校准它通往终点的证据路径。从这个意义上说,后训练的下一步可能不只是让模型获得更高分,而是让它学会:无论思考多长,都不能忘记自己的判断究竟来自哪里。
论文链接:https://arxiv.org/abs/2608.01314

