文章摘要
最新研究质疑AI动态评测“无污染”的共识。团队发现,即便在动态基准中,仍有17.09% - 29.30%的样本存在潜在污染风险,可能使多模态自动事实核查系统的Macro - F1虚高11.34个百分点。研究指出仅靠时间戳划线会漏掉两种隐蔽污染,并设计检测流程。实验显示,动态基准确实降低了污染信号,但仍有部分声明存在污染,还会导致分数虚高与排名错乱。

当下,AI评测领域最受关注的概念之一便是Live Benchmark(动态评测基准)。不少团队为了规避训练数据污染的问题,选择持续收集模型知识截止日期之后发布的新测试样本,按月或按季度更新评测集,试图打造真正无懈可击的动态评测体系。

这种动态评测的逻辑看似无懈可击:既然测试题目诞生于模型训练截止之后,模型不可能提前接触到相关内容,理应能真实反映其处理未知信息的能力。但最新的学术研究却对这一共识提出了质疑:仅仅以发布时间晚于模型知识截止日期作为标准,并不意味着测试样本真的超出了模型的既有知识储备。

有评论将这种现象类比为「Déjà Vu」(既视感):当模型面对一条看似全新的测试样本时,其实早已在训练数据中掌握了相关的核心信息,只是换了一种提问方式。来自学术团队的研究发现,即便在专门收集“截止日期之后”新测试样本的动态基准中,仍有17.09%–29.30%的样本存在潜在污染风险。

换句话说,你的评测基准看起来很「Live」,对大模型来说却未必真的「Live」。一道看似刚刚发布的“新题”,可能只是把旧知识换了个问法。这种污染最高可令多模态自动事实核查系统的Macro-F1 虚高 11.34 个百分点,甚至直接改写模型排行榜。

本次要介绍的研究《Novel Claim or Déjà Vu? Rethinking “Contamination-Free” Dynamic Evaluation for Multimodal Automated Fact-Checking》,由多家高校的研究团队共同完成,已被多媒体领域国际顶级会议 ACM Multimedia 2026 接收。研究首次系统审视了一个被广泛默认的前提:动态评测真的“无污染”吗?

ArXiv:https://arxiv.org/abs/2607.23514
代码: https://github.com/TrustworthyComp/Rethink-MAFC-Eval
项目网页:https://trustworthycomp.github.io/Rethink-MAFC-Eval/

从静态到动态:评测基准追着新闻跑的误区

虚假信息早已不只是文字谣言:一张移花接木的图片、一段脱离语境的视频,再配上一句极具煽动性的描述,就足以在社交平台快速扩散。为应对这类内容,当前先进的多模态自动事实核查系统通常会像一名调查记者一样工作:先理解待核查的文字、图片或视频,再调用搜索工具从开放网络收集证据,最后综合判断该声明究竟是“得到支持”“被证伪”,还是“证据不足”。

但现有系统大多在静态基准上接受检验,其中最新的声明也只到2020年,而今天主流大模型的训练数据早已覆盖了大量相关事件、报道和事实核查文章。这就产生了一个非常现实的问题:我们以为是在测试模型“会不会查”,实际上可能只是在测试它“记不记得”。

如果模型已经从训练数据中见过相关事件,甚至见过原始事实核查文章,那么它完全可能绕过外部证据检索,仅凭参数中储存的知识答对。最终分数看起来很高,却无法代表系统处理真正突发新闻的能力。

为了破解这一难题,研究社区开始采用动态评测:持续收集模型知识截止日期之后发布的新声明,并按月或按季度刷新测试集。LiveBench等通用大模型评测,以及多模态事实核查领域的相关基准,都体现了这种“用持续更新对抗数据污染”的思路。其逻辑非常直观,只要题目出现得足够晚,模型就不可能在训练时见过它。

可惜,数据在时间上是Live的,不代表它在知识上也是Live的。

两种隐蔽的数据污染类型

研究团队指出,仅靠时间戳划线,会漏掉两种更隐蔽的污染。

1. 新发布的声明,可能问的是一个老事实

一篇事实核查文章可能发布于2025年,但它讨论的对象可能是一项几十年前颁布的法律、一场几年前已经报道过的事件,或一项长期公开的政策。比如论文中的一个例子涉及美国《紧急医疗和劳工法案》(EMTALA),相关声明与事实核查文章虽然出现在模型知识截止日期之后,但这部法律早在1986年就已颁布,核心条款也被长期公开记录。

大模型即使没有见过这篇“新文章”,仍可能依靠训练时掌握的旧资料给出完整判断。此时,新闻发布时间是新的,核查所需的证据却一点也不新

2. 声明本身是新的,但答案可以由旧事实“拼”出来

另一类情况更隐蔽:某个说法可能从未出现过,但判断它所需的每一块拼图都早已存在。比如论文分析了一条关于Barron Trump能否在2028年竞选美国参议员的声明。即使这条具体说法是全新的,模型只需要组合两条旧知识:

  • Barron Trump出生于2006年;
  • 美国宪法规定参议员必须年满30岁。

简单计算即可得出:到2028年,他仍达不到年龄要求。模型没有见过原题,也没有读取最新事实核查文章,却仍能凭已有知识完成验证。

这种能力本身当然不是坏事;问题在于,如果测试的目标是衡量系统能否针对真正未知的新事件检索外部证据,那么这类样本就会让评测失真。

这正是论文标题中“Novel Claim or Déjà Vu?”的含义:对人类事实核查机构而言,它是刚刚出现的新声明;对大模型而言,它可能只是一场似曾相识的“昨日重现”。

基于证据充分性的污染检测方法

看不到大模型的训练数据,如何判断一条测试样本是否已经被模型内部知识覆盖?研究团队设计了一套基于证据充分性的污染检测流程,它不要求访问模型参数或训练语料,而是直接检查:如果不让模型上网,它仅凭内部知识,能否复现人类事实核查员使用的关键证据?整个流程可以概括为三步。

第一步:让模型“闭卷”撰写事实核查文章

研究人员把待核查声明交给目标模型,要求它仅依靠自身参数知识生成一篇事实核查文章。这样得到的内容,相当于模型“记忆库”的一次外显。如果声明确实涉及模型从未接触的新事件,它理应无法给出充分而具体的证据;反之,如果它能准确写出与专业核查文章高度一致的事实,就说明该样本可能没有真正考到外部检索能力。

第二步:从人类文章和模型文章中提取证据

随后,系统分别从专业事实核查机构撰写的原始文章,以及大模型生成的文章中提取关键证据。这一步会去除文风、广告、网页提示等无关差异,只保留真正支撑或反驳声明的事实信息。即使证据原本来自图片、音频或视频,也会被整理为可比较的文本陈述。

第三步:一对一匹配两组证据

最后,研究人员使用匈牙利匹配方法,在模型证据与人类证据之间寻找最佳的一对一对应关系,并从字面与语义两个层面计算相似度。为了避免只抓到“原句复读”而漏掉同义改写,论文同时采用:

  • METEOR,检测较严格的文本重合;
  • Gemma-Emb-0.3B与Qwen3-Emb-0.6B,检测语义层面的相似。

若模型仅凭内部知识生成的证据已经足够接近人类核查证据,该声明就会被标记为对该模型存在潜在污染

值得注意的是,这里的“污染”并不只指模型逐字背过某条测试数据。它采用的是更贴近事实核查任务的定义:模型是否已拥有足够的内部知识,可以绕过本应接受考验的外部证据检索环节。

实验验证:动态评测仍未彻底净化

为了检验动态评测究竟能把污染降低到什么程度,研究团队对比了两个数据集:

  • 静态基准AVeriTeC:去重后包含491条声明,声明最晚发布于2020年;
  • 动态基准ClaimReview2025Q4:研究团队从国际事实核查网络签约机构的文章中收集并清洗出901条英文声明,全部发表于2025年第四季度。

研究覆盖6个主流闭源与开源模型:GPT-5.2、GPT-4o-Mini、Gemini-3.0-Pro、Gemini-3.0-Flash、DeepSeek-V3.2,以及Qwen3.5-122B-A10B。

好消息是,与静态基准相比,动态基准确实降低了污染信号

  • 按METEOR衡量,平均污染分数下降2.92–4.95个百分点
  • 按两种语义指标衡量,平均下降6.20–11.16个百分点

但坏消息更加关键:当研究人员采用严格标准,只统计同时被三种指标识别的样本时,ClaimReview2025Q4中仍有17.09%–29.30%的声明存在潜在污染,具体比例因模型而异。

也就是说,即使测试题全部来自知识截止日期之后,每10道题中仍可能有接近3道,可以被模型用已有知识“绕过去”。语义指标发现的污染样本也显著多于纯文本匹配。这意味着,现实中的污染往往不是一句话原封不动地出现在训练语料中,而是模型掌握了同一事实的不同表述。若只检查关键词或句子重合,风险很可能被严重低估。

污染的真实影响:分数虚高与排名错乱

发现污染只是第一步。更重要的问题是:这些“似曾相识”的题,究竟会把系统成绩抬高多少?研究团队将6个模型分别接入先进的多模态事实核查框架DEFAME,该系统能够调用网页与图片搜索工具,自主反复检索证据。随后,研究人员把同一时间段、同一来源中的声明分为“潜在污染”与“未污染”两组,比较模型表现。

结果非常直接:所有模型从污染子集转到未污染子集后,Accuracy和Macro-F1均出现下降。

  • Gemini-3.0-Flash的Macro-F1从61.22%降至49.88%,相差11.34个百分点
  • Qwen3.5-122B-A10B的Accuracy从74.62%降至63.74%,相差10.88个百分点
  • GPT-4o-Mini的Accuracy与Macro-F1分别下降9.609.59个百分点
  • Gemini-3.0-Pro的Accuracy与Macro-F1分别下降10.508.57个百分点

对其中4个模型,研究观察到统计显著的性能下降。更值得警惕的是,污染不仅抬高绝对分数,还会改变模型之间的相对排名

在污染子集上,Gemini-3.0-Flash以61.22% Macro-F1排名第一;到了未污染子集,第一名却变成了GPT-5.2,Macro-F1为52.81%。这意味着,如果不控制污染,我们不仅可能高估所有系统,还可能选错“最好”的那个模型。对于依赖榜单决定研究方向、系统选型与资源投入的团队而言,这不是几个百分点的小误差,而是可能影响整个技术判断的系统性偏差。

搜索轨迹揭示的作弊逻辑

为了弄清污染如何影响事实核查过程,研究团队进一步分析了模型的搜索轨迹,并将相邻两次查询的变化分为四类:

  • 具体化:增加约束,把搜索范围收窄;
  • 泛化:放松约束,把搜索范围扩大;
  • 探索:转向同一主题的另一个侧面;
  • 重复:再次发出相同或近似的查询。

结果显示,面对未污染声明时,模型会显著增加“探索”型搜索:它需要切换视角、尝试替代关键词、检查更多可能的证据路径,才能逐步接近答案。而面对污染声明时,模型仿佛已经知道应该去哪里找。它发出的查询更加精准,更容易在前几条结果中命中相关证据,也就不必充分探索整个证据空间

这揭示了污染抬高分数的真正机制:模型表面上完成了“搜索—阅读—判断”的完整流程,内部知识却已经提前为它标好了检索路线。它看起来像一名高效的调查记者,实际上更像一名提前拿到线索提示的考生。评测最终奖励的,可能并不是面对未知事件时的调查能力,而是模型记忆与测试题之间的暗合程度。

严格过滤后的真实评测结果

最后,研究团队构建了一个更严格的统一评测集:只有当一条声明对全部6个模型、在全部3种相似度指标下都未被识别为污染时,它才会被保留。901条动态声明经过层层筛选,最终只剩下154条。在这个污染受控的评测集上,排行榜再次发生变化:

  • DeepSeek-V3.2取得最高Macro-F1:55.93%
  • GPT-5.2为51.66%
  • Gemini-3.0-Pro为50.88%
  • 其余模型均低于50%。

所有模型的Macro-F1都没有达到56%。这组结果撕掉了高分背后的“记忆滤镜”:当测试真正聚焦于模型尚未掌握、必须依靠外部检索才能判断的新声明时,当前多模态事实核查系统远未成熟。

对AI评测体系的反思

这项工作的意义,并不是否定动态评测。恰恰相反,实验已经证明,持续加入知识截止日期之后的新声明,确实能够明显缓解静态基准的污染问题。但它同时提醒我们:时间上的Live只是一道必要条件,不是知识层面“无污染”的充分保证。

一道题是否真正新颖,不能只看它什么时候发布,还要看:

  • 核查所需的关键事实是否早已公开;
  • 模型能否直接从参数知识中复现人类证据;
  • 答案是否可以由多条旧知识简单组合得到;
  • 系统是否真的进行了充分的外部证据探索。

未来更可信的事实核查评测,不能满足于“把时间戳推到模型训练之后”,还需要把污染检测变成数据构建的常规环节:先让模型闭卷作答,再比较其内部知识与人类证据,过滤掉能够走捷径的样本,并持续审计模型的真实搜索轨迹。

这篇论文最终抛出的,其实是一个远超事实核查领域的问题:当大模型已经吞下如此庞大的公共知识,我们究竟该如何证明,一道测试题真正测到了它的未知能力?

“新发布”不等于“新知识”。如果评测系统分不清二者,那么越来越高的榜单分数,可能并不意味着AI更会调查事实,只意味着我们越来越擅长用新包装,重复考它早已知道的答案。而一个无法准确测量能力的评测,最终也无法可靠推动能力进步。

以上内容不代表本平台立场,仅供读者参考