文章摘要
AI 顶会投稿量激增,同行评审评分尺度不一致问题凸显。华中科技大学李钦宾团队在 ICML 2026 提出用 LLM 校准“评语—分数”映射关系。方案在现有流程加校准模块,多实验证实可缩小评分偏差,使评审更稳定、结果更合理。

NeurIPS 2025共收到21,575篇论文投稿,相比2020年增长超过一倍;同期ICLR 2026的投稿量也逼近2万篇。随着AI顶会热度持续走高,海量稿件涌入的同行评审体系,长期存在的痛点被无限放大。

不少投稿人都有过类似的困惑:两份措辞高度接近的审稿意见,最终给出的分数却相差巨大,如今投一篇顶会论文,体验越来越像一场纯靠运气的抽卡游戏。比如两位审稿人都认为论文“缺少必要的消融实验”,其中一位认为只需补充实验便可以接受,给出较高评分;另一位则将其视为影响论文质量的关键缺陷,直接打出低分。表面上两人的评审意见高度一致,真正的差异在于他们对同一句评语的评分尺度截然不同。随着投稿规模不断扩大,这种评分尺度的不一致,正成为影响同行评审公平性和稳定性的核心因素。

针对这一问题,华中科技大学李钦宾研究团队在ICML 2026 Position Paper Track提出了全新的解决思路:并非让大语言模型替代人类审稿,而是利用LLM对“评语—分数”之间的映射关系进行校准,为同行评审补充一层统一的评分参考尺度。

为何不直接用LLM替代人工审稿?

面对评审人手不足、打分标准混乱的现状,不少人会提出直接让LLM完成全自动审稿的方案,但该团队给出了否定的答案。

学术评审绝非简单的对错判断,还需要综合衡量研究的创新价值、领域发展意义以及长远研究潜力等高阶学术认知,这类深度的领域判断依赖研究者长期积累的行业经验,很难完全交由模型独立完成。

除此之外,完全由AI主导评审还会催生学术投机乱象:如果作者知晓论文命运由大模型裁决,写作重心会转向刻意迎合模型偏好,而非聚焦真实科学问题的突破,彻底偏离学术研究的初衷。

团队指出,目前同行评审实际上包含两个过程:一是审稿人阅读论文并形成定性判断;二是将这些定性判断压缩为一个最终分数。真正容易出现偏差的,恰恰是第二步的分数映射环节。因此该工作的目标并非构建自动审稿系统,而是解决“如何让文字评语和最终评分保持一致”这一长期存在的评审痛点。

在现有流程中加入评分校准层

该方案没有改变现有的同行评审流程,而是在后台新增了一层LLM校准模块(Calibration Layer),整个流程可以分为三个核心环节:

  • LLM对审稿人的自由文本意见进行结构化分析,将其整理为论文的优点(Pros)和缺点(Cons);
  • 在统一的Prompt和固定评分标准下,根据整理出的优缺点生成锚点分数(Anchor Score),作为统一尺度下的参考分数;
  • 系统对比审稿人实际给出的评分与锚点分数之间的差值(Residual):如果两者接近,说明评分与评语基本匹配,无需额外处理;如果差距较大,则触发轻量级复核流程,要求审稿人重新确认当前评分,或者补充更多文字说明,解释为何自身评分明显偏离常规尺度。

在整个过程中,LLM不会新增任何学术评价,也不会参与录用决策,更不会替代领域主席(AC)或程序委员会(PC)的判断。它更像是一名“评分审计员”,负责检查分数是否能够被评语合理支撑。

三届顶会数据证实评分尺度差异逐年扩大

团队基于ICLR 2023至2025三届顶会的公开评审数据开展了大规模实证分析,数据集覆盖超过2.2万篇论文、5.2万条评审记录,能够真实反映近年来顶会评审的实际状态。

数据清晰证实,顶会审稿存在明显的年度尺度漂移:不同审稿人的打分标准差异逐年变大,相同评价对应悬殊分数的现象愈发普遍。从量化指标来看,衡量评审分歧的核心偏差跨度指标逐年上涨:2023年整体偏差相对可控,2024年小幅恶化,到2025年打分离散程度显著提升,极端不合理打分的占比持续走高。随着投稿量激增,审稿人的主观打分标准越来越不统一,评审的随机性和不公平性逐年加剧。

校准后的评分更贴合论文长期学术影响力

顶会评审中最具争议的通常是录用边缘论文(Borderline Papers),这类论文往往处于录用与拒稿的临界区间,一点评分差异就可能影响最终结果。为了验证校准机制能否改善这一问题,团队以论文的长期引用量作为客观参考指标,对比了人工原始评分与LLM锚点校准后的论文排序结果。

实验结果显示,经过统一评分尺度校准后,论文排序与长期学术影响力之间具有更高的一致性。以ICLR 2023的数据为例,在最难取舍的5-6分临界区间,LLM校准筛选出的论文,其平均引用量相比仅依据人工评分筛选的结果提升了94%。这一结果说明,统一评分尺度后,可以在一定程度上减少不同审稿人评分习惯带来的影响,使评审结果更加一致,也更容易保留后续产生较大学术影响力的边缘论文。

离线仿真复核实验有效缩小评分偏差

除了离线分析之外,团队还针对高偏差的评审样本开展了离线仿真复核实验。当审稿人的实际评分与锚点分数存在较大偏差时,系统会自动触发轻量级复核流程,请审稿人重新确认当前评分,或者补充更多文字说明来解释评分依据。

实验结果显示,这种基于差值的复核机制能够有效缩小缺乏评语支撑的评分偏差,在保留合理学术分歧的同时,减少由个人评分尺度差异带来的极端打分。

团队强调,这一机制并不会统一所有审稿人的观点,也不会改变同行评审的决策流程,而是在保留专家判断的前提下,为评分提供一套统一的参考尺度。随着AI顶会投稿规模持续增长,同行评审面临的压力仍在不断增加,该方案通过在现有流程中增加一层校准机制,希望借此减少评分尺度不一致带来的随机性,为同行评审提供更加稳定的参考依据。

论文链接:https://openreview.net/forum?id=PEyouQzOLD

以上内容不代表本平台立场,仅供读者参考