文章摘要
近期,开发者查看顶会论文开源代码时发现问题,引发学界对论文可信度的讨论。自动化科研验证团队将AI应用于论文结果复现,对ICML 2026年168篇Oral论文核查,成功复现105篇。多数论文未通过严格验证,复现成本高昂。公开代码也不一定能复现结果,系统还发现903个人工审稿盲区,不过该工具仍处测试阶段。

近期有开发者在查看顶会论文的开源代码时,发现疑似存在用测试集标签选择模型参数的操作,这一事件引发了学界对顶会论文可信度的广泛讨论。有知名实验室的研究者指出,当前不少顶会论文存在过度宣传,甚至触碰学术诚信边界,尤其是那些吸引眼球的亮眼成果,更需要谨慎验证。

针对这一行业痛点,自动化科研验证团队开始将AI Agent应用到论文结果复现环节,不再仅依靠阅读论文文本,而是通过实际运行实验、核对核心结论的方式验证论文真实性。该团队近期完成了对ICML 2026年全部168篇Oral论文的系统性核查,其中成功复现了105篇论文的完整实验流程。

在至少包含5条可核验核心主张的92篇论文中,仅有8篇的复现得分超过80%,也就是说绝大多数顶会录用论文的结论,并未经过严格的实验复现验证。同时,该团队还在代码与可复现性维度,发现了903个人工审稿完全未提及的问题。

AI驱动的科研验证新路径

不同于传统同行评审仅基于论文文本进行评估,不要求审稿人搭建运行环境、实际执行代码,自动化验证流程会从论文中提取关键研究主张,获取公开的代码、数据集与模型文件,运行完整实验后将结果与原文逐一比对。团队不仅关注论文能否被复现,还统计了完整复现的成本,对比了自动化验证与人工审稿的覆盖范围差异。在168篇ICML 2026 Oral论文中,近八成包含实验环节,仅判断方法合理性与叙述逻辑远远不够,要验证结论真实性必须实际运行实验。

复现顶会论文的真实投入

按照公有云按需服务的价格估算,完整复现一篇Oral论文报告的全部实验的中位成本约为8900美元,其中17篇论文的复现成本超过10万美元,最高的单篇接近220万美元。这一统计覆盖了正文、附录、消融实验、超参数搜索,以及跨随机种子、数据集和模型规模的全部重复运行环节,且属于保守估算——如果算上研发过程中多次尝试的额外开销,实际成本可能再增加2到3倍,此外人力薪酬与其他基础设施成本并未纳入统计。有一篇论文仅预训练阶段就使用了80张A100显卡,累计消耗38400个GPU小时。

复现结果的巨大反差

尽管复现投入不菲,但多数论文并未通过严格的验证。168篇参评论文中,仅有104篇发布了可直接运行的代码。团队优先选择资源需求较低的论文开展复现,最终67篇直接运行了作者发布的开源代码,剩余38篇因未提供可运行代码,由系统根据论文描述重新实现。

在92篇具备至少5条可核验主张的论文中,34篇的复现得分超过40%,仅有8篇得分突破80%。复现得分的中位数为28%,这里的得分并非论文整体正确率,而是指已尝试复现的研究主张中,与原文结论一致的比例。如果仅统计未缩小实验范围的完整运行场景,符合条件的论文减少至80篇,复现得分中位数提升至42%。

开源代码不等于可复现

值得注意的是,公开代码并不等于可以直接运行,能够运行也不代表能复现论文中的核心结果。在105篇完成复现的论文中,101篇至少存在一类复现障碍:58篇无法按照发布状态直接运行代码,48篇的实验数据与论文描述不一致,42篇缺少关键数据集,38篇未提供可运行代码,此外还有训练好的模型未公开、代码实现与论文描述不符等问题。更棘手的是,有4篇论文依赖已经退役或无法访问的模型,其报告的结果如今已无法按照原条件复现。

比如有一篇论文将仅训练基础模型0.77%的参数作为核心卖点,但公开的检查点实际训练比例达到6.31%,两者相差约8倍;另一篇论文给出了由裁判模型评分的可靠性表格,但代码仓库中既没有对应的裁判模型,也没有生成这些数据的脚本,这类问题仅通过阅读论文正文很难被发现。低复现得分并不等同于作者故意误导,代码老化、专有数据无法公开、运行环境差异都可能导致复现失败。

人工审稿的盲区

在人工审稿已经覆盖的问题中,78%也被自动化验证系统发现。在代码与可复现性维度,系统发现了903个人工未提及的问题,而人工发现但系统遗漏的同类问题仅有22个。不过在创新性与研究定位的判断上,人工审稿仍具备不可替代的优势。

团队同时提醒,该自动化验证工具仍处于Beta测试阶段,其发现的问题需要进一步交叉核对。这一项目也再次印证:公开代码不等于可以直接复现实验结果,能够运行代码也不意味着能重现论文中的核心数据与结论。

以上内容不代表本平台立场,仅供读者参考