文章摘要
近期行业人士指出顶会论文存夸大、造假问题。7月,科研分析机构对ICML 2026的168篇Oral论文复现验证,完成105篇,仅8篇合格。复现问题多、成本高,有问题论文收益高风险低。大模型前沿从业者少读论文引争议,产业界招聘仍看重论文,其在学术传播与人才竞争中的地位尴尬。

近期有行业人士直指顶会论文存在大量夸大其词甚至造假的问题,引发了学界和产业界的广泛讨论。这一声音并非空穴来风,此前就有网友针对一篇效果异常突出的顶会论文展开溯源,最终发现了其中暗藏的“捷径”。

想要验证一篇顶会论文的真实性,往往需要经过三重校验:首先看代码是否开源,其次检查实验设计是否存在不合规的操作,最后还要确认最终结果能否支撑论文的核心结论。而有团队真的针对顶级会议论文展开了系统性的复现验证工作。

105篇中,只有8篇“合格”

今年7月,由芝加哥大学相关学者联合创办的科研分析机构,公布了一项针对顶级会议论文的大规模复现审稿实验。此次实验选取的样本是ICML 2026的全部168篇Oral论文——要知道本届ICML一共收到了超过2.3万篇投稿,最终仅有0.7%的稿件能够获得Oral资格,这些论文已经是万余篇投稿中的顶尖成果。

不同于传统审稿仅依靠阅读论文文本,此次实验团队不仅会研读论文的方法、实验设计和结果,还会下载公开的代码、模型与数据集,配置完整运行环境后复现实验过程,再将复现结果与原文进行逐一对标验证。

在168篇Oral论文中,仅有104篇提供了开源代码,最终团队完成了105篇论文的完整复现工作。在这些复现结果中,仅有34篇的复现比例超过40%,而复现比例达到80%以上的合格论文,仅剩下8篇。

从整体数据来看,无论每篇论文包含1项、3项还是5项可验证的核心主张,复现得分的中位数始终维持在28%到30%之间,整体分布差异不大。即使排除掉未正常运行、提前中止或者超出现有硬件能力的实验样本,复现得分的中位数也仅在42%到50%之间,当论文至少包含3项可验证主张时,这一中位数稳定维持在42%。

复现过程中遇到的问题五花八门,最常见的包括代码无法正常运行、依赖文件缺失、环境配置说明不完整、第三方依赖包损坏,甚至出现了复现结果与论文声称的结论完全不符的情况。还有4篇论文依赖的模型已经下线,即便后续研究者愿意投入时间和资金,也无法复现原始结果。

实验团队还列举了两个极具代表性的案例:其中一篇论文将“仅训练基础模型0.77%的参数”作为核心卖点,但实际发布的训练检查点中,参数训练比例达到了6.31%,约为宣称数值的8倍;另一篇论文展示了由裁判模型评分的可靠性表格,但开源代码中既找不到对应的裁判模型,也没有能够计算出表格数据的脚本文件。

劣质论文,收益高风险低

这样的复现结果已经足够令人失望,但更值得警惕的是,此次发现的问题还只是“有条件被发现”的部分。那些没有公开代码的论文,几乎完全无法被第三方验证,相当于天然拥有了“无懈可击”的外衣。

即便代码完全公开,想要完整复现一篇论文的实验成本也极其高昂。根据该团队基于云平台公开按需定价的估算,完整复现一篇ICML Oral论文的成本中位数约为8900美元,在105篇完成复现的论文中,有17篇的复现成本超过10万美元,其中成本最高的一篇甚至接近220万美元。

论文对大规模算力的依赖程度越高,独立复现的难度就越大。没有代码,外界无从核查论文真实性;即便有代码,也很少有团队能够承担如此高昂的时间、精力和资金成本。这就导致存在问题的论文完全可以顺利通过评审、获得引用,进而被写入简历,成为申请深造、竞聘教职或是获得大厂工作机会的敲门砖。即便偶尔有人发现结果不符,会议方也很少启动重新审查程序,论文往往也不会被撤回。

这也正是不少评论中提到的现状:做出存在问题的研究能够获得实际收益,但几乎不需要承担任何代价。

不读论文,但是招聘要看论文

在大模型领域,确实有不少前沿实验室的从业者表示,他们已经很少阅读公开的顶会论文。作为站在产业最前沿的研究者,他们拥有充足的算力资源、快速的实验反馈渠道以及大量未公开的内部实验结果,确实拥有“不读论文”的底气。

但这样的言论却引发了不小的争议,有评论犀利地指出这是“上岸后抽走梯子”:这些前沿从业者从高校挖走研究人员,依托学术界公开积累的研究成果,用更高的薪酬和算力资源抢走顶尖人才,自身却越来越少接受同行评审,转头却宣称学术研究大多是骗局。

虽然这样的评价略显刻薄,但却道出了当前行业的矛盾:真正有资格“不读论文”的人,往往已经凭借发表顶会论文跨过了学术门槛。而对于缺乏产业经验的学生和年轻研究者来说,顶会论文依然是证明自身研究能力最直接的凭证,申请博士项目、竞聘教职或是进入顶级实验室,都需要依靠论文获得关注。

产业界的从业者在进入大厂或前沿实验室后,开始轻视顶会论文的价值,但在招聘新人时,依然会用论文数量、会议级别和引用量作为筛选标准。这就让顶会论文陷入了一个尴尬的境地:它在学术知识传播中的可信度受到了广泛质疑,但在人才竞争中的核心价值却丝毫没有减弱。

所以“前沿实验室已经不读论文了”这样的说法,听起来多少有些清高和傲慢,毕竟能说出这话的人,大多已经凭借论文跨过了那道学术门槛。

当然,并非所有学生都在刻意造假。有高校研究者开玩笑称,他甚至希望自己的学生能够有能力写出一篇夸大其词甚至造假的论文——毕竟还有不少研究者还在为掌握LaTeX排版、完成基础的实验设计而苦苦挣扎,一边是想要投机取巧的学术造假,另一边是连入门门槛都难以跨越的新手,两者之间的差距令人唏嘘。

参考链接:

https://x.com/MathewShen42/status/2084465434506768867

https://x.com/kellerjordan0/status/2084721463089902074

https://sai.science/blog/how-much-science-is-verifiable

https://x.com/mengyer/status/2085134204786921886

以上内容不代表本平台立场,仅供读者参考