文章摘要
生成式AI广泛应用于科研领域后,有观点提出其可能放大学界已存在的“生产—进步悖论”:当前科研论文产出指数增长,但真正的科学进步已明显放缓。AI会加剧论文过度生产、错误难发现、“有预测无理解”等问题,要改变现状,需科研体系调整激励方向,从追产量转向奖励真正的科学理解与突破。

当生成式AI被广泛应用于科研场景时,很多人相信它会大幅加速科学进步——从治愈疾病到拓展太空探索,甚至在十年内完成过去百年的进展。但一个反直觉的问题正在浮现:AI会不会让论文产出的速度变得更快,却反而拖慢了真正的科学进步?

要理解这个问题,首先要面对“生产—进步悖论”:全球学术论文的发表速度在1900到2015年间增长了约500倍,每12年就能翻一番,参与科研的人数和主要国家的研发投入也在快速增长,但无论用哪种指标衡量,真正的科学进步速度都没有同步提升,甚至正在明显放缓。

目前科研圈、资助方和政策制定者大多在聚焦于加速论文生产,这就像在收费站拥堵的高速公路上继续加开车道,只会让问题变得更严重。

多条实证数据都指向了这个趋势:具有颠覆性的论文在全部科研产出中的占比不断下降,尽管论文和专利数量在指数增长,但真正突破性的成果绝对数量却基本保持不变;论文标题中独特词组的数量在21世纪初后陷入停滞甚至下滑;不同领域的科学家普遍认为,20世纪早期的诺奖级发现和晚近的成果在重要性上并无明显差距,研发投入的暴增并没有让顶级突破变得更具突破性;某一年诺奖表彰的发现中,诞生于获奖前20年内的比例从1970年的约90%降至2015年的50%,意味着重大突破出现得更慢,或是识别周期更长;从经济增长、摩尔定律、农作物产量和预期寿命等多个维度观察,研究者人数的指数增长被单个研究者生产率的持续下降抵消了。

这些指标虽然各有局限,比如用引用关系判断颠覆性可能受引用习惯影响,AlphaFold这类成果也未必能被该指标认定为颠覆性研究,但综合来看,相对于论文、研究者和资源的增长,科学进步确实在明显放缓。

一种常见的解释是“低垂的果实已经被摘完”,即容易解决的问题越来越少,剩下的问题难度越来越大。但这种说法最多只能解释单个领域的部分放缓,因为科学工具和既有知识一直在进步,不断创造新的研究领域,比如计算机科学、气候科学、认知神经科学等近百年才出现的学科,依然有大量新的“低垂果实”等待采摘。

更值得关注的解释是,科学的组织方式出现了问题,导致科研投入转化为真正进步的效率下降,甚至“生产速度过快”本身就成了让科学变慢的原因。

科学家的注意力是有限的,海量的论文让真正新颖的研究很容易被噪声淹没。研究者会更依赖已经被大量引用的经典论文,新增的论文越多,学术注意力反而越集中到既有范式中,新思想更难进入主流知识体系。

“非发即亡”的职业激励进一步强化了这个循环:论文数量和科研经费容易量化,而真正的科学进步却很难被及时衡量,因此大学和科研机构自然会用可量化的指标评价研究者。对个体研究者来说,选择低风险、容易发表的研究是理性的,但对整个科学共同体而言,这会抑制高风险、可能多年才能产出一篇的突破性工作。

如果科学放缓的原因之一正是过度生产,那么AI会直接放大这个问题。AI让追逐论文数量、引用量等表面生产率指标变得更容易,虽然单个研究者可能变得更高效,但整个科学共同体会因为AI输出的同质化而失去研究多样性,同时AI还会进一步加剧学术注意力的分配不均,让新思想更难浮出水面。

当前科研中的大多数AI应用本质上都是软件开发,比如用模型挖掘数据模式、编写机器学习程序或是让生成式AI产出分析代码。但科研共同体的软件工程实践远远落后于产业界,自动化测试、版本控制和设计规范等基础方法在科研中依然缺失或执行混乱。

更严重的是,同行评审通常不会审查真正执行计算的代码和数据,许多论文甚至不会公开这些材料。一项针对1800篇承诺共享代码和数据的生物医学论文的研究发现,93%最终没有兑现;研究者向顶级期刊《Science》的204篇论文作者索取代码和数据时,只有44%得到了回应。即使代码和数据被公开,错误也非常普遍,比如Excel自动将基因名称转换为日期,导致约五分之一的遗传学论文出现相关错误。

科学界花了几十年才逐渐学会负责任地使用基础统计工具,AI带来的复杂性和隐蔽错误只会更难被发现。在生成式AI出现之前,传统机器学习就已经导致30个科学领域中超过600篇论文出现方法错误;对400多篇用AI诊断新冠的论文进行审查后发现,没有一项工作能凭借可靠的方法开发出临床可用的工具。

当然,AI也可以成为解决方案的一部分,比如发现论文漏洞、自动复现实验、帮助研究者优化代码、提供测试和代码审查服务,但这要求期刊、研究机构和资助方将激励重点从“生产更多”转向培训、综合、复现和错误检测。

传统科学建模通常先提出关于世界运行的假设,再用统计模型进行检验;而AI建模更像一个黑箱,它不一定能形成可解释的世界模型,而是直接利用历史数据来提高预测准确率。这种模式在产业中往往很有用,但在科学研究中可能会阻碍真正的理解。

作者用地心说作为类比:通过不断添加“本轮”,地心模型也能非常准确地预测行星运动,甚至现代一些天文馆仍在使用类似的计算方式。日心说最终胜出,并不是因为它一开始的预测精度遥遥领先,而是因为它对行星运动给出了更简单、更深刻的解释。

科学进步依赖的是理论更新,而不仅仅是预测精度的提升。AI可能非常擅长为各个领域制造新的“本轮”:在错误的理论基础上叠加越来越精确的预测。如果更精准的预测让研究者更长时间停留在有缺陷的理论框架中,整个领域就可能在既有范式中越做越精细,却迟迟无法跳出思想上的死胡同。

一项实验就证明了这一点:一个在一千万条行星轨道数据上训练的Transformer模型,可以出色地预测轨道运动,却没有发现产生这些轨道的引力规律。这正是“有预测、无理解”的风险所在。

解决问题和撰写论文看起来像是科研的最终目的,但作者认为,这些过程更像是通往真正奖赏的仪式,真正的奖赏是人类对现象的理解。没有这种理解,就不会有真正的科学进步。

菲尔兹奖得主William Thurston曾强调,数学家的工作不只是判断数学命题的真假,而是寻找能让人类理解和思考数学的方法。他以自己研究叶状结构理论的经历为例:当他快速解决了该领域的重要问题后,其他研究者反而开始离开这个领域——并非问题已经被穷尽,而是他的成果难以理解,加上重要定理似乎已经被证明,后来者既难进入该领域,也难以通过证明新结果获得学术回报,最终,曾经存在于共同体中的前沿理解逐渐流失。

研究者之所以能在解决问题的过程中形成理解,是因为他们必须亲自穿越推理和试错的全过程。如果AI直接给出答案,却没有产生相应的人类理解,就可能切断这个形成理解的过程。作者用一个形象的比喻来解释:在健身房里使用叉车当然可以举起更大的重量,但举起重量并不是去健身房的真正目的。

并非所有科学活动都以人类理解作为最终目标,比如天气预测和材料合成更看重现实应用结果,但大多数科研领域都处于这两个极端之间。如果AI绕过理解的过程,或是只制造“理解的幻觉”,科学共同体可能会逐渐失去培养新科学家、建立新理论、综合与纠正研究、将知识迁移到其他领域,以及提出真正新问题的能力。

来自六个领域的数据已经显示,采用AI的论文更倾向于解决已知问题、在既有范式中开展研究,而不是提出新的问题。当然,AI也可以帮助人类建立隐性知识,比如解释数学证明,关键在于科研激励必须开始奖励理解,而不只是奖励答案

过去十年,科学界高速采用AI技术,但并没有同步改造缓慢变化的制度规范、质量控制和人才培养方式,这很可能让“生产—进步悖论”进一步恶化:论文发表得越来越快,真正的科学进步却未必能得到加速。2012至2022年间,在大语言模型尚未普及之前,20个领域中使用AI的论文数量就已经增长了四倍。

要改变这一现状,首先需要研究者更谨慎地采用AI,补足软件工程能力,理解AI建模的常见陷阱,并避免将AI当成拐杖或是神谕。但个体研究者大多只是理性回应现有的生产率指标,真正能改变整个系统的,是期刊、大学的招聘与晋升委员会、资助机构和政策制定者。

元科学作为用科学方法研究科学本身的学科,正在尝试衡量科研产出和进步之间的差距,但我们仍不清楚“进步”究竟该如何定义,也没有形成解释科学放缓原因的共识。科学不可能拥有一个唯一的“真正进步指标”,因为一旦指标成为目标,就会被迅速博弈,最终像论文数量和引用次数一样失去参考价值。因此,元科学需要更深入地理解进步的因果机制,并验证改革方案是否有效。目前,元科学获得的资金只占总体科研经费的零点几个百分点,专门研究科学放缓的资源更少,假如整个科研体系的投入产出效率真的下降了几个数量级,这样的投入显然是不成比例的。

科学家们早已清楚“非发即亡”的问题,但改革一直因为制度惯性、指标博弈和突破只能事后识别而屡次失败。AI或许会带来一个转机:当撰写论文的成本低到有人一年可以共同署名近百篇论文时,论文数量可能彻底失去评价价值。学术职业发展应该更多奖励难以自动化的成果,比如新理论、新范式,以及真正推动理解的工作;资助机制也需要同步做出改变。科学界不需要继续奖励“采用AI”,因为AI已经在以极快的速度扩散,采用率早已不是瓶颈。

大型AI公司往往偏爱“AI发现了某某”的醒目标题,因为这能强化AI将解决人类重大问题的叙事。公众需要对这类新闻保持怀疑:结果可能无法复现,AI也可能只是众多工具之一,却被包装成了唯一的主角。真正有价值的AI for Science工具,应该瞄准科研的真实瓶颈,而不是再造一个文献综述产品,比如帮助发现科研代码中的错误、加强质量控制,或是帮助科学家建立对研究对象的理解。数学家多次表达,他们更期待能促进人类理解的工具,而不是单纯自动证明定理的工具。

评估一个文献综述类的AI工具时,至少应该问三个问题:它是否节省了时间并保持了质量?它如何影响研究者对文献的理解?如果整个学术共同体广泛使用它,会如何改变学术注意力——是否会让知名论文获得更多关注?这三个问题分别对应生产、理解和进步三个维度,而当前的评估通常只回答第一个问题,因此必然会高估工具的收益、低估系统性风险。

作者本人也是科研AI工具的积极使用者,日常使用中的兴奋感很容易让人忽略一个关键区别:AI对单个科学家的帮助,与AI对整个科学制度的影响,是两个完全不同的问题。我们乐观地相信,从长期来看,科学界的规范和流程最终会追上技术的发展,但在此之前,这段路注定充满颠簸。

以上内容不代表本平台立场,仅供读者参考