文章摘要
相关团队推出国际首个支持多学科端到端论文结果复现的AI科研能力测评基准PaperBenchX,经测试,当前表现最优的GPT-6 Astra模型完整复现率仅为13.98%,该测评首次量化了现有AI与通用AI科学家的差距,分析了AI复现的核心瓶颈,目前已开源部分测试任务供开发者使用。

一边是破解困扰人类百年的千禧年数学难题的突破性进展,一边是连基础学术论文复现都难以达标的现实差距——当前人工智能在科研领域的表现正面临着一场微妙的错位。

针对这一行业痛点,相关团队推出了PaperBenchX测评体系,试图用一套可验证的标准来衡量AI在真实科研场景中的实际能力。这一测评体系从全球范围内的学术论文中筛选出93项独立研究,覆盖电磁学、光子学、化学、材料科学、生物学、机器人学等12个研究方向,搭配10种领域原生的科学计算环境,总计包含3168条经过专家校验的评分项,是国际上首个支持多学科端到端论文结果复现的基准测试平台。

PaperBenchX的测评逻辑清晰且严谨:参与测试的智能体可以获取目标学术论文、预装了对应科学软件的容器化环境,以及明确复现任务范围的任务书,但无法提前知晓评分标准、误差容差和参考答案。智能体需要提交一份可执行的复现工作流,最终的测评不依赖智能体自述的结果,而是通过隔离环境中重新运行工作流生成的真实证据来判定。

在全部93项复现任务中,表现最优的GPT-6 Astra模型完整复现率仅为13.98%。这意味着尽管当前AI模型能够在不少任务中生成看似合理的数值结果,但真正从头跑通完整科学工作流、生成可验证且匹配论文结论的证据链的成功率,还不到七分之一。这一数据直观地展现了当前通用人工智能与能够跨越学科边界的通用AI科学家之间的真实差距。

PaperBenchX的核心价值,在于首次量化了这一差距。目前团队已经开源了覆盖全部12个研究方向的12个代表性测试任务,用于帮助开发者评测智能体、调试复现工作流,以及研究模型在真实科研环境中的端到端复现能力;同时保留了81个封闭测试任务,以维持测评体系的区分度和长期有效性。

我们可以通过测评的阶段得分数据进一步剖析当前AI在复现任务中的瓶颈:参与测试的智能体在建模和执行阶段的平均得分分别为62.70%和61.84%,但验证阶段的平均得分仅为42.80%。这说明当前智能体大多只能完成部分建模、调用求解器并生成结果文件,但无法确保这些结果真正支撑论文的核心结论,难以将各个环节串联成完整可信的复现流程。

另一个值得关注的现象是,更多的交互轮次并不必然带来更好的复现结果。轨迹分析显示,长时间运行往往意味着智能体在反复尝试故障恢复,或是在错误的模型设定上继续消耗算力。

从工作流的时间分配来看,前期的科学决策对最终结果有着决定性影响。以Fable 5为例,它将37.1%的时间用于论文理解和代码实现,是所有测试模型中前期投入比例最高的,却能够通过较少的交互次数获得接近最优的部分得分。如果几何结构、边界条件、关键参数等前期设置出现错误,即便求解器正常运行,后续的所有计算也都将失去科学意义。

团队进一步总结了达成可靠复现的三个核心要点:首先,复现的难点不在于能否跑通代码,而在于跑通的结果是否在科学上成立——一个看似匹配的数值,可能来自错误的物理模型、未收敛的仿真或是无效的后处理;其次,结果评测必须基于重新生成的证据,而非智能体的自述,需要通过删除输出、断网重跑等方式确保结果的真实性;最后,尽管当前AI已经能够生成合理的仿真代码并完成运行,但要让整个流程和最终结果都经得起科学验证,依然存在不小的挑战。

将论文复现作为智能体的测评范式并非首次提出,类似的基准测试如OpenAI的PaperBench大多局限于机器学习领域的论文。当拓展到物理、化学、材料等传统科研场景时,论文复现不再是简单的“运行代码”,而是需要应对三大核心挑战:

理解真实的科学问题:学术论文并非可直接执行的操作手册,智能体需要自主理解研究目标,判断边界条件、色散处理、关键参数等核心科学细节,而非简单按照文档运行代码

正确完成科学仿真:成功运行代码只是第一步,分辨率、求解器容差、采样时长等参数的细微调整都可能导致完全错误的数值结果,智能体需要读懂诊断信息、识别数值异常,并自主调整参数,这需要高度的学科专业知识

验证结果的科学可信度:跑出匹配论文的数值并不等同于完成了正确的科学复现,错误的模型、未收敛的仿真或是不合理的后处理都可能得到看似正确的结果,因此科学复现无法用简单的通过/不通过来判定,智能体需要能够判断结果背后的科学过程是否可靠

基于这些挑战,PaperBenchX与其他同类基准测试的核心区别体现在四大关键设计上:

第一,智能体必须在真实的科学软件环境中工作。PaperBenchX覆盖12个研究方向和10种专业仿真平台,每个领域都有独立的参数体系、计算流程和收敛判据,区别于其他局限于机器学习栈的基准测试,首次实现了在多学科场景下让智能体直接使用专业求解器如Ansys HFSS、Meep、PySCF等完成复现任务。

第二,智能体提交的工作流必须能够完整复现。在智能体提交任务后,系统会删除所有生成的输出并断开外网连接,在完全隔离的环境中重新执行整个工作流,只有能够重新生成的科学产物才能进入评分环节,彻底杜绝手动拼凑结果、依赖缓存或抄袭答案的可能。

第三,设置有限的时间预算倒逼智能体做出科研决策。单任务的时间预算为4到24小时,中位数为7小时,智能体需要自主分配算力资源,决定何时检查中间结果、何时调整参数、优先处理哪些环节,更贴近真实科研中的工作模式,而非无限试错的代码执行任务。

第四,多层次验证体系杜绝蒙混过关。科学复现无法用单一的通过/不通过标准判定,PaperBenchX将验证拆分为三个层次:首先检查能否在隔离环境中重跑工作流,过滤掉无法实际运行的方案;其次验证证据链的可追溯性,确保每个结果都能对应到具体的计算过程;最后从科学合理性角度进行判断,对于可量化的指标由程序自动检查,需要专业知识的环节则由大模型评审,且智能体的自述文字不会被作为有效证据。

那么,如何将一篇学术论文拆解为可执行、可重算、可客观判定的复现任务?PaperBenchX的每一道测试题都需要经过“构建候选任务”和“验证与审核”两个阶段,总计九个步骤才能正式进入测评体系,最终将论文中的科学结论转化为一条可由智能体执行、环境重放、证据重算并由评分器验证的完整科学工作流。

想要了解更多关于如何将学术论文转化为可测评的复现任务的细节,可以访问项目的开源仓库与官方博客:

https://github.com/UniPat-AI/PaperBenchX

https://unipat.ai/blog/PaperBenchX

以上内容不代表本平台立场,仅供读者参考