深度原理等提出AI科研“发现回合”评测新标准

2026年以来,全球AI for Science赛道迎来爆发式增长:谷歌前首席科学家Jeff Dean离职创办AI4S企业Discovery Loop,OpenAI、Anthropic、英伟达等科技巨头纷纷官宣入局,这批玩家的核心目标不再局限于打造科研辅助工具,而是希望构建能够自主完成“假设生成→实验设计→执行验证→迭代优化”完整科研循环的“AI科学家”。国内企业深度原理成立于2024年,是全球最早布局AI自主科研方向的企业之一。
这一赛道蕴藏着万亿级的产业价值:一旦AI实现自主闭环科研,将从单纯的软件服务提供商,升级为新材料、新药物等实体产业的核心生产力基座。同时,AI驱动的科学发现已经被纳入我国新一轮科技强国战略,获得了国家层面的高度重视。
随着赛道热度持续攀升,一个核心问题摆在行业面前:如何客观评价这些“AI科学家”的真实科研能力?长期以来,行业通用的评价标尺是HLE类闭卷知识考试,这类考核仅关注最终答案,完全忽略了答案生成的推理和执行过程。许多在这类考试中拿到高分的AI科研工具,在实际实验中会暴露明显缺陷:比如能够流畅引用学术文献,但无法针对异常数据进行反思调整;或是给出看似逻辑严密的实验方案,却无法在实际场景中落地执行。
2026年8月19日,一篇名为《Measuring AI Scientists: From Exams to Discovery》的论文正式发布,首次为AI真实科研水平提出了系统完整的评价范式,填补了行业长期以来的评价空白。该论文由深度原理联合微软研究院、斯坦福大学等全球顶尖产学机构共同完成,邀请了多位AI4S领域的泰斗级学者参与框架搭建——包括全球最大材料开源数据项目Materials Genome与库Materials Project创始人Kristin Persson、《Nature》期刊Co-Scientist论文核心作者Andrew White、科研智能体评测标杆ScienceWorld核心开发者Peter Jansen、2023年《Nature》AI4S综述第一作者Yuanqi Du、Terminal Bench最后通讯作者Ludwig Schmidt等,甚至包含了不以AI见长的诺贝尔化学奖得主Frances Arnold的署名,这一细节也体现出科学界对该赛道的日益重视。其中深度原理作为唯一的中国产业代表,将一线研发管线的实战经验融入框架,让这套评价体系具备了极强的落地可操作性。
这篇论文的核心创新,在于提出了发现回合(discovery episode)评估体系。与传统的应试考核逻辑截然不同,这套体系采用综合考核模式,全程记录AI在完整科研周期中的每一步决策,最终对整条科研轨迹的科学性、严谨性与有效性进行综合评分。具体来看,评估体系围绕科研闭环的三个核心阶段——科研假说生成、实验方案执行、实验结果解读,分别建立了独立的评判维度,最终还会通过全流程闭环测试,综合衡量AI产出真实科研发现的能力。此外,该体系重新定义了失败数据的价值:失败的实验数据并非无用的废料,而是训练和评估AI科研能力的核心资产,就像人类科学家会从失败中总结经验、规避弯路一样,AI科研也需要从试错过程中学习迭代。同时,考核还对AI科研结果的真实性与独立性提出了高标准要求,确保最终产出的是可实证的真实新发现,而非无法验证的自宣称成果。
在这一标准论文发布之前,头部AI4S玩家已经在产品中跑通了完整的科研闭环逻辑,深度原理的MIRA平台就是其中最典型的产业样本。与普通科研AI作为“答题工具”、仅根据科研人员给出的明确问题返回对应答案的定位不同,MIRA搭建了覆盖“假设生成→模拟计算→实验验证→知识沉淀”的完整闭环系统,通过三层架构实现了真实科研团队的完整协作逻辑:
- 上层是分工协作的多智能体小队,能够统一规划和调度整个科研进程;
- 中层是打通高性能计算与自动化实验室的双执行引擎,实现了湿实验室与干实验室的高效联动;
- 底层则是可沉淀、可复用的科研记忆体系,能够留存每个项目的实验数据与试错结论,为后续研究提供坚实的基础。
这套设计的产业价值已经通过公开基准测试得到了充分印证。在化学、能源、材料综合评测Research Claw Benchmark以及药物发现评测Science Agent Arena中,MIRA均位列第一,其中在Science Agent Arena药物发现榜单中以81.1%的综合分登顶,同时完成单项任务的平均成本处于行业最优水平,在性能与成本两个维度都形成了显著优势。深度原理此前推出的React-OT模型,能够在0.4秒内完成化学反应过渡态的计算,为MIRA平台奠定了底层的高精度计算能力,而MIRA的演进路径,也正是整个AI4S行业从单点工具到全流程平台、从分散应用到闭环生态的缩影。
作为这套评测体系的核心产业共创方,深度原理依托MIRA平台与自建的高通量实验平台形成的干湿闭环,在锂电、工业冷却液、新能源材料等多个赛道布局了多条自研管线,由AI主导全周期科研流程,真实沉淀完整的闭环科研数据,让MIRA平台与评测框架形成持续的互相验证与迭代。这种跨越干湿实验室的完整科研实践数据,是帮助AI快速掌握假设边界、规避重复试错的核心资产,也将成为下一阶段AI for Science发展的关键基础设施。
这一标准范式的发布,是AI for Science赛道的一个重要里程碑,为所有赛道玩家划出了清晰的评判标尺。不过,检验这套新标尺的数据门槛极高,只有像深度原理、Edison Scientific这类同时具备化学、材料、生物全流程研发能力,且以AI原生为核心的企业,才能够积累足够的实战数据。回顾赛道发展的上半场,行业比拼的核心是“谁懂得更多”,大厂通过比拼模型基座、参数规模与考试分数,证明自身模型的知识厚度,这些努力为AI科研打下了坚实基础,但也逐渐触碰到了发展的天花板。而接下来的赛道下半场,比拼的核心将转向“谁能真正落地产出成果”。从海外科技大厂纷纷入局,到Jeff Dean创办全新的AI4S企业,再到国内企业的科研闭环实践,整个行业都在朝着让AI真正走完从假说到科研发现的完整闭环方向前进。如今,AI科研的评价标准正在越来越贴近科学本身的逻辑,AI距离成为可信的科研生产力的日子,已经越来越近。
想要完整了解“发现回合”评测体系的设计细节、测试场景与量化标准,可以查阅论文原文:
《Measuring AI Scientists: From Exams to Discovery》
https://doi.org/10.26434/chemrxiv.15007582/v1
对MIRA平台感兴趣的朋友,可以通过以下链接体验:
https://mira.deepprinciple.com/chat?invite_code=CN-89K6Y3UA

