文章摘要
国内科研团队将“判断AI能否实现端到端自主科学发现”的讨论推进到真实物理世界实验阶段。他们搭建机器催化实验室系统,对48种AI配置展开评测。结果显示,当前领先大语言模型智能体距自主接管科研差距大,长程规划是瓶颈。研究厘清AI三种核心能力,该实验室可成测试与训练场所,推动AI迈向端到端自主科学发现。

我们如何判断人工智能已经足够聪明,能够从事科学研究,实现端到端的自主科学发现?这一行业关注的核心问题,此前多停留在虚拟方案生成的讨论中,而国内科研团队的最新研究将其推进到了真实物理世界的实验执行与反馈学习阶段。

研究团队搭建了一套完整的机器催化实验室系统,包含45个覆盖合成、表征和催化性能测试的模块化自动工作站。为了让AI智能体能够理解并调用实验室的各项能力,团队将所有实验操作封装为机器可读的标准化技能,智能体可以通过这些技能直接调用实验设备,同时严格遵循真实设备的能力边界、操作规范与实验条件约束。

为系统性评估当前主流AI智能体的科学研究能力,团队针对6种智能体框架与9种大语言模型组合成的48种实际配置展开了全面评测。测试覆盖32项由领域专家定义的真实研究任务,累计完成4608次独立测试,评估维度不仅包括智能体能否生成合理的实验计划,还追踪了这些计划能否通过合规性核验并下发至机器人系统,以及生成的实验工作流是否可以在完全无需人工干预的情况下直接执行。

残酷的真实世界评测结果

当前领先的大语言模型智能体距离完全自主接管科学研究仍有显著差距。在全部4608次测试中,仅有151个工作流可以无需人工修复直接执行,占比仅为3.3%。其中表现最优的Claude Code与Claude Opus组合,可执行率为28.1%;Codex与GPT组合的可执行率为19.8%。

会调整参数,不等于会重新规划

研究团队还进一步测试了智能体从真实实验结果中学习的能力,他们将Codex与GPT的组合置于开放式的五轮闭环实验流程中,依次开展实验规划、机器人执行、证据获取与重新规划。测试发现,该智能体确实能够根据返回的实验结果调整材料配方与操作条件,但这类调整仅停留在局部参数优化的层面。在五轮实验过程中,智能体始终保留了最初的工作流骨架,既没有重新设计实验分析方法,也未能纠正持续存在的关键遗漏,比如缺少电极黏结剂与特定分析物的显色试剂。这一结果表明,能够读取实验反馈并调整局部参数,并不等同于能够识别研究策略本身的缺陷,更不具备科学层面的整体重新规划能力。

长程规划仍然是瓶颈

虽然部分智能体能够生成经专家评估可执行、最多包含44个操作步骤的工作流,但在全部测试中,仅有3个工作流的操作步骤超过30个。这说明随着任务链条的延长,智能体维持实验逻辑完整性与物理可执行性的能力仍面临显著挑战。

重新定义AI的科学能力

基于本次测试结果,研究团队厘清了当前“AI科学家”讨论中经常被混淆的三种核心能力:第一种是流畅地生成文字层面的实验计划,第二种是生成能够在真实物理实验室中直接执行的标准化工作流,第三种则是根据实验反馈调整整体研究策略的能力。研究证实,语言层面的实验规划能力并不能自动转化为可靠的物理实验执行能力,而局部的参数调整也不能被直接等同于科学层面的策略重构。

从「AI测试场」走向「AI训练场」

这套机器催化实验室作为AI for Science的智能科研基础设施,既可以作为检验AI科学能力的标准化测试场,也可以成为推动AI持续进化的训练场。AI智能体通过机器可读技能与实验室直接交互,将科学意图转化为可执行任务,并接收来自设备执行状态、仪器反馈与实验结果的真实数据,形成“规划—执行—反馈—重新规划”的完整闭环。这个闭环不仅能够暴露AI在知识储备、操作理解与研究策略层面的缺陷,还可以将成功的工作流、失败案例、实验结果与专家评估沉淀为训练数据,持续迭代AI模型与智能体系统。

这项研究为回答“如何判断AI是否足够聪明开展科学研究”提供了可量化、可重复、可验证的物理世界证据,推动AI从单一的实验方案生成阶段,逐步迈向涵盖科学问题提出、实验设计、机器人执行、数据分析与证据驱动策略重构的端到端自主科学发现之路。

参考资料:https://arxiv.org/abs/2607.23045

以上内容不代表本平台立场,仅供读者参考