文章摘要
AIforScience正从单点任务辅助向完整项目承接范式跃迁。中科紫东太初旗下ScienceClaw升级,推出AutoProject引擎。该引擎围绕规划、执行、验证构建能力,由三层核心能力构成,可实现科研全流程自动化。其自主科研非无人科研,需人机协作。这一成果源于技术积累,推动AI4S迈向项目级自主科研新时代。

AI for Science正站在新的发展节点,行业正在经历从单点任务辅助到完整项目承接的范式跃迁。

过去几年,随着大模型和智能体技术的成熟,AI已经逐步从文献检索、数据分析、代码生成等基础环节,渗透到仿真计算、实验分析等核心科研流程中。曾经行业热议的“AI能否辅助科研”已经不再是核心命题,新的挑战浮出水面:AI能否真正承接一个完整的科研项目,而非仅仅完成一个个孤立的科研任务?

这背后折射出AI4S能力范式的迭代升级。过往的AI更多作为工具型助手,在科研人员明确划定目标、边界和执行路径后,完成相对独立的单个任务。但真实的科研绝非零散任务的简单叠加:一个科研项目往往始于模糊的研究构想,包含多个相互依赖的子任务,并且需要随着新文献、实验结果乃至异常数据不断调整研究路线。完成单个任务不代表推进了完整项目,真正的项目级科研需要AI能够理解顶层科学目标,主动拆解任务、协调依赖关系、持续执行并根据反馈动态调整,最终推动项目走向明确结论。这也成为当前AI4S赛道需要突破的关键能力边界。

正是在这一行业拐点上,中科紫东太初旗下的新一代科研原生智能体ScienceClaw完成了关键升级,推出了AutoProject项目级自主科研引擎,旨在解决“如何高效推进完整科研项目”的核心问题,推动AI从执行孤立任务,转向承接全流程的科学发现工作。

AI在科研中的工作单元,正在从单个Task转向完整的Project。要承接一个科研项目,AI需要覆盖从项目规划到最终结论输出的全流程,而非简单延长任务执行链路。AutoProject围绕项目规划、长程执行、证据验证三大核心维度构建能力,科研人员只需提交宏观的科研构想或目标,AI即可自主完成项目规划、子任务拆解、长程执行、证据验证、动态修复到成果沉淀的全流程。

整个系统由三层核心能力构成:

  • Project2Task:项目级规划——回答“这个Project应该怎么做?”
  • TaskExecutor:长程自主执行——回答“确定方向后,如何持续推进?”
  • EviGraph:证据驱动验证——回答“最终结论是否有充分证据支撑?”

Project2Task模块负责项目级顶层规划。面对模糊的科研目标,该模块会综合研究目标、现有文献证据、资源约束与任务依赖关系,自主确定研究路径,拆解子任务,并规划任务之间的串并行逻辑与可复用资产,最终生成可执行、可迭代的项目任务网络。

比如在带钢表面缺陷智能识别的课题中,科研人员仅需输入简短的研究目标,AutoProject就能依托Project2Task将模糊需求转化为全周期的任务规划。系统会自动识别可并行任务与强制串行环节,规划多条研究路线的优先级,构建任务依赖关系,挖掘可跨任务复用的数据与模型资产;同时支持横向拆分、纵向拆分、先横后纵、先纵后横四种项目拓扑结构,根据不同课题的特征生成匹配的研究路径,将宏观的科研目标拆解为具体可执行的子任务。这意味着科研模式从“人定义Task、AI执行”,转向“人提出目标、AI规划路径”,让AI开始承担科研项目的顶层规划职责。

但规划只是开始,有了清晰的项目框架后,还需要可靠的执行底座支撑长周期研究。科研项目是循环演进的探索闭环,而非一次性交付的任务,任何一个子任务的异常都可能影响上下游流程,传统的单次调用式AI无法适配科研的非线性迭代特性,难以支撑长周期的研究工作。

AutoProject打破了“一次调用、一次返回”的线性执行模式,TaskExecutor正是面向科研场景落地的核心执行能力。以YOLO建模项目为例,系统会自动将项目拆分为数据处理、建模实验、迭代优化三大模块,实现环节的自动衔接。在输入目标后,系统可以自主研读相关论文、处理数据集、监督训练模型、处理执行过程中的异常,并自动输出量化指标、可视化图表与完整的分析报告。

TaskExecutor会搭建目标驱动的自主科研循环,全局监控项目状态、持续捕获实验反馈,自动排查异常、修正研究假设与模型参数;当任务失败或结果出现异常时,系统可以回溯评估、重构任务网络,自主重跑实验、优化方案,无需人工高频介入,持续将分散的实验结果整合为完整的研究结论。这让AI不再是被动执行单个任务的工具,而是能够根据项目状态自主决策、持续迭代,驱动整个项目向目标演进,ScienceClaw也从工具型科研助手升级为具备长线自主科研能力的智能体。

当AI开始长期执行一个科研项目时,结果的可靠性成为至关重要的问题。科研结论与通用生成式内容的核心差异在于,科研结论不能仅满足行文通顺、逻辑自洽,每一个项目级结论都必须依托明确的研究问题、科学假设、多组对照实验与真实数据支撑。

AutoProject自研的EviGraph证据图谱体系,搭建了全链路、跨子任务,可核验、可回溯、可修复的可信科研闭环。其校验不再局限于单个子任务内部,还会兼顾跨任务的逻辑一致性:持续核验假设是否匹配顶层项目目标、实验结果能否支撑研究假设、各子任务的数据能否相互印证、结论是否未超出证据支撑范围。一旦检出逻辑偏差或数据冲突,系统会沿证据链定位根因,按需重跑实验、修正假设、调整子任务,实现自主修复。

公开测试验证了该机制的有效性:在ARCBenchML评测中,EviGraph综合得分达到0.865,远超最优基线的0.596;代表结论贴合实验事实的Result Analysis指标从0.442提升至0.794;可追溯证据的Claim Support Rate达到0.38,较最优基线的0.27提升了40.74%;实验数据一致性EDC为0.88。

当这三层能力协同运行时,科研过程中产生的数据、代码、模型、实验记录和研究方法,都会沉淀为可复用的科研资产。在一项蛋白质相关的研究中,这些资产具体表现为证据汇总表格、专业工具生成的蛋白质产物文件、研究分析报告、完整的研究论文等。

需要明确的是,AutoProject的自主科研并非无人科研。即便引擎可以完成规划、执行、校验、成果沉淀的全流程,科研人员依然发挥着不可替代的核心作用。在整个项目进程中,研究者可以随时介入,针对AI输出的研究路径、实验假设、中间数据进行评判和调整,及时纠偏不合理的研究方向,通过持续的交互反馈注入人类的领域直觉与科学洞察力,实现人机双向配合共同完成科学探索。在这种协作模式下,AI的角色从被动响应需求的科研助手,成长为科研项目的自主推进者。

当AI开始以Project为单位开展科研工作时,AI4S的能力边界也随之拓展。以AutoProject为代表的项目级自主科研体系,正在推动行业开启新一轮的范式升级:AI的工作对象从孤立的单个Task转向完整的Project,自主科研也从单点能力升级为系统能力。

实现这种跨越并非易事,ScienceClaw能够率先走到这一步,源于其背后的技术积累与团队支撑。ScienceClaw出自中国科学院自动化研究所孵化的中科紫东太初,这家企业从成立之初就将多模态作为核心技术基因。早在2021年,紫东太初就发布了全球首个千亿参数三模态大模型,将文本、图像、语音纳入统一的语义空间。经过持续迭代,如今的紫东太初4.0已经从“理解多模态”进一步走向“多模态推理”,具备自主规划、交错思考与反馈修正的能力。

在AI4S场景中,这种多模态技术路线的价值尤为突出:科研场景绝非纯文本世界,论文中包含公式、图表和实验曲线,科研项目中还涉及代码、数据、仿真与真实实验结果,只有能够统一理解这些异构信息,模型才能真正成为科研智能体的核心大脑。

大模型只是基础,紫东太初进一步将模型能力延伸到真实的科研流程中,构建了从模型底座、科研知识、专业工具到智能体执行的完整技术体系,这也是ScienceClaw与普通科研Agent的核心差异所在。ScienceClaw并未采用传统的“主从Agent”体系,而是搭建了面向复杂科研任务的分层自治、多智能体动态协同架构。

系统会围绕科研目标自动生成任务图,并根据领域属性、可用工具与执行状态,按需调度学科、代码、搜索、数据分析、仿真等专业Agent,形成可动态组网、协同执行、反馈重规划的科研智能体集群。目前,ScienceClaw已经覆盖生命科学、材料、化学、物理、天文等多个科研领域,并将文献检索、数据分析、代码执行、模型计算与仿真工具统一纳入科研智能体的运行时环境。通过云端思考、沙箱执行、端侧行动与虚实协同,ScienceClaw正推动AI从“分析科研信息”走向“执行科研任务”,从“完成单次Task”迈向“持续推进完整科研Project”,AutoProject正是这套能力之上实现的关键跃迁。

从表象来看,这只是AI的工作单元从Task升级为Project,但本质上,这是AI科研能力从工具级向系统级的跨越。与之相伴,AI4S赛道的竞争重心也发生了切换:行业比拼不再局限于单点模型或单体智能体的性能,而是整套端到端系统的综合能力。这也是本次ScienceClaw升级的核心价值所在。

中科紫东太初在AI4S领域的核心壁垒,不仅在于更大规模的基础模型或是性能更优的单一科研Agent,更在于构建了一套融合多模态大模型、科研智能体、专业工具链、自主执行框架与实验验证体系的完整科研系统。从Task走向Project,ScienceClaw正推动AI4S迈入项目级自主科研的新时代。

相关研究论文地址:
[1]https://arxiv.org/abs/2608.05225
[2]https://arxiv.org/abs/2608.04738

以上内容不代表本平台立场,仅供读者参考