自动科学研究新突破:MDA整合模型发现与实验设计

当科研智能体已经能够完成读论文、编写实验代码、执行测试并分析数据这些流程后,如今又向前迈进了关键一步:不再被动等待人类分配实验任务,而是能够自主规划最具区分价值的下一轮科学实验。
MDA系统的核心设计
这套名为模型发现智能体(Model Discovery Agent,MDA)的系统,将自动科研的闭环进一步完善。面对多个都能解释现有观测数据的候选科学假设,MDA不再只是依赖人类投喂新数据,而是先通过大模型生成合理的机制假说,再用贝叶斯方法维护每个候选的不确定性,主动挑选出最能区分不同假设的关键实验。
当新的实验结果返回后,系统会实时更新对各个候选机制的判断;如果现有的所有假设都无法匹配新数据,MDA还会重新扩展假说空间,确保不会遗漏关键的潜在机制。
精细化的实验决策逻辑
在MDA的架构中,大模型和贝叶斯推断承担着不同的核心角色:大模型负责生成初始的候选机制集合,而最终的假说筛选则由贝叶斯推断完成。通过序贯蒙特卡洛方法,系统会为每个候选模型推断参数的后验分布,同时计算边际似然,让不同候选的排序不再依赖大模型的主观判断,而是基于模型证据获得客观的结构后验。
在测试基准中,研究团队还加入了显式的复杂度先验,进一步压制那些仅仅通过增加自由度来换取拟合优势的模型,避免过拟合的问题。
基于得到的后验分布,MDA开始决策下一场实验的设计。系统的核心判断依据是信息价值:也就是不同候选模型在哪些实验条件下预测分歧最明显,且这种差异不会被观测噪声所掩盖。
实验的信息价值越高,就越值得优先执行。对于连续的实验空间,MDA还会通过CMA-ES算法搜索最优的实验设计方案。如果新实验持续产生较大的预测残差,说明当前的假说空间可能遗漏了重要机制,此时系统会重新调用大模型扩展候选池;当模型后验已经高度集中,且预测残差足够低时,系统则会清理重复的候选假说,优化整体的计算效率。
消融实验显示,MDA的各个组件分别解决了不同的瓶颈问题。在CHEMBENCH测试中,加入M-open设定后,整体的符号准确率从36%提升到50%,并让组合机制的恢复成为可能;再结合CMA-ES算法和自适应候选池后,完整配置最终达到了56%的准确率,后两者主要改善了高难度任务的表现。
多基准测试的验证结果
在多个标准化测试基准中,MDA的优势得到了充分验证。
首先在FORCEBENCH测试中,最直观的差异体现在实验效率上:仅经过8次实验,MDA的数值通过率就达到了约93%,而相同预算下的纯大模型智能体仅能达到约31%。常规的原生智能体平均需要41次实验,才能达到MDA在8次实验时的预测误差水平。
在更严格的精确形式恢复率指标上,MDA的表现为74%,而纯大模型智能体仅为31%。即使将完全相同的13种候选实验菜单交给纯大模型智能体,8次实验后的数值通过率也仅为22%,说明MDA的优势并非来自预设的实验列表,而是源于其科学的实验选择逻辑。
在Yukawa环境测试中,短距离的探测数据无法区分不同的候选模型,只有将探测范围拓展到屏蔽长度之外,不同模型的预测才会出现明显分叉。加入这组长距离数据后,真实机制才能在准确性与贝叶斯描述长度的权衡中胜出,这也证明了MDA主动选择实验条件的价值。
CHEMBENCH测试则暴露了另一个常见的科研误区:低预测误差并不等同于找到了正确的机制。该基准覆盖了57种单一或组合的酶动力学机制,在36个任务的分层子集上,约8次实验后MDA的符号准确率就升至约56%,并在此后进入平台期;而匹配后的同类智能体在60次实验后仅达到约42%的准确率。
在高难度的非竞争性抑制任务中,相关工具找到了均方根对数误差低至0.001的表达式,但却没有恢复出真实的动力学结构,这也凸显了仅依赖预测误差进行机制筛选的局限性,而MDA的多维度筛选逻辑则有效避免了这一问题。
在部分可观测的NEURONBENCH测试中,MDA的表现同样亮眼。大模型首先根据表型提出了包括Ih、T型钙通道、D型钾通道以及基础Na/K/漏电流模型在内的候选机制集合,在常规的去极化刺激下,这些模型难以被区分;而MDA通过信息价值选择了超极化条件,此时只有Ih通道会出现明显的电压sag现象,也就是超极化期间的缓慢去极化回升。仅通过这一次针对性实验,系统的后验分布就集中到了正确的机制上。
当加入通道噪声后,原本的确定性Hodgkin–Huxley模型变成了随机微分方程,此时边际似然无法直接计算。如果直接使用忽略随机性的确定性似然,随着噪声增强,系统甚至会高置信度选择错误的模型;而粒子滤波能够保持正确的判断,但计算成本很高。为了降低计算成本,研究团队训练了一维卷积网络,从模拟轨迹中学习摘要统计量来构造合成似然,在不同噪声强度下,该方法的模型选择准确率基本接近粒子滤波,但单次决策的计算速度提升了约10^4倍。
MDA还会将观测模型本身纳入选择范围,在粒子滤波和两类低成本合成似然之间权衡区分能力与计算成本:一类使用人工设计的摘要统计量,另一类使用神经网络学习的表示。如果低成本近似给出的后验判断与粒子滤波的校验结果不一致,系统会回退到更稳健的粒子滤波方法。在完整的随机NEURONBENCH测试中,模型化预测器仅经过3次实验就将误差降低了约4倍,比基于上下文学习的预测精度高一个数量级,此时的均方误差约为4.6,已经接近单次试验噪声下限4.0。
当单次实验本身的噪声较大时,MDA还会将实验重复次数纳入设计考量:预算究竟应该用于尝试全新的实验,还是重复最具区分力的已有实验,也成为了实验设计的一部分。
当前方法的局限性
不过,MDA距离真实实验室中的全自主科研还有明显的距离。目前的验证主要集中在合成基准和预先定义的设计空间中,尚未在真实的物理实验环境中完成大规模验证。
基础模型的能力也会影响MDA的优势大小。在跨不同大模型的测试中,MDA的数值通过率保持在约89%–94%,精确形式恢复率约为74%–83%;但当使用更强的Fable 5模型时,纯大模型智能体在精确形式恢复指标上反而超过了MDA。这说明MDA并不保证在所有结构恢复指标上都胜过强大的纯大模型智能体,其更稳定的优势在于在紧凑的实验预算下,通过模型证据筛选候选假设,并通过针对性实验持续减少不确定性,提升干预预测的可靠性。
总体而言,MDA的架构分工清晰明确:大模型负责扩大假设空间,贝叶斯推断负责用证据筛选假说,而实验环节则负责持续消除不确定性。当科研流程逐渐实现自动化后,下一步最值得获取的实验证据是什么,也开始进入自动科研的闭环范围。

