GOLLuM:高斯过程优化LLM赋能实验发现

近期一篇发表在国际学术期刊的最新研究提出了GOLLuM方法,即利用高斯过程优化大语言模型的表征空间,通过贝叶斯优化带来的不确定性与实验结果反向调整LLM的编码逻辑,让模型逐步构建更适配实验优化的几何结构。
在化学反应优化、材料筛选、分子设计等科研场景中,普遍存在一个共性难题:候选方案的组合空间往往多达数万甚至数十万种,但实际能够开展的实验数量却极为有限。这类科研决策任务的核心逻辑是,基于已完成的数十次实验结果,如何选择下一组最具潜力的测试方案。
传统解决方案多采用贝叶斯优化框架:先通过高斯过程建立代理模型,为每个候选方案同时预测其表现潜力与预测不确定度,再借助采集函数平衡探索未知区域与挖掘高潜力区域的需求。但这类方法的一大痛点是,高斯过程对输入表征的依赖性极强,化学反应需要专用的反应指纹,分子设计依赖分子描述符,材料研究则需要另一套表征体系,更换研究领域往往需要重新设计适配的表征方式。
大语言模型的优势恰好在于表征的通用性,实验条件可以直接以自然语言描述,比如“底物A + 配体B + 碱C,在特定温度下反应”,再通过语言模型转换为向量表示,这样试剂、温度、溶剂、分子结构等不同类型的变量都可以被纳入同一连续空间。不过这一思路存在一个明显陷阱:语言模型判定为“语义相似”的两个实验方案,实际的实验结果未必相近。该研究团队首先验证了这一问题:在Buchwald–Hartwig偶联反应的数据集上,直接使用固定的LLM嵌入进行贝叶斯优化,50次实验仅能找到15%至26%的最高性能区域,而采用专业化学反应指纹DRFP的方案则能达到38%的覆盖率,即便使用化学领域预训练的语言模型,也无法自然解决这一表征适配问题。
核心思路
GOLLuM的核心设计思路,正是通过实验结果来修正LLM的表征空间。其整体流程并不复杂:将实验条件的文本描述输入LLM得到嵌入向量,通过高斯过程基于已有实验结果建立从向量到实验性能的概率模型,再通过采集函数选择下一次实验的方案。
与传统方法不同的是,GOLLuM会以高斯过程的边际似然作为训练目标,同时更新高斯过程与大语言模型的参数,实验结果产生的梯度可以反向传播至LLM,调整其对实验条件的编码逻辑。这意味着LLM并没有直接学习“哪种反应产率最高”这类表层任务,而是在学习更底层的逻辑:如何组织表征空间,才能让高斯过程仅通过少量实验结果就能完成可靠的推断。假设每个实验条件经过LLM后得到一个向量 ,GP根据已有实验结果建立从 到实验性能 的概率模型。
空间平滑性分析
我们可以将高斯过程类比为在一张地图上寻找高产率区域:如果地图绘制合理,相邻地点的实验性质往往相近,高斯过程仅需观察少量样本就能推测周边区域的表现;如果地图绘制质量较差,即便高斯过程本身的性能很强,相邻的测试点也可能出现一个高产、一个低产的情况,目标函数会变得极为崎岖,模型很难从已有的实验结果推广到未测试的区域。
该研究用高斯过程的长度尺度与嵌入平均距离的比值来衡量表征空间的平滑程度,这一指标与优化性能的相关系数达到0.92,而普通的 只有0.78,这说明适配优化需求的表征空间,比单纯追求预测准确率更为重要。
基于不确定性的微调
常规的大语言模型往往存在过度自信的问题,能够流畅地给出实验方案,但不会明确表达“我对此结果没有足够把握”。而贝叶斯优化的核心优势之一,正是高斯过程天然能够提供预测分布,同时输出均值与不确定性信息。GOLLuM将这一不确定性直接融入LLM的微调训练过程中:随着新的实验结果不断加入,模型会逐步将实验结果相似的方案在嵌入空间中放得更近,同时将结果差异明显的方案区分开来,这一过程本质上属于一种隐式的对比学习。
在Buchwald–Hartwig反应的实验中,训练初期的嵌入空间较为混乱,经过数十轮优化后,高产率与低产率的实验会逐步形成各自的聚类区域,也就是研究中提到的富集范畴。
实验效果验证
传统的模型微调往往需要大量标注数据,但实验科学领域恰好面临数据稀缺的问题,单次实验的成本通常较高。GOLLuM的实验设置较为严苛:仅为模型提供10个初始实验结果,每完成一次新的实验就将结果加入训练集,再据此选择下一次实验,整个优化过程共进行约50次实验。
在涵盖有机合成、材料科学、工艺化学与分子设计的23个任务中,GOLLuM的平均表现位列第一,在50次实验预算下,其平均覆盖率达到36.3%,而采用固定LLM嵌入的方案仅为26.5%,基于监督回归再进行后验不确定性估计的方法则仅有12.1%的覆盖率。在Buchwald–Hartwig反应中,采用T5固定嵌入的方案对高产率条件的发现率约为24%,经过GP引导的联合训练后,这一比例提升至43%;同时,GOLLuM达到传统贝叶斯优化最终性能所需的实验次数,中位数减少了约41%。
对照实验对比
该研究还设置了极具代表性的对照实验:直接通过prompt提示多个先进大语言模型,让其基于历史实验结果选择下一组反应条件。实验结果并不理想,不同模型出现了10%至80%的失败情况,包括生成不存在的化学结构、参数超出合理范围、重复选择已测试的实验、输出无法解析的内容等问题。
这一问题的根源不仅在于模型的领域知识储备不足,更关键的是prompt本身并未提供严格的概率决策机制。大语言模型可能会说“我认为这个条件成功率很高”,但这种语言上的自信并未经过校准,对于真实的实验场景而言,这一差异至关重要:一次错误的回答仅会浪费少量计算资源,但一次错误的实验可能会耗费一整天的时间与昂贵的实验试剂。
GOLLuM则将LLM置于概率优化框架中,让高斯过程负责预测与不确定性估计,让LLM负责学习更适配优化需求的表征空间。
研究价值与局限
GOLLuM改变了大语言模型专业化的传统思路。过往的普遍认知是,要让通用大语言模型适配科学任务,需要更多的领域标注数据、更大的模型规模或是针对性的领域预训练。而GOLLuM的研究显示,我们还可以让模型学习“哪些信息对于不确定性下的决策最具价值”。
在这一框架中,实验结果既是训练数据,也是对表征空间的反馈信号;不确定性不仅是模型的输出结果,更成为训练LLM的重要指导信号。LLM在此处成为贝叶斯优化的可学习表征层,高斯过程提供统计约束与不确定性估计,采集函数最终负责决定实验的选择,这一分工模式结合了自然语言的通用表征能力与贝叶斯优化的小样本决策能力。
当然,这一方法也存在局限:标准高斯过程的计算复杂度会随实验数量快速增长,在大规模实验场景中需要可扩展的高斯过程实现;此外,对于蛋白质构象、晶体结构等难以通过自然语言完整描述的高维对象,单纯依赖文本表征并不适配。正如该研究总结的,更广泛地说,GOLLuM指出了一种全新的基础模型专业化范式,即借助更丰富、更具不确定性导向的信息来完成模型适配。
范式理解
基于相关的大模型数理框架,GOLLuM可以被理解为一种由实验反馈驱动的RG流过程。大语言模型首先将实验条件映射到高维嵌入空间,但其中往往包含大量与当前实验目标无关的语义信息。引入高斯过程后,模型会利用实验结果与边际似然持续调整表征空间,让实验结果相近的样本在嵌入空间中更接近,让结果差异较大的样本逐步分离。
从RG流的角度来看,这一过程会不断消除与目标无关的自由度,保留决定实验性能的相关变量,最终得到更适配优化需求的有效表征空间。从范畴论的角度来看,这一过程相当于寻找实验条件空间上的任务相关等价关系,将大量具体的实验样本压缩为具有相似规律的等价类。
可以预见的未来AI4S范式是:借助AI完成升维学习,形成包含富集范畴的高维表征空间,通过微调优化这一空间,最终降维输出低维结构,也就是科学发现。GOLLuM的本质可以概括为:通过高斯过程的概率反馈驱动大语言模型的表征空间重整化,将通用语义空间逐步转换为与实验规律对齐的有效富集范畴,再利用不确定性信息决定下一次实验的选择。也就是说,LLM提供表征能力,GP提供物理式的统计约束,实验提供RG流的反馈信号,最终得到面向实验发现的有效判断。
相关研究文献:Large language models as uncertainty-calibrated optimizers for experimental discovery

