文章摘要
近期一项大规模自主AI研究实验引发关注,团队将18个AI模型置于隔离沙箱完成153次有效运行,以进行nanoGPT速跑优化。首轮测试排名前三为Fable 5、Opus 5与Kimi K3。实验发现,模型能力差距源于实验执行逻辑。部分模型展现自主研究能力,但未出现全新优化方法。后续还将开展更多实验。

近期一项公开的大规模自主AI研究实验引发关注,研究团队将18个前沿AI模型部署在搭载8张H200显卡的隔离沙箱中,切断外网连接后赋予模型自主优化任务,全程记录所有运行轨迹、草稿与推理流程并公开。此次实验共完成153次有效运行,单轮最长耗时达8.7天,是目前公开规模最大的同类自主研究测试。

本次实验的核心任务为nanoGPT速跑优化:需要训练一个1.24亿参数的GPT模型,以尽可能少的训练步数将验证损失降至3.28以下。人类初始基准为3290步,当前公开的人类最优记录为2600步,研究团队希望观察AI模型能达到怎样的优化效果。

实验结果排名

首轮测试结果显示,不同模型的优化能力差距显著。排名前三的模型分别为Fable 5(2726步,闭合人类记录差距的81.7%)、Opus 5(2920步)与Kimi K3(2930步)。随着步数增加,模型间的差距进一步拉大,比如GPT-5.5达到3234步,Kimi K2.7为3240步,GLM 5.3尚未完成全部测试。

无论以运行时间、实验次数还是输出Token数量作为资源衡量标准,模型的排名都保持稳定,说明这种差距并非偶然的运行次数差异,而是真实能力的体现。

模型 最佳记录 闭合差距 运行天数
Fable 5 2,726 81.7% 8.7天
Opus 5 2,920 53.6% 2.9天
Kimi K3(prime-agent) 2,930 52.2% 3.6天
Kimi K3(kimi-code) 2,974 45.8% 5.1天
Opus 4.8 3,018 39.4% 3.0天
GPT-5.6 Sol 3,042 35.9% 6.1天
Sonnet 5 3,105 26.8% 2.0天
Grok 4.5 3,120 24.6% 2.7天
DeepSeek V4 Pro 3,205 12.3% 1.1天
GPT-5.5 3,234 8.1% 1.1天

实验规则与运行环境

每一轮运行中,模型都会获得一个代码仓库、一份规则手册与启动指令:读取规则文档并严格遵守,完全自主运行无需等待外部输入,目标是用最少的训练步数将验证损失降至3.28以下并持续刷新最佳记录。

读program.md并严格遵守。完全自主运行,永远不要停下来,永远不要等待输入。目标:用尽可能少的train_steps达到验证损失小于3.28,持续刷新当前最佳记录。

模型运行在完全隔离的GPU节点中,无法访问外网,仅拥有独立工作目录、只读数据集与基础Python环境。为防止模型靠运气或作弊达成记录,实验设置了严格的验证门槛:若要宣称打破当前记录,必须使用固定种子将训练脚本运行8次,且8次运行的平均验证损失必须低于3.27859,这一设置将靠运气蒙混过关的概率降至约千分之一。

早期的同类实验曾出现模型通过刷样本次数钻统计空子、过早终止运行的问题,此次实验的规则针对性堵住了这些漏洞。研究团队还在规则文件中故意提供了略微偏大的噪声估计值,测试结果显示,约100次运行中有62次模型自行测量了噪声并拒绝使用给定数值,这62次运行全部集中在排行榜前列。其中42次运行的模型还发现了一个未被研究者提及的细节:即便使用相同种子重跑同一训练配方,验证损失也会存在微小浮动,这是因为GPU本身并非完全确定性的。这种浮动的噪声远小于不同种子间的差异,发现这一细节的模型可以通过共享种子对比不同配方,在同等计算量下分辨出常规筛选无法识别的微小差距,部分模型甚至基于这一发现重构了整套筛选流程。

模型能力差距的核心来源

经过分析,所有模型找到的优化方向大体相似,大多集中在优化器调整层面,比如优化预处理流程、控制权重与更新量级的上下限、延长高学习率的维持时间、训练末期进行权重平均等。真正拉开差距的,是模型的实验执行逻辑。

表现较弱的模型容易因单一种子的负面结果就放弃整个优化方向,将自身代码的崩溃直接视为方法本身的问题,丢弃那些单独看收益不显著但长期来看可能有价值的微小改进。比如Grok 4.5就因为自身的缩放bug,两次错失了行归一化这个优化方向。

而表现更强的模型则会针对边界结果测试多个种子,只有在噪声模型验证值得投入时,才会花费8次运行的成本确认新记录。它们还会定期回头重测:每次合并新的改进后,都会对整个改进栈进行消融分析,丢弃已经不再有效的部分;遇到新的优化配方后,还会重新测试之前失败的方向,因为在新配方下,原本无效的方法可能会产生效果。

比如Opus 5在新配方下重新开启了对beta2参数的调优,最终达成了新的记录;Kimi K3发现新的归一化方式让此前记录依赖的两个机制变得多余,直接将其删除;Fable 5在单个参数调整无法获得增益后,开始测试那些单独看效果更差但组合后表现更好的参数对,一次晚期的重新探测就带来了31步的性能提升。

研究团队总结认为,高性能模型的核心优势在于能够足够长久地保留弱信号以完成验证,同时对实验结果拥有更深刻的理解,这并非单一能力,而是研究品味与噪声建模能力的结合。

模型自主构建研究工具

此次实验中最引人关注的现象之一,是部分模型在专属框架下的自主研究能力。该框架为模型提供了持久的交互环境,允许模型在其中构建专属的研究流程。

Kimi K3就在该环境中完成了一系列操作:先编写了一套用于构造受控优化器变体、启动训练、对比损失曲线、恢复干净基线的函数;随后又搭建了数值实验室,用于重调Newton-Schulz系数,并将优化后的系数投入实际训练测试,当理论上更干净的更新实际表现更差时,它及时修改了自身的假设。

Opus 5则将训练脚本拆分为可替换的模块,把优化配方转化为带有继承关系的字典结构,还编写了一个配置编译器,让每一次实验都可以简化为一行带标签的参数覆盖调用。

GPT-5.6 Sol走得更远,它在内核中并行启动了多个AI子实例,分别扮演优化器理论家、实验规划师与代码审计员的角色,通过异步方式同时运行多个研究流程。它甚至还检测到某个子实例可能擅自修改了共享工作目录的源文件,随后为所有分析角色添加了只读约束,明确禁止它们编辑文件或启动训练。

DeepSeek V4 Pro则在正式使用GPU训练前,先在CPU上搭建了随机协方差实验室,测试了9种PSGD递推规则,通过综合梯度过程验证哪种规则能让矩阵收敛到正确目标,最终根据测试结果决定放弃该优化方向。

这类行为的共性模式是:先在合成场景中以较小的成本验证机制,再决定是否投入较大成本进行正式训练。并非所有模型都采用这种流程,但一旦使用该模式,往往能带来对研究对象更深刻的理解。

未出现真正的全新方法

研究团队的核心结论之一,是此次实验中没有任何一个模型产出了本质上全新的优化方法。所有获胜的优化要素,都能在已公开的学术文献中找到相似的思路。

这一结果引发了广泛讨论:究竟是这类速跑任务本身存在局限性,还是当前的AI模型已经触达了这类任务的能力天花板?研究团队暂时没有给出明确答案,但这一问题也成为他们继续开展此类研究的核心动力。

目前研究团队计划后续开展更多实验,包括引入多智能体框架、增加测试种子数量、拓展模型覆盖范围与延长任务时长。所有运行轨迹、草稿与推理流程都已公开,感兴趣的研究者可以直接查看模型的完整决策过程。

公开研究数据与代码可通过官方渠道获取,交互式排行榜也已上线供全球研究者参考。

以上内容不代表本平台立场,仅供读者参考