1300张H200击败GPT-6 Astra 实验室AI科学家Neon问世

不用十万张加速卡,只用1300张H200,一款名为Periodic Neon的AI模型就在专业科学基准测试中击败了GPT-6 Astra。这款产品是前OpenAI研究副总裁Liam Fedus创办的Periodic Labs推出的首款成果。
Fedus在社交平台分享的消息中,最引人关注的核心信息是:依靠1300张H200和数月的实验数据,Neon在自家开发的科学分析基准上实现了对GPT-6 Astra的超越。
在Periodic位于门洛帕克的高磁场材料实验室中,机械臂正将刚合成的候选材料送入X射线衍射仪,设备生成的衍射图谱会作为Neon的训练数据。实验室保持24小时不间断运转,完成材料合成、性能测试、数据录入的全流程。团队首批攻关的方向,聚焦超导体、磁体和半导体材料领域的技术难题。
作为ChatGPT的核心参与者之一,Fedus曾负责OpenAI的模型后训练工作,深谙模型性能提升的核心逻辑。2025年创立Periodic时他就明确表态:互联网上的公开文本数据总量约10T token,当前最前沿的大模型已经几乎穷尽了这类数据,AI想要实现进一步突破,必须依赖互联网之外的全新数据集。而这类数据的最佳来源,就是真实的物理实验室。
他联合前谷歌DeepMind化学与物理研究负责人Ekin Dogus Cubuk,从创立之初就自建实验室、自主生成训练数据,目标是打造真正的AI科学家。仅用一年时间,Neon就交出了第一份答卷。
这款参数规模约1T的模型,在高难度的X射线衍射(XRD)分析测试中达到了55.3%的成功率,大幅领先GPT-6 Astra和Claude Fable 5.1。
根据业内传闻,GPT-6 Astra的总参数达到数万亿量级,而Neon仅为1T;算力方面,据黄仁勋公开披露的信息,Astra背后依赖超过10万张Grace Blackwell加速卡,而Neon的训练峰值仅用到1300张H200。这样的性能反差很快在行业内引发广泛讨论,Jeff Dean也第一时间在Fedus的分享下留言祝贺。
XRD测试:破解专家头疼的材料识别难题
X射线衍射分析(简称XRD)的原理并不复杂:当X射线照射晶体时,会在特定角度产生衍射亮峰,不同材料的亮峰位置存在差异,如同材料的独特“指纹”。通过识别这些指纹,可以判断合成的材料是否为超导体、磁性材料或半导体。
但实际应用中存在一个核心难点:实验室合成的样品往往纯度不足,多种物质的衍射峰重叠在一起,如同数百个指纹杂乱印在同一张纸上。材料学家想要识别其中的具体成分,通常需要打开专业软件、查阅学术数据库、对比多篇文献,整个过程耗时耗力。
Periodic选取了134道这类连专家都头疼的难题,搭建了名为FrontierXRD的基准测试集,Neon的55.3%成功率就是在这套测试中取得的。
所有参与测试的模型都使用Periodic自研的科学工具环境Periodic Harness。与基于Claude Code搭配标准XRD工具的方案相比,在单题成本相近的情况下,Periodic Harness的成功率是后者的3.8倍。
为了避免模型出现“背答案”的过拟合问题,团队额外准备了198道题目,这些题目涉及的化学体系在训练数据中被刻意剔除,Neon依然领先其他前沿模型。不过官方也承认,这套题目比FrontierXRD更简单。
成本方面Neon同样更具优势:最高配置下Neon的成功率为55.3%,单题成本约4美元;GPT-6 Astra单题成本约7美元,成绩却不如Neon;Claude Fable 5.1的成本与Astra相近,成功率仅约40%。
从互联网数据到物理实验:打造永不枯竭的数据水井
抛开跑分成绩,Periodic真正想让行业关注的,是其在门洛帕克搭建的高通量材料实验室。
从最初的第一批实验到如今24小时连续运转,Periodic将材料发现流程拆解为一个完整的循环:首先基于对材料稳定性和性质的预测确定研究方向,再预测该材料的合成路径,最后验证实际产出的材料性能是否符合预期,根据测试结果修正猜想,开启新一轮循环。
每完成一轮循环,实验室都会生成一批全新的私有物理反馈数据,这些数据就是Neon的核心训练原料。Periodic的训练语料混合了学术文献、代码和实验数据,目前规模每月翻倍。
团队还发现一个关键技巧:先用预训练将科学知识注入模型,后续的强化学习效果会更好。而且在实验运行时,GPU不会闲置,模型可以利用已有实验数据继续分析和优化预测方向。该团队的研究博客标题“自然就是学习环境”,精准概括了这一核心思路。
当前AI的规模化发展长期依赖互联网文本数据的堆叠,但这类数据已经接近被前沿模型穷尽。未来谁能拥有持续产出新数据的真实环境,谁就拥有了继续规模化升级模型的核心竞争力。互联网数据是越挖越少的矿产,而实验室则是源源不断的活水。
物理RL的困境:用AI裁判解决验证难题
将强化学习从数字世界搬进物理世界,难度完全不在一个量级。
数字世界的强化学习可以通过部署海量智能体,快速完成可自动判分的任务,比如编写代码、解决悬而未决的数学猜想,但物理世界的RL面临三大核心障碍:无法随意增加智能体,每新增一次实验都需要额外的电力、设备和工程投入;单次实验可能需要数天时间才能完成;实验结果往往模棱两可,难以直接判定成功与否。
其中最后一个障碍最为致命。Periodic在研究博客中精辟指出:科学只能被证伪,却很难被直接验证。一张XRD图谱仅看拟合度无法低成本判断分析是否成功,还需要专家判断每个物相是否有图谱支持、化学逻辑是否合理。
为此团队将专家的判断“蒸馏”为AI裁判。他们邀请材料专家为数千个XRD图谱标注标签,再用这些标签校准由Opus 5和GPT-5.6 Sol组成的LLM裁判组。三组对比数据清晰展示了裁判的可靠性:
专家之间的标注一致率为77.2%;
LLM裁判与单个专家的标注一致率为74.6%;
LLM裁判与专家整体共识的一致率达到84%。
这意味着该AI裁判的靠谱程度已经接近人类专家之间的水平,将难以量化的专业判断转化为可用于训练的奖励信号,也是Neon的核心技术亮点之一。
1300 vs 10万:极致利用每一块GPU
1300张H200,是Neon最终训练时预训练和强化学习两个阶段同时运行的峰值算力。而GPT-6 Astra的10万张Blackwell,则对应通用大模型的大规模训练算力。虽然无法直接计算效率倍数,但这组数据足以证明Periodic将1300张卡的性能发挥到了极致。
科学任务的强化学习有一个特殊之处:模型完成一道题目需要边思考、边查阅资料、边运行工具,整个过程可能需要一个多小时,但利用该题结果更新模型仅需几分钟。Periodic的解决方案是将做题和学习分离,各自使用独立的GPU,互不等待。
团队最初的RL循环没有隔离训练、推理和模型生成的代码,曾出现模型生成的代码申请80GB内存导致任务崩溃的问题,因此他们自研了沙箱pbox。该沙箱直接调用RL任务所在GPU节点上的闲置CPU运行科学工具,数据全程不出集群。与测试过的托管沙箱服务相比,pbox的数据传输速度快4.5倍,吞吐量是对方的3.3倍。
训练闲置的算力还可以分配给物理模拟等科学计算任务,让整个集群的常年利用率保持在95%以上。Periodic的思路很明确:既然无法在算力总量上与行业巨头竞争,那就比拼每GPU小时能带来的科学产出。
飞轮依旧,燃料已换
Neon已经部署在Periodic的实验室中,用于分析真实实验数据,帮助团队寻找更优质的超导体和磁体。不过目前模型还存在明显的短板:回到之前的材料发现循环,Neon目前仅完成了最后一环——识别实验室实际产出的材料。
要实现AI指挥整个科研项目、设计合成路径、决定下一轮实验方向,团队还在将这套方法向这些方向扩展。Fedus也表示,目前模型只是“辅助决策”,而非替代科学家做最终判断。准确来说,实验、数据、训练之间的飞轮已经运转起来,但要实现全自主闭环,还需要打通“确定研究方向”和“设计合成路径”两个环节。
Periodic并没有否认算力的重要性,官方表示将训练算力提升到当前前沿模型的量级,可以解锁更强的科学能力,未来也考虑更换更强的开源权重模型作为底座。GPU依然关键,但仅靠GPU已经不足以实现突破。
回顾Fedus的履历,他在GPT-4技术报告中负责“数据飞轮”相关工作,三年后,他将这个飞轮从互联网文本数据搬进了真实的物理实验室。飞轮的核心逻辑没有改变,改变的只是输入的原料:从人类写下的文字,变成了自然世界给出的真实反馈。未来的AI规模化竞争,或许不再只是比拼谁能采购十万张加速卡,还要看谁的实验室能够持续不断地向模型输送真实世界的数据集。

