OpenAI两周产出722篇AI数学成果 攻克多顶级猜想

近期,一则重磅消息在AI与数学领域同时引爆,大量研究者和从业者被海量的AI生成数学成果彻底震撼。一个公开的代码仓库中,一次性放出了722篇数学研究手稿,这些成果并非零散的小进展,而是被归为372个成果集群的重量级研究内容,全部由某未公开的内部前沿AI模型生成。清单上的研究方向,足以让任何修读过研究生数学课程的学者驻足细看:准黎曼猜想、四维挂谷猜想、唯一游戏猜想、自由群因子同构问题、有理数域上的希尔伯特第十问题、CM阿贝尔簇的霍奇猜想、马勒猜想……这些问题中,有的已经悬置了半个世纪以上,有的则是菲尔兹奖级别工作的延伸方向。相关负责人表示,我们正在进入一个大发现的新时代。
一次爆炸式的成果发布
据相关机构介绍,这批海量的数学成果来自内部AI模型的数学能力专项评估。由于该模型在标准数学评测数据集上的表现已趋近饱和,研究团队将评估范围拓展到了开放研究问题领域,部分成果甚至基于模型此前生成的研究结果进一步迭代。整个评估过程中,模型共处理了约4000个科研问题,最终将输出按相关性聚类为成果集群,并通过「具备足够学术价值」的门槛筛选,最终留下了372个成果集群,总计722篇手稿。
每个成果集群通常包含一项核心结论,以及配套的论证过程、衍生推论或替代性证明方案。根据机构自身的学科分类标准,这372个集群覆盖了17个数学分支,其中理论计算机科学(40个集群)、组合数学(37个)、代数与复几何(36个)和数论(31个)的占比最高,此外还涉及概率与统计力学、微分几何、数学物理、算子代数等领域,即便是占比最低的数理逻辑,也包含了6个相关成果集群。
在算力投入方面,机构表示,绝大多数成果都遵循统一的生成流程,单份成果的算力消耗约等同于ChatGPT Pro运行3小时的计算量。另一个值得关注的细节是,所有手稿的文件夹均以日期命名,且几乎全部集中在9月23日至10月5日之间,仅9月23日和24日两天就各产出了近200篇手稿,这意味着这批成果的主体是在不到两周的时间内批量生成的。
随同手稿一同公开的还有三类证明相关的配套材料:Lean形式化证明代码、10份模型推理过程的精简摘要,以及计算总耗时和尝试问题数量的统计数据。根据对仓库目录的统计,372个成果集群中有235个附带了Lean形式化说明页面,占比约63%。不过机构也坦诚,并非所有手稿都完成了形式化验证,未完成形式化的成果「可能存在逻辑问题」,团队将尽快修正并持续补充完善相关内容。
截至公开后不久,该仓库的星标数量就快速增长,仅3小时就突破了2000。相关仓库地址:https://github.com/openai/math
核心突破成果
在722篇手稿中,最先引发社交媒体广泛讨论的是编号003的准黎曼猜想相关研究。黎曼猜想断言黎曼zeta函数的所有非平凡零点都落在实部为1/2的直线上,这一目标难度极高,长期以来数论学家只能退而寻求更务实的突破,也就是证明存在某个小于1的常数θ,使得实部大于θ的半平面内不存在zeta函数的非平凡零点,这就是准黎曼猜想。百余年来,学界能证明的零点自由区域会随着虚部增大逐渐贴近实部为1的直线,始终无法划定一条固定宽度的竖直无零点区域。而此次机构公开的成果则给出了θ=7/8的结论,这一结论对zeta函数和所有狄利克雷L函数均成立,且已经完成了Lean形式化验证。配套论文还给出了Landau–Siegel零点的一致排除结果。
另一项引发热议的成果是编号074的挂谷问题相关研究。今年7月,数学家王虹与Joshua Zahl凭借三维挂谷集合猜想的证明获得菲尔兹奖,当时相关学术媒体盘点的后续研究方向中,四维挂谷猜想仍位列其中。而此次公开的成果集群则同时声称解决了三维挂谷「极大函数」猜想和四维挂谷集合的豪斯多夫维数猜想。
除了这两项成果之外,还有多项极具分量的研究进展:
- 理论计算机科学领域,编号102的成果声称证明了Subhash Khot在2002年提出的唯一游戏猜想,并据此给出了Max-Cut、顶点覆盖等经典问题的最优近似难度门槛;
- 代数几何方向,编号032的成果声称对所有复CM阿贝尔簇证明了有理霍奇猜想;
- 数论领域,编号002和006的成果共同给出了每条有理椭圆曲线的密度为1的二次扭曲族上完整的BSD公式,编号004则对有理数域上的希尔伯特第十问题给出了否定解答。这三项成果均涉及千禧年大奖难题或20世纪标志性数学问题。
算子代数领域,编号287的成果声称解决了自由群因子同构问题,结论为不同秩的自由群因子彼此同构,该成果同样附带了Lean形式化验证。此外,公开的手稿中还包含多项其他重要进展,例如证明π的无理性测度恰好为2、卡塔兰常数为无理数、马勒猜想在所有维度成立、平面无法用五种颜色完成单位距离染色,还包括对Kaplansky零因子猜想、Hadwiger猜想的反例构造。
据前机构研究者Will Depue使用GPT 6 Pro和Fable 5.1对过去三年的所有数学发现进行的排名显示,其中蓝色代表人类发现、红色代表10月6日之前的AI发现、绿色代表此次公开的来自该仓库的AI发现,而令人震撼的是,其中81%的成果都是此次才公开的。
未公开的内部模型
值得注意的是,此次发布中,支撑这些成果的AI模型始终未公开具体名称,机构仅在博客中将其称为「内部前沿模型」,并表示正在推进该模型的负责任发布流程。早在9月8日,机构就曾发布过Navier-Stokes相关公告,当时称一个显著强于GPT-6 Astra、于8月28日开始训练且仍在进行中的内部模型,使用约1万个并行智能体、耗时88小时完成了三维不可压缩流体在光滑外力作用下从静止状态出发并在有限时间内产生奇点的证明,后续还使用GPT-6 Astra额外耗时17小时完成了Lean形式化验证。在此次发布前夕,机构发言人就曾证实,该内部模型已经解决了数学绝大多数领域内超过100个长期悬而未决的问题。
数学界的争议与行业应对
此次发布也引发了数学界的广泛讨论与争议。过去两个多月以来,AI实验室与数学家群体之间的摩擦和压力持续升级。8月1日,机构曾公布下一代模型Astra在数学与理论计算机科学领域的十项进展,但仅几天后就有数学家指出,其中证伪Connes刚性猜想的反例中,有一个群并不满足所需条件。8月11日,另一家AI实验室也披露其未公开模型在黎曼猜想相关方向取得了进展。
据报道,8月间机构曾私下召集约40位数学家,讨论如果AI在数学领域的能力超越人类该如何应对。与会者表示,机构当时暗示其模型已经解决了数百个长期难题,并就如何发布征求意见,部分与会者称机构还承诺不会一次性全部放出相关成果,但机构发言人表示对此并不知情。西北大学的数学家回忆,当时与会者的情绪交织着兴奋与恐惧,大家当场提出,不应像8月的十项进展那样仅通过博客和推文发布,而应该写成标准的学术论文,让数学界能够消化和使用这些成果。
另有报道称,机构是在听闻有人即将解出相关问题的传闻后,才调动数千个智能体进行攻关。纽约大学的Tristan Buckmaster指控机构抢跑了他与Anthropic员工Levent Alpöge尚未发表的合作研究,二人此前一直在使用机构的工具辅助研究。不少数学家表示,「大家觉得这些头部AI公司有种黑帮式的行事作风」。
9月11日,包括陶哲轩在内的25位菲尔兹奖得主联署声明,指出攻克知名数学难题本应是推动概念理解的工具和衡量标准,但仓促的公告无法留出足够时间撰写规范论文、做好引用工作,会引发严重的署名与抄袭问题。在此之前,一份由4000多名数学家联署的《莱顿宣言》已经要求AI公司遵守数学界的学术标准,包括披露AI使用情况、遵循同行评审流程、正确引用前人工作以及保持开放获取等,Bryna Kra是该宣言的起草者之一。
9月29日,高等研究院(IAS)数学与人工智能独立咨询小组在汇总了600多份社区问卷后,发布了关于AI生成数学成果的发布建议,这也是机构此次在推文和博客中特意援引的文件。IAS的建议分为两个阶段:第一阶段为「初次发布」,要求实验室检索并引用相关已有研究,将证明内容写成符合传统数学论文惯例的格式;公开模型名称、提示词、思维链摘要、耗时和算力成本估算;尽可能完成形式化验证;将成果存放在「不受任何AI实验室控制」的中立仓库,带有持久标识和修改记录;报告在可比问题上的失败率。第二阶段为「支持理解」,要求资助相关会议、研讨会和阐释性写作,并向全球数学界提供广泛、公平的模型访问权限。
对照这份建议,机构此次的发布只能算是「有选择地达标」:公开了推理摘要、算力估计和尝试问题数量,承诺资助一系列围绕AI重大成果的研讨会和会议,承诺保留版本记录并通过新版本修订完善,形式化验证覆盖了超过六成的成果集群。但不符合建议的地方也不少,最突出的是未公开模型具体名称,且仓库仍托管在机构自己的GitHub组织下,机构表示仍在探索社区托管的替代方案。机构也在博客中承认,未来的发布将在引用规范、数学阐述和呈现方式上持续改进。
瓶颈从「证明」转向「理解」
如果说9月的Navier-Stokes公告证明了AI能够攻克顶尖的数学难题,那么此次发布则证明了另一个事实:在相当广泛的数学前沿领域,产出可验证的新研究成果已经可以达到「每份耗时数小时」的批量生产节奏。这也让陶哲轩在9月提出的观点变得更加尖锐:真正的冲突并非人类推理与机器推理的对立,而是充足的证明产出与稀缺的专家注意力之间的错配。
372个成果集群中有235个附带了Lean形式化证明,这确实大幅降低了「证明是否正确」的验证成本,但此前Connes刚性猜想的插曲已经提醒所有人,形式化验证能够保证推理过程无误,却无法自动确保被证明的命题与数学家原本关注的问题完全一致。机构为每个成果集群准备的Lean说明页中专门标注了「形式化验证覆盖的范围和未覆盖的部分」,例如准黎曼猜想的成果集群就注明论文中的后续应用部分并未纳入形式化验证,这本身就说明,对研究命题的陈述层面的核对仍然离不开人类专家的参与。
至于那些分量最重、却尚未完成形式化验证的成果,例如四维挂谷猜想、CM阿贝尔簇的霍奇猜想、有理数域上的希尔伯特第十问题,未来几个月内能否通过专家的逐行审读,将是此次发布的真正考验。一个更值得深思的问题是:当新定理的供给不再稀缺,数学共同体该如何重新分配最宝贵的资源——也就是人类专家用于研读和理解成果的时间?
正如相关负责人所说,我们正在进入一个大发现的新时代。这句话的前半部分,如今已经有722份证据作为支撑;但后半部分的「发现」要真正成立,还需要人类学者将这些成果读懂、吸收,并传承下去。
参考链接
https://openai.com/index/sharing-ai-progress-in-mathematics/
https://github.com/openai/math/blob/main/lean/docs/003.md
https://quantamagazine.org/hong-wang-wins-2026-fields-medal-the-third-woman-ever-20260723
https://www.remio.ai/post/terence-tao-ai-math-warning-challenges-the-benchmark-race

