OpenAI甩出722篇数学手稿 AI突破准黎曼猜想

2026年10月7日的清晨,或许将成为人类科学史上的一个标志性节点——一家AI实验室毫无预兆地在GitHub上公开了一座足以颠覆数学界的学术宝库。这个事件的冲击力之大,以至于即便提前做了大量功课,撰写这篇内容也耗费了远超预期的时间,其间无数次被事件的历史分量和宿命感所触动。
这家实验室直接在平台上创建了名为openai/math的全新仓库,里面存放着722份数学手稿,整合为372个独立研究成果,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等几乎所有核心数学分支。所有成果均来自该实验室内部一款尚未对外公布的大模型。
722篇论文的体量意味着什么?作为学术出版的核心平台,arXiv对个人上传有严格限制,每人每月仅能提交两篇。如果由人类学者手动上传这些成果,需要连续工作近30年才能完成。而数学作为科学的基础与核心,这次突破的意义更远超单纯的数量级增长。
消息发布后的24小时内,全球数学界陷入了前所未有的沸腾状态,有人狂喜有人震撼。有评论者的感受最具代表性:在这个混沌却又充满指数级突破的时代,《三体》中描述的技术大爆炸,或许真的会在我们这一代人的有生之年成为现实。
一、这场突破的完整脉络
首先需要解释的是“成果组”的概念:数学研究中,一个核心结论往往会衍生出一系列推论、补充论证或不同视角的证明,这些相关内容会被归为一个成果组,本次公开的372个组便是如此。
该实验室表示,当前主流的数学评测基准已经被现有AI模型刷至饱和:国际数学奥林匹克竞赛的金牌水平AI早已达成,各类标准化数学题库也被充分训练,单纯提升评测分数已经无法体现模型的真实科研能力。因此,他们挑选了约4000个尚未解决的数学开放问题,输入到内部模型中进行探索,最终筛选出具备学术价值的372组成果。
值得注意的是,尽管在编程领域有其他模型表现突出,但GPT系列在科研方向上始终处于前沿位置。本次产出的每个成果,平均仅耗费了相当于ChatGPT Pro级别3小时的思考算力。要知道,其中部分问题,人类数学家已经钻研数十年却未能取得实质进展。
该实验室负责人随后在社交平台发文感慨:“你的海洋如此浩瀚,我的船只如此渺小。”每一个接触过前沿AI的人,或许都曾有过类似的感受——在AI的无限可能性面前,人类的认知边界正在被快速拓展。
二、为什么数学界会如此重视这次突破?
要理解这场震动,首先需要明白数学与其他学科的本质区别。不同于物理、化学等依赖实验验证的学科,数学的核心在于严格的逻辑证明:从最基础的公理出发,每一步推导都必须严丝合缝,一旦证明成立,在相同的公理体系下就会永远成立,不会被时代推翻或过时。比如两千多年前欧几里得在《几何原本》中证明的结论,至今依然是数学的基石。
我们可以用一个简单的例子理解这种严谨性:素数是否存在最大值?欧几里得的证明至今无人能挑出漏洞:假设素数有限,将所有素数相乘加1,得到的新数无法被任何已列出的素数整除,因此要么本身是新素数,要么能被未列出的素数整除,这就证明了素数必然有无穷多个。
数学中的“猜想”则是指被广泛认为正确但尚未完成严格证明的命题。比如哥德巴赫猜想,尽管计算机已经验证到极大的数值仍未找到反例,但在数学家眼中,只有严格的证明才能真正确立其正确性。历史上也曾有过类似波利亚猜想这样的案例:大量数值验证都成立,却在某个大数上被推翻,这也凸显了证明的不可替代性。
随着数学研究的深入,证明的长度和复杂度也在不断增加,人类的精力逐渐难以应对。这时,机器辅助验证的需求应运而生,也就是本次事件中多次提到的Lean工具。对于编程爱好者来说,Lean就像是数学界的编译器:将证明过程转化为机器可识别的代码,通过编译验证每一步推理的合规性。不过这套工具也存在局限:一是无法验证证明的问题是否为原问题本身,二是无法判断成果的创新性与学术价值。
三、本次突破中最震撼的成果
在372组成果中,最具颠覆性的无疑是对准黎曼猜想的突破。要理解这个成果的重要性,我们需要先回顾黎曼猜想的起源:素数的分布看似随机,但高斯在少年时代就发现了其整体的稀疏趋势,而1859年,黎曼通过引入ζ函数,建立了素数分布与函数零点之间的深刻联系。
黎曼猜想的核心内容是:ζ函数所有非平凡零点的实部都等于1/2。这个问题既是千禧年七大数学难题之一,也是目前数学界最核心的未解问题之一,悬赏百万美元的奖励。百余年来,数学家们只能逐步从实部为1的一侧向1/2推进,1958年后的近70年间几乎没有实质进展。而本次公开的成果显示,AI模型已经将这个边界推进到了7/8,也就是实部大于0.875的区域内不存在任何非平凡零点。
这个看似微小的推进,实则意义重大——这是几十年来黎曼猜想研究中最重大的突破之一。有数学家评论称,如果这一成果由人类学者完成,足以直接斩获菲尔兹奖。
除了准黎曼猜想,本次公开的成果中还有多项重磅突破:比如将复数域下矩阵乘法的计算复杂度指数从之前的2.37推进到了2.25;解决了挂谷猜想的四维版本,并在三维版本上取得了更强的结果;此外还有唯一博弈猜想、霍奇猜想特殊情形、更快的整数乘法等成果,随便一项在过去都足以成为学术头条。
四、AI与数学的百年纠葛
其实AI涉足数学领域的历史远比我们想象的更久。1956年达特茅斯会议召开,人工智能概念正式诞生的同年,“逻辑理论家”程序就证明了罗素《数学原理》中的数十条定理,当时人们曾乐观地认为机器证明数学的时代即将到来,但这一等就是数十年。
1976年四色定理的证明引发了巨大争议:两位数学家通过计算机程序检查了上千种地图情况完成证明,但数学界质疑“人类无法逐一验证的证明是否算得上真正的证明”。1998年开普勒猜想的证明同样遭遇了类似的困境,审稿人最终只能给出“99%确定正确”的结论,证明者随后耗时十余年通过机器完成了形式化验证,才让成果获得广泛认可。
大模型时代的到来彻底改变了这种局面:2024年DeepMind的AI在国际数学奥林匹克竞赛中拿到银牌,2025年多家AI模型都达成了金牌水平,随后研究方向从竞赛题转向真正的开放问题。2025年曾出现过一则乌龙事件:某实验室副总裁声称GPT-5解决了10个埃尔德什问题,后续却被证实不过是从尘封的文献中找到了早已被遗忘的旧结果,但这也侧面证明了AI作为超级文献检索工具的强大能力。
真正的转折点出现在2026年5月:该实验室的模型推翻了埃尔德什在1946年提出的几何猜想,菲尔兹奖得主蒂莫西·高尔斯专门为此撰写了配套论文,称这是当时最受认可的AI原创科研成果之一。随后的进展速度呈指数级增长:5月1项成果,8月10项,9月百余项,到10月直接突破372组。同时,算力成本也大幅下降,9月攻坚纳维-斯托克斯方程时还需要上万个Agent运行88小时,耗费数百万美元算力,而10月的成果仅需单个Agent和3小时的计算。
这场突破并非孤例:DeepMind同期解出了9个埃尔德什问题,Anthropic仅用11天就将费马大定理的完整证明转化为1300万行的Lean代码,整个行业都在加速前进。
五、数学界的反思与争议
其实在这次公开成果之前,数学界与AI实验室之间已经爆发过激烈的交锋。9月8日,该实验室宣布在纳维-斯托克斯方程这一千禧年难题上取得突破,但随后引发了一系列争议:实验室承认是在听闻传闻后紧急启动项目,而相关学者在其公告前12小时就已上传了自己的研究成果,双方随后在论文署名等问题上产生了激烈争执。
三天后,25位菲尔兹奖得主联名发表了公开信,指出AI公司将“解题能力”作为模型实力的衡量标准,与数学本身的目标存在根本偏差,正在伤害数学共同体。信件强调,数学的核心价值不仅在于得到答案,更在于人类通过研究获得的新理解与洞见,同时也明确表示并非反对AI,而是希望为论文撰写、署名和消化留出足够时间。这封信在一周内就获得了七千多人联署。
更早之前,该实验室曾召集40位数学家闭门会议,有学者恳求“不要一次性抛出所有成果,也不要仅通过社交平台发布数学研究”。9月21日,实验室宣称解决了百余项开放问题却未公开细节,普林斯顿高等研究院的独立顾问组随即向数学界征集意见,并在9月29日发布建议:反对使用外部无法访问的专有模型测试前沿数学问题,要求立即停止此类行为;同时要求所有成果必须公开在不受实验室控制的学术存档中,公开模型细节、提示词、推理过程、算力消耗,甚至包括失败的尝试,并且不得将数学成果用于自家模型的商业宣传。但实验室并未对此做出回应,直到一周后直接公开了722份手稿。
六、属于全学科的技术大爆炸即将到来?
回顾历史,2016年AlphaGo击败李世石的场景至今仍历历在目,当时“AI战胜人类棋手”曾是震动全球的大新闻,而如今AI在围棋领域的优势已经成为常识。或许未来所有学科都会走上类似的道路:AI在特定领域的能力超越人类,从引发轰动变为默认事实。
我们可以发现,技术突破的速度与该领域的“裁判成本”密切相关:数学的裁判是Lean工具,仅需数秒即可完成验证;下棋的裁判是一盘对局,耗时几十分钟;而化学的裁判是实验室合成与测试,需要数周甚至数月;新药的裁判是临床试验,往往需要数年时间;高能物理的裁判是造价数十亿美元的对撞机;天文学的裁判则需要等待新一代望远镜升空。AI的速度再快,也无法超越现实世界的物理限制。
因此,技术大爆炸必然会遵循成本优先的原则:首先爆发的会是数学与代码领域,因为其验证成本几乎为零;随后是天气、蛋白质结构、材料筛选等可以在计算机中模拟的领域;最后才是必须依赖实体实验的硬科学以及与人类相关的医学领域。当AI能够在每个领域源源不断地提出新想法时,整个研发链条中最慢的环节就会变成两个:现实世界的实验周期,以及人类自身的理解、审核与决策能力。
这种趋势已经在数学领域显现:AI一天可以生成数十万行证明代码,但人类的代码审查速度却远远跟不上,审核与理解证明正在成为最稀缺的资源。本次公开的372组成果,或许就需要整个数学界花费数月时间才能完成消化,而几个月后,模型的能力又会进化到何种程度?
七、尾声:我们必须知道
最后想分享两个关于数学的小故事。第一个发生在1900年的巴黎国际数学家大会上,德国数学家希尔伯特提出了23个影响整个20世纪数学发展的核心问题,这些问题养活了整整一个世纪的学者,也塑造了现代数学的走向。一个好的问题,往往比一个好的答案更有价值,因为答案只是终点,而问题却能指引一代人的探索方向。
第二个故事发生在1930年的柯尼斯堡,希尔伯特在故乡发表演讲,结尾的“我们必须知道,我们必将知道”成为了他一生数学乐观主义的缩影。但就在同一天,24岁的哥德尔在同一座城市的学术会议上宣布了不完备定理:任何足够强大的数学公理体系,都存在无法被证明也无法被证伪的命题。这一定理用最严格的数学方法证明了数学自身的边界:人类无法在体系内部证明体系的完备性,必须不断拓展边界,才能探索更多的未知。
我的家人和朋友中就有数学研究者,他们告诉我,数学最迷人的地方从来不是最终的“证毕”二字,而是穷尽一生去追寻、去理解的过程。如果仅仅追求答案,AI或许会比人类做得更快更多,但数学这门传承了数千年的手艺,其核心在于人类的思考与探索本身。
英国数学家哈代曾说,数学家与画家、诗人一样,是模式的创造者。而有一句话最近常被用来提醒自己:“你可以外包思考,但你没法外包理解。”在AI时代,人类剩下的价值是什么?我想大概有三点:一是提出有价值的问题,这依赖于人类的好奇心与审美;二是理解成果的本质与联系,这需要人类的深度思考;三是赋予研究意义,就像即使有了汽车,人类依然会跑马拉松,有了缆车依然会爬山,探索本身就具有价值。
我们必须知道。
我们,也必将知道。

