OpenAI发布722篇数学手稿 数学界直呼读不完

近期,OpenAI向全球数学界抛出了一系列极具冲击力的研究成果:一次性对外发布了722篇由内部未发布模型生成的数学手稿,这些成果被整理为372组研究结果。据OpenAI披露,该模型此前共尝试了约4000个数学研究问题,单组成果的平均算力消耗,相当于ChatGPT Pro运行3小时的计算量。
此次公开的内容包括完整论文、源代码以及部分Lean形式化证明,全部上传至了GitHub代码仓库。浏览仓库目录可以发现,这批成果覆盖了数论、代数几何、理论计算机科学、统计力学等17个研究方向,其中不乏准黎曼猜想、霍奇猜想、BSD猜想这类顶级数学难题的相关进展,光是千禧年大奖难题就涉及了三道,此外还包含π的无理性指数、卡塔兰常数这类经典常数问题,以及稀疏自旋玻璃、量子磁性、自由群因子等细分领域的研究。
在众多成果中,关于准黎曼猜想的进展最为引人注目。传统的黎曼猜想旨在证明黎曼ζ函数的所有非平凡零点都位于实部为1/2的临界线上。此次OpenAI的模型给出的结论是:ζ函数与所有狄利克雷L函数,在实部大于7/8的区域内均不存在非平凡零点。这一突破意义重大——此前数学界仅能证明实部大于0.99的竖带区域内无零点,且该区域始终紧贴实部为1的边缘,而此次成果将零点的可能存在范围向临界线方向推进了一大截,尽管尚未完全达到黎曼猜想要求的1/2临界线。
该组成果还包含另一项独立证明:将无零点区域缩小至实部大于11/12的范围,同时额外证明了可以一致排除“西格尔零点”——这类潜藏在实数1附近的L函数“捣乱零点”,已经困扰数论学界近百年,此前绝大多数关于素数分布的研究都需要绕开这类假设性零点展开。
另一项核心成果针对有理数域上的希尔伯特第十问题,OpenAI的模型给出了明确结论:不存在可以判断整数系数多项式是否存在有理数解的通用算法。该问题的整数版本早在1970年就由苏联数学家马季亚谢维奇解决,但有理数版本却悬而未决了半个多世纪。
此次公开的成果还涉及另外两道千禧年大奖难题:BSD猜想与霍奇猜想。针对BSD猜想,模型针对满足Selmer余秩为0或1等条件的椭圆曲线推导出了完整公式,结合仓库内的其他相关结果,按密度统计可以覆盖有理数域上每条椭圆曲线的绝大多数二次扭曲情况。而关于霍奇猜想,模型聚焦于两类特定几何对象:具有特殊复乘结构的阿贝尔簇,以及K3曲面的乘积,相关论文声称覆盖了该类对象的所有维度与余维,不过霍奇猜想本身涉及的几何空间范围更广,此次成果仅覆盖了上述特定子类。
在经典常数问题上,两篇手稿分别给出了突破性结论:其一证明了π的无理性指数恰好为2——此前学界最优的结果仅将该指数压缩至7.1左右,此次成果直接达到了该问题的理论最优值;其二则证明了卡塔兰常数为无理数,尽管π的无理性早已被证实,但卡塔兰常数是否为无理数此前始终没有公认的严谨证明。
理论计算机科学领域的相关成果则针对唯一游戏猜想展开。该猜想由Khot于2002年提出,旨在回答复杂优化任务中算法能将答案逼近到何种程度,其弱化版本已于2018年被证明,但完整版始终未能攻克。此次OpenAI的模型声称证明了该猜想的完整版,同时还给出了最大割、顶点覆盖等经典问题的近似难度结论。
除此之外,仓库目录中还包含了稀疏自旋玻璃的梅扎尔—帕里西公式、量子海森堡铁磁体的自发磁化、自由群因子同构,以及三维单种粒子相对论性弗拉索夫—麦克斯韦方程的整体光滑解等细分领域的研究结果。
值得注意的是,此次公开的绝大多数成果均由同一未发布的内部模型通过标准化流程生成,但有两项成果例外:黎曼ζ函数的无零点区域相关证明,以及复乘阿贝尔簇上的霍奇猜想研究,并未完全遵循这套固定流程。其中,实部大于11/12的黎曼ζ函数无零点证明文稿还经过了人工编辑,以提升可读性。仓库同时标注,这批手稿的核验进度各不相同,部分成果尚未完成Lean形式化证明。
学界的审视与担忧
尽管OpenAI一次性公开了数百篇数学手稿,但数学界的反应并未如预期般热烈,反而引发了诸多讨论与担忧。手稿上线后,由九位学者组成的独立数学与AI顾问组随即发布声明,该顾问组包含蒂姆·高尔斯、马丁·黑尔两位菲尔兹奖得主,以及理论物理学家爱德华·威滕。声明中明确表示,顾问组此前向OpenAI提供的建议,并不代表他们认可这些研究成果,也不代表他们认同OpenAI产出成果的具体流程,所有证明的正确性以及对后续研究的价值,仍需交由各领域的数学家逐一消化验证。
Francesco Maggi作为得克萨斯大学奥斯汀分校的数学家,在手稿发布前就曾在社交平台上提出质疑:此前9月公开的流体力学证明,学界专家至今仍在反复研究其逻辑细节,而此次一次性推出数百篇成果,不仅没有足够的人力逐一研读,更难以从中提炼出可复用的新方法与新研究方向。
Maggi的态度颇具代表性:他并不反对利用AI辅助数学研究,但担忧当前AI产出研究成果的速度已经远超人类学界的理解与消化能力,数学家们只能被动追赶AI的产出节奏。
事实上,在这批手稿公开前,OpenAI就曾与数学家群体沟通成果发布事宜。据相关报道,8月OpenAI召集了约40名数学家讨论发布方案,西北大学的Bryna Kra等学者希望OpenAI能提供撰写清晰、便于同行阅读与引用的正式论文。部分与会者表示,当时他们以为OpenAI不会一次性放出全部成果,但OpenAI发言人则称公司并不清楚有过此类承诺。
9月的流体力学研究争议进一步加剧了学界的紧张情绪。当时,纽约大学数学家Tristan Buckmaster与Anthropic研究员Levent Alpöge公开了三篇流体方程爆破证明,并配套了Lean形式化内容,几乎与此同时OpenAI也发布了纳维—斯托克斯方程的相关证明。Buckmaster称,原本计划花费更多时间完善证明的可读性,但因外部压力提前发布了成果。随后,Buckmaster团队与OpenAI围绕研究进度与成果归属产生了争执,双方提交的成果存在高度相似甚至重合的内容,而OpenAI否认其模型受到了Buckmaster此前使用Codex时的提示词影响。
就连一直积极推广AI工具的陶哲轩也对此表达了谨慎态度,他在9月加州理工的一场演讲中提到,AI领域的发展速度“过于疯狂”,完全没有必要如此激进。菲尔兹奖得主Cédric Villani在看到OpenAI此前公布的纳维—斯托克斯方程证明时,曾直言“大受震撼,仿佛经历了数学界从未有过的浩劫”。
此次OpenAI将全部手稿、部分形式化证明与推理摘要公开至仓库,并表示将出资举办研讨会协助学界研究这些成果。顾问组则回应称,材料已经公开,接下来的工作将由数学家们自行完成检查、解读,并筛选出真正能推动数学研究进展的成果。可以说,OpenAI已经提交了答卷,但数学界的正式阅卷才刚刚开始。
近期其他动态
与此同时,OpenAI的“28天挑战赛”也来到了第二日。此前该挑战赛的负责人放话,在接下来的28天里,每天都要为Codex或Work用户带来一项明显的功能改进,若某天未能达标则会重置用户的使用额度。
挑战赛首日共推出了四项更新:其中最直观的是Auto-review功能,当Codex执行长任务时,可以让另一个AI代理检查其准备执行的操作,帮助用户拦截高风险动作;目前通过ChatGPT账号登录的用户使用该功能,不再消耗套餐额度。其余三项更新则分别面向开发与日常办公场景:API付费档位从五档简化为三档;Meetings插件可以自动将会议内容整理为纪要与待办事项;供开发者调用的Decisions API开放了公测版本。

