文章摘要
OpenAI近日将其AI模型测试推理得到的722篇数学研究成果批量上传至GitHub开源,成果涵盖约4000道人类未解数学问题,完成了准黎曼假设等多个经典悬置难题的证明,部分成果经机器校验通过,该事件引发数学界震动,学界开始反思AI对数学研究的影响。

OpenAI近期将其内部前沿AI模型产出的海量数学研究成果批量上传至GitHub开源仓库,这一动作在数学和AI领域引发了广泛震动。该仓库地址为openai/math,其中共收录722篇相关论文,将研究结果归类为372个成果族,涵盖了约4000道尚未被人类完全解决的数学问题,据统计每个成果平均耗费约3小时ChatGPT Pro的思考算力。

当打开编号003的论文时,会发现一个足以颠覆学界认知的结论——OpenAI宣称其AI模型完成了准黎曼假设的证明。


重磅研究合集详情

此次公开的完整研究合集共有41页,按照数论、代数几何、理论计算机科学、数学物理等17个学科分类排布,数论领域的成果被放在了最靠前的位置。数论板块收录的问题大多已经悬置数十年,其中包括多个经典未解难题:

  • 准黎曼假设(编号003):经典黎曼假设提出ζ函数的所有非平凡零点都位于实部为1/2的直线上,而准黎曼假设则是退一步的弱化版本,仅要求证明实部大于某个小于1的数的区域内不存在ζ函数的非平凡零点,此前无人能完成证明。此次OpenAI的模型证明了,实部大于7/8的复数区域内,ζ函数没有非平凡零点。

  • 有理数版希尔伯特第十问题:该问题询问是否存在通用算法,可以判断任意整系数多项式方程是否存在有理数解。整数版的希尔伯特第十问题已于1970年由马季亚谢维奇解决,答案是否定的,但有理数版本始终悬而未决,此次模型同样证明了该问题的答案为不存在。

  • 卡塔兰常数的无理性:卡塔兰常数由级数1 - 1/9 + 1/25 - 1/49 + ……求和得到,长期以来人们无法确定它是否为分数,此次模型证明了该常数是无理数。

  • π的无理性指数为2:用分数逼近π时,无法获得比一般无理数更高的精度,此前学界能证明的上界约为7.1,此次模型不仅将该上界优化到了2,还同时证明了Flint Hills级数的收敛性——这是一个形式简单却长期无人能判断的级数。

  • BSD猜想的部分证明:BSD猜想是七大千禧年大奖难题之一,此次模型并未完成完整证明,而是证明了:对于任意一条定义在有理数域上的椭圆曲线,其二次扭曲中密度为1的部分都满足完整的BSD公式。

除了数论领域的成果,合集中还涵盖了CM阿贝尔簇上的霍奇猜想、正特征域下几何朗兰兹纲领的一个版本、一系列推翻Kaplansky猜想的反例,以及大量埃尔德什提出的未解决问题。需要说明的是,文档中的编号仅为目录顺序,并不代表成果的重要性排名,比如编号第三的正是准黎曼假设这一重磅成果。


研究成果的积累过程

这批海量的数学研究成果,其实是OpenAI在使用开放研究问题评测其AI模型时逐步积累下来的。由于现有的数学评测数据集已经被充分挖掘,团队转而选择使用人类尚未解决的数学问题作为测试题目,来检验模型的推理能力。

OpenAI团队首先收集了约4000道“人类未解数学难题”进行模型测试,将得到的结果汇总为成果族,再经过“分量足够”的标准筛选后,最终留下了372个高质量成果族。

在过去两个多月的时间里,OpenAI已经分四次公开了相关研究进展:

  • 8月1日:发布《数学与理论计算机科学的十项进展》,公开10个模型完成的数学证明成果;

  • 9月8日:宣布内部模型解决了纳维-斯托克斯千禧年难题,证明了光滑流体可以在有限时间内产生奇点。为了完成这一证明,团队使用约1万个智能体并行运行了88小时,所用的模型更是在8月28日才刚刚完成训练;

  • 9月21日:再次宣布同一内部模型解决了超过100个公开的数学难题;

  • 10月6日:将722篇相关论文一次性全部公开至GitHub仓库。

通过仓库中论文的目录日期,可以清晰看到模型的迭代突破过程,比如9月23日产出了177篇成果,9月24日则达到了193篇。


成果的严谨性验证

AI模型产出的数学证明如何确保正确性?验证方法也在随着技术发展不断进化,其中Lean工具链就是其中的代表——将数学证明转化为可被计算机逐步校验的代码,由机器完成严谨的验证。

以准黎曼假设的证明为例,使用Lean表达的核心代码仅有三行:

theorem riemannZeta_ne_zero_of_seven_eighths_lt_re
  {s : ℂ} (hs : (7 / 8 : ℝ) < s.re) : riemannZeta s ≠ 0 := by
  sorry

翻译成自然语言就是:对于任意复数s,只要s的实部大于7/8,那么ζ(s)就不等于0。代码末尾的“sorry”是一个占位符,意为“证明待补充”,而OpenAI的工作就是将这个占位符替换为完整的严谨证明。

此次成果的校验工作通过Comparator程序完成,具体流程包括:

  • 使用完全相同的命题作为测试题目;

  • 仅依赖三条标准数学公理;

  • 由Lean内核逐行检查代码,最终所有模块都通过了校验。

有开发者在OpenAI的开发者论坛上分享了自己的编译结果,整个校验过程包含2924个模块,最终零错误、零警告。目前仓库中的形式化清单仅收录了162篇论文的核心结果,剩余的五百多篇论文目前仅能通过人工阅读的方式进行验证。


学界的震动与反思

此次公开的成果引发了数学界的广泛震动。早在9月,25位菲尔兹奖得主联合发表公开信,警示AI正在对数学家的智力工作带来潜在威胁。

就在9月21日,OpenAI宣布成立数学与AI顾问组,该小组挂靠在普林斯顿高等研究院,由九位全球知名数学家组成,包括高尔斯、海雷尔、威滕、梅兰妮·伍德等,这些成员既不从OpenAI领取薪酬,也不受OpenAI的直接管理。9月29日,顾问组参考六百多份调研问卷,发布了一份AI实验室发布数学研究成果的指南,OpenAI表示此次公开的仓库完全参考了这份指南,包括保留版本记录、规范引用格式、附带Lean代码、10份推理摘要、算力消耗说明以及问题统计数据等。

逻辑学家Jeremy Avigad在陶哲轩的博客上发表评论称:

一年前还算体面、能正经发表的那类结果,现在借助AI就能轻松生成。这让我们开始担心,往后做数学意味着什么,又该怎么培养下一代数学家

在OpenAI公开这批成果的当天,数学与AI顾问组也同步发布了相关声明,强调对于这类AI辅助产出的数学研究而言,公开成果仅仅是第一步,人类学界仍需要花费时间理解这些工作,并将其纳入现有的数学知识体系。不少学者感叹,科学研究似乎已经真正踏入了智能革命的奇点。

以上内容不代表本平台立场,仅供读者参考