OpenAI宣布万级AI智能体破解千禧年数学难题

2026年9月8日,OpenAI宣布约1万个AI智能体协同工作88小时,给出纳维-斯托克斯方程存在性与光滑性问题的证明,同步公开166页论文及形式化验证代码。这是AI智能体破解千禧年数学难题的首次尝试,但数学界对成果归属和方法论提出重大质疑,一场关于AI与学术伦理的深层讨论由此展开。

一、88小时、1万个智能体:数学史上的“非人类时刻”
一个困扰人类数学家90年的难题,被1万个AI智能体在88小时内推平了。
2026年9月8日,OpenAI对外宣布,其一款尚未公开发布的内部大模型,组织约1万个AI智能体协同工作,成功给出了纳维-斯托克斯方程存在性与光滑性问题的证明,并同步公开了一份长达166页的论文及配套的形式化验证代码。
这道题来头不小。它是克雷数学研究所在2000年设立的七大“千禧年大奖难题”之一,每道题悬赏100万美元求解。26年过去,七道题中只有庞加莱猜想被俄罗斯数学家佩雷尔曼在2003年攻克,其余六道始终纹丝不动。而OpenAI选择攻克的纳维-斯托克斯方程问题,核心追问的是一个极其朴素却极难回答的命题:三维空间中,流体的运动是否永远保持平滑,还是会在有限时间内出现速度趋向无穷大的“奇点”?
OpenAI给出的答案是后者。其证明构造了一个向内旋转并沿轴向拉伸的“涡流”结构,论证在特定光滑外力条件下,流体的局部速度确实会无界增长。换句话说,这组服役了近200年的方程,在数学上并不完备。
但这只是故事的开始。
二、拆解“智能体蜂群”:OpenAI是怎么做到的?
2.1 两步走:从欧拉方程到纳维-斯托克斯
要理解这次突破的技术路径,必须回到一组更简单的方程——欧拉方程。欧拉方程是纳维-斯托克斯方程忽略流体黏性后的简化版本,相当于去掉了“摩擦力”这一项。
OpenAI的智能体系统分两步推进。第一步,约100个AI智能体协同工作约50小时,先攻克了无外力条件下欧拉方程的有限时间奇点问题。这一步的数学基础并非凭空而来,而是建立在西班牙数学家科尔多巴和马丁内斯-索罗亚从2021年起发展出的“叠罗汉”方法之上——他们构造出一层一层的流体解,每一层单独看都很正常,但把无穷多层叠加后,就能产生含有奇点的新解。
第二步才是硬仗。近1万个AI智能体被启动,在88小时内交换了270万至490万条消息,消耗约1300亿个输出token(整个项目总消耗接近3000亿token)。这些智能体被分为不同小组并行探索,可以读取缓存版本的互联网、运行代码并相互交流,由Codex汇总思路并交叉分发。
2.2 关键突破:让“叠罗汉”的外力保持光滑
这里有一个技术上的关键难点。用“叠罗汉”方法叠出奇点的过程中,用来推动流体运动的外力函数会在叠加过程中变得“不光滑”,但克雷悬赏明确要求外力函数必须是光滑的。差的就是这最后一步:怎么在叠出奇点的同时保住外力函数的光滑性。
这正是AI智能体大军在88小时内穷尽搜索所啃下来的硬骨头。证明需要同时满足自相似尺度、局部剪切、应力锥等数十个互相牵制的高维非凸约束条件,人类数学家可能需要耗费数年时间试错和微调参数,而AI智能体在极短时间内“搜”出了一套能够整体闭合的数学构造。
随后,GPT-6 Astra再花费约17小时,用Lean编程语言完成了形式化验证。Lean是一种可以将数学命题和证明步骤写成严格可检查代码的系统,编译器会逐步判断每一步是否合法。最终形成了一份166页的论文和约19000行Lean代码,论文署名仅有“OpenAI”。
2.3 人类数学家做了什么?
如果抛开争议,冷静审视这场证明中的分工,画面其实是清晰的。
人类数学家负责“搭骨架”——他们贡献了最核心的破局思路:“故意偏离临界尺度”“高频振荡脉冲”“剥离局部速度与整体动能”等数学结构,这些需要跳跃性思维的几何与物理直觉,目前的AI依然无法从零开始完成。
AI智能体负责“填血肉”——在人类搭建的框架内,用几乎无限的并行算力穷尽所有可能的分支,从庞杂的假设空间中搜索出一套能够整体闭合的数学构造。
这种分工本身,就是一幅关于人机协作新范式的启示录。
三、争议漩涡:谁先想到的?谁该拿功?
3.1 一场“抢发”风波
OpenAI的宣布在数学界引发的,远不止赞叹。
就在OpenAI官宣的前一天,纽约大学数学教授特里斯坦·巴克马斯特与Anthropic研究员莱文特·阿尔珀格公布了他们在相关流体力学问题上的研究进展。巴克马斯特随即公开质疑:OpenAI是否在获悉他们的研究路线后,才将资源转向同一方向并利用海量算力“抢跑”。
更敏感的是数据问题。巴克马斯特提到,他与阿尔珀格此前使用OpenAI的编程工具Codex处理过研究对话,未发布的研究草稿和数据存储在OpenAI的服务器上。他质疑这些数据是否被用于模型训练,从而间接影响了AI的解题路径。
OpenAI研究员布贝克否认了直接访问用户数据的指控,但公司也在声明中承认,“不排除”来自其产品的匿名化数据帮助改进了模型。
3.2 署名之争
更具戏剧性的是署名安排。据透露,OpenAI数学负责人布贝克曾在电话中提出一套发布方案,其中包括将阿尔珀格从署名中移除,理由是阿尔珀格的雇主Anthropic是OpenAI的竞争对手。
OpenAI首席执行官奥特曼则将这些指控称为“毫无根据的抄袭指控”,强调双方采用的数学路径完全不同。
3.3 25位菲尔兹奖得主联名发声
这场争议在9月11日达到高潮。包括陶哲轩、邓煜在内的25位菲尔兹奖得主联合发表了一份公开信《人工智能在数学中的严重错位》,警告AI公司把解决难题当作基准测试的做法,正在伤害数学本身。
公开信的核心关切并非技术本身,而是方法论和学术伦理。当一家AI公司可以动用数千万美元的算力,在几十小时内碾平一个人类数学家可能需要数年才能完成的证明时,学术研究的优先权规则、同行评议机制、乃至成果归属体系,都面临根本性的挑战。
四、陶哲轩的警告:好问题将比好答案更稀缺
在所有关于这次突破的讨论中,菲尔兹奖得主陶哲轩的评论最具穿透力。
他在OpenAI宣布突破后连夜撰文指出:真正稀缺的资源或许正在发生变化。过去我们担心的是没有足够强大的工具解决问题;AI时代,我们可能越来越需要担心的是,还有多少值得研究的好问题,以及研究者是否还敢公开它们。
陶哲轩用一个精妙的类比解释了这个问题。一个国家可能一边被浩瀚海洋环绕,一边陷入严重的饮用水短缺。我们当然可以随意生成无数个数学开放问题,比如求π的第10^10^10位数字,但绝大多数这类问题并不值得投入研究精力——它们没有表现出能进一步揭示新洞见或与其他问题建立联系的潜力。
判断一个问题是否值得重点研究,是一个漫长且带有主观性的过程。它建立在数学发展的历史经验之上,需要了解某一领域的“难度地形”——哪些问题用现有方法就能轻松解决,哪些问题需要付出一定努力,哪些问题在现有技术下根本无法解决。
而AI的介入,正在以惊人的速度抹平这种“难度地形”。
陶哲轩还提出了一个更深层的忧虑:如果AI能在人类不深度参与的情况下解决最困难的问题,可能会削弱人类对数学的理解。数学不仅仅是答案的集合,更是人类理解世界的思维方式。当答案来得太快、太自动化,理解的过程是否会被跳过?
不过,陶哲轩并非反对AI进入数学。他早在2023年就公开预测,到2026年AI可能可靠到足以成为技术论文的合作者。他甚至亲身实践——在2026年的一次研讨会后台,临上台前仍用AI助手生成了一份19页关于Sendov猜想的数学证明。他反对的是将AI当作“军备竞赛”的工具,而不是真正推进数学理解的伙伴。
五、全球AI数学竞赛:一场正在加速的“算力军备”
OpenAI并非唯一在数学领域发力的AI公司。
2026年5月,谷歌DeepMind发布了全新数学智能体AlphaProof Nexus,在353个开放的Erdős问题中自主解决了9个,其中2个已悬而未决长达56年。每个问题的推理成本仅需数百美元。这标志着AI在数学研究领域首次实现了大规模突破。
更早之前,Anthropic宣布其内部一款未公开的Claude研究模型在攻克黎曼猜想的过程中取得重要进展,将黎曼ζ函数临界线上零点比例的长期下界从41.6%提高到了67.2%。9月4日,Anthropic再次宣布,Claude在基本自主运行11天后,完成了对费马大定理的首个端到端、经过计算机检查的形式化证明。
而OpenAI总裁Greg Brockman在纳维-斯托克斯突破后公开透露,公司在另一个千禧年大奖难题上也取得了“重大进展”。外界猜测这个目标很可能是P vs NP问题或黎曼猜想。如果P=NP被证明,整个计算机科学的基础将面临颠覆性重构——密码学、算法理论、计算复杂度的所有假设都需要重新审视。
一场围绕数学难题的“算力军备竞赛”正在全面展开。而这场竞赛的底层逻辑,究竟是纯粹的科学探索,还是AI公司争夺技术话语权的商业博弈?这个问题,值得每一个关注AI发展的人认真思考。
六、横向对比:三大AI巨头的数学攻坚路线
为了更清晰地理解这场竞赛的格局,以下表格从多个维度对三家主要AI公司的数学攻坚策略进行横向对比:
| 对比维度 | OpenAI(纳维-斯托克斯) | Google DeepMind(AlphaProof Nexus) | Anthropic(Claude数学研究) |
|---|---|---|---|
| 攻克难题 | 纳维-斯托克斯方程存在性与光滑性 | 9道Erdős开放问题(含2道悬置56年) | 费马大定理完整形式化证明;黎曼猜想部分进展 |
| 核心技术 | 万级AI智能体并行搜索+Codex汇总 | LLM生成证明+Lean形式化验证的四级智能体架构 | 自主推理+形式化验证 |
| 算力规模 | 约1万个智能体,88小时,约3000亿token | 每个问题推理成本数百美元 | 11天自主运行 |
| 计算成本 | 估算约1500万-2250万美元 | 单题约数百美元 | 未公开 |
| 验证方式 | Lean形式化验证(17小时) | Lean编译器逐步验证 | Lean端到端计算机检查 |
| 成果归属争议 | 面临NYU教授“抢发”指控 | 暂无重大争议 | 暂无重大争议 |
| 学术反应 | 25位菲尔兹奖得主联名警告 | 学术界相对正面 | 学术界相对正面 |
从这张表可以清晰地看到,OpenAI在算力投入和智能体规模上远超同行,但这种“大力出奇迹”的模式也引发了最多的争议。DeepMind走的是更“精打细算”的路线——用数百美元解决一道研究级数学题,效率惊人。Anthropic则更强调自主运行和端到端验证能力。
三种路径背后,折射的是三家公司在AI能力发展方向上的不同判断:OpenAI押注“规模化智能体协作”的涌现效应,DeepMind追求“高效推理”的工程极致,Anthropic则聚焦“自主研究”的可靠性。
七、克雷研究所的态度:评审“有意放缓”
面对OpenAI的高调宣布,克雷数学研究所的反应出奇冷静。
所长Martin Bridson表示:“评审过程本就有意放缓,我们会确保它绝对严谨。”根据该奖项的规定,解答必须刊登于经同行审查的期刊,并在获数学界接受后经过2年,研究所才会召集委员会审议成果。
这意味着,即便OpenAI的证明最终被证明是正确的,正式获得克雷研究所的认定也可能需要数年时间。而OpenAI已经明确表示,不会申领100万美元的奖金,发布结果仅为展示AI模型的飞跃进展。
这种态度本身就耐人寻味。放弃奖金、快速发布、公开论文和验证代码——OpenAI选择了“先发制人”的公关策略,而非传统学术界的“先验证后发布”路径。这恰恰触及了AI时代学术规范的核心张力:当一家公司可以在几天内产出可能需要数年才能完成同行评审的研究成果时,传统的学术评价体系还能有效运转吗?
八、深度见解:AI智能体协作正在重塑科学发现范式
抛开争议不谈,这次事件在方法论层面的意义值得深入分析。
第一,智能体协作正在成为解决复杂科学问题的新范式。 传统的大语言模型是“单体”的——一个模型面对一个提问,给一个回答。但OpenAI这次调动的1万个智能体,呈现出一种“蚁群”式的分布式智能。每个智能体可能只负责一个子问题、一个约束条件、一个验证步骤,但当它们协同工作时,系统的整体推理能力远超任何单体模型。这种“蜂群智能”模式,与人类的科研团队协作有结构性相似之处,但速度和规模不在同一个量级。
第二,形式化验证正在成为AI数学能力的“信任锚点”。 数学证明最怕的是“看起来对但实际有漏洞”。Lean编译器的作用就是逐步检查证明的每一步推导是否合法。OpenAI这次不仅给出了自然语言论文,还生成了约19000行Lean代码——这意味着证明的每个逻辑步骤都被机器严格检验过。这种“双重验证”模式,正在成为AI数学证明的新标准。
第三,人机协作的边界正在变得模糊而复杂。 在这次证明中,人类数学家贡献了核心的破局思路,AI智能体完成了极其繁重的高维约束搜索和验证。但问题在于:当人类的贡献和AI的贡献紧密交织在一起时,“谁做得多”和“谁该署名”就变得难以界定。巴克马斯特事件本质上反映的是,在AI辅助研究日益普遍的时代,学术成果的归属规则需要全新框架。
第四,效率与理解的张力,可能成为AI时代科学研究的核心矛盾。 AI能给出正确答案,但答案背后的数学直觉和物理洞察,是否被人类所掌握?陶哲轩的担忧正指向这一点。如果研究者只看到AI给出的结果,而不再亲自经历“从困惑到理解”的过程,数学作为人类理解世界的方式,其价值是否会被稀释?这个问题没有简单的答案。
九、FAQ:关于AI智能体破解千禧年数学难题的常见问题
问1:纳维-斯托克斯方程问题到底是什么?为什么它这么重要?
纳维-斯托克斯方程是一组描述流体运动的基础方程,广泛应用于天气预报、飞机设计、血液流动模拟等领域。这道千禧年难题的核心问题是:三维空间中,流体在初始条件足够平滑的情况下,是否始终会保持平滑,还是可能在某些条件下出现速度趋向无穷大的“奇点”?这个问题悬而未决近200年,克雷数学研究所为此设立了100万美元的悬赏。
问2:1万个AI智能体是怎么协作完成证明的?
这些AI智能体被分为不同小组并行探索,可以读取缓存版本的互联网、运行代码并相互交流。系统先派出约100个智能体攻克欧拉方程的奇点问题,然后将规模扩大到约1万个,在88小时内交换了近300万条消息,穷尽了所有可能的证明分支,最终由Codex汇总并交叉分发,形成一套整体闭合的数学构造。
问3:OpenAI的证明是否已经被数学界接受?
尚未。克雷数学研究所所长明确表示评审过程将“有意放缓”,会确保绝对严谨。根据规定,解答必须刊登于经同行审查的期刊,并在数学界接受后经过2年,研究所才会召集委员会审议。OpenAI也表示不会申领奖金。
问4:为什么纽约大学教授指控OpenAI“抢发”?
纽约大学教授巴克马斯特称,他与Anthropic研究员阿尔珀格此前在相近方向取得了研究成果,因曾使用OpenAI的Codex处理研究对话,质疑OpenAI模型是否接触了相关数据影响了训练。OpenAI否认直接访问用户数据,但承认“不排除”匿名化数据产生了间接影响。
问5:陶哲轩为什么说“好问题将比好答案更稀缺”?
陶哲轩的核心论点是:AI正在以极快的速度解决那些人类数学家花费数年才能攻克的问题,导致原本具有高研究价值的“好问题”被迅速消耗。同时,研究者可能因为担心被AI“抢跑”而不敢公开自己的研究方向,进一步加剧好问题的稀缺。
问6:AI智能体破解千禧年数学难题对普通人有什么影响?
短期内对普通人的日常生活影响有限。数学家指出,这不等于得到了一套可以直接计算任意流体运动的通用解法,对现有工程计算也不会立刻产生明显变化。但从长期来看,AI在基础科学领域的突破可能加速新材料研发、药物设计、气候模拟等领域的进展。
问7:除了纳维-斯托克斯,还有哪些千禧年难题未被解决?
目前未被解决的千禧年难题包括:P与NP问题、黎曼猜想、杨-米尔斯规范场与质量间隙、霍奇猜想、贝赫和斯维讷通-戴尔猜想。加上OpenAI正在攻克的纳维-斯托克斯问题,共有六道难题仍在等待解答。
问8:AI智能体在数学研究中会取代人类数学家吗?
从目前的情况看,更准确的描述是“人机协作”而非“取代”。人类数学家负责提供破局思路和物理直觉,AI智能体负责高维约束搜索和形式化验证。但陶哲轩等数学家警告,如果AI能在人类不深度参与的情况下解决最困难的问题,可能会削弱人类对数学本身的理解。

