文章摘要
Anthropic旗下AI模型Claude,依托Prove2Me多代理协作平台,仅用11天就完成了原本数学界规划多年的费马大定理端到端形式化验证,产出超千万行代码,成果经Lean校验通过,全程人类指导极少。该成果证明AI可大幅提速数学证明形式化工作,同期OpenAI也开放新旗舰模型GPT-6 Astra,业内预计AI科研工具将快速涌现。

困扰数学界三百五十多年的费马大定理,在被人类数学家攻克后,如今又被AI完成了一项极具工程价值的工作。Anthropic最新宣布,旗下Claude模型完成了首个端到端、可经计算机完整校验的费马大定理形式化证明。

整个项目产出了约1300万行Lean代码,包含超过3万个中间定理,最终的正式证明调用了其中约29500个定理。这项工程的代码规模,更是超过了Lean核心数学库Mathlib的五倍。

需要明确的是,Claude并没有推导出全新的费马大定理证明路径,它完成的是将人类数学家能够读懂的常规证明文本,完整转化为计算机可以逐行检查、没有任何“此处显然成立”这类模糊表述的形式化证明。而这项工作,数学界原本规划为需要多年才能完成的大型工程。

先简单介绍费马大定理的核心内容:对于任意大于2的整数n,不存在正整数a、b、c满足等式aⁿ + bⁿ = cⁿ。这个命题看似简单,但其证明难度却远超想象。从17世纪费马提出这个猜想开始,欧拉、勒让德、库默尔等一代代数学家前赴后继推进研究,始终未能完成完整证明。

直到1993年,英国数学家Andrew Wiles首次公开宣布完成了费马大定理的证明,但后续审查发现其中存在关键漏洞。Wiles随后花费约一年时间,与Richard Taylor合作修补了这个缺口,最终在1994年正式完成了完整证明,困扰数学界三个半世纪的难题终于被攻克。

但在证明被人类认可后,数学界又提出了一个更具工程挑战性的问题:能否让计算机也能百分之百确认这份证明的正确性?这就是数学证明的形式化工作。

常规的数学论文是写给人类数学家阅读的,同行可以凭借专业背景快速理解推导过程,认可其中的逻辑步骤。但像Lean这类专门用于校验数学证明的程序助手,则不会接受任何模糊的表述。我们可以将Lean理解为数学领域的超级严格编译器:无论是人类还是AI,都需要将定理、定义和证明步骤完全按照形式化规则编写成Lean可以识别的代码,由Lean来验证每一步推导是否严格基于已有的公理和定理。正因如此,形式化一个大型现代数学证明的工作量往往极其惊人。

早在2000年代,就有计算机科学家提出了形式化Wiles费马大定理证明的设想。直到2024年,相关团队才正式启动一个长期社区项目,计划使用Lean完成费马大定理的形式化工作,仅项目第一阶段的技术蓝图就长达86页。

但Claude的出现彻底打破了这个进度预期——整个形式化工作仅用了11天就完成了。

项目团队最初并没有打算一口气完成全部工作,只是想测试Claude能够将这个项目推进到何种程度。最终,Claude直接完成了整个形式化流程。

整个过程中,多个AI代理同时并行开展工作:一部分负责补充数学定义,一部分专门攻坚中间引理,一部分基于已有成果向更高层定理推进,还有代理负责将各个部分整合为完整的证明体系。

最终产出的代码量达到约1300万行,包含超过3万个中间定理,规模超过Lean核心数学库Mathlib的五倍。Anthropic团队表示,这份完整证明仅依赖Lean的三个标准公理,并且通过专门的比对程序确认,Claude最终证明的定理陈述与Mathlib中的费马大定理完全一致。这意味着,逻辑校验的最终裁判正是Lean本身,而非AI模型自身的宣称。

不过Claude的这次11天攻坚并非一路顺畅。项目初期,多代理协作很快遇到了当前大型AI系统普遍存在的问题:随着参与的代理和任务数量增加,项目逐渐陷入混乱。早期的代理虽然快速完成了部分成果,但随着工程规模扩大,它们难以跟上整体进度,也无法有效协同工作。这些失败尝试留下的代码,最终仅占成品非模板代码的约7%。

真正的转折点在于团队引入了名为Prove2Me的协作平台——这是项目研究者专为数学形式化工作搭建的系统,可以理解为给多个AI代理装上了一套数学领域的项目管理工具。

Prove2Me会将整个证明拆解为由定理节点组成的有向无环图,各个代理可以通过这张图清晰了解哪些定理已经完成证明、哪些还缺少前置条件,以及下一步应该主攻哪个节点。同时,平台还会将定理的自然语言描述和形式化代码分开管理,加速Lean编译过程,并为每个定理保留可读的自然语言说明,方便不同代理搜索和复用已有成果。在这套系统的支持下,多代理团队终于能够像高效协作的大型数学团队一样开展工作。

Anthropic最终采用的方案是Prove2Me平台结合基于Claude Code的多代理框架。整个项目消耗了约60亿个输出Token,内部使用的通用研究模型能力大致相当于Claude Fable 5.1。更值得注意的是,整个过程中人类提供的数学指导非常有限,项目主导者仅偶尔给出高层级的提示,比如调整研究方向优先级、加快特定定理的推进速度。绝大多数的数学定义编写、中间证明推导、任务拆分与整合工作,都由Claude自主完成。

负责审阅这项成果的研究者将其评价为“非凡的自动形式化成果”。这个评价背后有着更深远的行业意义:费马大定理的形式化完成,并不只是又一次AI证明数学命题的案例。如果这种规模、复杂度极高的现代数学成果,都能够被AI自动转化为形式化系统,那么长期依赖人工、进度缓慢的数学文献形式化工作,将首次具备大规模提速的可能性。

几乎在Claude完成这项工作的同时,OpenAI也有新动作:GPT-6 Astra正在逐步向ChatGPT付费用户开放。其中GPT-6 Pro面向Pro、Business和Enterprise计划用户推出,Pro用户可以在Chat、Work和Codex中使用Astra模型。

这款新模型已经准备就绪,可以开始投入实际应用了

据介绍,GPT-6 Astra重点强化了多项当前行业热门的能力,包括长链路AI代理任务、软件工程、计算机操作、浏览器使用,以及科学研究与专业工作场景的表现。

一边是Claude用11天完成了三百多年数学名题的形式化校验,一边是OpenAI将新旗舰模型推向付费用户,不难预见,一大批面向数学研究、科研工作的AI工具和成果,即将随着新一代大模型的落地快速涌现。

以上内容不代表本平台立场,仅供读者参考