文章摘要
2026 年第 67 届国际数学奥林匹克竞赛(IMO)上,ClaudeFable5、GPT - 5.6Sol 和 KimiK3 三款通用大模型全部斩获 42 分满分,标志通用人工智能在长链条逻辑推理领域超越人类精英。此外,AxiomProver、小红书 dots - note - 3.0 和华为小艺等也获满分认证。这显示 AI 数学推理能力集体跃迁,有行业应用潜力,但也需理性审视其局限。

2026年7月,第67届国际数学奥林匹克竞赛(IMO 2026)在上海落下帷幕。在这场全球最高水平的中学生数学赛事中,一个历史性时刻悄然诞生——前Google工程师Deedy Das发起的一场AI横评显示,Claude Fable 5、GPT-5.6 Sol和Kimi K3三款通用大模型全部斩获42分满分。过去七年IMO共有4347名人类选手参赛,仅30人拿过满分,比例仅为0.69%。全球三大AI包揽IMO满分,标志着通用人工智能在长链条逻辑推理领域实现了对人类精英的全面超越,人工智能的“数学时刻”正式到来。

图片描述

一、IMO:人类数学智力的终极试金石

国际数学奥林匹克竞赛(International Mathematical Olympiad, IMO)始于1959年,是全球规模最大、水平最高的中学生数学竞赛,每年吸引全球100多个国家和地区的顶尖数学学子同台竞技,素有数学界的“奥运会”之称。IMO的金牌得主中诞生了多位菲尔兹奖获得者,包括知名华人数学家陶哲轩。

IMO的赛制极为严苛:比赛分两天进行,每天4.5小时完成3道题,总计6道题,涵盖代数、组合、几何和数论四个方向,每题7分,满分42分。参赛者不仅要给出正确答案,还必须写出逻辑完整、可接受逐步审查的证明过程。这种对推理链条严谨性的极致要求,使得IMO成为检验AI数学能力的终极试金石。

2024年,谷歌DeepMind首次挑战IMO,AI系统仅获得28分的银牌水平,且需要人工将自然语言题目翻译为形式化语言。2025年,谷歌Gemini Deep Think以自然语言端到端完成证明,用4.5小时解决5道题,获得35分金牌。而到了2026年,三个通用大模型直接拿下满分——这次,不仅没有经过任何专项数学训练,而且所有人都能用上。

根据IMO官网历届数据汇总,1959年至2025年的66届比赛中,满分率约为1.37%;本届的满分率则仅为1%。全球三大AI包揽IMO满分,意味着人工智能在IMO这个人类最难的数学竞赛中,已经走在了绝大多数人类精英的前面。

二、三强争霸:Claude Fable 5、GPT-5.6 Sol与Kimi K3的满分之路

(一)Claude Fable 5:干净利落的效率之王

Claude Fable 5是Anthropic推出的第五代推理模型,属于Mythos-class级别。在此次IMO 2026的挑战中,Fable 5仅用2.5小时就完成了全部6道题,花费51美元。整个过程中,Fable 5进行了9轮对话,其中6轮为有效输出,单次最长运行73分钟(P3),全程输出70万token。

在P1这道全场最温和的“开胃菜”中,Fable 5展现出了极具创造性的解题思路。题目大意是:黑板上写着2026个大于1的正整数,每一步选两个数m和n,擦掉后换上gcd(m,n)和lcm(m,n)/gcd(m,n),反复操作直到无法继续。证明过程一定会终止且最终剩一个大于1的数M,M的值不依赖于操作顺序。Fable 5直接“生造”了一个每步必定缩水的计数器——定义Φ = T + N,其中T是黑板上所有数的素因子个数之和(重复计),N是大于1的数的个数,然后证明每执行一步操作Φ至少减少1。这种“单一计数器,一刀斩断”的解法,展现了AI在抽象概念构造上的惊人能力。

(二)GPT-5.6 Sol:极致性价比的算力大师

GPT-5.6 Sol是OpenAI于2026年6月发布的旗舰模型,被OpenAI称为“step function”级别的提升——不是渐进式改进,而是跳跃。在IMO 2026的挑战中,Sol的xhigh版本同样拿下满分,用时3.8小时,成本压到了极低的20美元。

Sol的解题之路并非一帆风顺——在P2上磨了106分钟跑了4轮,中途还被网络故障打断了两次。但它的算力控制堪称恐怖:总输出只有23万token,是三个满分模型中最省的。对于P1这道题,Sol另辟蹊径,追踪的是两个量:P = 所有数的乘积,K = 大于1的数的个数。每步操作中,如果gcd(m,n) = d > 1,乘积P会减少;如果d = 1,则大于1的数的个数K减少。通过字典序降维的思路,Sol同样完成了严谨的证明。

GPT-5.6 Sol的API定价为输入5美元、输出30美元每百万token。以20美元完成IMO全部6道题的证明,其性价比优势极为突出。

(三)Kimi K3:不知疲倦的参数量巨兽

Kimi K3是月之暗面(Moonshot AI)于2026年7月17日发布的2.8万亿参数MoE模型,被描述为全球首个接近3万亿参数级别的开源权重AI系统。在这场IMO挑战中,Kimi K3历经17.4小时鏖战,花费31美元,最终拿下满分。

Kimi K3像一头不知疲倦的巨兽——一口气喷涌出154万token,是Sol的6.5倍。仅P3一道题就发起了6次冲锋,鏖战491分钟。这种“大力出奇迹”的策略虽然耗时最长、成本最高,但也证明了超大参数规模模型在面对极端复杂推理任务时的独特优势。Kimi K3的完整模型权重将于2026年7月27日开源释放。

(四)AxiomProver:第四方满分势力

除了上述三大模型,独立交卷的AxiomProver同样登顶满分。AxiomProver由Axiom Math公司开发,其创始人Carina Hong是一位24岁的华人女性。AxiomProver在2025年Putnam数学竞赛中已拿下12题满分,成绩超越约4000名人类参赛者。2026年初,AxiomProver还独立解决了四个长年未解的数学问题,其中包括Fel’s Conjecture的完整形式化证明,全程无需人类介入。

这意味着,在IMO 2026的AI赛道上,至少有四款模型同时达到了42分满分——Claude Fable 5、GPT-5.6 Sol、Kimi K3和AxiomProver。从结果来看,不仅满分42分和第四名28分之间横着14分的鸿沟,而且三个满分模型登顶的姿势截然不同。

三、横向对比:四大AI模型IMO 2026满分表现

对比维度 Claude Fable 5 GPT-5.6 Sol Kimi K3 AxiomProver
开发机构 Anthropic OpenAI 月之暗面(Moonshot AI) Axiom Math
参数量 未公开(Mythos-class) 未公开 2.8万亿(MoE) 未公开
IMO得分 42/42(满分) 42/42(满分) 42/42(满分) 42/42(满分)
解题耗时 2.5小时 3.8小时 17.4小时 未公开
API成本 51美元 20美元 31美元 未公开
总输出Token 70万 23万 154万 未公开
最大特点 效率最高、解法优雅 性价比极致、算力控制强 参数量最大、开源 独立证明数学猜想
开源状态 闭源(全球可用) 闭源 开源(7月27日释放权重) 未公开

从横向对比可以清晰看到,全球三大AI包揽IMO满分并非偶然——三款模型以截然不同的技术路径和策略,殊途同归地达到了人类数学竞赛的顶峰。Fable 5靠的是效率与创造力,Sol靠的是极致性价比,Kimi K3靠的是规模优势。这恰恰说明,AI在数学推理能力上的突破已经是系统性、全方位的。

四、不只是三大模型:更多AI的满分突破

值得注意的是,在Deedy Das的横评之外,还有其他AI模型在IMO 2026中获得了官方评卷的满分认证。

小红书dots-note-3.0经IMO官方评定,六道题全部答对,以满分成绩斩获金牌。这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini之后全球第二个达到该成绩的大模型——而且是满分,谷歌此前仅答对5/6题。dots-note-3.0仅用自然语言就完成了从读题、解析到写证明的全过程,在部分题目上还创新地提出了非常规解法。双CMO金牌得主刘涵祚评价其解法“结构紧凑、逻辑自然,即使放在IMO解答中,也属于较为简洁优雅的一类”。该模型将于近期开源。

华为小艺AI竞赛Agent在IMO 2026官方特别邀请下,以满分42分的成绩夺得金牌。这是AI智能体首次在全球最高水平的中学生数学赛事中取得满分。小艺Agent的核心在于三大技术体系的协同:复杂问题建模能力、长程推理引擎,以及工具协同框架。

谷歌Gemini Deep Think虽然在2025年已获得金牌水平(35分,5/6题),但2026年的满分突破意味着AI整体能力又上了一个台阶。2026年IMO金牌线为29分,较2025年的35分下降了6分,说明本届赛题难度明显高于去年。满分与金牌线之间整整相差13分。

这些事实共同指向一个结论:全球三大AI包揽IMO满分不仅是一个孤立事件,而是整个AI行业在数学推理能力上集体跃迁的集中体现。

五、技术突破:从“做对答案”到“写出证明”

IMO满分之所以意义重大,核心在于它检验的不是“计算能力”,而是“推理能力”。

此前,AI在数学竞赛中取得的突破大多集中在选择题或填空题层面——只要答案正确即可得分。但IMO的每道题都是证明题,参赛者必须写出完整的、可被逐步审查的推理链条。这要求AI不仅要“知道答案”,还要“理解为什么”,并能将这种理解以人类可读的形式表达出来。

从技术演进来看,AI挑战IMO经历了三个阶段:

第一阶段(2024年及以前) :AI需要人工将自然语言题目翻译成Lean等形式化语言,系统才能进行处理,部分题目耗时长达数天。这一阶段的AI更像是“被人类扶着走”的工具。

第二阶段(2025年) :谷歌Gemini Deep Think实现了端到端的自然语言证明,用4.5小时解决了5道题,获得金牌。AI开始“自己走路”了。

第三阶段(2026年) :Claude Fable 5、GPT-5.6 Sol、Kimi K3、小红书dots-note-3.0、华为小艺等多款模型全部拿下满分。而且Fable 5仅用2.5小时就完成了全部6道题。AI不仅“自己走路”,而且“跑起来了”。

小红书dots-note-3.0的突破尤其值得关注——它不依赖形式化语言,直接读取原始LaTeX题目,通过递归自我批判能力端到端完成解题。这种“端到端”的能力意味着AI已经能够在没有人工干预的情况下,独立完成从“读题”到“理解”到“推理”到“证明”的全流程。

华为小艺Agent则展示了另一种范式——通用基座模型加垂直场景Agent的组合。这种架构正在释放更大的专业能力,让AI在特定领域达到甚至超越人类专家的水平。

六、行业影响:从数学竞赛到科学发现

全球三大AI包揽IMO满分的意义远超竞赛本身。数学被广泛认为是AI智力与推理能力的试金石——AI在IMO这类数学竞赛中走得越远,越能说明其底层优势。

就在本周,Fable 5参与构造了一个雅可比猜想反例。该猜想自1939年提出以来悬而未决长达87年,连张益唐等顶尖数学家都曾在此折戟。虽然这一反例尚未经过正式同行评审,但它标志着大模型现阶段的能力已经足以参与真正的数学发现。

业内人士指出,IMO满分不仅是数学能力的标杆,更验证了AI在需要严谨逻辑链的领域——如定理证明、芯片验证、药物分子设计——的应用潜力。华为方面透露,小艺AI竞赛Agent的部分技术已在教育辅助、科研计算等场景开展试点应用。

从更宏观的视角看,全球三大AI包揽IMO满分意味着人工智能已经跨越了一个关键的门槛:它不再仅仅是一个“信息检索工具”或“模式匹配引擎”,而是具备了处理复杂逻辑推理、构建严谨证明链条的能力。这种能力一旦与具体行业场景结合,将释放出巨大的生产力。

七、理性审视:满分之后的路还有多长?

在庆祝全球三大AI包揽IMO满分的同时,也需要保持理性审视。

第一,IMO赛题有明确的边界。 IMO的6道题虽然难度极高,但都在数学的已知框架内,有确定的答案和可验证的证明路径。现实世界的问题往往是开放的、模糊的、信息不完整的,AI在这些场景下的表现仍需验证。

第二,从“解题”到“发现”还有距离。 Fable 5参与构造雅可比猜想反例是一个振奋人心的信号,但真正的数学发现——提出新猜想、建立新理论——仍然是人类的领地。AI目前更多是在人类已经划定的框架内“解题”,而非“出题”。

第三,算力成本仍是制约因素。 Kimi K3耗时17.4小时、花费31美元才完成6道题。虽然Sol将成本压到了20美元,但如果要在更复杂的科研场景中规模化应用,成本仍需大幅下降。

第四,产线认证的考验。 如同中国“芯片刻刀”的突破需要经过晶圆厂的产线认证,AI在数学竞赛中的满分表现也需要在实际应用场景中接受检验。从竞赛到落地,中间还有很长的路。

尽管如此,全球三大AI包揽IMO满分依然是一个里程碑式的事件。它标志着通用人工智能在人类最难的数学推理测试中,已经达到了顶尖人类选手的水平——甚至超越了99%的人类参赛者。这把“硅基大脑”的数学刻刀,已经出鞘。

FAQ(常见问题)

问:“全球三大AI包揽IMO满分”是哪三大AI?

指在2026年国际数学奥林匹克竞赛(IMO 2026)中同时获得42分满分的三款通用大模型:Anthropic的Claude Fable 5、OpenAI的GPT-5.6 Sol和月之暗面的Kimi K3。此外,AxiomProver、小红书dots-note-3.0和华为小艺也分别获得了满分认证。

问:IMO满分有多难?人类选手的满分率是多少?

IMO满分极为罕见。过去七年的IMO比赛中,共有4347名人类选手参赛,只有30人拿过满分,比例仅为0.69%。1959年至2025年的66届比赛中,满分率约为1.37%。

问:AI在IMO中拿满分意味着什么?

IMO的每道题都是证明题,要求写出完整的、可被逐步审查的推理链条。AI拿满分意味着它已经具备了处理复杂长链条逻辑推理、构建严谨数学证明的能力。这种能力可以迁移到定理证明、芯片验证、药物分子设计等需要严谨逻辑的领域。

问:这些AI模型是专门为IMO训练的“应试机器”吗?

不是。Claude Fable 5、GPT-5.6 Sol和Kimi K3都是通用大模型,并非专门为IMO进行专项数学训练。它们的能力覆盖编程、科研、知识工作等多个领域。

问:Kimi K3是开源的吗?

是的。Kimi K3是全球首个接近3万亿参数级别的开源权重AI系统。完整模型权重将于2026年7月27日释放。

问:AI拿IMO满分之后,下一步是什么?

IMO满分验证了AI在封闭框架内的顶级推理能力。下一步的挑战是将这种能力迁移到更开放的现实世界问题中。此外,Fable 5已开始参与构造数学猜想反例,标志着AI正在从“解题”走向“发现”。

以上内容不代表本平台立场,仅供读者参考