文章摘要
第67届国际数学奥林匹克竞赛中,三名中国选手与国产大模型 dots - note - 3.0 同获满分,这是中国选手与国产AI首次在IMO赛场巅峰同台。该模型实现历史性突破,展现自主探索与自我检查能力。不过,数学证明有明确标准,真实生活任务变化多、周期长,该团队构建评测基准探索评价方法,AI将面临更难的“现实考试”。

AI真正更难的考试,其实在真实生活当中。

第67届国际数学奥林匹克竞赛(IMO 2026)刚刚落下帷幕,包括三名中国选手在内的全球7名参赛者,拿下了满分42分的金牌成绩。

而本届竞赛的另一大亮点,则是一款大模型同样交出了满分答卷,创下了新的行业纪录。

这款名为dots-note-3.0的大模型,实现了历史性的突破:中国选手与国产AI模型首次在IMO赛场的巅峰同台。

就在去年,谷歌的Gemini Deep Think在IMO 2025中仅完成了6道题中的5道,以35分达到金牌分数线。仅仅一年时间,dots-note-3.0便实现了全题7分的满分表现,成为首个通过IMO官方阅卷认证的满分AI模型,大模型在高难度数学证明领域的能力实现了跨越式提升。

这份满分成绩很快引发了行业的广泛讨论,大家的关注点从42分的分数本身,转向了这款大模型究竟是如何完成解题的。

多位AI领域的资深研究者都对这款大模型的解题思路给出了高度评价。

在解题过程中,dots-note-3.0反复排查逻辑漏洞、调整推导思路,最终提交了六份完整的书面证明。这种自我检查与持续修正的能力,让这份满分成绩拥有了远超数学竞赛本身的价值。

这份42分的含金量,藏在六份经得起推敲的完整证明中

相较于常规数学计算题,证明题的评判标准要严苛得多:计算题只要最终结果正确,基本就能通过判定,但证明题考察的是完整的论证链条——哪怕最终结论碰巧正确,中间的推理过程依然可能存在致命漏洞。

一段读起来逻辑通顺的数学证明,可能暗藏着未经证实的前提假设;某一步推导在多数场景下成立,但遇到边界条件就会失效;模型甚至可能引用一个听起来耳熟却并不存在的定理。这类问题很难通过单纯比对答案发现,只能沿着整个证明链条逐一核查。

这也正是IMO竞赛的特殊之处:它要求参赛者提交完整的自然语言证明,选手需要把每一个关键推导步骤清晰写出来,从条件是否遗漏、结论能否由前文推出,到推导过程是否存在逻辑跳跃,都要接受专业评委的逐一评阅。

dots-note-3.0拿到的42分满分,其核心价值就在于这六份经得起逐一审视的完整证明。相较于依靠模板匹配、答案比对或自动测试完成判定的常规评测,IMO的专业阅卷更容易暴露长链条推理中的隐藏问题——哪怕模型抓住了大致解题方向,只要关键步骤缺乏严谨论证,依然会丢分。

具体到本次竞赛的第三题,就能很好体现这款模型的解题特点。

多位竞赛资深选手表示,这道组合数学领域的两人博弈极值证明题,人类参赛者的常规思路是将其转化为图论中的连通性问题,但dots-note-3.0另辟蹊径,选择了归纳法作为解题路径:它先设计了一组按倍数递减的切割单元,再通过归纳证明,无论博弈双方如何操作,最终一方损失的总长度始终被限制在一个固定上限内。原本复杂多变的博弈过程,被压缩成了一条简洁完整的证明链条。

dots-note-3.0交出的不仅是正确答案,在部分题目中它还能跳出常规思路,找到更简洁的证明路径,这说明该模型已经具备了一定的自主探索能力。

但在IMO这个足够严苛的能力试验场,思路巧妙并不等同于能够拿到满分。评委最终审核的是整份证明,哪怕只是漏掉一个边界条件,或是跳过一步关键推导,都可能导致丢分。

因此,模型还需要完成另一项关键工作:在提交最终答案前,重新审查自己完成的证明。dots-note-3.0最值得关注的能力,正是在这一环节体现出来的。

让AI学会给自己的证明“挑错”

dots-note-3.0的证明、检查与修改流程,并没有依赖Lean这类形式化证明系统,也不需要提前将竞赛题目翻译成机器可验证的形式化语言。

它可以直接读取原始LaTeX格式的竞赛题目,以自然语言展开推理,并结合Python工具进行辅助分析,以智能体的方式端到端完成整个解题流程。这种路径更接近人类用自然语言构思和书写证明的过程。

在实际的数学研究中,人类通常会用自然语言搭配数学符号来提出思路、展开推导。这种表达方式更加灵活,也更贴近真实的解题过程,但缺少形式化系统的逐步校验,这对模型提出了更高的要求:需要主动回头检查自身的论证过程并及时改正。dots-note-3.0就具备这样的能力,它的解题流程包含了Proof、Verify和Refine三个核心环节:

  • Proof环节负责生成候选证明,模型会尝试不同的解题思路,形成多份可能成立的解题方案。

  • Verify环节负责检查已生成的证明,判断论证是否正确完整,找出条件遗漏、逻辑跳跃和推导不严谨的问题,并给出改进建议。

  • Refine环节则会根据检查结果修改答案,重新处理存在问题的部分,再将多轮推理得到的方案整合起来,形成最终可以提交的完整证明。

这三个相互衔接的环节,分别承担了生成初稿、检查漏洞和修改答案的任务。完成一轮流程后,证明还可以再次进入检查与修正环节,让模型拥有多次推翻并完善答案的机会。

看似只是增加了几个流程步骤,背后却是大模型能力的关键升级。过去评价大模型时,我们往往关注它第一次回答的效果如何,但随着任务变得更长、更复杂,单次生成很难覆盖全部情况。模型能否在执行过程中停下来检查、发现偏差并及时修正,正在成为新的能力分界线。

该团队将这种循环式的检查修正流程称为「递归自我批判」,并将其视为实现递归自我改进(Recursive Self Improvement,RSI)的核心前提。其中的逻辑并不复杂:只有先识别出当前答案的问题,后续的迭代优化才能拥有清晰的修正方向。

这也切中了长程复杂任务的一个现实难题:模型具备初步执行能力,可以启动任务,但只有当它能够持续发现错误、吸收反馈并调整方案时,任务才更有可能稳定推进下去。

在IMO竞赛中,模型需要检查的只是一份数学证明,但到了真实生活场景中,模型需要持续检查的内容还要更多:不仅要检查方案本身,还要审视自己对用户需求、任务目标和外部环境的理解是否准确。

IMO夺金之后,AI迎来了更难的“现实考试”

数学证明虽然难度极高,但依然拥有明确的题目和专业的评委。而真实生活中的任务往往周期更长、变化更多,很多问题甚至没有统一的评分标准。

在该团队的研究框架中,这类生活任务可以放在两条坐标轴上进行观察:一条衡量任务的持续时长,另一条衡量结果是否容易验证。像IMO这类数学题以及代码编写任务,属于短程、可验证的任务:前者有明确的评阅规则,后者可以通过运行结果和测试用例快速获得反馈。

而真实生活中的任务,则落在了更长、更模糊的一侧:步骤繁多,用户需求和外部条件也在不断变化。以房屋装修为例,一句看似简单的“帮我设计装修方案”,背后可能涉及户型理解、家庭结构、审美偏好、预算分配、材料选择和施工排期等多个环节。这是一项天然的多模态任务,模型需要读懂户型图、参考图片和施工照片,还要处理报价单、材料清单与聊天记录等多种类型的信息。

整个装修流程可能持续数周甚至数月,最终的方案也很难用单一标准评判:预算、审美、耐用性和居住体验往往相互牵制,材料价格低不一定代表整体选择更优,视觉效果漂亮也未必住得舒服。这就要求模型能够反复权衡不同因素,并随着情况变化随时调整方案。

类似的挑战也出现在旅行规划、求职应聘和日常购物等其他生活场景中:旅行计划需要持续跟踪天气、签证和价格变化;求职要结合个人经历、岗位要求和职业目标反复调整策略;购物则要在预算、偏好、使用场景和商品变化之间不断权衡。尽管场景各不相同,但对智能体模型的能力考察却十分接近:能否串联起多轮交互中的零散信息,识别用户真正重视的偏好与约束,并据此调整后续的判断与行动。

为了回答这类问题,该团队构建了VibeAgentBench评测基准。该基准覆盖了旅行、理财、诉讼、装修、求职、健身医疗、备考、租房、购物和团建等10个生活领域,共设计了200个测试任务,接入了22个模拟服务后端和288个工具接口,涵盖了日历、邮件、金融、出行、电商、招聘等真实生活中的常见场景。这些任务的中位持续时间达到29天,最长的任务甚至需要约111天才能完成。在评测过程中,测试环境会持续发生变化,团队通过7453个脚本事件和超过1.2万条检查标准,考察智能体能否在长期交互中维持目标、响应变化并及时调整方案。

该评测基准试图探索出一套适用于复杂生活任务的评价方法:当答案没有唯一标准时,我们该如何判断一个智能体的表现是否足够优秀?

其实无论是IMO竞赛还是真实生活任务,核心考察的都是同一件事:模型在提出方案后,还要能够根据反馈检查问题、修正判断。尤其是进入真实生活场景后,模型需要审视的范围更广:不仅要检查方案本身,还要判断自己是否准确理解了用户需求,哪些偏好值得保留,哪些需求已经发生了变化。

IMO赛场拿到的42分,更像是一次阶段性的能力验证,证明了模型能够在边界清晰、结果可验证的任务中完成检查、纠错并形成完整闭环。而现在,该团队已经将目光投向了下一场更难的考试:一场没有固定考期,也没有标准答案的真实生活考验。

以上内容不代表本平台立场,仅供读者参考