小红书大模型IMO首秀满分夺金,全球第二

2026年国际数学奥林匹克竞赛官方评测结果刚刚公布,一款来自社区平台的大模型交出了惊艳答卷——以满分成绩拿下IMO官方金牌认证,这也是全球范围内第二个拿到该级别满分的大模型,更是中国大模型首次获得这项权威认可。
小红书大模型dots-note-3.0在本届赛事中六道题目全部答对,经官方评卷确认拿到满分42分。要知道,谷歌Gemini在2025年的挑战中仅完成5道题拿下金牌,而这次小红书的模型直接实现了零失误的完美表现。
作为全球最顶尖的中学生数学赛事,IMO常年被视为大模型智力与推理能力的试金石:赛事分为两天进行,每天4.5小时完成3道覆盖代数、组合、几何、数论的题目,每题7分满分42分,不仅要求最终答案正确,更需要提交逻辑严密、经得起逐步骤审查的完整证明过程。从这里走出的选手包括半数以上当代菲尔兹奖得主,谷歌联合创始人谢尔盖·布林也曾斩获IMO金牌,足见其权威性。
在今天的模型训练里,你基本可以认为,互联网上一旦出现了某些数据,很快就会被模型拿去训练,模型也就知道了。所以如果要测试一个模型到底聪不聪明,只能测一些没有公开过的东西。
一位头部模型研究员的这番话,恰好点明了IMO测评的核心价值:它考验的不是模型记住了多少题目和数学知识,而是在真正未知的问题首次出现时,能否独立理解、探索并完成严密推理。
本次拿下满分的dots-note-3.0,其解题表现同样亮眼:它仅用自然语言就完成了从读题、解析到撰写证明的全过程,不仅答案全部正确,在部分题目上还提出了非常规的创新解法。
双CMO金牌得主刘涵祚评价称,模型给出的证明思路正确且漂亮,解法结构紧凑、逻辑自然,即使放在IMO官方解答中也属于简洁优雅的一类;另一位CMO金牌得主汪千桐则表示,从数学审美的角度看,这套解答非常漂亮优雅,常规解法已经很巧妙,但dots直接攻克了题目最难也最本质的部分,解题简洁明了且直击核心,让人看完后觉得每一步都顺理成章,但人类选手很难想到这样的切入角度。
满分背后的核心能力
具体来看,这款模型的能力体现在多个维度:首先,六道题目全部做对证明了Agentic推理系统的稳定性,模型能够准确理解自然语言题目条件,筛选关键信息,提出合理的中间结论并组织成完整证明链,整个过程没有出现任何误读或推导跳步,表现并非依赖偶然灵感。
其次,它采用自然语言端到端处理的方式,不需要像早期Gemini那样将题目翻译成形式化语言,能够像人类选手一样直接读懂题目、自主寻找解题路径,具备从问题理解到答案表达的完整闭环,代表模型拥有可迁移的通用推理能力。本次答题过程中,模型通过智能体方式结合自然语言与Python代码执行推理解题,并借助递归自我批判能力审视论证过程,能够更好地应对现实中的复杂任务。
让人惊喜的还有模型的创新思维:在本届赛事的第三道组合博弈题中,行业内主流解法是将原问题转化为图论连通性问题,再借助图论语言构建证明,但dots-note-3.0没有沿用这一思路,而是选择了归纳法,精准抓住问题最本质的结构,设计出恰到好处的归纳对象与归纳命题,这也是汪千桐称赞其解法优雅的核心原因。
满分的含金量:比金牌更严苛的考验
从赛事本身来看,本次满分的含金量格外突出:2026年IMO的金牌线为29分,比2025年的35分下降了6分,意味着本届赛题难度明显更高,拿到金牌的门槛反而降低,侧面反映出赛事的整体难度提升;而满分与金牌之间整整相差13分,29分仅需要完整解决4道题再从剩余两道中拿到1分就能进入金牌区间,dots-note-3.0却实现了全对,直接抵达了这套试卷能够衡量的能力最高点。金牌只是进入全球顶尖选手行列的标志,而满分则是在顶尖选手中再次完成极小概率的筛选,难度远超普通金牌。
技术亮相与开源计划
选择IMO作为技术亮相的起点,对于小红书而言是非常明智的一步。当前行业内展示大模型底层技术能力的主流方向包括编码与数学任务,这类任务的结果无法靠语言包装蒙混,相比知识问答和主观评测更能直接体现模型对复杂问题的理解、拆解与持续推进能力。而IMO作为知名度高、业内认可度强的赛事,能够直观展示模型面对未知高难度问题时的深度推理能力。
过去外界对小红书的技术认知更多集中在内容社区、推荐算法和内容理解领域,其在基础模型领域的实力一直缺乏一份公开权威且无需复杂解释的成绩单。参数规模无法直接等同于能力,常规基准测试的小幅提升也很难让行业形成鲜明认知,但IMO的42分满分摆在眼前,足以证明小红书已经具备值得行业认真审视的基础模型能力,基础模型领域也因此出现了一个值得关注的新玩家。
据了解,这款dots-note-3.0大模型即将开源,相关进展值得期待。


