文章摘要
纯数学前沿成果加速落地大模型训练。团队将三维挂谷猜想用于解决大模型“黑盒”推理难题,提出GeoLAN,利用“粘性挂谷集”概念为语义空间添加几何约束,设计惩罚规则,在部分模型上效果显著。此外,菲尔兹奖得主入职OpenAI,数学与AI正加速融合。

纯数学前沿成果正在加速落地大模型训练一线。有团队将刚刚刷屏全网的三维挂谷猜想,搬进了神经网络训练流程,跨界解决大模型的“黑盒”推理难题。

他们的论文名为《GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models》,核心思路是利用挂谷猜想证明中诞生的“粘性挂谷集”概念,为大模型的内部语义空间制定标准化的“摆放规则”,从训练初始阶段就理顺纠缠在一起的概念,让AI的思考路径真正具备可追溯性。

这正是典型的“前有数学大佬开荒,后有AI研究员捡宝”的跨界合作案例。

大模型的核心顽疾:表征坍塌

先聊聊大家普遍感知到的大模型“黑盒”困境:当前的大模型在解题、写代码、数据分析等任务上表现优异,但当你追问它“这一步是如何得出的”时,它要么无法给出清晰解释,要么会编造虚假理由敷衍。

这个问题的根源,藏在名为“表征坍塌”的底层特性中。我们可以将大模型的语义空间想象为一个拥有数千层的超大智能仓库,理论上可以分门别类存放逻辑、情感、事实、推理等无数概念,每个概念都应有独立的占位空间。

但Transformer架构在训练时往往会“偷懒”,倾向于将所有语义信息集中堆放在仓库门口的一小块区域,剩余90%的空间完全闲置。最终的结果是,所有概念都被挤压在一个狭窄的高维锥形区域内,这也就是学界所说的“各向异性”问题。

这种挤作一团的状态会引发诸多问题:比如,概念纠缠会让毫不相关的内容被强行绑定到同一个方向,导致单个神经元既要响应“猫”的概念,又要激活“圣经经文”的语义;同时,开发者根本无法拆分哪部分表征对应哪条逻辑路径,连模型本身都无法还原真实的思考过程。

当相近但不同的概念被挤在一起时,还会引发混淆问题,稍微调整提问方式,AI就会出现胡说八道的情况。有论文精准总结过这一现象:少数几个“流氓维度”霸占了大部分信息方差,直接浪费了模型的有效容量。

这一问题几乎是所有主流Transformer架构的通病,从GPT、Llama到Gemma都未能幸免。

此前行业的解决方案基本都是“事后补救”:等模型训练完成后,通过稀疏自编码器等工具强行拆分纠缠在一起的概念。但这类方法得到的结果只是“看起来合理”,未必对应模型内部的真实逻辑,保真度始终存在折扣。

而GeoLAN的思路则完全不同:与其等语义空间混乱后再整理,不如在训练初期就按照规则摆放。团队选择在整个训练过程中为表征空间添加几何约束,让每个概念都能找到独立的位置。

挂谷猜想如何与AI产生关联?

要理解GeoLAN的核心思路,首先需要了解挂谷猜想的核心内容。1917年,数学家挂谷宗一提出了一个看似简单却困扰学界半个世纪的难题:用一根1厘米长的针在桌面上旋转一周,它扫过的最小面积是多少?

很多人会认为,旋转一周必然会形成一个圆形,面积不可能太小,但数学家们发现,通过让针一边旋转一边滑动,它扫过的面积可以无限接近零。也就是说在二维空间中,我们可以将全方位的几何轨迹塞进一个极小的角落中。

这一挑战进一步延伸到三维空间:当这根针可以在上下左右等无数立体方向上旋转时,要将所有方向的针的运动轨迹都装入一个空间中,这个空间的最小体积是多少?按照二维的经验,三维空间中的这个图形的绝对体积依然可以被压缩到接近零。

但这里产生了一个新的谜题:这个图形虽然体积趋近于零,但它在微观层面是否也会缩水退化?数学家引入了“分形维数”来衡量其骨架的密实度。最终王虹等人的研究证明,即便将图形的体积压榨到极致,为了覆盖所有方向的针,其内部交织的骨架依然保持着完整的“三维饱满度”,在微观维度上没有任何退化,这也是该团队终结这一世纪难题的关键贡献。

在这一硬核的证明过程中,诞生了一个极为关键的概念——“粘性挂谷集”。所谓“粘性”,本质上是一套防挤压规则,专门用于约束线段和管状结构,避免它们相互聚集。如果一组管状结构遵守这套规则,它们会均匀铺开,占据应有的空间;如果违反规则挤在一处,空间的“有效大小”就会缩水,看起来如同被压扁一般。

看到这里不难发现,大模型的表征坍塌问题,本质上就是“语义管道未满足粘性条件,全部挤在一起”的情况。GeoLAN的核心做法,就是直接将挂谷猜想的数学结论作为工程标准:既然数学上已经严格证明“满足粘性条件则空间不会坍塌”,那么我们就可以为大模型的语义空间添加同款粘性约束,让模型的表征天然不会挤作一团。

要将这一规则融入训练流程,核心是构建可量化的惩罚函数,让模型能够计算并调整自身的行为。GeoLAN设计了两套可落地的惩罚规则,将挂谷猜想中的几何约束转化为具体的训练目标:KT-CW用于解决“语义扎堆”问题,KT-Attn则用于纠正“注意力机制偷懒”的问题。

KT-CW的逻辑很简单:在训练过程中随机抽查语义空间的各个方向,如果发现某个方向堆积了过多的语义信息,就对模型进行扣分。这一规则会迫使模型将知识均匀分布在高维空间的每个角落,充分利用之前被浪费的维度,从根源上解决“挤成一团”的问题。

而KT-Attn则针对注意力机制的同质化问题:大模型的注意力头在训练后期往往会陷入严重的同质化,大量注意力头只会反复关注同一个词或同一个位置,有效工作的比例极低。这一规则强制要求每个注意力头必须关注完全不同的语义区域,确保注意力能够实现全方向覆盖,彻底解决注意力头的秩坍缩现象。

这套组合拳的效果立竿见影:在Llama-3-8B模型上,GeoLAN将原本被挤扁的锥形表征空间重塑为圆润的球形,语义扎堆的程度显著降低,各方向的均匀性大幅提升,同时保持了任务的准确率。在Gemma-3-4B模型上,MMLU准确率从0.59提升到0.60,约提升0.75个百分点,TruthfulQA的语义稳定性也得到了显著改善。在体量更大的Gemma-3-12B模型上,偏见率指标也出现了统计学层面的明显下降。

更有趣的是,论文还发现了名为“金凤花区”的现象:均匀分布的严苛几何约束对于参数量过小的模型反而会造成灾难,小模型天生需要依靠概念纠缠来实现极致的语义压缩,强行打散只会让内部几何结构彻底恶化。而对于体量过大的巨型模型,庞大的预训练过程已经自发构建了极其复杂的流形结构,额外添加这套规则不仅无法适配,还会拖累整体性能。只有4到80亿参数的中等体量模型,刚好拥有足够的空间来消化均匀分布带来的红利,效果最为显著。

不仅如此,论文还推导出了精妙的“语义粘性定理”:当表征满足“防挤规则”时,不同的语义概念会自动分解为近似互相垂直的子空间,论文将其形象地称为“颗粒”。每个子空间都可以独立解释和调整,这意味着困扰行业多年的黑盒问题将变得透明。

一篇ACL论文,直接将挂谷猜想从纯数学殿堂带入了AI工程领域。

菲尔兹奖得主与AI的深度融合

另一个值得关注的动向是,本届菲尔兹奖得主Jacob Tsimerman在获奖当天宣布,将很快入职OpenAI,专注于AI安全方向的研究。

这一消息进一步凸显了前沿数学与AI的紧密联系。就在一年前,Jacob与伯克利AI安全研究者Andrew Critch合著了论文《A Taxonomy of Omnicidal Futures Involving Artificial Intelligence》,以数学家的极致严谨,为AI风险路径搭建了严密的分类体系。

Jacob本人也是AI的重度受益者:2025年他有5篇数学论文上传到arXiv,他直言AI让自己的科研产出效率直接提升了一倍。更具戏剧性的是,在菲尔兹奖颁奖前三天,他的学生Levent Alpöge借助Anthropic最新的Claude Fable 5模型,一夜之间推翻了悬置87年的雅可比猜想,这一成果震动了全球数学界。

面对AI不断逼近甚至超越顶级数学家的“智商”,数学泰斗蒂莫西公开感叹:这是他生平第一次见到大语言模型在自己完全陌生的领域,轻松攻克家喻户晓的世纪难题。

数学与AI的关系,早已超出了“密不可分”的范畴,正以惊人的速度融为一体。回顾过去一年AI在数学领域的表现:从DeepMind的AlphaProof在国际奥数赛场斩获银牌,到OpenAI的推理模型推翻埃尔德什单位距离猜想这一80年悬案,再到GPT-5.6仅用一小时解决循环双覆盖猜想,以及Claude Fable 5一夜荡平雅可比猜想,AI在短短两个月内连续创下多项世纪纪录,攻坚速度正呈指数级加快。

在AMS的访谈中,Jacob直言:“数学界存在大量自我安慰的声音,大家盯着AI现在不如数学家,就推断它永远不如数学家。”他用自己的实践证明,虽然AI生成的证明“不完整、不严谨”,但“通常能给出大致正确的方法,帮你走完八成的路程”。他甚至认为,两年内AI在数学证明领域将全面超越人类。

那么一个值得思考的问题是:四年后的2030年菲尔兹奖,还会有人类得主吗?

菲尔兹奖有硬性的年龄限制,获奖者必须未满40岁。这意味着,如果AI在未来四年内系统性超越人类数学家的原创发现能力,评审委员会将面临前所未有的困境:我们究竟是要把奖颁给做出最好数学工作的实体,还是颁给“人类中做出最好数学工作”的个体?

更耐人寻味的是数学与AI的双向加速:三维挂谷猜想刚被证明,三个月后就诞生了GeoLAN,纯数学成果直接落地为大模型训练工具。今天菲尔兹奖上表彰的André-Oort猜想、希尔伯特第六问题突破,明天又会演化出什么样的AI能力?

过去常说“数学家在前拓荒,AI在后捡宝”,但现在,“捡宝”的一方已经开始自己开辟道路了。

参考链接:https://arxiv.org/html/2603.19460v1

以上内容不代表本平台立场,仅供读者参考