AI数学新突破:从解题到自主生成研究议程

当大语言模型在数学证明、反例寻找上的能力逐渐被验证后,一个更具颠覆性的问题开始浮现:当一条证明路线失败后,AI能否自主决定下一步的研究方向?是调整解题路径、缩小命题范围,还是主动提出新的可证伪猜想?由某海外高校研究人员搭建的AI Has Taste系统,正在尝试将这种设想转化为可落地的数学研究范式。
该项目的公开仓库目前收录了453份数学研究手稿,总计2312页内容,其中6篇被明确归类为AI提出的数学猜想。仓库的核心定位清晰直白:从“答案生成”转向“研究议程生成”,不再局限于解决给定的问题,而是主动参与整个研究流程的设计。
AI Has Taste的开发初衷并非基于“AI一定擅长数学”的预设,项目发起者最初对大模型能否真正推动数学研究并不确信。一次偶然的测试成为了项目的关键转折点:他将一篇已发表论文中的猜想输入模型,原本只是想测试模型的推理边界,结果模型没有顺着原有思路尝试证明,反而直接构造出了一个反例推翻了该猜想。
最初他并不相信这个结果,随即将反例和完整的推导过程发送给原论文作者核实,最终得到了对方的确认。这一发现也被收录进了项目的手稿库中,彻底改变了项目的推进方向。
“最开始我还不相信AI在数学上的力量。直到输入一篇论文的猜想,AI直接给出反例推翻;我立刻写信问原作者,对方回复确认是对的。那之后,我才真正放开手脚干。”
分层协作的多Agent研究框架
这套系统并非单一模型的自问自答,而是将研究角色拆分为四个明确的层级:
· 监督筛选者:负责选择候选研究问题、对比已有相关成果,并规划最高效的决定性验证实验;
· 研究专员:负责完成具体的证明推导、反例搜索与精确计算任务;
· 上下文独立审稿人:在全新的上下文中,对冻结的命题、关键引理和计算证书进行针对性的攻击与验证;
· 发布审核者:负责梳理最终可接受的结论范围,检查引用规范、材料构建和发布要求。
系统采用多机协作的部署方式,不同机器分别推进证明、反例搜索、精确计算和独立审稿环节,共享冻结的命题、实验记录、失败原因、代码和证据,避免了单一Agent既生成结果又自我审核的潜在问题。项目仓库中的一句话精准概括了这种设计逻辑:“批评不是论文写完之后才补的一道手续,而是研究发动机的一部分。”
人机结合的双重验证体系
随着手稿数量从几十份增长到数百份,如何确保系统产出的结果不是系统性幻觉成为了关键问题。项目并没有将AI内部审核作为最终验证环节,而是逐步邀请不同领域的真实学者参与部分结果的验证、复核和学术讨论,包括多位来自全球不同高校和科研机构的专家。
需要明确的是,这些学者并非对453份手稿逐篇签字认证,而是仅对其中部分问题、证明、计算结果或研究方向进行过验证、审核或讨论。这种“机器内部红队审查+人类专家抽检复核”的组合,比单一的AI自审更能保障结果的可信度:AI负责将研究速度推至极限,人类专家则在关键节点将“看似成立”的结论拉回到“值得信赖”的学术标准。
从失败中生长出的新研究方向
该项目最能体现“研究品味”的案例,并非一次完美的成功,而是一次失败的研究过程。在fractional Gaussian trace问题上,系统最初尝试了单调性和单侧配对两种解题路线,但不断出现精确反例。常规的基准测试到这里只会标记为“失败”,但该系统并未就此停止。
Agent继续追问:反例到底破坏了什么核心结构?失败是否存在稳定的模式?最终研究团队将注意力转向一个固定的负向缺陷,构造出十项修正结构,并提出了一个新的统一有界性猜想。后续的精确计算和独立审查又对该新猜想发起了针对性攻击,目前该统一界仍未被证明。
这一过程的意义不在于AI证明了某个重大定理,而是将失败的研究路线转化为了更清晰、更可证伪的新命题,让研究在失败中延伸出全新的方向。正如总结所言:“过去:人类出题,AI答题。现在:AI答题,也开始参与决定‘下一道题是什么’。”
6篇AI自主提出的数学猜想
截至公开快照,仓库将6篇论文单独归类为AI提出的数学猜想。这些工作横跨组合数学、图论、数论与分析等多个领域,包括A182510三个子序列的无限binary-kernel矩阵非奇异性、Young图形的CDS-colorability、最大度不超过6的无三角图分解、18-colored generalized Frobenius partitions的unary-theta同余公式、reciprocal-subsum denominators在dyadic stages上的Newton系数非负性,以及前述fractional Gaussian trace固定缺陷猜想。
真正值得关注的并非AI能否“脑洞一个猜想”——随口提出一个猜想并不困难,难的是将其转化为精确的数学定义,说明其来源、支撑证据、可推翻的反例条件以及成立后能带来的研究价值,并将计算过程和源代码一并留存以供后续复核。这也是项目将“提出猜想”视为比“生成答案”更高阶研究动作的原因:证明回答的是已有问题,而猜想则会改变后续的研究资源投向。
453份手稿背后的科研范式变革
AI Has Taste目前公开的453份研究手稿总计2312页,其中一套名为BigWIN2的工作流就对应223份手稿,并为这些工作提供了配套的LaTeX源码和复现材料包。
这类规模的反直觉之处并非“AI打字快”。数学研究真正的成本在于上下文切换:一个问题需要图论知识,下一个问题可能需要数论,再下一个则可能涉及SAT求解、穷举枚举、精确有理数运算或矩阵计算。一个人类研究者很难同时维持数百条完全不同的研究思路,但Agent系统可以将其拆分为独立任务,完整保存失败路线、局部定理和可复现的实验结果。
这也让个人研究者的角色发生了变化:不再需要亲力亲为每一步推导,而是更像项目负责人——设定研究边界、选择问题池、决定哪些结果值得继续投入、何时停止研究,以及哪些结论值得公开。
“AI Has Taste”的真正含义
“AI有品味”听起来充满拟人色彩,但项目文档明确了其边界:这里的“品味”并非意识或主观体验,而是通过研究决策体现出的数学判断。比如,在多个可选问题中优先选择哪个?当一条路线已有局部进展但边际收益下降时是否应该停止?一个反例是直接否定命题还是提示需要调整表述?一个小的局部结果是否值得独立成文?
这些决策过去往往隐含在研究者的经验中,难以通过标准基准测试衡量,而该系统则将这些决策留下可检查的轨迹:选择了哪个问题、为何更换路线、失败留下了哪些结构、下一步命题的来源,以及新结论如何通过独立上下文进行再次攻击。
离“自主数学家”还有多远?
该项目最容易被夸大的地方同样需要明确:453份手稿并非经过正式同行评审的期刊论文,AI内部审核也不等同于数学共同体的独立审稿,有限计算的覆盖范围也不能自动推广到无限情形。仓库本身也明确列出了这些限制条件。
但即便如此,该项目带来的研究范式变化依然值得关注:AI的能力边界正从“执行给定任务”转向“参与设计下一个任务”。数学研究真正稀缺的资源不仅是算力和推理长度,还有判断什么问题值得投入时间、什么失败值得留存、何时应该更换研究方向。当AI开始介入这些环节,“AI辅助数学研究”的竞争将不再只是谁更擅长证明,而是谁拥有更完善的研究闭环,能够在大量失败中提炼出更值得追踪的研究方向。
未来的人机科研分工
过去的AI科研叙事更像一个超级学生,由人类出题,AI负责解答。而AI Has Taste想要构建的,则是一个研究小组的模式:人类给出研究边界和价值判断,Agent负责寻找问题、尝试解答、接受失败、推翻自身假设、留存局部结果,并提出新的研究问题。
如果这一范式能够持续发展,未来基础研究中的人机分工可能会从“人类负责思考,AI负责计算”转变为更复杂的结构:人类负责设定目标、价值判断和最终责任,AI承担大规模搜索、验证、失败管理和候选研究方向生成,而形式化工具和公开证据则负责确保结果可复核。当AI能够熟练解题后,下一个挑战或许就是:AI能否自主选择研究方向。

