文章摘要
数学家陶哲轩围绕AI在数学研究领域的应用展开讨论,批评只追求单一指标优化的“跑分式”研究,指出AI与人类各有优劣,应构建人机协作的科研生态,强调探索过程与人类深度理解的价值,同时为AI时代普通人给出能力培养方向与职业策略,点明判断力、品味才是最不可替代的核心能力。

当人工智能在数学研究领域的表现不断突破边界,从检索文献到生成证明、完成形式化验证,一个更深层的问题逐渐浮出水面:当AI越来越擅长完成数学工作,人类是否能同步获得更深的数学理解?围绕近期相关研究引发的讨论,数学家陶哲轩的访谈与公开观点为我们提供了极具启发性的思考框架。

一、AI数学研究的核心争论:不是会不会,而是如何协作

近期,包括陶哲轩在内的多位学者联合发布了相关公开讨论,这一事件将AI在数学领域的应用从技术层面推向了范式讨论的层面。我们真正需要探讨的,并非“AI是否会取代数学家”,而是:怎样的AI辅助研究能够真正增进人类的数学理解,哪些研究只是为了优化单一指标;在速度、算力、形式化验证与人类的洞察之间,应当如何建立合理的分工边界。

需要说明的是,本文的讨论基于当前的技术语境,而AI辅助数学研究的内涵已经从单纯的工具属性转向了学科范式的变革,这一领域的发展速度极快,本文的观点也可能随着技术迭代被进一步验证或修正。

二、思想实验:AI早来20年,会抹掉一条通往数学的路

真实的素数间隔研究脉络

陶哲轩以素数间隔问题的研究历程为例,还原了真实的学术发展路径:2005年,三位学者发展出GPY方法,在特定假设下给出了素数间隔的上界;2013年,当时在餐饮行业工作的张益唐,借助早期的冷门研究成果,证明了素数间隔的有限上界为7000万,这一成果引发了后续一系列的改进竞赛。陶哲轩指出,这场竞赛已经显现出早期的基准测试文化特征:时间压力驱使研究者在论述和验证上有所简化。

假想的AI提前到来场景

如果AI早20年出现,它或许不需要张益唐那样的巧妙思路,仅凭借算力就能快速算出更优的上界。但这样的场景也会带来一个隐性的代价:张益唐不会凭借这一成果成名,那个“普通人突然震惊世界”的故事不会发生,一代年轻研究者或许会因此失去投身相关领域的动力。

陶哲轩强调,答案本身并不重要,探索过程中的失败尝试、试错路径才是学术价值的核心。AI直接给出结果的同时,也锁死了这条充满探索价值的道路。

三、陶哲轩批评的“跑分式”研究模式

陶哲轩并非反对AI进入数学研究,也并非否定所有计算型数学工作,他所批评的是以下这类研究倾向:

  • 将未解决问题当作单纯的基准测试,只追求单一指标的微小优化
  • 为了抢先发布而简化论证、验证和论文写作流程
  • 拒绝与领域专家合作,不愿提炼可供人类理解的新思想
  • 不将研究成果提交同行评审、纳入课堂教学或教科书体系
  • 依靠宣传性进展占据注意力,挤压真正具有长期价值的研究空间

这类“只为跑分”的研究,或许能在短期内获得亮眼的数字成果,但会错过可迁移的核心理论。其机会成本并非只是“少赢了几个百分点”,而是人类错失了下一代学术工具的发展机会。判断一项研究的价值,从来不是看它是否使用了AI,而是看它是否增加了可复用的数学理解。

四、陶哲轩眼中的科研范式五次迁移

在专业访谈中,陶哲轩梳理了科学研究的范式演进脉络:

时代 核心方法 典型代表
17世纪 理论结合实验 理论研究与观测数据结合的经典范式
20世纪 理论+实验+模拟 超级计算机模拟复杂自然现象
21世纪初 大数据驱动研究 从海量数据中挖掘模式与规律
2020年代 AI辅助研究 自动实验、自动化分析工具
未来 人机协作生态 人类判断+AI搜索+形式化验证结合

陶哲轩特别强调,每一次范式迁移都不会完全取代前一种方法,而是形成叠加。正如模拟技术不会取代传统实验,AI也不会取代理论推导,真正改变的是各类方法的相对效率与分工边界。

五、过程价值的核心隐喻:直升机与徒步的区别

陶哲轩用一个生动的比喻阐释了过程的重要性:做科学研究就像徒步旅行,你听说某处有美丽的瀑布,便约上朋友一同寻找。你们需要一路摸索,绘制地图,途中可能迷路,但也可能在偏离路线时发现更有趣的风景,整个走向目标的过程本身就充满价值。而AI工具就像直升机,可以直接把你送到瀑布前,但你看完之后乘飞机返回,却完全没有学会如何自己找到这条路。

这一隐喻揭示了一个深刻的悖论:效率的提升往往伴随着能力的退化。当AI代劳了推导、验证、搜索的全过程,人类研究者可能会失去在过程中积累直觉、发现意外联系、打磨判断力的机会。

过往的学术获奖者也曾分享类似的观点:尽管没有攻克核心猜想,但在漫长的探索过程中,那些看似荒废的失败草稿,孕育出了数十个意想不到的灵感火花,后续的重要工作正是这一主线任务失败后结出的“副产物”。

六、“证明消化不良”:AI产出与人类吸收的速度差

陶哲轩指出了当前学术研究的一个现实困境:我们正在生成大量的证明,也核验了其中的不少内容,但要理解这些证明,并将它们整理成最终可以写入教科书的成熟知识,仍然只能依靠人类。我们正面临一种可以称之为“证明消化不良”的情况。

一个证明从诞生到被学科体系吸收,需要经历提出、验证、理解、论文写作、同行评审、教科书化、教学传承七个环节。AI加速了前两个环节的速度,但后续五个环节的效率并没有同步提升。这一问题并非数学领域独有,而是所有知识工作共同面临的挑战。

七、AI的能力边界:擅长广度,依赖人类的深度判断

陶哲轩认为,AI与人类的智能各有侧重,二者高度互补:

  • AI的强项:能够从海量任务中筛选出部分可解的问题,发现人类集体遗漏的组合模式,不受领域固有偏见的限制,保持独立的观察视角
  • AI的弱项:面对常规方法失效的真正难题时表现依旧有限,缺乏持久的对话记忆,无法形成人类合作者之间的思维默契,容易出现错误且倾向于迎合用户需求

在相关猜想的研究中,AI并非依靠暴力穷举得出结果,而是展现出了极强的高维逻辑收敛与跨领域推理能力。它敏锐地抓住了前沿研究搭建的理论跳板,在形式化验证工具的严苛约束下,调用了人类已知的大量分析工具与技巧,以人类研究者从未设想过的精巧路径,完成了复杂的推理闭环。这一成果也说明,AI的能力可能远超我们当前的认知。

八、数学研究的价值判断标准

陶哲轩提出,数学研究的重要性至少可以分为四个层次:

  1. 问题的重要性:该问题是否能够揭示深层结构、连接不同研究领域,或是代表长期具有价值的学术目标
  2. 方法的重要性:研究是否产生了可迁移的证明技术、新概念、新工具或新的组织框架
  3. 理解的重要性:研究结果是否解释了“为什么成立”,而非仅仅给出一个通过验证的输出
  4. 共同体价值:研究成果是否可复核、可交流、可教学,并能成为其他研究的可靠基础

单纯的数字改进或许有一定价值,但只有当它暴露了新的结构或产生了可推广的方法时,才能真正推动数学的发展。真正推动学科进步的工作,往往具备以下特征:能够将复杂问题拆解为更清晰的子问题,能够发现隐藏的不变量、对偶性或统一框架,能够将局部技巧推广到一类问题,能够产生可靠、透明、可复用的证明与计算,能够吸引后续研究者继续探索,而非让问题在榜单上短暂消失。

在这套标准下,AI最适合承担搜索、计算、实验与检查的工作,而人类则需要负责判断问题的价值、解释研究结构、选择研究方向,并将局部的成功升华为一般的理论体系。

九、数学研究的未来图景:人机协作的生态

未来的数学研究,更可能形成“人类-AI-形式化系统-计算基础设施”的协作生态,而非单一AI独立完成所有工作。可能的发展方向包括:

  • 自动证明代理:自动提出引理、寻找证明路径并调用定理库
  • 形式化数学基础设施:将更多经典定理、猜想与研究论文纳入形式化验证系统
  • 数学实验平台:大规模搜索参数、反例、猜想与结构,再由人类提炼核心理论
  • 可复现研究:论文同步提供代码、数据、形式化证明与完整的计算环境
  • 新型评价体系:从单一指标转向综合判断研究的长期价值
  • 人机分工专业化:研究者专注于问题选择与理论解释,工程师负责搭建工具系统,AI承担大量候选生成与验证工作

与此同时,相关的风险也在同步增加:研究注意力可能被算力集中的热门方向绑架,冷门但重要的问题被挤压;AI生成的错误或不可复核的证明可能快速扩散;年轻研究者可能失去必要的训练机会。因此,同行评审、独立复核、透明披露与教育制度的重要性会愈发凸显。

十、普通人的职业启示:数学职业的边界正在被重新定义

核心判断:AI改变了入场方式,但没有消灭职业本身

陶哲轩的观点为普通人吃下了一颗定心丸:数学界需要思考如何利用AI的新能力,与人类现有的能力形成配合,由人类深挖少数极具深度的问题。AI降低的是执行门槛,却提高了判断门槛。这意味着:

  • 过去需要数年才能掌握的计算技巧,现在借助AI辅助可能仅需数月就能上手
  • 但“知道该计算什么”的判断力,变得比以往任何时候都更加珍贵
  • 研究者的核心价值,已经从“完成任务快”转向“判断准确、理解深刻、表达清晰”

六条面向普通人的职业路径

  1. 数学翻译者:将AI生成的数学结果转化为人类可理解的形式,包括撰写科普内容、设计教学材料、为行业解释模型含义。这一角色的核心价值在于解决“证明消化不良”的瓶颈,搭建AI产出与人类理解之间的桥梁。
  2. 形式化工程师:使用专业证明工具,将数学论文与AI生成的证明进行形式化转换,确保逻辑严谨。这一工作是可靠研究的基础设施,需要掌握相关工具、能够阅读学术论文并提取逻辑结构,同时具备细致耐心的特质。
  3. 数学实验设计师:设计数值实验、参数搜索策略与反例检测方案,借助AI与计算工具验证猜想。人类的核心价值在于决定“应该搜索哪些方向”,这一角色需要具备基础分析能力、编程能力,以及从失败实验中提炼规律的直觉。
  4. 跨学科建模师:将数学工具应用到其他领域的实际问题中。跨学科问题恰好需要在广度中寻找深度,这正是人类与AI协作的最佳场景,AI可以搜索不同领域的方法,而人类负责判断哪些组合具有实际意义。
  5. 教育创新者:开发新的数学教育方法、课程与工具,帮助学生在AI时代培养思维能力。教育的核心是培养判断力与思维方式,这一角色需要对数学概念有深刻理解,掌握教育相关基础,以及整合工具的能力。
  6. 品味校准师:评估与筛选AI生成的结果,判断哪些值得深入研究,哪些只是无效噪声。当AI能够批量生成候选成果时,“判断什么值得研究”成为最稀缺的能力,这一角色需要广泛的阅读积累、对“好问题”的长期直觉,以及批判性思维能力。

普通人培养数学能力的实操框架

陶哲轩的“徒步隐喻”为学习方法论提供了直接指导:不要坐直升机学数学,要脚踏实地地学习。

  • 先独立思考,再调用AI:面对问题时先写下自己的猜想、例子、反例与可能路径,再让AI提出不同方案,训练的是判断力而非对答案的依赖。与AI的“默契”需要你先拥有自己的立场,否则只会被动接受AI的输出。
  • 把AI当陪练和审稿人,而非拐杖:要求AI解释定义、寻找反例、检查隐含假设、比较不同证明,而非直接代写最终答案。对关键结论必须回到权威资料或形式化系统进行核验。
  • 保留研究日志:失败比成功更有价值:记录尝试过的思路、失败原因、被推翻的猜想与最终保留的洞见。长期价值往往来自失败模式而非单一的成功答案。
  • 做可复现的小闭环项目:选择一个公开问题,完成完整的研究循环。项目不必宏大,但必须能够让他人复核,这是避免“直升机式学习”的关键。
  • 从具体例子进入抽象:先计算小规模情形、绘制图表、运行模拟,再追问哪些现象不依赖具体数字。抽象应当是对结构的压缩,而非逃避细节。
  • 进入共同体:品味来自长期观察:参加学术社区、讨论活动。品味很大一部分来自观察哪些问题能持续吸引优秀研究者,以及他人如何判断一个想法的价值。

什么是数学品味,为何它最难以被AI替代

数学品味并非神秘的天赋,而是对“什么值得理解、什么只是偶然”的长期判断。它通常表现为:能够区分漂亮的数字改进与真正的新机制,会追问一个技巧能否推广而非满足于单次成功,重视定义是否自然、证明是否解释结构、问题是否连接多个领域,对过于复杂的应试式论证保持警惕,愿意选择暂时没有即时回报但可能产生长期影响的问题,能够欣赏简洁、必要性与意外联系,也能接受重要结果有时并不简洁。

品味之所以难以被AI替代,是因为它本质上是基于长期经验的模糊判断,无法被形式化为单一的优化目标。AI可以优化给定的目标,但“什么目标值得优化”本身,就是品味问题。培养品味的有效方式,是反复比较不同解法:为什么教材采用这个定义而非另一个?为什么某篇论文的成果成为后续工作的基础?一个证明删掉哪些技术细节后仍能保留核心?AI生成的答案究竟增加了理解,还是只是增加了篇幅?这些问题比“答案是否看起来专业”更加重要。

陶哲轩的警示:不要吃掉培养下一代的种子

陶哲轩曾警告:一方面,AI工具让科学成果的产出速度大幅提升,但代价可能是,我们吃掉了培养下一代研究者的种子。这直接指向普通人的职业策略:应当选择那些“越做越值钱”的路径,而非“越做越容易被替代”的路径。

越做越值钱的路径 越做越容易被替代的路径
积累判断力与品味 单纯积累执行速度
建立领域知识网络 仅掌握单一工具的使用
培养提问能力 仅培养回答能力
深度理解一个领域 浅层覆盖多个领域
建立人类合作的信任网络 仅独立完成任务

十一、跨行业的深度启示:从数学领域看所有职业

陶哲轩方法论的跨行业映射

陶哲轩在数学领域观察到的现象,在其他行业都能找到对应:

数学领域的现象 其他行业的对应场景
证明消化不良 各类产出的速度远超人类消化吸收的速度
直升机式研究 跳过基础训练,直接借助AI快速产出成果
品味校准 产品判断力、市场洞察、技术选型能力
形式化验证 代码审查、合规审计、质量保证工作
数学品味 技术品味、设计品味、商业直觉
过程价值vs结果价值 学习曲线与交付速度的平衡

七条跨行业的核心原则

  1. 不要把代理指标当成最终目标:单一指标的优化可能诱发目标偏离,每个阶段都应当反思:我们优化的指标,与真正想实现的目标是否还是一回事。
  2. 警惕直升机式学习:效率可能是能力退化的伪装:AI让你更快产出成果,但如果跳过了基础学习的过程,你将失去在过程中积累的直觉、判断力与意外发现。即使AI能够代劳,也应当定期手动完成核心工作,维护手脑的连接。
  3. 培养“问得准”的能力,而非“答得快”的能力:AI擅长广度搜索,人类擅长深度判断。在任何行业,“知道该问什么问题”都比“快速给出答案”更有价值。每天留出固定时间,仅用纸笔思考核心问题。
  4. 可验证性是AI时代的核心竞争力:未来各类产出都可能由AI生成,能够追溯来源、复现过程、解释假设并接受独立检查,将比“生成速度”更重要。在核心产出中加入“验证层”,不仅完成任务,更要能解释为什么这样做是对的。
  5. 保护长期研究:不要让短期成果吞噬基础能力:如果所有资源都只奖励短期可见成绩,组织会失去那些需要多年积累、但能形成核心基础能力的工作。个人应当定期投入无短期回报的深度学习项目,团队应当保留部分时间用于基础研究与能力储备。
  6. 人与机器应形成互补,而非替代:AI负责候选生成、大规模搜索、一致性检查与格式化,人类负责目标设定、价值判断、异常处理与关系建立,最终决策由人类在AI提供的选项中选择。
  7. 清晰思考是所有行业的底层能力:数学训练的本质并非培养数学家,而是培养清晰思考的能力。这在任何行业都是最核心的竞争力:能够将模糊问题拆解为可验证的子问题,能够区分相关性与因果性,能够识别隐含假设,能够用简洁语言解释复杂结构,能够容忍不确定性而不焦虑。

每个行业的“开普勒时刻”

陶哲轩用开普勒的故事说明,理论与实验之间需要时间磨合,AI时代亦是如此:如果早期的研究者拥有AI,那些最终正确的模型反而可能被淘汰,因为它们最初的表现还不如旧有模型。

这一案例带来的启示包括:不要因为AI的短期表现而放弃长期正确的方向,AI说你的方案不如现有方案,可能只是因为你的方案解决的是更深层的问题;给新方法足够的时间,我们仍在学习如何最有效地使用AI工具;过程中的失败是重要的信号而非噪声,看似失败的探索往往蕴藏着关键突破的可能。

普通人的AI时代职业策略总结

  1. 选择深度,而非广度:AI擅长广度,人类擅长深度,在细分领域建立壁垒
  2. 培养品味,而非速度:速度会被AI超越,但品味不会
  3. 做桥梁,而非终端:连接AI产出与人类理解的角色,比任何单一角色都更不可替代
  4. 保留过程,而非只留结果:研究日志、学习记录、决策链,这些是你独有的成长轨迹
  5. 建立信任网络,而非只建立技能栈:人类合作者之间的默契无法被AI复制,这种默契建立在长期合作与相互信任之上
  6. 投资“越做越值钱”的能力:判断力、品味、提问能力、领域深度、人际信任
  7. 定期手动完成核心工作:并非因为效率更高,而是为了维护手脑的连接

十二、结语

对普通人而言,陶哲轩的观点传递了一个清晰的信号:AI时代最稀缺的不是“能完成任务”的人,而是“知道什么任务值得做”的人。这种判断力,也就是品味,需要长期培养,无法速成,且在任何行业都同样稀缺。

未来真正值得追求的,并非“AI是否会赢过人类专家”,而是“AI能否帮助人类提出更好的问题、发现更深的结构,并将这些结构转化为后来者能够学习和继续发展的知识”。而普通人在这条路上的位置,恰恰在于成为那个“消化者”——将AI的产出转化为人类的理解,将速度转化为深度,将数字转化为真正的知识。

以上内容不代表本平台立场,仅供读者参考