诺姆·布朗谈OpenAI万模系统攻克千禧数学难题

OpenAI核心研究员Noam Brown的最新长对谈中,披露了团队用万级智能体系统攻克千禧年大奖难题的核心细节,这场仅耗时88小时的突破,背后的技术逻辑远超行业现有认知框架。
1300亿Token的暴力推演
单次任务推理达到1300亿Token的计算量,这个数字远超人类日常的认知边界,几乎无法用直观的方式去衡量。如果将这个计算量折算为全职科研人员的连续思考:按照每天8小时、每周5天、全年无休的标准计算,1300亿Token相当于一个人脑从公元前2000年的古苏美尔文明时期,一直不间断思考到今天,整整跨越了4000年的思维总量。而OpenAI将这相当于4000年人类文明的高强度思考,在88小时内就完成了全部推演。
这种能力的本质,是对测试期计算在空间和时间维度上的极限制缩。早期的单体推理模型比如o1,其测试期计算主要采用串行模式,就像人类答题一样,在输出最终答案前会进行长周期的内部自我对话,逐步枚举不同情况、排除错误假设、反复核对每一步推导逻辑。但这种串行思考存在难以突破的延迟瓶颈——没有任何实际应用能让用户等待数年才能得到问题的回复。要打破这种单线思考的延迟墙,唯一的路径就是将计算从纯粹的串行模式转向大规模并行,这正是多智能体系统的核心价值所在。
当然,并行化本身也存在效率损耗:单一智能体拥有完整的上下文视野,但当任务被拆分给多个智能体后,上下文需要在不同个体之间流通和同步。不过只要协作机制设计合理,这种并行的测试期计算就能在极短时间内聚合出惊人的认知生产力。OpenAI在发布5.6版本及其Ultra模式时,曾公开过多智能体并行的基准测试曲线:在默认的4智能体或扩展到16智能体的设置下,不同任务呈现出不同的加速特征。比如在部分数学基准测试中,4个智能体协同工作的耗时几乎缩短了一半,仅付出了2倍的计算成本;当智能体数量从4增加到16时,加速曲线呈现出轻微的亚线性趋势。这说明并行效率是否会随着规模扩大而严重衰减,很大程度上取决于任务本身的内在属性:数学证明、代码生成这类任务高度适合并行,深度搜索和信息整合的研究任务也天生适合大规模分工;但像文学创作这类需要保持长程单一连贯性的任务,10000个智能体协作并不会比10000个人类共同写一本小说更有优势。
不过目前学术界和工业界对多智能体扩展性的认知,还停留在十几个或几十个节点的规模。将规模提升到10000个智能体需要消耗天量的高性能算力,根本无法开展常规的多变量对照实验。OpenAI用万模系统攻克千禧年大奖难题,只是一个在周末完成的极端孤例。就连Noam Brown本人也承认,目前OpenAI并没有确切的对比数据,能证明10000个智能体比1000个智能体快多少,也没有数据能说明单体智能体需要运行多久才能独立解决同一个问题。更关键的是,Noam Brown明确反对将攻克千禧年数学难题的功劳全部归于多智能体架构——它的贡献甚至不到10%。真正起到决定性作用的,是OpenAI底层训练的、具备超强长视野推理能力的通用基础大模型,多智能体只是将这种强大的底座能力在时间维度上快速展开,底层模型的通用智能才是这场突破的核心支柱。
去中心化的智能蜂群
过去几年,AI行业在构建多智能体系统时,普遍陷入了中心化的死板工程思维:通常会人为设定一个总指挥协调器,挂载若干子智能体,由协调器负责拆解任务、分发子任务,子智能体在封闭沙盒中计算后再将结果交回协调器。这种中心化架构存在致命的效率硬伤:一方面,如果两个子智能体分到高度关联甚至互补的子任务,它们无法直接交流,形成严重的信息孤岛,遇到对方已经解决的难点也无法直接询问,极大浪费计算资源;另一方面,如果子智能体对协调器的任务指令存在理解歧义,要么中断执行发起多轮低效确认,要么凭主观假设硬做,最终产出偏离预期。如果开发者为解决这些痛点不断堆砌特例逻辑,整个软件架构会变得极其复杂、脆弱且难以维护。
OpenAI在这次万模系统中彻底抛弃了所有预设的复杂管理拓扑,走向了极致的极简主义:研究团队没有给智能体强加协调员、管理者或执行者的身份标签,也没有预设任何层级汇报路线,只给每个智能体开放了最基础的原语工具——智能体拥有简单的通信调用权限,可以在需要时自主向任意其他智能体发送消息,收到消息的智能体会将内容动态插入自身的上下文窗口中。仅此而已,所有的协同规则、沟通时机和组织形式,都交给模型自身在强化学习中自行探索和演化。
这种极度放权的策略在训练收敛后,涌现出了高度成熟且类似人类的协作形态。在内部实验中,研究人员看到了令人惊叹的场景:当一道复杂题目下发后,智能体之间并没有出现混乱的广播拥堵。某个智能体在局部推导后率先发送消息,表示自己算出了答案;紧接着另一个智能体立刻回复,指出自己的结果与对方不同,并询问对方推导第四步的核心依据;双方在通信通道中来回展开逻辑辩驳和假设核对,最终前一个智能体意识到自己在某一处边界条件上考虑不周,随即向整个工作组广播,修正了之前的结论,认可了对方的证明方案。整个沟通逻辑的流畅度和组织效率,完全就像一群顶尖人类数学家在协作群组里进行高效的异步办公。
在早期版本中,让智能体自发学会沟通其实非常困难:纯粹的强推理模型习惯在单机环境下进行深度的线性思维链展开,外部其他智能体的消息插入往往会打断自身的专注思考流,导致系统容易陷入所有智能体各自为战的局部最优陷阱。但随着基础模型通用能力的全面提升,模型对自然语言交互的理解愈发敏锐,这种协作机制经过强化学习塑造后迅速成熟。甚至在面对不同交互对象时,智能体能够清晰区分对方是AI还是人类,并自动切换完全不同的交流节奏和语义密度。
未来,这类多智能体系统的工作节奏将彻底突破人类的生理极限:它们不需要休息和睡眠,在超高速采样模式下的词元生成速度比人类正常语速快10到15倍。在企业组织内部,这相当于存在一个以人类百倍速度狂飙运转的智能蜂群,仅用一周时间就能完成人类团队一整年才能消化的研发工作量。
数学大爆炸背后的AI自我迭代奇点
数学能力在过去几年的跨越式狂飙,为AI自动化研发和递归自我改进提供了最坚实的参照系。回顾大模型攻克数学的历史轨迹,其发展加速度远超所有顶级专家的预期:2024年,AI还只能在中小学基础数学题库GSM8K上答题,人类顶尖学者完成这类题目仅需5秒钟;随后模型攻克了MATH基准,对应人类专家需要思考1分钟的高中竞赛题;紧接着拿下了AIME美国数学邀请赛的高分,这类题目需要顶尖竞赛选手连续演算10分钟;到2025年,模型在不借助外部计算器和互联网搜索的前提下,拿下了国际数学奥林匹克竞赛IMO的金牌,单题思考量达到人类专家的100分钟级别。
按照每年任务难度提升10倍思考时间的指数趋势推算,从IMO金牌跨越到需要顶尖数学家苦思数年甚至数十年才能解决的千禧年大奖难题,理论上至少要等到2028年甚至2030年之后。但现实是,这个跨越在2026年就被万模系统以极其暴力的方式提前完成了。就在该成果公布的两周前,某顶级前沿实验室的核心研究员还曾和Noam Brown立下1000美元的赌注,坚信2027年之前绝对不可能有AI攻克任何一个千禧年大奖难题,甚至认为要等到2030年。不仅外部学者预判失误,OpenAI内部的核心团队也被这种突变速度彻底震惊。
尽管包括陶哲轩在内的数学界学者指出,目前的模型虽然能够暴力证明定义明确的硬核难题,但在开创全新数学理论分支、提出深刻数学问题以及构建全新公理体系方面仍有欠缺,呈现出明显的能力锯齿状特征。但在机器学习研发领域,这种锯齿状的能力分布不仅不是缺陷,反而成为推动递归自我改进的绝佳武器。在AI算法研究中,科研人员不需要模型去玄学式地顿悟深奥的哲学理论,机器学习工程的核心目标极其具象、明确且可量化:如何在固定数据下降低预训练损失,如何提升特定强化学习环境下的样本利用效率,如何构建更稳健的在线学习架构——这些目标都有清晰的数字指标可以监控。模型在数学证明中展现出的强大长程推导和逻辑闭环能力,可以直接无缝迁移到算法代码修改和训练超参数搜索上。
而且,AI在算法研发上的能力锯齿状具有根本性的正反馈特性:即便模型在很多领域能力残缺,只要它在设计更强学习器这一个单一维度上展现出超强能力,它迭代出的下一个版本学习器的通用泛化能力就会实现全方位跃迁。当然,AI自我迭代和纯数学推演之间存在物理屏障:实验算力和时延。纯数学研究受限于大脑的思考带宽,只要算力充足、思维链足够长,逻辑就能在虚拟空间中狂飙;但AI研发必须进行真实世界的物理实验,训练新架构、验证新假设都需要消耗大量GPU物理时间,实验结果只能串行等待。这也是为什么AI目前不会在88小时内瞬间引发指数爆炸的奇点,但算力底座的膨胀速度正在迅速抹平这个差距。到明年年底,仅OpenAI一家实验室拥有的庞大算力储备,就足以支撑成千上万个超人类智能体,让每个智能体每天都能独立发起一次GPT-3级别的完整训练实验。在OpenAI内部,顶级研究人员每天消耗在内部编程工具Codex上的费用已经达到7000到8000美元,内部研发流程的推进速度已经实现了3倍以上的实际加速。如果以每年3倍的速度在指数曲线上奔跑,从非推理模型时代跨越到现在的全能智能体时代所经历的全部技术质变,未来将在短短一年内被彻底重演一遍。
未公开模型与正在闭合的时间窗口
目前,全球科技界和普通大众对AI能力的真实认知,和前沿实验室内部的真实技术现状之间,已经存在一条极其巨大的认知鸿沟。公众能接触到的商业化模型虽然性能强大,但和实验室内部封存的未发布超前版本相比,已经存在显著的代际差距。在数学领域,这种内外脱节的局面已经成为现实:内部未公开的模型不仅攻克了千禧年大奖难题,还在以惊人的速度连续破解人类数学史上大量长期悬而未决的未解问题。这种强大的认知能力在不久的将来会迅速外溢到算法优化、系统工程、经济决策甚至地缘博弈等各个关键领域。
一方面,为了确保安全,实验室理应放慢外部部署节奏,花费更长时间评估具备超长视野执行能力的高危模型;但另一方面,外部发布节奏的放缓,不可避免地会拉大前沿实验室和外部真实社会之间的能力落差,造成极其危险的技术和权力高度垄断。回顾从2011年Jane Street举办的第一场FOOM奇点辩论,到如今大模型在各个硬核科学领域全面领先,技术演进的烈度已经彻底超出了绝大多数人类学者的想象框架。在访谈的最后,Noam Brown直言,过去长期在一线摸爬滚打的顶尖研究员,虽然对未来充满敬畏,但通常还能对未来12个月的技术走向做出大致靠谱的预测;而到了今天,即便是身处技术风暴最核心的OpenAI核心团队成员,也没有人敢于断言未来3个月后世界会变成什么样。用海量算力和智能体蜂群推动的自动化AI研发引擎已经启动,人类跨越奇点门槛的倒计时正在以周为单位疯狂缩短,留给全人类彻底解决对齐难题的时间窗口,正在不可逆转地急剧闭合。

