文章摘要
OpenAI研究院的Ethan Knight公布,GPT - 5.6 Sol Ultra不到一小时完成困扰数学界50年的循环双覆盖猜想证明,生成三页证明文档。研究团队拉满模型性能、启动64个子智能体并行计算。此外,OpenAI公开提示词工程方案,含实用技巧及获取链接。

最近,OpenAI研究院的Ethan Knight公布了一项突破性进展:刚推出的GPT-5.6 Sol Ultra模型,仅用不到一小时就完成了困扰数学界半个世纪的循环双覆盖猜想证明,整个过程生成了一份三页的正式证明文档。

该成果发布后,正在韩国参加ICML会议的o1核心贡献者Noam Brown第一时间给出了评价。他指出,此次成果与此前解决Erdős单位距离问题不同,并未使用内部特供模型,仅依靠公开可用的GPT-5.6 Sol Ultra就完成了任务。

为了完成这项证明,研究团队将模型性能拉满至GPT-5.6 Sol Ultra版本,并启动了64个子智能体并行计算,将原本可能需要一整天的推理压缩到了一小时以内。这一成果不仅进一步拉高了前沿AI模型在数学领域的能力天花板,也证明了多智能体架构能够极大提升复杂任务的处理效率。

此次被攻克的循环双覆盖猜想,是图论领域最重要的开放问题之一,其起源可追溯至上世纪多位数学家的陆续提出。该猜想的核心问题是:对于任意无桥的有限图,是否存在一组闭合的圈,使得图中的每一条边都恰好被这组圈经过两次。

这里的“桥”指的是一旦被删除就会导致整张图断开的边。举个例子,如果我们移除图中的A-F边,仍可以通过A-B-G-I-F的路径到达F,那么这条边就不是桥。而循环双覆盖猜想要求的前提正是图中不存在这样的桥。

乍看之下,这个猜想似乎很直观:既然无桥图的每条边都至少属于一个圈,那只要收集所有边对应的圈就能完成任务。但实际的难点在于,循环双覆盖要求的是每条边恰好被覆盖两次,而非至少一次。在添加新圈覆盖未被覆盖的边时,很可能会让其他已覆盖的边被多次计数,需要全局协调所有圈的分布,既不能遗漏任何一条边,也不能让任何一条边被重复覆盖超过两次。

GPT-5.6并未采用直接在图中寻找圈的常规思路,而是将问题转化为有限域上的边标号问题,通过线性代数的方法完成了证明。整个证明过程大致分为四个步骤:

  1. 将一般图归约为三次图,也就是每个顶点恰好连接三条边的图。只要证明了三次图的循环双覆盖存在性,原问题就迎刃而解。
  2. 利用无处为零的8流定理,为每条边赋予一个非零的三位二进制标签,同时保证在每个顶点处,相邻三条边的标签可以相互抵消。
  3. 将每条边的一个标签扩展为两个标签,使得在每个顶点附近,同一标签要么完全不出现,要么恰好出现两次。这样一来,所有带有同一标签的边会自然首尾相接形成圈,每条边因为带有两个标签,恰好会属于两个圈。
  4. 解决全局一致性问题:由于同一条边连接两个顶点,两端的标签必须完全一致。GPT-5.6将这一问题转化为线性方程组,通过对偶空间和奇偶性证明了该方程组一定有解,最终实现了全局统一的标号方案。

总的来说,这份证明的核心思路是将复杂的图论结构问题,转化为可以通过线性代数解决的全局一致性问题,通过设计特殊的边标号让圈从标号中自然生成,而非直接手动寻找圈集合。

此次OpenAI还公开了完整的提示词工程方案,其中包含了驾驭顶级大模型完成复杂任务的实用技巧,值得所有AI使用者学习。这份提示词约700个英文字符,延续了当前先进提示工程的核心思路:不规定固定的执行流程,而是明确最终交付标准与验收规则。具体可以分为四个要点:

第一,不写解题步骤,只明确验收标准

很多人在编写复杂任务的提示词时,习惯给模型安排固定的执行流程,比如先分析问题、再提出方案、逐步验证最后总结答案。但对于路径未知的复杂任务,预先设定的步骤很可能本身就是错误的,模型如果严格按照错误流程执行,最终只会得到结构完整的错误答案。

OpenAI的提示词则采取了完全相反的思路:不规定模型必须使用归纳法、流理论还是极小反例等特定方法,而是反复强调最终结果需要满足的条件。比如明确要求“每一个有限、无桥、无自环的多重图,都必须被证明存在圈双覆盖”,同时明确禁止通过添加额外假设来简化问题,比如不能只证明三次图、平面图,也不能假设图一定是连通的。这种写法的核心是,对于路径未知的任务,不要过度规定过程,而是把最终交付物的标准定义清楚。

第二,提前明确所有定义、范围和边界情况

模型出现错误的常见原因之一,是初始理解的任务与实际需求不一致。因此OpenAI在正式提出问题前,用了大量篇幅明确定义:什么是图、什么是桥、什么是圈、什么是圈双覆盖;是否允许平行边、两条平行边能否组成一个圈;不连通图是否纳入讨论范围、无边图应该如何处理等。

他们还专门强调,覆盖中的圈不必是诱导圈,也不必彼此边不相交,唯一的要求是每条边总共恰好出现两次。此外,提示词还在多个位置重复强调最终目标,帮助模型在长推理过程中不偏离任务方向,避免出现上下文漂移的问题。

第三,不仅说明什么是合格答案,还要列出不合格的情况

这是这份提示词中最值得直接借鉴的技巧。它没有停留在“请给出完整证明”这种抽象的要求上,而是专门列出了一批看似接近完成但实际未达标的结果,比如只证明特定图类的情况、构造的覆盖中部分边出现次数不是恰好两次等。这种提前预判模型可能偷懒或出错的方式,能够从源头排除大量失败的可能性。

第四,复杂任务采用动态分工而非固定分配,设置独立审查机制

OpenAI要求模型调用最多64个子智能体,但并未简单地将智能体固定分配到不同的研究路线,比如10个智能体研究路线A、10个智能体研究路线B。相反,提示词要求先建立多样化的方法组合,再根据每条路线的实际进展动态调整资源:如果大量智能体集中在同一种方法上,就将部分智能体转移到未探索的方向;如果某条路线卡在和原问题难度相当的引理上,就将其标记为受阻,除非出现新的机制,否则不再继续投入算力。

此外,提示词还专门设置了“对抗性智能体”,负责检查候选证明是否存在偷换定义、遗漏边界情况、将非闭合路径错误当成圈等问题。同时要求每个子智能体在汇报时必须提供具体的引理、方程、构造或反例,不能只笼统地汇报“有进展”。

这里包含两个实用的提示工程原则:一是复杂问题需要探索多条独立的路线,避免所有模型过早收敛到同一可能错误的方向;二是生成答案和检查答案应该分开进行,不要让提出方案的模型同时为自己的方案打分,而是专门安排独立的审查角色来寻找漏洞。

总的来说,这份提示词的核心价值并非长度本身,而是将复杂任务转化为一份可以验收、可以审查、可以不断纠错的任务合同:不规定唯一的执行道路,但把最终目标、边界条件、失败规则和审查机制全部明确下来。

感兴趣的读者可以通过以下链接查看完整的提示词和证明文档:


塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/

AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

以上内容不代表本平台立场,仅供读者参考