OpenAI GPT-5.6左脚踩右脚:AI改写底层代码降本20%

在行业呼吁开放AI权重的浪潮下,OpenAI公布了其AI递归自进化(RSI)的最新实践成果。这款名为GPT-5.6的模型,实现了标志性的自主迭代:改造支撑自身运行的底层系统。
根据最新发布的技术报告,GPT-5.6已经部署在OpenAI的真实生产环境中,承担多项核心工作:分析线上流量、调整请求路由,甚至直接改写底层Kernel代码、优化推测解码模型。这套自主优化的组合拳效果显著,OpenAI端到端服务成本降低了20%,Token生成效率提升超过15%。
值得关注的是,这项工程的五名作者中,包括大名鼎鼎的Triton语言发明者Philippe Tillet。2021年OpenAI推出Triton 1.0时,目标是让不懂CUDA的开发者也能写出接近专业水平的GPU程序;五年后的今天,GPT-5.6已经开始用Triton改写自身在GPU上运行的底层代码。从教人类编写Kernel到让模型自主优化Kernel,这正是RSI的典型发展路径,也难怪不少行业从业者会选择回归OpenAI投身这类前沿研究。
所谓递归式自我改进(RSI),核心是让AI进入“改进AI”的反馈循环:本轮能力得到提升后,反过来加速下一轮的迭代升级。虽然GPT-5.6还没有完全实现自动训练下一代GPT的完整RSI闭环,但它已经不再只是工程师部署调用的被动工具,而是开始成为改造自身运行系统的主动参与者。
具体来看,GPT-5.6的自主优化涵盖四个核心方向:第一,分析真实生产流量,排查不同机器和服务节点的负载不均问题,测试新的路由策略,将请求分配到更合适的节点;第二,重写和优化生产Kernel,深入模型的前向传播流程,寻找可以提前计算、省略或并行执行的环节,通过Codex改写生产环境中的Triton和Gluon Kernel;第三,优化自身的推测解码系统,为草稿模型设计方案并自动开展数百次实验,测试不同的模型规模、结构和特征,同时在训练过程中持续监控,遇到硬件故障或训练不稳定时主动介入;第四,针对不同任务场景自主寻找最优部署参数,面对短对话、长上下文、代码任务等不同负载,自动搜索批量处理、分片和KV缓存管理的最佳组合。
这四项工作串联起来,形成了完整的工程反馈循环:从观察生产系统、寻找瓶颈、提出方案、运行实验、处理故障,再到将有效改进部署回承载自身运行的系统,GPT-5.6参与的不再是孤立的代码任务,而是真正的自我优化闭环。
当然,当前的RSI还处于早期阶段,人类依然处于核心决策环节,也就是所谓的“human in the loop”。GPT-5.6虽然开始参与改造自身,但优化目标、工具权限、评测指标以及代码能否上线生产环境,仍然由人类把控。
除了模型内部的优化,模型外部的重复工作也会带来大量资源浪费。比如ChatGPT Work和Codex执行复杂任务时,往往需要经历“模型思考—调用工具—读取结果—继续思考”的循环,一次用户请求背后可能有十几甚至几十轮循环。假设一次任务调用模型30次,每次额外浪费1秒,累计就会达到30秒;而且每轮循环中,上下文、工具说明和历史结果都会被重复传输和计算。
为此,OpenAI搭建了由Rust编写的Agent Harness,连接模型、工具和用户环境,专门减少Agent循环中的重复工作。其中两项核心优化尤为关键:一是延迟发现工具,不再一开始就将所有工具的说明塞入上下文,而是在真正需要时才向模型展示对应工具,同时将工具返回内容默认限制在1万Token以内,只有当模型需要更多内容时才主动申请;二是只追加不回写的Prompt缓存机制,Prompt缓存可以复用已经计算过的上下文前缀,前提是这段前缀保持不变,因此新的消息和工具结果只会接在上下文末尾,不会插入到旧内容中,同时保持工具顺序固定,审批和权限设置留到执行阶段处理。
这样一来,GPU可以直接复用此前的计算结果,只处理本轮新增的内容。单次循环节省的资源看似不多,但当成千上万的Agent每天循环几十轮,整体节省的资源就非常可观。
整体来看,这一轮效率优化来自两股核心力量:一方面是GPT-5.6自主参与模型自身的优化,另一方面是人类团队继续清理模型运行环境中的重复劳动。人类依然在闭环中,但AI已经开始主动参与系统改造。
除了让GPT-5.6参与优化自身的工作,OpenAI还在报告中透露了另一组关键数据:在GPT-5.6的内部测试阶段,每名活跃研究人员的日均输出Token量超过了GPT-5.5时期峰值的两倍。过去半年,OpenAI用于内部编程推理的研究算力占比增长了100倍,内部Agent的Token用量也增长了约22倍。
虽然这些数据不能直接证明OpenAI的研究速度提升了100倍,但至少印证了一个核心结论:当AI变得更便宜、更好用时,它的使用量不仅不会减少,反而会持续增长。


