GPT-5.6 Sol自主优化内核,算力节省20%

7月底,某头部AI企业公布的一组数据引发行业震动:其最新大模型参与优化的生产系统,让对外服务成本降低20%,模型生成token的效率提升超过15%。更关键的是,这次优化的执行者,正是大模型本身——AI第一次自主完成了线上生产环境的底层代码重写与效率提升。
这款最新大模型上线后的首个核心任务,就是对自身的运行环境进行全面“翻修”,重写并优化了线上负责运行模型的生产GPU内核。不同于以往的演示环境优化,这次改动直接作用于每日承载十亿级用户请求的线上生产系统。
该企业总裁表示,让这款大模型去提升生产服务效率,正是它既强大又低成本的核心原因之一。该企业内部负责Codex的团队负责人将这套思路总结为两步:首先训练出足够强大的模型,再用这个模型去优化一切,包括运行自身的基础设施、推理栈和内核。
20%的成本压降从何而来?
这款大模型通过Codex接入了企业的生产推理栈,针对其中最核心的四个模块进行了优化:GPU内核、负载均衡、推测解码与KV缓存。
简单来说,负载均衡就是避免部分GPU过载闲置,让算力资源得到更均匀的分配;KV缓存则是将已经计算过的中间结果存储复用,避免重复计算;而推测解码则是通过小模型先生成候选内容,由大模型进行验证,一次可以输出多个token,大幅提升生成速度。
这款大模型的具体优化动作包括:分析真实生产流量,找出被忽略的负载不均问题并测试新的路由策略;自主重写了基于Triton和Gluon的生产内核,挖掘可以预先计算、跳过或并行的计算任务;在推测解码环节,针对配套的draft模型设计并完成了数百次架构实验,自主启动训练流程,主动处理硬件故障与训练不稳定的问题。
这些细致的优化最终带来了开篇提到的两组数据:服务成本降低20%,token生成效率提升超过15%。事实上早在7月9日该大模型发布时,就已经露出端倪:内部研究员已经用它排查故障、优化训练系统、开展实验并解释结果,还专门设置了KernelGen、NanoGPT、RSI Index等自我改进评测项目。这次的成本压降,意味着这些前期布局终于转化为了实实在在的成本节约。
比降本更重要的是自我优化闭环
比20%的成本压降更关键的,是一个完整的自我优化闭环已经跑通。从分析流量、提出优化方案、编写代码、完成实验、处理故障到最终用生产指标验证结果,这条回路的每一个环节,如今都可以由模型自主参与。
以推测解码环节为例,要优化该技术需要搭配更小的draft模型。过去想要找到最优的模型配置,需要稀缺的GPU工程师凭借经验手工调试,往往需要数月时间,而配置空间的庞大让人工调试只能依靠粗糙的经验法则。如今这款大模型可以将“测量-优化-验证”的循环压缩到极短,让团队可以探索更多想法,更快适配不断变化的业务负载。
更重要的是,这个闭环还会自我强化:模型越强,就能把推理栈优化得更省钱;成本越低,同样的硬件就能服务更多用户请求;服务的用户越多,企业就能把更强大的模型触达更多人群。该企业的内部数据也印证了这个循环的速度:在这款大模型的内测阶段,每位活跃研究员的日均token输出是前代最高值的两倍以上;过去半年,用于内部代码推理的研究算力占比增长了100倍,内部智能体的token用量增长了约22倍。省下的每一分算力,最终都转化为了更多人可以使用的智能服务。
这算不算AI的自我进化?
那么,这是否意味着AI已经开始了自我进化?至少目前来看,答案是否定的。
这款大模型优化的只是运行自身的软件、服务配置以及辅助的draft模型,并没有证据表明它在线改动了自身的主体权重,也无法脱离工程团队自主升级出下一代模型。如果将模型的权重比作智能的“货物”,那么内核和配置就是运输货物的卡车与路线,这次优化的只是运输效率,而非货物本身。因此,这更准确地说是“自优化飞轮”的早期形态,而非递归式的自我改进。
需要注意的是,官方使用“自主”来形容内核重写与部分实验,并不等于完全无人参与。从目标设定、系统接入、验证工具选择到最终部署上线,所有核心环节仍牢牢掌握在该企业的工程体系手中。例如,模型编写的生产内核需要经过专门的审核才能上线,该企业使用名为FpSan的开源工具来检查内核的结构与数据流是否合规。自动验证体系的完善程度,才是“让AI编写底层代码”的真正瓶颈。
尽管如此,该企业已经在为递归自我改进(RSI)铺路。早在2月,前代Codex模型就被官方形容为“参与了自身的创造”;此次这款大模型还自主后训练了更小的Luna模型;在内部衡量自我改进能力的RSI Index上,它比前代高出16.2分。其竞争对手Anthropic的判断更为激进:如今人类只需要对个位数百分比的方向性决策负责,该公司联创Jack Clark更是称,到2028年底前出现完整的递归自我改进的概率超过60%。尽管自我优化的飞轮已经转动,但真正的“AI自主创造下一代AI”仍在路上。
行业竞争赛道正在改写
这20%的成本压降,意味着同样一批GPU,如今可以多承接20%的业务。这指向了行业竞争赛道的根本性变化:过去几年,AI企业比拼的是谁能采购到更多的GPU,这套逻辑简单粗暴,但耗资巨大。而在算力永远供不应求、业务需求增长快于产能的当下,另一个关键变量已经浮出水面:同样的硬件,谁能榨出更多的token?
推理效率正在成为和芯片数量同等重要的竞争筹码。该企业已经用产品线印证了这一点:此次推出的这款大模型分为Sol、Terra、Luna三档,核心卖点就是“同等智能,更少token”,效率被放到了和智能同等重要的位置。而这次帮助提升推理效率的,正是模型自身,形成了完整的正向飞轮:模型越强→推理栈越高效→硬件服务更多token→成本降低→更强的模型触达更多用户。这个飞轮,已经在该企业内部转动起来。


