文章摘要
未经过额外训练、未更新权重的GPT - 5.6 Sol模型,仅调整调用框架的保留推理状态和上下文压缩两个配置,就在ARC - AGI - 3公开测试集上成绩提升近3倍,单次测试输出令牌数降至原本的约六分之一。此前该模型初始成绩仅7.8%,默认框架会清空推理状态、截断历史内容。此次调整解决推理状态丢失问题,但成绩仍未达人类平均水平。

一款未经过额外训练、未更新权重的大语言模型,仅通过调整调用框架的两个配置,就在ARC-AGI-3公开测试集上取得了近3倍的成绩提升,同时单次测试输出的令牌数下降至原本的六分之一左右。

这款名为GPT-5.6 Sol的模型,此前已经展现出攻克数学证明、完成长程游戏的能力,但在ARC-AGI-3测试中的初始总成绩仅为7.8%,表现远低于预期。而在更早的测试中,该模型曾在特定环境中连续运行5小时的卡牌游戏,最终通关了随机日常挑战,为何在几款无操作说明的二维小游戏中表现不佳?

ARC-AGI-3仅向智能体提供当前画面的文本化描述,测试者需要自行摸索目标、机关规则与禁忌操作。每完成一步操作后,需要观察画面变化推导规则,猜错则更换方向重试。这类游戏的操作本身并不复杂,难点在于将数十步的试错过程串联成完整的推理思路。

后续的对照测试显示,在相同的GPT-5.6 Sol最高推理档位下,使用官方测试框架得到的成绩为13.3%;而在保留推理状态并启用上下文压缩的配置下,成绩提升至38.3%。测试结果显示,调整配置后的表现向左上角偏移,意味着成绩更高的同时,单次测试的输出令牌数显著减少。

推理状态丢失,如同被抽走草稿纸

团队排查运行日志后发现了核心问题:在默认的测试框架中,每次游戏动作结束后,模型的私有推理状态都会被清空。虽然历史动作和简短备注得以保留,但模型做出当前选择的原因、验证过的规则、下一步的计划等关键推理信息完全丢失。这就好比解题到一半,按下方向键后草稿纸就被抽走,下一回合必须重新确认当前位置和之前的尝试过程。

随着测试时长增加,这套框架还会使用滚动截断机制,当历史内容超过175000字符时,最早的消息会被直接删除。前半程丢失推理思路,后半程连已完成的操作记录都无法保留,无怪乎模型每一步都要花费大量时间思考,却迟迟没有进展。

两个配置,恢复模型推理记忆

本次调整仅启用了两个框架设置,就解决了推理状态丢失的问题。第一个设置是保留推理状态,通过在调用接口中传入上一轮的响应previous_response_id,模型可以在后续工具调用和多轮交互中复用此前的私有推理内容。开发者无法查看完整的思维链,但模型无需在每一回合重新理解当前游戏的状态。

第二个设置是上下文压缩。默认的框架会从最早的消息开始直接删除历史内容,而压缩机制会将后续仍需使用的历史状态和推理过程打包为一个不透明条目,带入下一段上下文。无需完整保留每一步的细节,已经确认的游戏规则、走过的弯路和当前计划都可以连贯衔接。

两个设置同时开启后,GPT-5.6 Sol每次行动前减少了大量重复思考,策略也不再频繁断线。最终带来了成绩提升与令牌数下降的结果。

未更新模型,仅调整测试框架

本次测试没有更新模型权重,也没有进行额外训练,所有性能提升都来自模型外部的调用框架配置。ARC-AGI-3的评分同时考量通关数量和相对人类的操作效率,内部推理、工具调用和重试不计入正式游戏动作。根据测试日志估算,人类测试者在公开集上的平均分为约48%,38.3%的成绩仍未追上人类平均水平。

以上内容不代表本平台立场,仅供读者参考