GPT6 Sol和Luna价格降一半:Token便宜了,你的账单真的少了吗?

2026年9月22日,OpenAI发布GPT-6 Sol和Luna,API价格较GPT-5.6促销价直降50%——Sol降至$2/$10,Luna降至$0.10/$0.50。GPT6 Sol和Luna价格降一半看似是开发者的普惠时刻,但独立评测揭示了一个值得警惕的事实:Token单价腰斩,任务成本却没有同步下降,部分能力甚至出现倒退。

一个被忽略的算术问题
9月22日,OpenAI发布了GPT-6家族的两款新成员——Sol和Luna。新闻标题整齐划一:价格腰斩。
数字确实漂亮。Sol每百万输入Token从$4降到$2,输出从$20降到$10;Luna输入从$0.20降到$0.10,输出从$1.20降到$0.50。OpenAI官方声明中明确表示,这是永久定价,不是限时促销。
但Artificial Analysis在同一天的独立评测中给出了一个更值得玩味的数字:GPT-6 Sol完成一次Intelligence Index任务的成本约为$1.06,比GPT-5.6 Sol的$1.99低了约47%——低于50%的降价幅度。原因在于,GPT-6 Sol完成同一任务消耗的输出Token从29k增加到了31k。
换句话说,单价降了50%,但用量涨了约7%,净效果打了折扣。Luna的情况更明显:任务成本从$0.18降到$0.07,降幅约61%,优于50%——但这主要是因为Luna的输出Token消耗从41k激增到51k,单价降幅被更大的消耗量部分抵消了。
这是理解GPT6 Sol和Luna价格降一半这件事的第一个关键视角:Token定价是原料价格,任务成本才是出厂价。 原料降了价,如果配方变了,出厂价未必同比例下降。
降价幅度与能力变化的错位
把两款模型放在同一张桌子上对比,会看到一个更复杂的故事。
| 对比维度 | GPT-6 Sol | GPT-6 Luna | GPT-5.6 Sol(前代) | GPT-5.6 Luna(前代) |
|---|---|---|---|---|
| 输入价格(/百万Token) | $2 | $0.10 | $4 | $0.20 |
| 输出价格(/百万Token) | $10 | $0.50 | $20 | $1.20 |
| 缓存读取折扣 | 90% | 90% | 90% | 90% |
| AutomationBench(xhigh/max) | 33.2%($0.27/任务) | 未披露同档 | 未披露 | 未披露 |
| OSWorld 2.0(xhigh) | 60.5% | — | 65.7% | — |
| DeepSWE v1.1(max) | 68.8% | 66.6% | — | — |
| Coding Agent Index | 57(↑2分) | 41(↓2分) | 55 | 43 |
| 幻觉率(AA-Omniscience) | 60%(前代92%) | 77%(前代93%) | 92% | 93% |
这张表里藏着两个重要的错位。
第一个错位:Sol和Luna的“进步方向”并不一致。Sol在编码智能体上比前代提升了2分,但Luna反而退步了2分——在SWE-Atlas-QnA上从49%掉到44%,在DeepSWE v1.1上从66%降到64%。Sol是实打实的升级,Luna更像是“降价换能力”的取舍。
第二个错位:计算机操作能力出现了明显回退。GPT-6 Sol在OSWorld 2.0上的得分是60.5%,而GPT-5.6 Sol是65.7%——差了5.2个百分点。一个价格只有前代一半的模型,在最广泛的通用能力测试上表现更差,这不是偶然。OpenAI明显在优化“每任务成本”而非“能力上限”。
还有一个容易被忽略的数据:在GDPval-AA v2.1——一个基于44个职业的经济价值任务基准——Sol的Elo分下降了约100分,Luna下降了约75分。这意味着在真实的知识工作场景中,两款新模型的实际产出质量可能不如前代。评测团队人工检查了数百个模型输出后发现,退步主要体现在“呈现质量下降和遗漏评分标准要素”。
这不是说GPT-6 Sol和Luna不好。而是说,降价的代价被精确地分配在了某些能力维度上。OpenAI选择了一条清晰的产品路线:为高频、规模化的工作流提供极致性价比,而不是为追求最高质量的复杂任务提供最优解。GPT-6 Astra仍然是“最佳效果和无妥协体验”的选择。
缓存不是技术优化,是定价权的转移
OpenAI在公告中把降价的底层原因归结为“缓存和推理效率的改进”。这句话值得拆开看。
提示词缓存不是新技术。它的基本原理是:当系统发现同一段指令已经被处理过,就不再重复计算,直接返回缓存结果。对于高频调用相似场景的企业应用来说,这天然是一个省钱机制。
但GPT-6的缓存改动有一个关键升级:推理强度或可用工具在对话中途改变时,之前的上下文仍然可以作为缓存使用。在此之前,一旦Agent在任务执行过程中调整了推理深度或切换了工具,缓存就会失效,之前积累的上下文需要重新计算。这个限制让缓存在真实的Agent工作流中很难发挥作用——因为Agent的本质就是在执行过程中动态调整策略。
现在这个限制被解除了。OpenAI同时将缓存读取的折扣维持在90%,写入溢价维持在25%。GitHub的报告显示,这些改动让需要重新处理的提示词Token比例下降了超过50%。
但这里有一个被低估的战略含义。缓存的效果取决于调用模式,而调用模式取决于用户积累。 谁拥有更多的高频真实业务场景,谁就能让缓存发挥更大的杠杆效应,形成“用得越多,单位成本越低”的正反馈。OpenAI把Luna的价格压到$0.10,本质上是在赌自己的用户基数足够大、调用模式足够集中,能让缓存效应持续放大。
这意味着一个看似纯粹的技术优化,实际上重新分配了议价权:缓存命中率高的用户获得真实降价,缓存命中率低的用户承受名义降价。 如果你的调用模式天然分散、每次请求的上下文差异大,你拿到的实际折扣远低于50%。
“协调放缓”的终结
把GPT-6 Sol和Luna放在2026年9月的时间轴上,会看到更大的图景。
9月21日,xAI发布Grok 4.7,主打性价比。9月22日,Anthropic在OpenAI发布前90分钟推出Opus 5.5,定价$4/$20,声称典型工作负载成本降低40%。同一天,OpenAI发布Sol和Luna。三家头部实验室在48小时内密集出手。
这不是巧合。Axios的报道指出,行业竞争焦点正在从“性能比拼”转向“成本优化”。更值得关注的是,这种同步降价的节奏表明,此前几家实验室之间某种心照不宣的“协调放缓”已经结束。当一家开始实质性降价,其他家必须在数小时内跟进,否则面临开发者流失的风险。
Forkast的分析用了一个精准的标题:“三层模型家族终结了协调放缓”。GPT-6家族现在的三层结构——Astra $10/$50、Sol $2/$10、Luna $0.10/$0.50——覆盖了从企业级推理到高频文档处理的完整成本谱系。一个开发者在OpenAI生态内就能找到所有价位的选择,离开的动机被大幅削弱。
但这不意味着OpenAI在打一场纯粹的防守战。更准确的理解是:OpenAI正在用Luna的极致低价,把“AI调用成本”这个概念本身变得无关紧要。 当一次文档摘要或数据提取的成本趋近于零时,企业的决策逻辑会从“这件事值不值得用AI做”变成“为什么不用AI做”。这是需求侧的扩容策略,不是供给侧的价格战。
与此同时,缓存机制和三层架构的组合,构建了一道不容易被简单复制的能力壁垒。竞争对手可以匹配Token单价,但很难在短时间内复制一个覆盖全谱系、缓存效率经过大规模调用验证的模型矩阵。
六个你真正需要知道的问题
GPT-6 Sol和Luna的价格确实降了50%吗?
官方定价表显示,Sol从$4/$20降至$2/$10,Luna从$0.20/$1.20降至$0.10/$0.50,降幅精确为50%。但这是永久定价,不是限时促销,与GPT-5.6此前的“促销价”对比的含义需要留意:促销价本身可能已经是折扣后的价格。
为什么单价降了50%,任务成本降幅却不一样?
因为GPT-6 Sol和Luna完成同一任务消耗的输出Token略多于前代。Sol从29k增加到31k,Luna从41k增加到51k。输出Token的增量部分抵消了单价的降幅。
GPT-6 Luna比Sol便宜20倍,它适合什么场景?
Luna定位是“专注、高吞吐量的任务”——文档摘要、信息提取、分类、路由等目的明确、不需要深度推理的工作。它在这些场景下的每任务成本可以低到Sol的十分之一甚至更低。但如果你需要的是复杂代码重构或多步Agent工作流,Luna的能力天花板会成为瓶颈。
GPT-6 Sol和Luna在所有能力上都超过了前代吗?
不是。在OSWorld 2.0计算机操作基准上,Sol的得分从65.7%下降到60.5%。在GDPval-AA v2.1知识工作基准上,Sol的Elo分下降了约100分,Luna下降了约75分。编码和Agent任务上Sol有提升,但通用知识工作的产出质量出现了回退。
缓存到底能帮我省多少?
取决于你的调用模式。如果你的应用涉及大量重复的上下文——比如固定的系统指令、相似的文档结构、迭代式的代码修改——缓存命中率高,实际成本可能远低于标价。但如果每次请求的上下文差异大,缓存效果有限,你拿到的就是标价上的50%降幅。OpenAI提供了90%的缓存读取折扣,但前提是“命中”。
我应该从GPT-5.6切换到GPT-6 Sol或Luna吗?
如果你的工作流以高频、规模化、对单次输出质量容忍度较高为特征,GPT-6 Luna的性价比优势非常显著。如果你需要编码Agent或自动化工作流,GPT-6 Sol在DeepSWE和AutomationBench上的表现值得考虑。但如果你对计算机操作能力或知识工作的产出完整度有较高要求,GPT-5.6 Sol在某些维度上仍然是更稳妥的选择,或者应该考虑GPT-6 Astra。切换之前,建议用你自己的真实任务跑一轮对比,而不是依赖通用基准分数做决定。

