Opus 5性能跃升价格腰斩成AI新宠

原本以为新版本还要再等一周才会推送,结果一觉醒来发现目标工具直接上线,完全打乱了原本的测试计划——最期待的就是爆料里提到的3D游戏生成功能,要是真能达到预期,终于可以换掉那个经常出现幻觉的旧版本了。
首先看各项跑分数据,原本以为某高端模型会稳居榜首,结果新版本除了多学科推理、Agent编程、法律和健康这四个项目外,其余维度都实现了反超,确实让人意外。现在订阅的额度有了新的使用方向,不用再用完高端模型就只能切换到另一款工具了。它的API定价和旧版本一致:输入每百万Token5美元,输出每百万Token25美元,还支持快速模式,速度提升2.5倍,售价为原价的两倍。
新版本支持100万上下文窗口,知识截止时间更新到2026年5月,数据非常新鲜。在max effort模式下,它的总分距离该高端模型的最高分仅差0.5%,而且在high、xhigh、max这几个性能档位上,它的性能成本比都优于其他同类模型。
最亮眼的是ARC-AGI-3得分是另一款工具的三倍以上,这个测试的核心是评估模型在完全陌生的环境中,能否通过试错快速理解规则并完成目标。具体来说,就是将模型放入从未接触过的二维小游戏中,只告知可用的按钮,不说明玩法、规则和胜利条件,模型需要自行建立规则模型,将前几关学到的规律迁移到后续关卡中。
之前的执行路线是高端模型制定计划,另一款工具负责长时间执行任务,还有一款模型处理短时间一次性任务,而幻觉严重的旧版本基本不用。现在调整为高端模型出计划,两款工具并行执行,最后由高端模型整合结果,实测下来额度足够用,很多执行环节都可以交给新版本来完成。另外还发现可以用网页版的另一款工具Pro版本来做大型代码评审,又省下了一部分额度。
新版本在社交平台上被测试最多的就是3D场景游戏生成,同样的提示词下,另一款工具生成的效果非常差。我自己尝试制作了一款逃生游戏,新版本可以设置完整的关卡和智能NPC,不再像之前只能和静态物体互动。我做的游戏里,机器人会随机扫射玩家位置,压迫感极强,试玩的时候被发现后只能活5秒就被淘汰了,最后还是玩了十年游戏的朋友帮我打到了第二关,作为游戏的制作者我居然连第一关都过不去。而另一款工具生成的游戏里,机器人就像木头一样,很容易就能绕开,完全没有试玩的欲望。
最后测试了写作能力,先看了另一款工具的产出,整体风格偏理性,叙事比较直白,确实更偏向理工科的表达逻辑。再看新版本和旧版本的对比,不同人的感受有差异,我们内部投票了多轮,我还是认为旧版本的悬疑感营造得更好,而新版本的故事结构更完整。
最近还有一个很实用的更新,相关工具去掉了80%的系统提示词,结合之前另一款工具推出的SuperPower辅助思考技能,可以直接删除冗余的配置。随着模型能力的提升,我们已经不需要过多的条条框框来限制模型的发挥。被删掉的主要是过量的示例、硬性的禁止要求、重复的约束,以及模型已经可以自行判断的内容。之前有测试数据显示,在内部编码代理评测中,更简洁的系统提示词可以让评分提升10%-15%,Token消耗减少41%-66%,成本降低33%-67%。之前保留过多的技能反而会让模型出现兼容冲突,我一开始使用另一款工具的时候甚至出现过简单问题思考一小时的情况。相关工具推荐使用/doctor命令来清理长期未使用但仍占用上下文成本的技能、MCP和插件。我也改造了之前用于Codex的技能瘦身提示语,直接删除可能会影响习惯了的触发词,所以保留了触发空壳的方案。
请写一个短篇故事,题目是《凌晨三点的便利店》。
要求:
800字以内
主角是一名长期失眠的年轻人
故事中必须出现:一张过期的彩票、一位奇怪的店员、一通没有来电号码的电话
开头要能快速吸引读者
中间必须出现一次意外转折
结尾要有余韵,但不要故意解释所有谜题
人物行为必须合理,避免空洞煽情
不要使用网络流行语
直接输出故事,不要解释创作思路
具体的技能分层规则如下:
## skill分层提示语
盘点当前 Agent 环境中的 Skill、插件和 MCP:
统计安装数量、去重数量、全局/项目作用域、最近使用时间、实际调用次数,以及它们占用的启动上下文和调用后上下文。
不要只看装没装,要结合 session 日志、/doctor、/context、插件 Last used 和必要的 fresh-session A/B,输出一张分析图表。
再把所有 Skill 分成三档:
- 高频常驻:几乎每周或多数相关任务都在用,保留全局启用;
- 中频项目化:稳定使用但只服务特定项目,改为仅在项目生效;
- 低频归档:长期未使用,先归档完整内容,不要直接删除。
对低频归档项保留一个极小的“触发空壳”,只记录名称、能力摘要、2–5 个自然语言触发词、归档位置、恢复方式和观察截止日。
当用户请求命中触发词时,只提示:“这个能力对应的 Skill 已归档,是否要为当前项目临时加载?”未经明确同意,不安装、不启用、不复制、不执行。
归档后默认观察 60 天。期间再次触发就恢复到项目级;多项目持续高频才恢复全局。60 天内 0 次触发的非关键 Skill,只能进入可删除候选,仍需用户再次确认后才能删除。
发布、回滚、安全、隐私等低频关键 Skill 单独加RARE_CRITICAL 标签,不得仅因使用次数低而归档或删除。
这样的调整不会影响日常工作流,还能提升模型的使用效果。这次更新最让人开心的不是新版本拿到了多少个第一,而是它终于将原本只有高端模型才具备的高性能,拉到了日常可用的价位区间。之前高端模型虽然强大,但额度和成本都很高,除非任务非常重要,否则根本舍不得使用,我之前专门做了路由配置,让高端模型只负责纯思考类的任务,才能将每周的API成本控制在3000美元以内。现在新版本的性能已经和高端模型处于同一梯队,但价格却大幅降低,终于可以不用再为了日常使用而舍不得调用高端模型了。

