文章摘要
GPT-6 Astar现已正式发布,用户暂无法直接使用,其定价与Claude Fable5持平,缓存费用更高,支持用户全额使用额度,完成相同任务的Token消耗仅为Opus5的五分之一。本文解析了它多方面的能力升级,同时指出其存在压缩思考过程、延长思考时间的缺陷,作者称下周将推出相关横评。

近期GPT-6 Astar版本正式对外公布,但用户暂时还无法直接上手使用,同时它的定价也调整到了和Claude Fable5持平的水平,而且缓存读取的费用还要更高一些。

值得一提的是,和Claude仅开放Fable5使用50%额度的限制不同,所有用户都可以将100%的可用额度全部用于GPT-6。而且在完成相同任务时,GPT-6的Token消耗仅为Opus5的五分之一,至于最终使用成本能否降低,我们会等下周版本上线后做一期全面的横评对比。

另外还有一个好消息,相关技术支持方加大了重置卡的发放力度,只要当天无法正常使用Astar版本就会发放重置卡,这让不少用户松了一口气。毕竟前一晚GPT、Claude、Grok三款主流模型全部出现宕机,我提前设置的定时任务也全部无法正常运行。

不过事后排查发现,我测试用的五个中转节点里,只有一个能正常调用真实的Claude模型,也算是意外的小收获。

更意外的是,这次三家模型同时宕机的事件,也让另一款AI产品抓住了机会:相关团队放出了免费使用福利,从即日起至20号,用户可以在相关平台免费体验服务,而且核心开发团队也回归了,我打算把之前整理的200多个UI测试用例全部跑一遍。

接下来我们可以先看看GPT-6公开的纸面性能表现:

首先是UI设计能力有了明显提升,从官方技术文档配套的演示PPT来看,它已经可以生成蓝红白三色混合的页面布局。在3D渲染领域,GPT-6还支持在Blender中根据静帧图片快速建模,再通过UE5渲染生成完整的三维场景。

原本就表现出色的电脑操作Codex能力,这次得到了史诗级的增强。之前因为重置卡发放不足,我尝试用Claude来完成电脑自动化任务,结果效果很差,那三天我基本只能纯手动完成上传工作。根据Osworld的测试指标,GPT-6相比5.6版本提升了6.9%,任务完成时间还缩短了47%,这也是我直接把Mac Mini M4升级为Mac Studio的原因之一。

相信GPT-6可以充分利用可用额度,释放更多创作潜力。

还有不少优化更适合让GPT-6长时间运行在独立电脑设备上。当我们提供的信息存在合理推断空间时,GPT-6会自动补充必要的细节,不会再像之前那样,制作PPT时还要反复询问字体、字号、缩进等细节问题。

之前我对AI的可靠性还抱有一些疑虑,翻查了相关测试报告后,我好奇GPT-6还有哪些升级可以让我相信它能准确判断低风险操作,同时完成合理推断。答案就是安全防护能力。

在未开启额外安全防护的情况下,GPT-5.6有48.2%的概率会尝试访问授权范围之外的目标,但GPT-6的这一概率为0%。我认为这个数据如果有水分的话,应该会写成4%或5%,而不是直接写0,否则很容易引发用户的质疑。

不过,大量能力升级也给GPT-6带来了新的版本弱点:它会压缩自身的思考过程。举个例子,GPT-5.6 Sol的思考过程会清晰列出步骤ABCDE再给出最终答案,但GPT-6只会简单写一个“解”字就直接给出结果,而且思考时间反而增加了10倍。OpenAI团队显然也无法接受这种情况,因为思考过程的缺失会让模型的监督难度大幅提升。

不过有压力也不全是坏事,正如Greg Brockman此前公开表态的那样:欢迎来到AGI时代!

虽然今天我已经无数次看到这句话,但每次看到还是会忍不住感到兴奋,嘴角根本压不住。

以上内容不代表本平台立场,仅供读者参考