GPT-6 Astra要来了?刘小排谈三大能力猜想及今日预告

今早刚睁眼就看到GPT-6 Astra的相关讨论刷遍了行业交流圈。据非官方消息,这款模型将是今年内推出的尺寸最大的大模型,不少行业从业者都对其充满期待。目前还没有实际体验过这款新模型,不过结合行业观察到的现象,整理了几个关于它的猜测,等正式上线后可以回头验证。
❶ GPT-6 Astra的编程能力不会有肉眼可见的大幅提升。目前主流大模型的编程能力排行中,多款不同尺寸的模型表现几乎处于同一水平线,其中最典型的例子就是GLM 5.3和Fable 5.1,二者的编程能力差距仅在个位数百分比,但模型尺寸却相差了10倍之多。由此不难得出推论:单纯依靠提升模型尺寸,对编程能力的提升效果非常有限。
❷ GPT-6 Astra的科研能力会大幅领先其他模型。和编程能力的情况不同,不同尺寸的大模型在面向科学研究的AI应用场景中,能力差异表现得十分显著。
❸ GPT-6 Astra的Computer Use能力会大幅领先其他模型。一方面,有公开信息显示,OpenAI此前采购了海量民用级Mac电脑,外界普遍猜测这是为了训练模型的Computer Use相关能力;另一方面,从技术原理来看,Computer Use任务要求模型直接对接真实世界的操作场景,不再局限于传统的纸面答题模式,这会直接考验模型对真实世界知识的掌握程度,而尺寸更大的模型在这方面天然具备优势。
❹ 所有现存的头部大模型测评榜单,包括Artificial Analytics在内,都将在GPT-6 Astra上线后面临失效,直到新一代的针对性测评算法被研发出来。在新的测评体系落地之前,今年剩余的时间里,想要分辨前沿大模型的真实能力,只能依靠用户自身的使用体感以及一线实操人员的反馈来判断。
也欢迎大家在评论区分享自己的看法。
另外还有一则最新预告:今日上午10点,要么可以直接体验GPT-6,或是能够获得一张Codex重置卡,该消息由Tibo分享,相关截图可在评论区查看。

