文章摘要
近期行业交流圈热议网传OpenAI将于年内推出尺寸最大的大模型GPT-6 Astra,刘小排结合行业观察提出相关猜想:该模型编程能力不会有明显提升,科研、Computer Use能力将大幅领先现有模型,现有头部大模型测评榜单在其上线后会失效;另有预告称当日上午10点或可体验该模型,或获得Codex重置卡。

今早刚睁眼就看到GPT-6 Astra的相关讨论刷遍了行业交流圈。据非官方消息,这款模型将是今年内推出的尺寸最大的大模型,不少行业从业者都对其充满期待。目前还没有实际体验过这款新模型,不过结合行业观察到的现象,整理了几个关于它的猜测,等正式上线后可以回头验证。

❶ GPT-6 Astra的编程能力不会有肉眼可见的大幅提升。目前主流大模型的编程能力排行中,多款不同尺寸的模型表现几乎处于同一水平线,其中最典型的例子就是GLM 5.3和Fable 5.1,二者的编程能力差距仅在个位数百分比,但模型尺寸却相差了10倍之多。由此不难得出推论:单纯依靠提升模型尺寸,对编程能力的提升效果非常有限。

❷ GPT-6 Astra的科研能力会大幅领先其他模型。和编程能力的情况不同,不同尺寸的大模型在面向科学研究的AI应用场景中,能力差异表现得十分显著。

❸ GPT-6 Astra的Computer Use能力会大幅领先其他模型。一方面,有公开信息显示,OpenAI此前采购了海量民用级Mac电脑,外界普遍猜测这是为了训练模型的Computer Use相关能力;另一方面,从技术原理来看,Computer Use任务要求模型直接对接真实世界的操作场景,不再局限于传统的纸面答题模式,这会直接考验模型对真实世界知识的掌握程度,而尺寸更大的模型在这方面天然具备优势。

❹ 所有现存的头部大模型测评榜单,包括Artificial Analytics在内,都将在GPT-6 Astra上线后面临失效,直到新一代的针对性测评算法被研发出来。在新的测评体系落地之前,今年剩余的时间里,想要分辨前沿大模型的真实能力,只能依靠用户自身的使用体感以及一线实操人员的反馈来判断。

也欢迎大家在评论区分享自己的看法。

另外还有一则最新预告:今日上午10点,要么可以直接体验GPT-6,或是能够获得一张Codex重置卡,该消息由Tibo分享,相关截图可在评论区查看。

以上内容不代表本平台立场,仅供读者参考