文章摘要
中秋国庆假期前,全球头部大模型厂商集体冲刺,密集推出或测试新旗舰基模,开启节前行业竞争。海外Anthropic、谷歌、xAI均有新品相关动作,国内阶跃星辰已发布新一代旗舰Step 5 Preview,Kimi、DeepSeek、阿里通义千问也透出新品信号,行业竞争进一步加剧。

中秋国庆连放的13天假期,或许会成为今年AI大模型领域最热闹的时段——全球各家厂商都在节前憋足了劲推出新模型,一场围绕旗舰基模的竞争已经悄然打响。不管是已经官宣的新模型,还是处于灰度测试阶段的版本,或是藏在文档里的彩蛋,几乎所有头部玩家都加入了这场节前的冲刺。

硅谷玩家集体追赶GPT-6 Astra

最先有动作的是Anthropic,也就是被称为A社的团队。据行业观察消息,他们正在筹备推出新一代旗舰模型,目前社区呼声最高的版本是Claude Opus 5.2和Fable 5.2,相关的灰度测试信号已经在开发者社区流传了一段时间。

最早的线索来自Claude Code的使用体验,有开发者反馈,明明选择的是Opus 5,但在处理复杂任务时,模型的表现和此前版本有明显差异。随后更多开发者发现,原本调用Fable 5.1的请求,被后台静默重定向到了新版本。

有开发者在高推理模式下实测后发现,这个新版本的输出质量明显优于刚发布的GPT-6 Astra,不过代价是推理速度更慢,单次调用的成本也更高。

最具戏剧性的是9月17日晚间的灰度测试变动:Anthropic突然切断了代号为Opus-Next的内部测试版本的灰度测试通道,活跃测试账号一度归零,引发了开发者社区的不小波动。但仅仅一天之后,灰度测试就重新上线,测试范围还从Claude Code扩展到了Chat和Cowork两个产品线。

从市场格局来看,OpenAI月初发布的GPT-6 Astra已经拿下了约13%的企业AI支出份额,而Anthropic的Claude Fable占比约为8%。在即将迎来IPO的节点,Anthropic放出新一代模型的风声,显然是为了抢回市场叙事的主动权。

谷歌的动作则更加隐蔽,最近在AI测试平台Arena里出现了一个名为gemini-3.8-flash的模型,看起来只是普通的轻量版本,但不少测试者很快发现它的表现完全不像Flash系列。

社区成员一致推断,这个模型很可能是下一代旗舰Gemini 4 Pro的隐身测试版,内部代号流传为Argon。随后出现的一系列测试Demo,更是直接拉高了相关讨论的热度。

比如AI圈经典的“鹈鹕骑自行车”测试,这个疑似Gemini 4 Pro的版本不仅画出了鹈鹕和自行车,还进一步生成了带有踩踏动作、光照变化和完整控制组件的交互式网页,复杂度远超普通的3.8 Flash版本。

还有用代码生成细节丰富的PS5矢量图的测试,模型花费约10分钟就完成了一套带有复杂曲线、阴影和机身结构的PS5图形,测试者评价这是自己从AI模型中拿到过的最惊艳的输出之一。

体素宝塔的测试中,模型直接生成了包含多层宝塔、地形、树木和周边环境的完整3D场景,还保留了视角切换和灯光控制功能,相比此前的测试版本,几何结构和场景完整度都有了明显提升。

另一个传播较广的测试是根据极简提示词“画一只侧视的家猫”生成SVG图形,测试者将这个结果和GPT-6 Astra Max、正式版Gemini 3.8 Flash放在一起对比,从轮廓、四肢比例和空间关系来看,这个隐身测试版的表现都更为出色,相关对比图在社区获得了大量点赞。

后续的测试已经从SVG图形扩展到了完整网页和互动小游戏,有网友用它生成了“奥特曼骑哥斯拉打怪兽”的互动页面,支持鼠标点击发射激光和加速功能,展示出了极强的多模态生成和交互设计能力。

虽然谷歌尚未官宣这个隐身测试版是否就是Gemini 4 Pro,但从密集的测试频率和出色的表现来看,下一代Gemini旗舰模型已经离正式发布不远了。

马斯克的xAI团队也没有落下节奏,此前有网友在社交平台询问Grok 4.7的开发进度,马斯克直接回复称“Grok 4.7 needs a few more days to cook”,按照时间推算,新版本应该就在这几天就能和大家见面。

参考马斯克过往的发布风格,他通常会等待其他厂商先推出新模型之后再跟进,主打一个“黄雀在后”的策略,这次或许也会延续这个节奏。

国内厂商的节前冲刺

国内的大模型厂商也在假期前密集放出了新动作,不少团队已经提前抢跑。

首先是阶跃星辰,突然发布了新一代旗舰模型Step 5 Preview。这款模型采用稀疏MoE架构,总参数量达到600B,激活参数量为27B,支持百万Token的上下文窗口,并且针对编程、Agent和专业知识工作等真实场景进行了专项优化。

在全球权威的Artificial Analysis Intelligence Index榜单中,Step 5 Preview取得了44分,位居全球开源模型前三,而且单任务的推理成本仅为Claude Opus 5的1/8,性价比优势明显。

几乎在阶跃星辰发布新版本的同时,Kimi也通过官方账号放出了一串数字谜题:415926535897932384626433832795……熟悉圆周率的开发者很快反应过来,去掉开头的3.1之后,剩下的数字刚好和这串内容吻合,这显然是在暗示即将推出的K3.1版本。当然也有网友调侃称,这或许意味着Kimi并不会推出3.1版本,而是直接更新到更高的版本号。

除了Kimi,DeepSeek也早早埋下了新版本的彩蛋。在9月10日发布DeepSeek V4.1 Flash的时候,官方文档就明确提到,在V4.1 Pro正式上线之前,部分V4 Pro的请求会被路由到V4.1 Flash进行测试。这意味着V4.1 Pro已经基本确定存在,只差正式发布的时间点。

按照DeepSeek过往的发布节奏,轻量版本和旗舰版本通常不会间隔太久,此前V4系列发布时,Flash版本和Pro版本基本同步亮相。更早的版本迭代中,轻量版本先行之后,旗舰版本往往会在数周内跟进。再加上即将到来的假期,“假期即发布”的戏码或许会再次上演。

阿里的通义千问也提前亮出了Qwen4的底层架构。在8月底开源Qwen3.8-Flash-Next的时候,官方就明确说明,这个版本就是Qwen4底层架构的早期预览版,之所以提前开放架构供社区测试,就是为了在完整的Qwen4系列构建完成之前收集社区反馈。这也意味着Qwen4已经进入了最后的测试阶段,距离正式发布已经不远了。

目前,太平洋两岸的大模型厂商都已经严阵以待,就看谁能率先打出自己的底牌。不管是有新模型要发布的团队,还是没有更新计划的从业者,这个假期或许都需要加班准备——AI领域的竞争只会越来越激烈,要么推动技术迭代,要么跟上行业节奏,这或许是每个从业者都无法避免的挑战。

十一假期即将到来,你准备好迎接这场基模决战了吗?

以上内容不代表本平台立场,仅供读者参考