文章摘要
国庆假期第一天凌晨,谷歌发布全新旗舰AI模型Gemini 4 Argon,填补了Gemini系列高端型号空白。该模型在18项行业基准测试中13项排名第一,多项性能优于GPT-6与Claude Opus,幻觉率低,输出上限达百万token,定位长程复杂专业任务,目前仅对首批可信用户开放,后续将逐步放开权限。

国庆假期的第一天凌晨,不少人还在睡梦中时,一款全新的旗舰AI模型正式登场。这款由谷歌推出的Gemini 4 Argon,凭借远超竞品的各项测试成绩,迅速成为AI行业的焦点话题。

根据官方公布的18项基准测试结果,这款模型的表现堪称亮眼——12项拿下独占第一,1项并列第一,剩余的测试中,GPT 6 Astra拿下3项,Claude Opus 5.5仅拿下2项。其中在真实软件工程任务测试DeepSWE v1.1中,它以77.9%的准确率位居全球第一,Vals Index、AutomationBench两项测试也同样斩获头名。

此次发布也标志着谷歌再次回归人工智能领域三大顶尖实验室的阵营。值得一提的是,Gemini 4 Argon是Google DeepMind七个多月以来推出的首款高于Flash级别的自研模型,填补了该系列高端型号的空白一段时间。

在推理能力方面,这款模型达到了目前行业最高级别,在人工智能分析智能指数(AII)中拿到53分,与GPT-6 Astra持平,比GPT-6.1 Sol高出1分,得分提升的核心原因在于更低的幻觉率和更强的自主决策能力。在AA-Omniscience测试中,它的幻觉率仅为15%,是所有智能指数得分45分以上的模型中最低的。

输出上限也从之前的64K直接拉到100万token,位居业界第一,支持文本、图像、视频和语音输入,仅输出文本内容。API定价方面,标准档位为每百万输入/输出令牌4美元/20美元,目前有50%的优惠,实际售价为2美元/10美元。缓存输入令牌还可享受95%的折扣,折合每百万0.10美元,比Gemini 3.8 Flash的90%折扣力度更大。

智能体性能一直是Gemini系列的短板,但Gemini 4 Argon在各项智能体评估中都实现了突破。在AutomationBench-AA测试中,它以77.5%的成绩位居第一,比Claude Sonnet 5.5的最高分71.3%高出6个百分点。第三方评测机构Artificial Analysis的相关数据也印证了这款模型的实力。

Gemini 4 Argon的核心定位是长程复杂任务,包括软件工程、金融与法律知识工作、网络安全防御等领域。数千名谷歌员工都肯定了它在专业编码、深度研究和高质量写作方面的优势。

谷歌官方还公布了多个实际落地案例:比如帮助量子计算研究人员优化限制应用性能的子程序时空资源,仅用几分钟就将性能提升了40%,超过了已发布的基准水平;内部团队用它进行内存优化,通过分析整个集群的遥测数据,自主识别并应用数据中心的内存优化方案,一旦落地即可释放超过300TiB的内存,预计总共节省500TiB到1PiB的内存资源;在大规模代码库迁移项目中,团队正在将谷歌各部门的C/C++代码迁移到Rust,迁移规模从re2、libgav1等核心库的数万行,到Fuchsia Zircon内核的80多万行不等,如此体量的代码迁移对模型能力是极大的考验。

不过目前大部分用户还无法使用这款模型,首批仅开放给可信网络安全防御者,后续才会向付费API用户和AI Ultra会员开放。不少开发者都期待能够尽快拿到测试权限,亲身体验这款旗舰模型的实力。

作为关注AI行业的从业者,笔者也注意到一个有趣的现象,不少大厂都喜欢选择在中国的节假日发布新的AI模型,这次谷歌也不例外。国庆假期本该是休息的时间,却要熬夜关注新模型的跑分数据,多少有些无奈。不过吐槽归吐槽,谷歌这次确实拿出了实打实的硬货,各项落地成果都是在自身业务中跑出来的真实数据,并非纸面宣传。

当然,跑分数据看看就好,官方宣传的亮眼表现,在第三方评测中也仅与GPT 6 Astra打平,实际使用手感还是要等正式开放后才能见分晓。笔者也计划在模型正式开放后,第一时间用真实项目进行实测,后续会给大家带来详细的体验报告。其实大厂之间的竞争越激烈,普通用户就能越早享受到更优质的AI服务,也期待这款模型能够带来更多惊喜。

你觉得Gemini 4 Argon能够打得过Claude Opus 5.5吗?欢迎在评论区交流讨论。

以上内容不代表本平台立场,仅供读者参考