文章摘要
谷歌沉寂近一年后,为应对竞品密集升级推出新一代旗舰AI模型Gemini 4 Argon。该模型支持百万Token输出,成本较同类竞品减半,多项核心评测性能领跑,在网络安全、复杂长周期任务中优势突出,目前仅对经审核的部分网络安全团队开放。谷歌高管公开站台,但内部对其实际表现存在争议,实际效果有待市场验证。

沉寂近一年后,谷歌终于推出了新一代旗舰AI模型Gemini 4 Argon。这款产品的登场,正是对近期竞品密集升级的直接回应——就在此前一周,多家厂商接连推出多款旗舰模型,给谷歌带来了不小的竞争压力。

Gemini 4 Argon在推出之初就展现出极强的竞争力:单项任务的最低成本可至1.99美元,仅为部分竞品的一半左右;同时它支持最高百万Token的输出上限,能够适配编程、金融、法律等复杂的长周期工作流,其网络安全防御能力更是被官方重点强调。不过目前这款模型还未面向普通用户开放,仅对经过筛选的部分网络安全团队开放使用,其他订阅用户需要等待后续逐步解锁权限。

谷歌多位核心管理层对这款新模型给予了高度认可,包括首席执行官、DeepMind创始人以及团队核心接班人,都公开站台并高呼“谷歌is back!”。同时有相关研究人员在社交平台发帖调侃:“RSI来了!我已做无可做,是时候追逐我的咖啡师梦想了:)”

多项核心评测领跑

从官方公布的跑分数据来看,Gemini 4 Argon在多个权威评测中都取得了优异成绩。在衡量长期软件工程任务的DeepSWE v1.1测试中,它拿到77.9%的得分,高于同类竞品的平均水平;在网络安全漏洞修复测试CWE-bench v1中,它以68%的成绩与头部模型并列第一。

在综合性能评测中,Argon以68.90%的成绩登顶榜首,相比上一代的Gemini 3.8 Flash实现大幅提升;其中专项指数更是跃升至第四位,超越了多款主流旗舰模型。

在第三方独立评测中,Gemini 4 Argon同样表现亮眼:在文本综合评测中,它凭借在代码编写、高难度提示词处理、指令遵循、长查询处理以及创意写作等赛道的突出优势,位居第一;在针对网页开发的专项评测中,它排名较上一代提升明显,但仍略逊于最新的头部模型。

在第三方分析评测中,Argon与头部竞品旗鼓相当,性能提升主要来自于更少的幻觉问题和更强的智能体能力。

极具竞争力的成本优势

相比同类旗舰模型,Gemini 4 Argon的价格优势十分明显。在优惠期间,单题成本约低四成,具体定价为每百万输入Token 2美元,每百万输出Token 10美元,是当前市场上性价比最高的旗舰模型之一。

适配复杂工作流的实际能力

Gemini 4 Argon的定位是处理复杂且长期的深度推理任务,包括软件工程、企业专业知识梳理以及网络安全防御等。其百万Token的输出上限,能够为模型提供充足的连续工作空间和推理深度,支持更长周期的复杂任务。

谷歌内部已经在多个场景中测试了这款模型:在数据中心场景中,Argon自主识别并落地了内存优化方案,待全面部署后预计可释放超过300 TiB的内存资源;在另一个案例中,Argon Agent围绕视频解码器的Rust移植版本进行了反复实验,替换了3.2万行SIMD代码,最终版本的运行速度达到原Rust移植版的2.7倍。

突出的网络安全防御能力

官方重点强调了Gemini 4 Argon在网络安全领域的优势:它能够自主发现、验证并修补20多种语言的关键软件漏洞。在内部黑箱渗透测试中,这款模型可以在没有源代码的情况下实时分析网络系统,高效识别攻击面、发现漏洞并生成概念验证证据。

为了防止模型被滥用,Gemini 4 Argon首批接入了谷歌的专项计划,仅面向经过审核的网络安全防御团队开放。对于这些受信任的团队,谷歌会放开针对网络安全任务的部分限制,帮助防守方进行漏洞修复和攻击入口查找。

内部争议与未来展望

尽管官方和部分高管对Gemini 4 Argon给予了高度评价,但谷歌内部对于这款新模型的态度并非完全一致。有接触过这款模型的员工认为,它在实际编程任务中的表现并没有跑分数据那么亮眼,部分场景仍是其短板,甚至存在过度刷榜的嫌疑;而另一位熟悉开发工作的员工则表示,内部普遍认为这款模型已经达到了行业前沿水平,相关质疑的说法并不准确。

总体来看,Gemini 4 Argon的实际表现还有待市场和用户的进一步验证,但不可否认的是,谷歌终于再次回到了AI旗舰模型的竞争牌桌之上,这也将推动整个行业的技术迭代和竞争升级。

以上内容不代表本平台立场,仅供读者参考