文章摘要
谷歌近期正式发布Gemini 3.8系列两款AI模型,包含面向推理与编程的主力Gemini 3.8 Flash,以及网络安全专用的Gemini 3.8 Flash Cyber,多项基准测试性能领先竞品,成本远低于同类产品,高推理模式单任务仅0.58美元。同日Meta发布同级新模型,AI赛道竞争加剧,谷歌押注模型递归自我改进方向。

在过去六周内,谷歌已经连续推出三款Flash系列模型,迭代速度相当亮眼。近期,谷歌正式发布了Gemini 3.8系列,包含两款全新的AI模型,这也是该公司当前最强的推理与编程类AI产品。

谷歌DeepMind研究员姚顺宇评价称,这次模型发布对于单款模型来说只是一小步,但对于递归自我改进领域而言却是里程碑式的一大步。

本次推出的Gemini 3.8系列包含两款核心模型:

第一款是Gemini 3.8 Flash,作为主力模型,它拥有100万token的上下文窗口,在软件工程、智能体任务以及专业领域的多步推理等关键能力上,相比前代的3.7 Flash都有了全面提升。

第二款则是Gemini 3.8 Flash Cyber,专注于网络安全领域,在漏洞检测和自动修补方面达到了行业前沿水平,将通过全新的Fairwind计划向受信任的防御者开放使用。

两款模型共享同一套基础智能架构,通过长时运行的Agentic loop进一步加速优化。这类循环机制可以递归评估并优化底层模型,让共享核心的编程和推理能力得到了显著提升。

在基准测试方面,Gemini 3.8 Flash的表现十分亮眼:在14项主流测试中,它有8项成绩排名第一,整体表现超过了Claude Opus 5和GPT-5.6 Sol。这些测试覆盖了金融分析、法律工作流、终端代码编写、复杂图表推理、长视频理解、跨学科专家难题以及生物学真实科研任务等多个领域。

在Artificial Analysis智能指数测试中,Gemini 3.8 Flash取得了59分,与GPT-5.6 Sol和Grok 4.6的非最高推理配置持平。

推理成本方面,Gemini 3.8 Flash的高推理模式下,每个智能指数任务成本仅为0.58美元,是同等级智能水平中最便宜的模型;中等推理模式下,单任务成本降至0.41美元;低推理模式下更是仅需0.24美元。

目前Gemini 3.8 Flash采用优惠定价,为每百万输入token 0.75美元、每百万输出token 3.75美元,其标准定价为每100万输入token 1.5美元、每100万输出token 7.5美元。对比来看,Claude Opus 5的定价为输入每百万token 5美元、输出每百万token 25美元,是Gemini 3.8 Flash标准定价的3倍多;GPT-5.6 Sol的定价为输入每百万token 5美元、输出每百万token 30美元,是其3到4倍;Terra定价为输入2.5美元、输出15美元,约为其2倍;Luna定价为输入1美元、输出6美元,相对更为便宜。

目前外网已经有不少开发者体验了Gemini 3.8 Flash。有开发者对比了该模型和Claude Opus 5的海浪模拟器任务:Opus 5耗时24分钟完成,而Gemini 3.8 Flash仅用了37秒,不过Opus 5的成果细节处理更为完善。该开发者对此十分乐观,表示如果给两款模型相同的时间,Gemini在质量上也能彻底碾压Opus 5。

外网AI模型测评博主Lumina使用相同的提示词,在最高配置下分别让Gemini 3.8 Flash、Gemini 3.7 Flash、GPT-5.6 Sol和Grok 4.6生成罗马斗兽场相关内容,她评价称Gemini 3.8 Flash的生成结果最为清爽利落,也是本次测试中质量最好的之一,认为谷歌这次升级表现出色。

在谷歌官宣该模型的推文评论区中,多数用户留言表达了对旗舰Pro版本模型的期待。

几乎与谷歌同时,Meta在今日凌晨发布了Muse Spark 1.3。在Artificial Analysis智能指数排行中,Muse Spark 1.3超越了Gemini 3.8 Flash的高推理模式,仅落后于Claude Fable 5.1和Claude Opus 5。Meta首席AI官Alexandr Wang转发了该发布推文,还调侃称“gemini是谁?”。

实际应用能力展示

谷歌团队在官方博客中分享了多个Gemini 3.8 Flash的实测案例。仅通过一个简单的提示词配合Google Antigravity中的循环指令,该模型就构建出了一款沉浸式3D关卡游戏,融合了谜题元素与环境叙事,还利用Nano Banana生成的纹理,玩家可以在其中扮演巫师探索城堡。

Gemini 3.8 Flash还可以仅凭单个提示词,生成功能完整的可交互DOS版谷歌地图,支持地点查询、路线规划和街景浏览等完整功能。

用户可以借助美国地质调查局的真实数据集,通过Gemini 3.8 Flash构建地形图,并在其中探索实时横截面、2D投影以及相关科学解释。

名为Hardware Anatomy的交互式3D可视化工具同样由Gemini 3.8 Flash构建,它可以生成符合物理尺寸比例的硬件设备拆解图,基于Three.js实现逼真渲染,能够自动将设备分解为多个层级,用户可以通过滑块展开查看各个部分。

在X平台上,大量开发者分享了自己使用Gemini 3.8 Flash的创作成果。中国AI博主Chasen实测了“鹈鹕踩单车”的生成任务,他感叹输出速度极快,仅用10秒就完成了整体代码编写,后续仅为验证和二次输出。不过生成的内容也存在一些小瑕疵,比如鹈鹕的脚没有踩在单车踏板上,自行车框架与车轮存在错位,但整体画面色彩协调,也体现出单车向前行驶的效果。

还有开发者使用该模型生成了纯Three.js实现的DeBerti Design 2019款福特F-250 “Transformer”工作卡车,3D汽车模型的各组件齐全,支持交互操作。

目前,Gemini 3.8 Flash可以通过Google AI Studio、Android Studio或Gemini API直接调用,开发者也可以在Google Antigravity和Stitch中体验智能体工作流。企业用户可以在Gemini Enterprise中使用该模型,订阅了AI Pro或Ultra的普通消费者则可以在Gemini应用、谷歌搜索的AI Mode以及谷歌表格中体验。

基准测试与性能细节

回到基准测试的具体表现,在长周期软件工程基准测试DeepSWE v1.1上,Gemini 3.8 Flash在端到端自主解决复杂工程问题的能力上,超过了多数更大规模的前沿模型,同时成本大幅低于同类产品。

在专业知识领域,Gemini 3.8 Flash在需要高级分析和报告能力的定量及专业场景中,比如Vals Finance Agent V2和Harvey法律智能体基准测试中,表现均优于Gemini 3.7 Flash和其他前沿模型。

在人类最终测试HLE-Verified基准上,Gemini 3.8 Flash取得了54.9%的成绩,证明了其在STEM、人文学科和专业领域中进行多步推理的能力。

在任务完成速度上,高推理模式下Gemini 3.8 Flash的平均输出速度约为每秒300个token,单任务耗时约2.5分钟,略优于GPT-5.6 Luna和GPT-5.6 Terra。低推理模式下,任务耗时缩短至0.8分钟,在“智能水平vs.每任务耗时”的权衡中达到了帕累托前沿。

网络安全专用模型表现

与Gemini 3.8 Flash一同发布的Gemini 3.8 Flash Cyber,专注于网络安全领域。在用于漏洞发现的标准行业基准CyberGym上,该模型超越了GPT-5.6 Sol、Mythos 5和GPT-5.5-Cyber。

谷歌团队还在一个覆盖20种编程语言的复杂代码库的内部全面基准上测试了该模型,其漏洞发现成功率超过70%,相比谷歌前代模型有了大幅提升。

谷歌团队表示,在开发Gemini 3.8 Flash Cyber时,他们优先致力于为防御者赋予专家级能力,让其在面对攻击者时占据主动,因此从一开始就将漏洞修复作为模型的核心投入方向,优先于漏洞利用等攻击性能力。

在外部补丁能力测试CWE-Bench上,Gemini 3.8 Flash Cyber的pass@1达到47.2%,而领先的前沿模型为47.8%,但前者的成本显著更低,同样达到了帕累托前沿。

在实际应用中,谷歌团队已经率先将Gemini 3.8 Flash Cyber应用于谷歌内部代码的安全防护。Chrome安全团队发现,该模型为Chrome漏洞生成正确补丁的数量,是规模更大的顶尖商业模型的2.6倍。Wiz公司在内部渗透测试基准上的评估显示,Gemini 3.8 Flash Cyber的召回率比其他前沿模型高出7.5~9.7个百分点,而成本仅为后者的2.3~5.2分之一。谷歌云漏洞研究团队则利用该模型,在不到2小时内就发现了一个关键的基础性漏洞,而这类漏洞的常规研究和发现通常需要耗费数月之久。

目前,网络安全领域的受信任机构,包括政府、关键基础设施相关单位等,需要通过Fairwind计划单独申请访问Gemini 3.8 Flash Cyber。

行业竞争与未来方向

谷歌在六周内连续推出三款Flash版本更新,迭代速度之快令人瞩目。不过在快速迭代的背后,用户对于旗舰级Pro版本模型的期待依然强烈。与此同时,Meta也在同日发布了Muse Spark 1.3,不难看出AI模型赛道的竞争愈发激烈。

对于谷歌而言,如何平衡发布节奏、满足不同用户群体的需求,并在激烈的市场竞争中持续保持技术领先,仍是需要长期关注的课题。值得注意的是,谷歌DeepMind研究员姚顺宇的评价或许暗示了谷歌真正押注的方向,可能并非某一款具体的模型,而是让模型能够自我迭代、自我进化的底层递归改进能力。

以上内容不代表本平台立场,仅供读者参考