谷歌Gemini 3.8 Flash发布 代码追平旗舰性价比拉满

谷歌近日正式推出Gemini 3.8 Flash版本,当前定价保持不变,每百万token的输入费用为0.75美元,输出费用为3.75美元。该版本将推出首发半价优惠,2027年起将恢复至输入1.5美元、输出7.5美元的标准定价。
这已经是谷歌六周内推出的第三个Flash系列版本:7月21日发布3.6版本,8月13日推出3.7版本,此次3.8版本的更新间隔平均仅两周左右,迭代速度相当迅猛。
此次官方公布的跑分对比直接瞄准了行业内的两款旗舰模型——Claude Opus 5与GPT-5.6 Sol,表现超出不少预期。在代码能力方面,Gemini 3.8 Flash与Opus 5打成了平手:在DeepSWE榜单上两者通过率分别为73.7%和74.0%,Terminal-bench 2.1榜单上则是89.4%对89.1%。
DeepSWE是第三方数据机构Datacurve推出的编程能力评测榜单,题目全部来自91个真实开源仓库,共计113道需要模型自主读取、修改代码并跑通测试的任务。在该机构的实测中,Gemini 3.8 Flash与Opus 5的最终通过率均达到74%,并列榜单首位。
值得注意的是,两款模型虽然得分相近,但使用成本差距悬殊。完成同一批测试任务,Gemini 3.8 Flash平均每道题花费2.36美元,而Opus 5则需要11.84美元,两者成本相差五倍之多。Datacurve将评测分数与单题成本结合绘制的性价比图表中,Gemini 3.8 Flash直接占据了右上角的最优位置,是全场效率最高的模型,甚至超越了主打性价比的GLM-5.3。
回顾过去四个月,谷歌的Flash系列模型进步显著:从3.5版本的35%通过率,一路提升到3.8版本的74%,已经追平了Opus 5的代码能力表现,更关键的是,这几代更新几乎没有提升单题的使用成本,这一进展依然相当震撼。
除了DeepSWE和Terminal-bench 2.1这两个代码评测榜单外,Gemini 3.8 Flash在金融Agent和法律Agent专项任务中还实现了反超,表现优于两款旗舰模型。不过,双方的差距并没有完全抹平。
在评估长程任务能力的Terminal-bench 4.0榜单中,Gemini 3.8 Flash的表现与旗舰模型仍有较大差距:Opus 5的通过率达到51.8%,而3.8版本仅为19.1%。综合智力方面,在Artificial Analysis的通用智力榜单中,该模型排名第八,得分为59分,与Kimi K3、GLM-5.3处于同一档位,仅比GPT-5.6 Sol低2分。
作为一款综合排名第八的模型,代码能力却能对标行业第二,Gemini 3.8 Flash显然是针对性强化了代码相关的能力。根据模型卡信息,3.8版本是在3.7 Flash的基础上继续进行后训练得到的,底座模型并未更换;往前追溯,3.6和3.7版本同样采用了这一迭代路径。历代模型卡的知识截止日期都停留在2025年1月,说明谷歌自那之后没有进行过新的底座预训练,这三代Flash版本都是基于同一底座通过针对性后训练打磨出来的,而3.8版本更是将优化重心完全放在了代码能力上,这也解释了为何其代码表现突飞猛进,但综合智力和长程任务能力提升有限。
后训练的优化效果依然惊人。
近段时间,Gemini 3.8 Flash已经进行了多轮灰度测试。参与测试的用户给出了两类截然不同的反馈:一部分用户对其评价颇高,最认可的是响应速度快和指令执行严谨,模型会严格按照用户的要求完成任务,不会像部分其他模型那样自作主张调整需求,成品质量也符合预期。
不过,长时间运行代码任务时,也有用户提出了负面评价:该模型的代码生成风格过于激进,交付速度快但遗留的bug较多。实测数据显示,Gemini 3.8 Flash的token消耗量比3.7版本有明显提升:在同一套高难度评测任务中,3.7版本仅使用了6400万token,而3.8版本的token用量达到了1.2亿,接近翻倍。有用户在社区反馈,该模型的思维链长度也有明显增加,相当于用更多的计算资源换取了代码能力的提升。
谷歌官方也在迁移指南中承认了这一点,表示如果应用场景优先考虑算力效率,可以选择降档使用,或者继续沿用3.7 Flash版本。
回顾此前的产品规划,谷歌原本计划推出的Gemini 3.5 Pro已经从五月推迟到了九月,一拖再拖之下,官方干脆将下一代Pro版本更名为Gemini 4。在正式的Pro版本推出之前,谷歌选择用Flash系列模型顶上去参与市场竞争,并且拿出了相当亮眼的表现。
去年七月3.6版本发布时,评论区还曾有不少关于谷歌模型退化的调侃,而此次3.8版本推出后,不少用户都发出了“Google,我们回来了”的感慨。

