文章摘要
谷歌近期更新推出Gemini 3.8 Flash,这是其四个月内发布的第四款Flash支线大模型,距上一版本仅隔三周。该模型API定价不变,同步推出仅对审核通过安全机构开放的网络安全专用版;它在金融、法律等专项测试表现突出,性价比、输出速度优势明显,但偏科明显,复杂场景存在短板,评价呈两极,目前已跻身中端大模型第一梯队。

作为Transformer的发明者,拥有自研芯片、搜索引擎的顶级科技公司,谷歌在大模型赛道的Pro系列迟迟没有更新,反而在Flash支线模型上动作频频。四个月内已经推出四款Flash模型,就在不久前,Gemini 3.8 Flash正式发布,距离上一代3.7版本仅隔三周,距离3.6版本也只有六周时间。

本次更新的API定价保持不变,输入每百万tokens收费0.75美元,输出为3.75美元。同时推出的还有网络安全专用版本Gemini 3.8 Flash Cyber,仅对通过审核的安全机构开放,普通用户暂无法使用,这一做法被认为是效仿了同行Anthropic的策略。

谷歌本次将Gemini 3.8 Flash与顶级模型Claude Opus 5、GPT-5.6 Sol放在同一对比维度中展示性能。在DeepSWE v1.1测试里,该模型得分73.7%,反超GPT-5.6 Sol,仅略低于Claude Opus 5的74.0%。谷歌还基于该测试绘制了大模型斩杀线,左下区域为被超越的其他模型。

还有多项测试中Gemini 3.8 Flash拿下全场第一,不少业内人士合理怀疑这其实就是迟迟未发布的Gemini 3.5 Pro。金融智能体测试Vals Finance Agent v2中,该模型拿到61.4%的最高分,远超Claude Opus 5的58.6%;法律智能体测试Harvey Legal Agent Benchmark中以10.0%的成绩领跑,Claude Opus 5仅为6.7%;多学科专家推理测试HLE-Verified中,Gemini 3.8 Flash以54.9%的成绩微弱领先,GPT-5.6 Sol和Claude Opus 5分别以54.5%和54.4%紧随其后,三家几乎打成平手。

谷歌在展示中特意强调了定价差异:Claude Opus 5的输入和输出价格分别为5美元和25美元每百万tokens,Gemini 3.8 Flash的价格仅为其七分之一左右,但在金融、法律赛道的表现反而更出色。


不过作为Flash系列模型,其在复杂场景下的表现仍有明显短板。在Terminal-bench 4.0的复杂终端编程测试中,Gemini 3.8 Flash的准确率仅为19.1%,而Claude Opus 5达到51.8%,差距接近两倍。知识工作综合评分GDPVal-AA v2中,Gemini 3.8 Flash得分为1545,低于Claude Opus 5的1824;计算机操控测试OSWorld 2.0中,该模型为59.0%,同样不及Claude Opus 5的75.4%。整体来看,Gemini 3.8 Flash的表现偏科明显。


在最新的大模型排行榜中,Gemini 3.8 Flash综合得分59分,较前代提升3分,已经跻身中端模型的第一梯队。

除了性价比优势,该模型的token输出速度也十分亮眼,每秒可达305个token,排名行业第一。第二名Meta的Muse Spark 1.2仅为154个,Claude Fable 5.1为66个,Claude Opus 5仅56个。不过有开发者发现,Gemini 3.8 Flash完成相同任务的token消耗量几乎是3.7版本的两倍,有业内人士指出,Claude Opus 5完成同类任务的token消耗仅为该模型的四分之一,单纯比较输出速度并不完全公平。

谷歌官方也承认,Gemini 3.8 Flash在复杂任务中会花费更多思考时间,执行更多推理步骤,更频繁调用工具,本质上并没有变得更聪明,只是思考过程更长。


网友对这款模型的评价呈现两极分化。支持的开发者表示,使用Gemini 3.7 Flash时就发现其表现可以和顶级模型抗衡,且速度更快,编程体验流畅,不会出现过度纠正用户的情况,甚至有用户将其作为无广告、无SEO垃圾内容的搜索工具使用。

但质疑的声音也不少,不少用户指出该系列模型存在较强的刷榜嫌疑,幻觉问题仍然突出,长上下文表现不佳,还有开发者翻看DeepSWE测试历史后,怀疑该基准测试存在数据污染的问题,认为每次新模型发布都在该指标上表现突出,合理性存疑。


玩笑归玩笑,结合谷歌近期推出的相关会员活动,Gemini Flash系列的性价比确实十分突出,值得关注。

以上内容不代表本平台立场,仅供读者参考