文章摘要
7月21日,海外科技厂商推出Gemini系列三款新模型,其中3.6 Flash主打特定场景。第三方评测显示,其与3.5 Flash智力指数均为50,但平均任务耗时减半,运行效率提升。此次升级聚焦效率,后续需验证答案准确性等,能否转化核心价值待察。

近期海外科技厂商推出了Gemini系列大模型的全新升级,7月21日一口气发布了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。其中3.6 Flash主打代码开发、多模态推理与多步骤智能体工作流场景;3.5 Flash Cyber则仍处于限量试点阶段,仅通过CodeMender向政府和受信任合作方开放。

看到3.6这个版本号,不少人第一反应是这次升级应该会进一步提升模型的智能表现。但结合官方公告和第三方独立评测结果来看,最亮眼的并非推理能力,而是每秒304个token的输出速度,以及一个更值得关注的数字:50。

第三方评测对比显示:Gemini 3.6 Flash与3.5 Flash的智力指数同为50,平均任务耗时却从2.7分钟降至1.3分钟

该评测用9组涵盖推理、知识、代码和智能体任务的内容构建了智力指数体系,在相同的高推理档位下,两代Flash模型得分完全一致。这当然不能等同于通用智商测试,也无法覆盖所有任务场景,但从3.5到3.6的版本迭代,综合得分毫无提升,还是让不少人感到意外。

不过更直观的变化是任务耗时的大幅缩短:从2.7分钟降到1.3分钟,相当于运行速度提升了一倍。这意味着即便核心推理能力没有明显变化,模型的运行效率已经得到了实打实的优化。

官方公布的代码、机器学习研究和界面操作成绩确实有小幅提升,但并未实现全面跃进。3.6 Flash的输出速度达到每秒304个token,官方还提到该模型在第三方评测指数中的输出token数量减少了17%,同时输出价格从每百万token9美元下调至7.50美元。

按照第三方评测的任务组合折算,平均单任务成本也从0.59美元降到了0.50美元。综合得分、耗时、token使用量和价格来看,这次升级的核心方向非常明确:把研发重点放在了缩短等待时间、减少输出token消耗以及降低使用成本上。

在普通聊天场景中,这种速度提升可能只是让用户少等几十秒,但如果应用在需要规划步骤、调用工具、失败重试的智能体工作流中,1.3分钟和2.7分钟的差异会随着每一轮任务执行不断累积。即便模型智能水平没有大幅跃升,仅仅是更快完成每一步操作、减少不必要的绕路,就已经具备很强的实用价值。

速度升级后的核心考验

当模型的输出速度不再是瓶颈之后,接下来真正需要验证的,是答案的准确性、稳定性以及事实新鲜度是否同步得到保障。

有用户发布的测试截图显示,模型界面标注的知识截止时间为2026年3月,但模型却将多款已发布产品回答为“尚未发布”或“不存在”

当然,这只是一位用户的单次测试,无法作为评判3.6 Flash整体质量的最终依据,但这个测试恰好点出了关键问题:如果模型只是更快给出结果,却在事实准确性和信息新鲜度上出现偏差,那么之前节省的等待时间就失去了意义。

因此在现阶段来看,我们更应该将Gemini 3.6 Flash看作一次效率升级,而非已经得到验证的“智能升级”。它没有在综合评测榜单上拉开代际差距,但直接将用户的等待时间砍掉了一半。

对于命名为Flash的模型来说,这种聚焦效率的升级方向,相比单纯提升几分评测得分要更加务实。接下来最值得观察的,就是在真实的智能体工作流场景中,这款模型能否将“更快交卷”的优势,逐步转化为“更快交对卷”的核心价值。

以上内容不代表本平台立场,仅供读者参考