AI行业动态:智谱算力、开源冲突、Kimi K3与DeepSeek融资

在母公司Alphabet发布季度财报的前一日,谷歌突然推出了三款全新的Gemini系列模型,全部归入主打「高效、低成本」的Flash产品线,核心目标是优化智能体工作流的运行效率,同时降低Token消耗,整体策略清晰地将运行效率放在了绝对性能之上。
就在此前一周,多家头部AI厂商已经接连推出了新一代模型:xAI的Grok4.5、OpenAI的多版本GPT-5.6、国内头部AI厂商的Kimi K3相继亮相,Anthropic的Fable5更是登顶了多个权威榜单。在这场被业内称为「全面超车的盛夏」的AI模型竞赛中,谷歌此次的回应显得格外直接——用更具性价比的低价模型抢占市场。
牺牲峰值性能,换取效率和更低的价格
根据谷歌官方说明,全新的Flash系列旨在通过更强的基础能力与更高的性价比,加速AI智能体的开发落地。本次发布的三款模型分别为Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全场景定制的Gemini 3.5 Flash Cyber。
作为系列中的主力旗舰款,Gemini 3.6 Flash主打性能与效率的平衡。谷歌表示,相比前代产品,该模型的知识截止时间更新至2026年3月,在编程、知识型任务以及多模态推理能力上均有小幅提升,同时将平均输出Token消耗降低了17%。在部分实际场景中,它相比旧款3.5 Flash最多可减少65%的输出Token——在当下AI应用精打细算Token成本的行业环境下,这一优化成为了极具吸引力的卖点。通过压缩中间推理步骤与工具调用流程,该模型显著降低了多步骤AI工作流的整体运行成本。在基准测试表现上,Gemini 3.6 Flash在代码修改准确率、机器学习研究、计算机操作、文档解析以及报告生成等任务中均有明显进步。包括Heavia和Harvey在内的企业客户反馈显示,在视觉处理、图表分析和数据提取等多模态任务中,模型的实际表现得到了显著增强。
不过值得注意的是,该模型的定价优势并不算特别突出:输入价格为每百万Token1.50美元,输出价格从每百万9美元降至7.5美元,整体价格与Grok4.5、GPT-5.6大致持平。在多数关键基准测试中,Gemini 3.6 Flash的表现落后于Anthropic的Claude Sonnet5以及OpenAI的GPT-5.6,甚至在智能体编程这类高商业价值的任务上,已经被最新的Grok4.5拉开了差距。这也让它在激烈的市场竞争中找到精准定位的难度不小。
Gemini 3.5 Flash-Lite则是系列中「最快、最具性价比」的型号,主要面向高吞吐的智能体搜索和大规模文档处理场景。该模型每秒可生成350个Token,和3.6 Flash一样,在延续前代性能的基础上进一步提升了整体运行效率。谷歌官方数据显示,Flash-Lite在多个代理和编程基准测试中击败了旧款3 Flash,包括SWE-Bench Pro和OSWorld-Verified;和其直接前身3.1 Flash-Lite相比,终端工作台2.1评分从31%提升至54%。其定价更为亲民:输入为每百万Token0.30美元、输出为每百万2.50美元,能够为高负载的企业级应用提供极具竞争力的成本解决方案。
两款通用模型背后,谷歌押注的核心战略判断十分明确:绝大多数AI使用场景,并不需要「前沿级的顶级大脑」,而是一个足够快、足够便宜的通用模型。今年早些时候,谷歌CEO Sundar Pichai就曾公开表示,「企业已经在透支全年的Token预算,而现在才仅仅5月」,他在采访中提到,组合使用Flash系列模型,每年可以为企业节省超过10亿美元的AI使用成本。目前,Gemini 3.6 Flash和3.5 Flash-Lite已经面向Gemini企业用户以及Gemini应用用户开放,3.5 Flash-Lite也将在不久后接入Google搜索。
对标Mythos的「平价替代」,但有严格限制
本次发布中最具针对性的型号,当属面向网络安全场景定制的Gemini 3.5 Flash Cyber。该模型基于Gemini 3.5 Flash打造,专门针对网络安全任务优化,用于自动化发现和修复软件漏洞。谷歌将其集成进了Google DeepMind的代码安全智能体CodeMender中,该系统由多个Flash Cyber子智能体并行运行,并将结果汇总成一份统一的安全报告,是谷歌进军网络安全专用AI模型的一次重要尝试。
谷歌将Flash Cyber定位为大型安全模型的「高性价比替代方案」,声称其在关键基准测试中可以达到前沿模型的水平,但成本仅为其的一小部分。在CyberGym基准测试中,该模型取得了83.2%的成绩,仅比OpenAI的GPT-5.5-Cyber(85.6%)低约2个百分点,尽管其模型规模要小得多。值得注意的是,CyberGym是目前少数包含竞品模型对比的基准测试之一,各模型的分数差距非常接近,而谷歌的优势主要体现在更低的Token成本上。
在实际测试中,Google云漏洞研究团队利用该模型扫描公开API,仅用两小时就发现了远程代码执行漏洞,并生成了可绕过安全防护的有效利用代码。在真实应用场景中,Google的Big Sleep团队使用该模型检测Google Chrome和Safari中的关键漏洞,其表现超过了标准Flash模型以及Anthropic的Claude Opus4.6:在扫描V8 JavaScript引擎的代码提交时,Flash Cyber发现了55个已确认的独立问题,而标准3.5 Flash仅发现47个,Opus4.6则发现36个,其中有10个漏洞是其他模型完全未能识别的。
作为其直接竞品,Anthropic的Mythos是该领域的老牌选手,但定价高达每百万输入Token10美元、输出50美元,成本远高于Flash Cyber。不过谷歌也承认,这类模型在「网络攻击」和「安全防御」两方面同样强大,因此必须严格控制访问权限。目前,Flash Cyber仅通过CodeMender,在试点计划中向政府机构及可信合作伙伴开放,用于检测并修复安全漏洞。至于CodeMender智能体本身,则已通过Gemini Enterprise Agent平台提供预览版,支持C/C++、Go、Java、Python、Ruby、Rust和TypeScript等多种编程语言。其竞争对手在网络安全能力上也采取了类似的访问限制策略:Anthropic对其Claude Mythos实施了受限访问,而OpenAI则通过「可信访问」计划,仅向经过验证的用户开放GPT-5.6的部分防御能力。
关键模型缺席,曝Gemini 4开启预训练
尽管谷歌在3.6 Flash上做出了不少推进,但此次发布更引人关注的,其实是「没有发布的东西」。目前,谷歌在公开的AI模型榜单前十中甚至没有一款上榜产品。原计划在6月推出的旗舰模型Gemini 3.5 Pro,至今仍处于测试阶段,而华尔街正将该模型作为衡量Google旗下Google DeepMind是否能够与Anthropic和OpenAI保持竞争力的重要信号。去年11月,Gemini 3系列模型的推出,一度显示出谷歌在经历多年落后后重回AI竞赛前列,甚至促使OpenAI在内部拉响「红色警报」,加速推进其GPT系列模型的研发迭代。
7月17日,据外媒报道,Gemini 3.5 Pro的延期据称是因为其未能达到内部预期,尤其是在编程能力方面,而编程能力恰恰已成为企业级AI最具商业价值的应用场景之一。6月下旬,团队曾尝试通过更新训练数据来进行改进,但结果依然令人失望。受该消息影响,Alphabet Inc.的股价单日下跌约4.4%,市值蒸发约2000亿美元。
有10名现任和前任谷歌员工透露,包括研究人员和管理层在内的许多人担心,随着竞争对手Anthropic和OpenAI推出能力超过Gemini现有模型的产品,公司可能会在市场上失去优势。这些不愿具名的知情人士表示,谷歌在模型发布前需要协调多个层级的利益相关方,同时还要努力将AI融入其庞大的产品体系,包括搜索、地图以及YouTube,这种复杂性也可能导致发布进度放缓。
谷歌对此的回应,是将目光投向更远处。该公司表示,已经启动了迄今为止「最雄心勃勃的一次预训练」,目标直指Gemini 4。但这更多是一种意图表达,而非已经落地的能力——也就是说,Gemini 4也很可能还处于预训练阶段。因此,与其说Gemini 3.6 Flash是一次重大升级,不如说更像是在「真正的大版本到来之前」,提醒市场Gemini产品线仍然存在的一次展示。
这次谷歌的三款模型发布,率先传达出「效率优先」的整体策略。从全局来看,这一策略是自洽的:在企业开始精打细算Token成本的年份,用「便宜+快速」的产品占领中端市场,同时为旗舰模型的落地争取时间。并且,该策略也不止体现在软件层面,据了解,谷歌同时在研发自研芯片,以更低的硬件成本运行Gemini系列模型。
但这场赌局能否成立,最终取决于两点:Gemini 3.5 Pro能否尽快落地,以及Gemini 4最终是否不只是一次「训练中的承诺」。


