谷歌Gemini 4 Pro开测:套着旧马甲测出了什么?

谷歌Gemini 4 Pro开测引发全球关注。该模型以“gemini-3.8-flash”代号在Arena平台秘密测试,内部代号Argon,据传支持256K输出Token和2M上下文窗口。CEO皮查伊确认Gemini 4已投入训练,预计2026年10月正式发布。

一、一只鹈鹕如何在Arena上“出卖”了谷歌
1.1 “gemini-3.8-flash”的反常表现
2026年9月中旬,LLM评估平台Arena.ai上出现了一个异常信号。多名用户报告,一个标注为“gemini-3.8-flash”的模型变体在battle模式中产出的结果远超该名称应有的水平。
一位用户让这个模型“用HTML画一只鹈鹕骑自行车的2D SVG动画”。输出结果中,鹈鹕有完整的踩踏动作,背景会切换场景,嘴里甚至叼了一条鱼。而当同样的提示词跑在正常的3.8 Flash上时,得到的只是一只方块拼出来的静态鸟。
另一位测试者要求模型生成PlayStation 5主机的矢量渲染图。模型花了约10分钟进行思考、编译和优化,最终交付了数千行SVG代码,捕捉了每一处曲线、阴影和光驱细节。
社区迅速得出一致结论:这是谷歌Gemini 4 Pro套着3.8 Flash的马甲在进行盲测。
1.2 Argon检查点与泄露规格
这一判断并非仅凭直觉。9月15日,爆料账号Lentils发帖称,Gemini 4 Pro的新检查点几天前已出现在Google内部,内部代号叫argon。
泄露信息中最引人注目的是两个数字:最高输出256K Token,此前Gemini系列的输出上限为64K,直接翻了四倍;2M上下文窗口,意味着模型可以在单次提示中处理约150万至200万个Token的信息量。
如果这两个数字属实,对Coding和Agent应用的影响将是结构性的。当前市面上的Agent产品普遍基于64K至128K的输出上限设计截断逻辑,256K输出意味着大量现有的上下文管理策略需要重写。
1.3 为什么用“旧马甲”测试
谷歌选择以“gemini-3.8-flash”之名进行测试,而不是直接发布新模型,这一策略本身值得分析。
Arena平台的盲测机制可以排除品牌偏见对评测结果的影响。当用户不知道自己在使用哪个厂商的模型时,评估结果更能反映模型的真实能力。更重要的是,用旧版本号作为马甲,可以在不引起竞争对手警觉的情况下获取大规模的真实用户反馈数据。
从谷歌的视角看,这种“隐身测试”策略还有一个隐性收益:它让社区成为了免费的评测团队。数千名用户在不同任务上的真实使用,比任何内部基准测试都更能暴露模型的边界和短板。
二、从3.8 Flash到Gemini 4 Pro:一次预训练范式的跃升
2.1 谷歌的“Flash矩阵”策略
要理解Gemini 4 Pro为何值得单独一代,需要先看谷歌在2026年的Flash系列迭代节奏。
2026年7月21日,谷歌发布Gemini 3.6 Flash,知识截止时间更新至2026年3月,编程与多模态推理能力提升,平均输出Token消耗降低17%。一个半月后的9月2日,Gemini 3.8 Flash上线,在长程软件工程测试DeepSWE v1.1中拿到71.0%至73.7%的成绩,距离Anthropic的Claude Opus 5仅差0.3个百分点。
从3.6到3.8,四个月迭代了四个Flash版本。但这些迭代有一个共同特征:它们都建立在同一个底座模型之上,通过后训练来释放性能。模型卡中的知识截止时间始终停留在2025年1月,说明底座本身并未更新。
谷歌3.8 Flash在HLE-Verified基准上达到54.9%,已经接近甚至在某些维度超越了更高成本的前沿模型。这意味着Flash系列的“后训练红利”可能已经接近天花板。
Gemini 4 Pro的意义正在于此:它不是Flash系列的后训练迭代,而是全新预训练基座的第一次亮相。
2.2 被砍掉的3.5 Pro与算力资源重分配
在Gemini 4的路线图上,有一个被悄然移除的节点:Gemini 3.5 Pro。
据SemiAnalysis报告和多位爆料人确认,原定2026年6月发布的Gemini 3.5 Pro已被取消,谷歌将全部算力资源重新分配给了Gemini 4。
这个决策的逻辑可以从皮查伊在2026年第二季度财报电话会议上的表态中找到线索。当被问及Gemini模型的领先地位时,皮查伊表示:“下一代前沿模型需要规模更大的基础模型,我们目前正在训练Gemini 4,并且投入了非常大的资源”。
他同时承认,谷歌在编程和智能体领域仍存在不足,团队正在高度关注这些方向。这实际上是对3.5 Pro被砍原因的最好解释:3.5 Pro无法在编程和智能体这两个关键维度上实现阶跃式的提升,与其发布一个平庸的过渡型号,不如将资源集中到真正具备突破性的Gemini 4上。
在TPU算力分配上,谷歌明确将Gemini 4置于最高优先级。Alphabet动用了第五代TPU系统和Trillium架构,目标不仅是增加计算量,更是提升训练深度和吞吐率。
2.3 256K输出与2M上下文:为什么翻四倍是质变而非量变
256K的输出上限和2M的上下文窗口,表面上只是数字的增长,实际上代表了应用场景的结构性扩展。
在编程场景中,256K输出意味着模型可以在一次响应中生成一个中等规模项目的完整代码库。当前Agent编程工具的工作流程通常需要将任务拆分为多个子任务,每次生成一部分代码,再通过人工或自动化方式拼接。256K输出使“一次性生成整个模块”成为可能,减少了拆分-拼接带来的信息损失。
在Agent场景中,2M上下文窗口使模型可以在单次会话中维持对完整代码仓库、整套法律文件或数小时视频内容的全局理解。此前1M上下文已经让Gemini系列在“长文档检索”上拥有60%于竞品的优势,2M窗口将进一步拉大这一差距。
但这两个数字也带来了新的工程挑战。推理成本随上下文长度呈非线性增长,256K输出的计算开销远高于64K输出的四倍。谷歌需要在成本和能力之间找到平衡点——Flash系列的成功恰恰建立在高性价比之上,Gemini 4 Pro如果定价过高,可能面临“能力强大但用不起”的尴尬。
三、Gemini 4 Pro开测背后的竞争格局:三足鼎立还是重新排序
3.1 三大前沿模型的最新状态
2026年9月,全球前沿AI模型格局呈现出三强竞逐的态势。
OpenAI于9月3日发布GPT-6 Astra,称其为“目前全球最智能、且对齐程度最高的模型”,GPT-6 Astra Pro仅面向Pro和企业订阅用户开放。在网络安全风险方面,GPT-6 Astra已跨越OpenAI“预备框架”中的“严重”门槛,触发了额外的部署限制。
Anthropic于9月2日发布Claude Fable 5.1,在科学研究型Agent基准Terminal-Bench-Science 0.1中取得52.6%的成绩,相比前代Fable 5的24.7%提升超过一倍;在Terminal-Bench 4.0中得分55.8%,远超Fable 5的42.0%。
谷歌的Gemini 4 Pro虽然尚未正式发布,但泄露的早期评估数据显示其在复杂编程和软件工程测试中已超越Fable 5.1,在多步推理方面对GPT-6 Astra保持优势。
3.2 核心规格横向对比
| 对比维度 | Gemini 4 Pro(泄露规格) | GPT-6 Astra Pro | Claude Fable 5.1 |
|---|---|---|---|
| 上下文窗口 | 2M Token(传闻最高10M) | 未公开具体数值 | 1M Token |
| 最大输出 | 256K Token | 128K Token | 128K Token |
| 发布状态 | Arena盲测中,预计10月 | 2026年9月3日已发布 | 2026年9月2日已发布 |
| 核心优势 | SVG生成、多步推理、超长输出 | 计算机操作、网络安全 | 科学研究Agent、代码工程 |
| 推理耗时 | 约8-10分钟(复杂任务) | 未公开 | 自适应推理 |
| 记忆机制 | 跨会话永久记忆(传闻) | 未公开 | 缓存优化 |
| 知识截止 | 2026年(推测) | 2026年4月30日 | 2026年6月 |
表格中最值得关注的一行是“最大输出”。如果Gemini 4 Pro的256K输出规格属实,它在这一维度上将是GPT-6 Astra Pro和Claude Fable 5.1的两倍。这不仅仅是数字优势,更意味着Gemini 4 Pro在处理需要超长输出的任务(如完整代码库生成、长篇结构化文档撰写)时,可能具有不可替代的适用性。
另一行值得关注的是“推理耗时”。Gemini 4 Pro在Arena测试中的8至10分钟推理时间,远超典型语言模型的响应速度。这种“慢思考”模式类似于OpenAI的o系列推理模型,但耗时更长。它暗示Gemini 4 Pro可能内置了一个更深层的推理链,在回答问题之前进行了大量内部计算。这对需要精确推理的任务是优势,但对需要快速响应的场景则是劣势。
3.3 谷歌的真正短板:不在模型,在分发
一个容易被忽视的事实是:在模型能力趋同的大趋势下,分发能力可能比模型能力更重要。
ChatGPT拥有数亿周活跃用户,Claude在企业API市场占据了大量份额,而Gemini的主要分发渠道——Google Workspace、Android和搜索——虽然用户基数庞大,但在“开发者主动选择”这一关键指标上,Gemini的占比并不突出。
谷歌显然意识到了这个问题。Gemini 4 Flash-Lite的提前发布策略(据爆料将在9月上线)和NB2Lite图像模型的更新,都是为了让开发者在Gemini 4 Pro正式发布之前就开始在谷歌的模型生态中构建应用。
这种“先用轻量模型圈住开发者,再用旗舰模型完成能力跃升”的分发策略,与谷歌在云计算时代的打法如出一辙。
四、Gemini 4 Pro开测透露的行业信号
4.1 预训练仍然是前沿竞争的入场券
在“后训练能解决一切”的声音越来越大的2026年,Gemini 4 Pro的出现给出了一个相反的答案。
Flash系列的迭代证明,后训练可以在同一底座上榨取出显著的性能提升——3.6到3.8的进步幅度在DeepSWE上超过20个百分点。但这种提升存在天花板。当谷歌需要同时在编程、智能体和多模态三个维度上实现阶跃式突破时,唯一的路径是回到预训练阶段,构建一个更大的基础模型。
这对整个行业的启示是:后训练是效率优化,预训练是能力上限。两者缺一不可,但在前沿竞争中,预训练决定了你能触及的天花板。
4.2 推理时间正在成为新的性能维度
Gemini 4 Pro在Arena测试中花费8至10分钟完成一个SVG任务,这在传统语言模型的评估框架中是“异常”的。但用户普遍认为输出质量“值得等待”。
这指向一个更深的趋势:AI模型的评估标准正在从“准确性”转向“准确性×推理深度”。当所有前沿模型在标准基准上的差距缩小到几个百分点时,模型在复杂任务上愿意投入多少“思考时间” ,可能成为区分能力层级的新维度。
Anthropic的Fable 5.1同样采用了自适应推理(Adaptive Reasoning)机制。但Gemini 4 Pro的推理时间更长、内部计算更重,暗示其推理深度可能更高。两者代表了同一方向上的不同激进程度。
4.3 跨会话记忆:从工具到伙伴的临界点
泄露信息中反复出现的一个关键词是“跨会话永久记忆”。如果这一功能在Gemini 4 Pro中正式落地,它可能比256K输出或2M上下文更具颠覆性。
当前主流AI模型的交互模式是“每次对话都是独立的”。用户在每次会话中都需要重新提供背景信息。跨会话记忆意味着模型可以在不同会话之间保留对用户偏好、工作习惯和项目上下文的理解。
这不仅是功能层面的升级,更是AI模型从“工具”向“伙伴”转变的临界点。一个记得你上周告诉它的项目进度的助手,与一个每次都从零开始的工具,在使用体验上有着根本差异。
但这一功能也带来了隐私和可控性的挑战。永久记忆意味着数据在谷歌的服务器上长期保留,用户需要清晰的机制来查看、修改和删除模型所记住的信息。谷歌是否已经解决了这些问题,将是Gemini 4 Pro正式发布时需要重点关注的方向。
五、发布时间与部署节奏:10月能否如期而至
5.1 时间线的拼接
将各方信息拼接起来,Gemini 4 Pro的时间线大致清晰。
2026年7月21日,谷歌在发布Gemini 3.6 Flash时透露已启动“迄今最有野心的一次预训练”,目标直指Gemini 4。两天后的财报电话会上,皮查伊确认Gemini 4正在训练中。
9月初,爆料人lyra在X平台表示,谷歌在长时间测试后正式发布了Gemini 4 Pro的第一个内部检查点,预计10月公开发布。9月15日至17日,Arena平台上的盲测痕迹被密集发现。9月18日,多家科技媒体同步报道了“Gemini 4 Pro开测”的消息。
多数可信的非官方目标指向2026年10月公开发布,定位在预训练微调完成之后的时间节点。
5.2 发布延迟的风险因素
但时间线中存在不可忽视的风险因素。
最初的预期是9月发布,因预训练遇到问题推迟到了10月。预训练阶段的“问题”可能涉及模型行为的不可控、训练效率不达预期或评估指标未达到内部标准。从第一个内部检查点到公开版本之间,通常还需要经过大量对齐和安全评估工作。
此外,谷歌在Gemini 3.5 Pro上的“跳票”记录表明,这家公司并不介意为了质量而推迟发布。如果10月版本的Gemini 4 Pro在内部评估中未能展现出对GPT-6 Astra和Claude Fable 5.1的明确优势,谷歌可能选择进一步推迟。
5.3 发布前的“清场”动作
值得注意的是,在Gemini 4 Pro发布之前,谷歌正在用Flash系列进行“清场”。
据爆料,9月将推出Gemini 4 Flash-Lite和更新版NB2Lite图像模型。这两个轻量级产品的作用是为开发者提供在Gemini 4 Pro发布之前就开始熟悉谷歌模型生态的入口。当10月旗舰模型正式到来时,已经有一批开发者在等待升级。
FAQ
Gemini 4 Pro是什么?
Gemini 4 Pro是谷歌下一代旗舰AI模型,基于全新预训练基座构建,内部代号Argon。2026年9月中旬被发现以“gemini-3.8-flash”名义在Arena平台进行盲测,预计2026年10月正式发布。
为什么Gemini 4 Pro开测的消息来自Arena而不是谷歌官方?
谷歌通常不会在模型完全就绪之前公开宣布。Arena平台的盲测机制使社区能够通过模型输出质量的变化来推断新检查点的存在。这次“gemini-3.8-flash”变体的反常表现被多位用户独立发现并验证。
256K输出Token意味着什么?
此前Gemini系列的输出上限为64K Token。256K输出使模型可以在单次响应中生成更长的内容,对于完整代码库生成、长篇结构化文档等任务具有实质性意义。
2M上下文窗口和10M上下文有什么区别?
2M是多个来源交叉验证的泄露规格,10M来自部分用户对Arena后端路由规格的观察。前者更可信,后者可能涉及模型内部缓存机制而非公开API的上下文窗口。正式发布前均无法确认。
Gemini 4 Pro与GPT-6 Astra Pro相比如何?
泄露的早期评估显示Gemini 4 Pro在复杂编程和多步推理上略占优势,GPT-6 Astra Pro已在2026年9月正式发布。最终的对比结论需要等Gemini 4 Pro正式发布并经过独立基准测试后才能得出。
Gemini 4 Pro会在中国可用吗?
谷歌AI服务在中国大陆的可用性受现有政策限制。Gemini 4 Pro的发布不会改变这一现状。
Gemini 3.5 Pro为什么被取消了?
据报道,谷歌认为3.5 Pro无法在编程和智能体等关键维度上实现足够的性能飞跃,选择将算力资源集中用于Gemini 4的预训练。

