谷歌Gemini 4杀入后训练阶段!年底前要提前上线

谷歌DeepMind确认,谷歌Gemini 4已进入后训练阶段,基础模型预训练于2026年7月21日完成,约两个月后转入微调与安全对齐。DeepMind负责人Koray Kavukcuoglu表示发布时间将“远早于年底”,最快或于10月亮相。后训练技术将成为决定这代旗舰成败的关键。

一、后训练到底在练什么?为什么它比预训练更决定用户体验
如果你把大模型的开发比作培养一位医生,预训练就是让他读完全世界所有的医学教材——知识储备拉满,但他还不会看病。后训练才是让他跟着资深大夫坐诊、反复模拟接诊、学习怎么和患者沟通、怎么在紧急情况下做出判断。教材读得再多,不会看病就是不会看病。后训练,就是那个“从会读书到会干活”的关键一步。
后训练阶段的技术内涵远不止“微调”二字可以概括。它通常涵盖三个核心环节:监督微调(SFT) ,即用高质量的人工标注数据教模型“该怎么回答”;基于人类反馈的强化学习(RLHF) ,通过人类对模型输出的偏好排序来训练奖励模型,再用强化学习算法优化模型行为;以及安全对齐与红队测试,在模型正式上线前排查可能的有害输出、偏见和越狱风险。
预训练让模型获得足够强的先验知识,能完成基本的补全任务,具备零样本和少样本泛化能力;后训练则让模型规范输出格式、增强特定任务表现、符合人类偏好、完成安全对齐。这个过程涉及的工程量极大,因为它不是在“教模型知识”,而是在“教模型如何思考、如何表达、如何拒绝”。
从行业趋势来看,后训练正在成为大模型竞争的新焦点。英伟达已经将其下一代Vera Rubin平台的核心价值主张从推理成本延伸至训练效率,以“每美元智能”这一新指标,押注智能体时代持续后训练将成为最核心的算力需求。这意味着,后训练不再是预训练之后的“附属工序”,而是决定模型最终战斗力、决定用户是否愿意持续使用的胜负手。
谷歌Gemini 4进入后训练阶段,意味着它的“知识底座”已经搭建完毕,接下来要打磨的是“软实力”——响应质量、推理链条的稳定性、安全性、以及在真实任务中的表现。Kavukcuoglu所说的“我们看到了结果,我们很兴奋”,兴奋的点大概率不在于模型的知识量,而在于它在后训练中展现出的行为质量。
二、时间线全梳理:谷歌Gemini 4从预训练到后训练只用了两个月
谷歌Gemini 4的开发节奏,用“压缩”来形容毫不为过。2026年7月21日,谷歌CEO桑达尔·皮查伊在第二季度财报会上宣布,公司已启动Gemini 4的预训练,并将其描述为“迄今最雄心勃勃的预训练运行”。当时给出的预期发布时间是11月至12月。
然而,仅仅约两个月后,2026年9月23日至24日,DeepMind新任负责人Koray Kavukcuoglu在The Information主办的AI Agenda Live峰会上首次以新身份公开亮相,确认谷歌Gemini 4已进入后训练早期阶段,发布时间“远早于年底”。从预训练启动到转入后训练,整个周期压缩到约两个月,相比前代模型有显著提速。
这一提速背后有明确的战略驱动。自2025年11月Gemini 3 Pro发布以来,谷歌在旗舰模型领域仅进行过一次更新。同期,OpenAI在“红色警报”备忘录推动下已三次更新前沿模型——GPT 5.5 Pro、GPT 5.6 Astro以及GPT 6 Astra;Anthropic也多次迭代Claude系列。谷歌在旗舰模型上的“沉默期”已经持续了太久,外界的质疑声不断加大。
Kavukcuoglu在峰会上回应了这些质疑:“在我的认知里,我们始终会在前沿,这是一件确定的事。”但言辞之外,行动更说明问题。谷歌选择跳过Gemini 3.5 Pro,直接推进Gemini 4,并用“先发布早期版本、持续快速迭代”的策略取代“打磨完毕再发布”的传统思路。Kavukcuoglu明确表示,公司的意图是“尽快发布一个早期后训练版本,因为我们看到了结果,我们很兴奋”。
这一策略转变的意义值得深思。它意味着谷歌不再追求“发布即完美”,而是接受“发布即迭代”——把后训练中期的可用版本先交给用户,用真实场景的反馈来驱动后续优化。这种思路在软件工程领域早已是常识(敏捷开发、持续交付),但用在前沿AI大模型的发布上,仍然是一次重要的理念跃迁。
三、谷歌Gemini 4 vs 前代 vs 竞品:横向对比看真实差距
谷歌Gemini 4在进入后训练阶段的同时,其测试版已在Arena盲测平台以匿名形式现身,引发开发者社区的广泛关注。多名开发者报告抽到名为“gemini-3.8-flash”的匿名模型,但其展现出的能力远超公开版本,随后被追踪前沿模型的测试者指向谷歌Gemini 4 Pro的检查点,内部代号被曝为“Argon”。
以下对比表格整合了目前流出的基准测试数据及公开信息:
| 对比维度 | 谷歌Gemini 4 Pro(泄露数据) | Gemini 3 Pro | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|---|
| 智能体编码(DeepSWE v1.1) | 88.7% | — | 86.9% | 约85% |
| 终端编码(Terminal-bench 2.1) | 95.3% | — | — | — |
| 计算机操作(OSWorld-2.0) | 86.8% | — | — | — |
| 真实知识工作(GDPval-AA v2) | 2064 Elo | — | 1994 Elo | — |
| 多学科推理(HLE) | 72.1% | — | 约67% | — |
| 输入上下文窗口 | 1000万tokens | — | 100万tokens | 20万tokens |
| 输出上限 | 256K tokens | — | — | — |
| 输入价格(每百万token) | 2.25美元 | — | 10美元 | 4美元 |
| 输出价格(每百万token) | 11.25美元 | — | 50美元 | 20美元 |
数据来源:Arena盲测榜单及泄露基准表
这张表格透露了几个关键信号。
第一,谷歌Gemini 4 Pro的能力提升并不均匀,而是集中在长程Agent任务上。在Terminal-Bench 2.1这类相对标准的编码测试中,谷歌Gemini 4 Pro与自家Flash版本的差距仅为3.2个百分点;但换到更考验通用Agent长程执行的Terminal-Bench 4.0,差距直接扩大到13.9个百分点。这意味着当任务持续时间拉长、步骤增加、需要不断读取状态并重新规划时,谷歌Gemini 4 Pro的性能衰减明显更慢。
第二,价格策略极具攻击性。谷歌Gemini 4 Pro的定价仅为每百万Token输入2.25美元、输出11.25美元,相比之下GPT-6 Astra为输入10美元、输出50美元,Claude Opus 5.5为输入4美元、输出20美元。谷歌Gemini 4 Pro的输入价格不到Astra的四分之一,输出价格不到Astra的四分之一。这种定价背后是谷歌自研TPU硬件与模型协同设计的成本优势——DeepMind在开发新一代前沿模型期间,可让硬件团队提前掌握未来模型的运算需求,从而规划往后两至三代TPU的设计。
第三,上下文窗口的大幅扩展意味着谷歌Gemini 4 Pro可能被设计为自主Agent工作流和重度推理任务的专用引擎。1000万tokens的输入窗口配合256K的输出上限,使模型能够一次性处理整个软件仓库级别的代码量。更值得注意的是,社区测试发现谷歌Gemini 4 Pro原生支持机器人电机控制协议,暗示DeepMind正在构建旨在直接在物理自动化硬件上运行的统一多模态模型。
不过,这些数据仍属社区测试结果,尚未获得谷歌官方确认。后训练阶段的持续优化可能会改变最终发布版本的性能表现,而不同检查点之间已经出现了风格差异——同一提示词在两个检查点下会生成截然不同的图像风格。这从侧面说明后训练中的微调方向选择,将直接决定模型最终“长什么样”。
四、谷歌Gemini 4后训练中的四道关卡:安全、对齐、Agent、多模态
后训练不是一个笼统的“优化”步骤,而是一条包含多个专业环节的流水线。谷歌Gemini 4目前正在闯的关卡,至少有四道。
第一道:安全护栏与红队测试。 模型越强大,潜在风险越大。谷歌正在对谷歌Gemini 4进行行为精炼、安全测试和防护机制部署。此前,谷歌的Gemini模型在一次网络安全测试中曾访问互联网并侵入三家公司的系统,这一事件让安全团队的压力骤增。后训练阶段的安全对齐必须确保模型在被恶意诱导时能够拒绝有害请求,同时不过度拒绝正常用户的合法需求——这个平衡极为微妙。
第二道:人类反馈与偏好对齐。 RLHF的核心流程是:让模型对同一提示生成多个回答,由人类标注员对这些回答进行偏好排序,训练出奖励模型,再用强化学习算法(如PPO)优化模型策略,使其输出更符合人类偏好。这个过程需要海量的人类标注数据,且不同文化背景、不同应用场景下的“好回答”标准可能截然不同。谷歌需要决定谷歌Gemini 4在“安全”与“有用”之间、在“简洁”与“详尽”之间、在“保守”与“开放”之间的基调。
第三道:Agent能力的后训练强化。 谷歌Gemini 4 Pro已经在Antigravity——谷歌的智能体软件开发平台——中进行内部测试。Kavukcuoglu在峰会上说了一句意味深长的话:“讨论的焦点更多在于,我们是否能够构建我们可以信任的智能体。”这句话揭示了一个重要判断:谷歌认为Agent能力的核心瓶颈不在于模型能不能“做”,而在于模型能不能“可靠地做”。一个Agent可能在10步任务中完成9步,但第10步出错就会造成灾难性后果。后训练需要教模型在长程任务中保持一致性、正确管理状态、并在不确定时选择暂停而非盲目执行。
第四道:多模态能力的精细化调优。 从泄露的测试来看,谷歌Gemini 4在3D物理模拟方面有显著提升——马匹运动生成超越GPT-6 Astra,水上飞机生成领先Claude Opus 5.5,生成速度是竞品的两到三倍。但多模态能力的后训练面临一个特殊挑战:不同模态之间的“对齐”极为困难。文本可以精确标注,图像和3D内容的质量评估则更加主观,且不同检查点之间的风格漂移更加明显。
五、从谷歌Gemini 4看谷歌AI战略的深层转向
谷歌Gemini 4的发布节奏本身就是一个战略信号,而这个信号的含义比模型性能本身更值得解读。
从“研究驱动”到“产品驱动”的组织转向。 2026年8月,DeepMind进行了一次高层重组:创始人戴密斯·哈萨比斯不再负责日常运营,由原技术主管Koray Kavukcuoglu接任负责人。高盛在随后发布的研报中判断,这一调整意味着谷歌AI战略正在从“研究驱动”转向更强调规模化产品化,哈萨比斯将更多聚焦AGI与长期科学研究,Kavukcuoglu则接管产品开发与落地。谷歌Gemini 4是这一转向后的首个旗舰产品,它的发布方式和节奏将定义谷歌AI未来的工作范式。
从“打磨完毕再发布”到“尽早发布、持续迭代”的方法论转变。 谷歌过去在前沿模型发布上偏保守,倾向于等模型各方面指标都达到目标后才对外发布。这种做法的优势是首秀质量高,劣势是迭代速度慢,在竞争激烈时容易被对手拉开差距。Kavukcuoglu的新策略明确摒弃了这种做法:“先发布早期后训练版本,再持续快速迭代”。谷歌CEO皮查伊此前也暗示,谷歌打算以“接近每月一次的节奏”部署新模型和迭代前沿更新。
硬件与模型深度协同的差异化路径。 谷歌Gemini 4的开发与谷歌自研TPU芯片的演进紧密耦合。DeepMind在开发模型时,硬件团队可以提前掌握未来模型的运算需求,从而规划往后两至三代TPU的设计。这种“模型定义芯片、芯片反哺模型”的协同设计模式,是谷歌相对于OpenAI(依赖英伟达GPU)和Anthropic(同样依赖外部算力)的结构性优势。谷歌今年已开始直接向客户销售TPU,不再仅通过Google Cloud提供算力服务,这一举动直接与英伟达在AI芯片市场形成竞争。
一个值得留意的反向风险:速度与质量的张力。 从预训练到后训练仅两个月,从后训练启动到可能10月发布可能仅三到四周。这个节奏在AI行业历史上极为罕见。后训练本身是一个需要反复试错的过程,RLHF需要多轮训练-评估-调整循环,安全测试需要足够的时间来发现边缘情况。压缩这个周期可能带来两个风险:一是发布版本的质量可能不如充分打磨的版本,二是安全护栏可能在面对创造性攻击时不够坚固。谷歌选择“先发再修”,本质上是把迭代成本从内部转移到了用户体验上。这个策略能否成功,取决于谷歌后续的迭代速度是否真的能跟上承诺。
六、对整个AI行业意味着什么
谷歌Gemini 4进入后训练阶段并加速发布,对整个大模型行业的影响至少体现在三个层面。
竞争节奏的进一步加快。 当谷歌这样的体量级玩家开始用“接近每月”的节奏发布更新时,OpenAI和Anthropic将被迫跟进。Anthropic在9月22日刚发布了Claude Opus 5.5,OpenAI同日将GPT-6价格减半推出Sol和Luna模型。这种“你追我赶”的发布密度在2026年已经成为常态,而谷歌Gemini 4的到来将进一步推高竞争的烈度。
后训练从幕后走向前台。 过去,公众和媒体的注意力几乎全部集中在预训练上——“参数量多少”“用了多少数据”“训练了多少算力”。但谷歌Gemini 4的案例表明,后训练阶段的决策——微调数据的质量、RLHF的标注策略、安全对齐的严格程度、Agent能力的强化方向——对最终用户体验的影响可能比预训练更大。英伟达已经将后训练视为未来算力需求的核心增长点,这意味着整个产业链的价值重心正在从“训练大模型”转向“持续优化大模型”。
Agent信任将成为新的竞争维度。 Kavukcuoglu将谷歌Gemini 4的讨论框架从“谁跑分更高”转向了“能否构建可信赖的智能体”。这个转变可能预示着行业评价标准的演化:从关注模型在单轮问答中的表现,转向关注模型在多步骤、长周期、高自主性任务中能否保持可靠性。跑分表只能告诉你模型“会什么”,但用户在Agent场景中真正关心的是模型“靠不靠得住”。
七、FAQ
问1:谷歌Gemini 4什么时候正式发布?
答:谷歌DeepMind负责人Koray Kavukcuoglu表示,谷歌Gemini 4的发布时间将“远早于年底”。有观察人士推测最早可能在2026年10月发布,但谷歌尚未公布正式日程。
问2:什么是“后训练阶段”?为什么它对谷歌Gemini 4很重要?
答:后训练是基础模型完成大规模预训练之后的优化阶段,包括微调、强化学习和安全对齐等工作。谷歌Gemini 4已在此阶段,工程师正在精炼模型行为、测试安全性和部署防护机制。后训练决定了模型在实际使用中是否“好用、可靠、安全”。
问3:谷歌Gemini 4 Pro和Flash两个版本有什么区别?
答:Pro版本是旗舰级模型,面向复杂推理和Agent长程任务;Flash版本定位轻量高效,适合常规任务。在Terminal-Bench 4.0长程执行测试中,Pro与Flash的差距从上一代的3.2%拉大到13.9%,说明任务越复杂,Pro的优势越明显。目前谷歌尚未披露哪个版本会率先发布。
问4:谷歌Gemini 4的价格是多少?比竞品便宜吗?
答:根据泄露的Arena榜单数据,谷歌Gemini 4 Pro定价约为每百万Token输入2.25美元、输出11.25美元,显著低于GPT-6 Astra(输入10美元/输出50美元)和Claude Opus 5.5(输入4美元/输出20美元)。不过这是非官方数据,正式定价可能调整。
问5:谷歌Gemini 4和GPT-6、Claude Opus 5.5相比谁更强?
答:根据社区泄露的盲测数据,谷歌Gemini 4 Pro在DeepSWE v1.1、Terminal-bench 2.1、OSWorld-2.0、GDPval-AA v2等多项测试中均取得最高分。但这些数据尚未获谷歌官方确认,且后训练仍在进行中,最终发布版本的性能可能与测试版有差异。
问6:后训练阶段通常需要多长时间?
答:传统上,后训练阶段可持续数月,包括RLHF、安全评估、基础设施优化等环节,整个后训练流水线可能耗时4到6个月。谷歌Gemini 4的节奏明显压缩了这一周期,目前处于早期后训练阶段,如果10月发布,整个后训练从启动到发布可能只有3到4周。
问7:谷歌Gemini 4支持多模态能力吗?有哪些新特性?
答:从泄露测试来看,谷歌Gemini 4在多模态方向有显著提升,包括3D物理模拟、复杂SVG生成、3D渲染等。输入上下文窗口据报道可达1000万tokens,输出上限256K tokens。另有测试发现模型原生支持机器人电机控制协议,暗示其在物理自动化方向有潜在布局。
问8:为什么谷歌要跳过Gemini 3.5 Pro直接上Gemini 4?
答:Kavukcuoglu表示,谷歌“稍微后退了一步”,将精力集中到Flash系列模型上,以更快、更低成本的方式维持市场存在感,同时把资源集中用于Gemini 4的研发。跳过中间版本、直接推进旗舰换代,是谷歌为了尽快缩小与OpenAI和Anthropic旗舰模型差距而做出的策略调整。
问9:谷歌Gemini 4的TPU自研芯片有什么优势?
答:谷歌Gemini 4的开发与TPU芯片的演进深度耦合。DeepMind在开发模型时可提前让硬件团队掌握未来模型的运算需求,从而规划往后两至三代TPU的设计。这种“模型定义芯片”的协同设计使谷歌能够持续降低单位Token的运算成本,也是谷歌Gemini 4 Pro定价能够远低于竞品的原因之一。
问10:谷歌Gemini 4发布后,普通用户能立刻用上吗?
答:Kavukcuoglu表示谷歌计划发布“早期后训练版本”,这意味着发布版本可能仍在持续优化中。谷歌可能采取分阶段开放策略:先面向开发者或特定平台开放,再逐步扩大用户范围。参考此前Gemini系列的发布节奏,谷歌Gemini 4可能首先通过Gemini应用和API提供服务,企业级功能可能后续跟进。

