谷歌Gemini 4 Carbon内部测试曝光:代码能力直逼Opus 5.5

谷歌Gemini 4 Carbon内部测试曝光引发行业高度关注。内部文件与截图显示,代号Carbon的新版本已接入谷歌内部代码平台Jetski,员工评价其编程体验“堪比Opus 5.5”。这距离Argon正式官宣仅两周,谷歌“发布一代、测试一代”的迭代节奏远超外界预期。

一、Carbon泄露事件全景:谷歌内部在测什么
1.1 泄露源头与关键信息
这次泄露的信息来自《商业内幕》获取的谷歌内部文档、员工聊天记录及相关截图,随后由TestingCatalog等泄露追踪媒体转载扩散。核心信息指向一个明确的事实:谷歌员工正在密集测试Gemini 4系列的新版本,代号Carbon,该版本已于近日接入内部编程平台Jetski。
Jetski是谷歌内部使用的代码开发平台名称,与Antigravity——谷歌的代理式编程环境——密切相关。Carbon在这个平台上接受员工的日常代码编写、调试和重构任务测试,而员工的反馈出人意料地积极。
1.2 内部代号体系:化学元素周期表的隐喻
谷歌内部对Gemini 4系列的代号命名采用了一套有趣的体系。已正式发布的旗舰模型Argon(氩)、此前参与内部测试的Barium(钡),以及新近曝光的Carbon(碳)——三者均来自化学元素周期表。这并非简单的命名趣味,内部文件揭示了一个更具战略意义的事实:产品内部代号与最终对外发布的名称之间不存在严格的一一对应关系。此前以Argon名义发布的模型,其内部代号实为Barium-B。
这一细节的含义值得深思。它意味着谷歌在Gemini 4的研发过程中同时维护着多个候选版本,根据各版本在不同任务场景下的实际表现进行动态筛选和迭代。内部代号体系本质上是一个“版本竞争”机制的组织化表达。
1.3 泄露信息的可信度评估
需要指出的是,本次泄露的信息存在明确的边界。有分析指出,目前没有任何一方公开发布过Carbon的基准测试数据。员工所说的“堪比Opus 5.5”,是基于个人使用体验的主观评价,而非经过标准化评测框架验证的量化结论。一名员工在透露这一评价时也明确表示,“这一结论仍有待更深入的评测验证”。
这一区分很重要。内部体验评价反映的是模型在实际使用场景中的“手感”——代码生成是否流畅、上下文理解是否准确、复杂任务拆解是否合理——而这些维度恰恰是标准化基准测试难以完全捕捉的。体验评价与基准数据之间的互补关系,构成了评估模型真实能力的两个不可或缺的视角。
二、Carbon技术画像:一款更懂代码的Gemini
2.1 编程能力的质性提升
从内部反馈来看,Carbon最显著的特征是编程体验的跃升。多名员工在内部聊天频道中的评价集中在几个关键维度:代码生成的自然度、对复杂需求的拆解能力,以及在长代码库中维持上下文一致性的表现。一位员工直接称赞“Carbon真的很不错”,另有员工提到一个带有“Next”标签的新Gemini Pro模型使用体验相当出色。
“Next”标签值得单独关注。这是谷歌内部为部分新模型更新使用的测试标记,表明Carbon的定位可能并非Argon的简单修复版本,而是代表了一次有意义的架构或训练策略升级。
2.2 Carbon与Argon的能力对比
要理解Carbon的进步幅度,需要先看清Argon的能力边界。Argon在公开发布的基准测试中表现强劲,尤其在长周期软件工程任务上取得了显著成绩。在DeepSWE v1.1测试中,Argon得分77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。但在终端操作类任务Terminal-Bench 4.0中,Argon得分仅为57.4%,而Claude Opus 5.5达到66.4%。接近9个百分点的差距,暴露出Argon在交互式编程环境中的短板。
内部员工对早期Argon的评价也印证了这一点。有测试者认为,早期Argon在处理部分编程任务时的水平大体只相当于Anthropic早前发布的Claude Opus 5,而非最新的Opus 5.5。Carbon的出现在很大程度上是对这一短板的针对性回应。如果员工的体验评价能够转化为标准化的测试成绩,Carbon在终端操作类任务上的提升幅度将是衡量其实际价值的关键指标。
2.3 技术路线的推测与验证
Carbon被描述为“Argon架构下的新检查点更新”。Checkpoint在机器学习训练中通常指模型训练过程中保存的中间状态,这意味着Carbon可能是在Argon基础架构上、经过额外训练迭代后产生的新版本。这种“架构不变、训练迭代”的路线,与谷歌DeepMind负责人Koray Kavukcuoglu此前透露的“后训练初期”状态形成了呼应。
Kavukcuoglu在9月下旬的AI Agenda Live峰会上确认,Gemini 4已进入开发流程中的后训练阶段,并希望“尽快”推出早期版本,“远早于年底”。后训练阶段的核心工作正是对基础模型进行对齐优化和特定能力强化——代码能力作为谷歌内部最重要的应用场景之一,很可能被赋予了最高的优化优先级。
三、横向对比:Carbon在竞争格局中的位置
3.1 Gemini 4系列与竞品的基准表现
以下对比基于Argon公开发布的基准测试数据,Carbon作为内部测试版本尚缺乏可比的标准化成绩,但其被内部对标Opus 5.5这一事实本身已说明了定位。
| 测试项目 | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | 测试类型 |
|---|---|---|---|---|
| DeepSWE v1.1 | 77.9% | 74.1% | 74.2% | 长周期软件工程 |
| FrontierSWE v2 | 65.0% | 65.5% | 62.3% | 前沿软件工程 |
| Terminal-Bench 4.0 | 57.4% | 58.2% | 66.4% | 终端操作 |
| Vals Index | 68.9% | 63.3% | 67.0% | 知识工作综合 |
| Harvey’s Legal Agent | 19.6% | 5.4% | 3.8% | 法律智能体 |
| LVBench(长视频理解) | 91.7% | 87.5% | 83.7% | 多模态理解 |
数据来源:Gemini 4 Argon公开发布基准及第三方评测
从这张对比表可以读出几个关键信号。Argon在长周期软件工程(DeepSWE)和知识工作综合评估(Vals Index)上建立了领先优势,在法律智能体任务上的表现更是竞品的数倍。但终端操作(Terminal-Bench 4.0)是明显的薄弱环节,与Opus 5.5之间存在接近两位数的差距。Carbon如果能在这一维度上取得实质突破,其战略价值将远超一次普通的版本迭代。
3.2 竞争格局的结构性变化
2026年10月的AI模型竞争格局呈现出微妙的三方博弈态势。Anthropic在经典编码基准和指令遵循能力上仍然保持优势,AA-SciCode排行榜上Opus 5.5以66.9%领先,Gemini 4 Argon以61.8%紧随其后。OpenAI在代理式任务上展现出独特优势,但其GPT-6.1 Astra模型因安全考量被推迟发布。谷歌则在科学推理和成本效率上建立了差异化定位——Argon的定价为每百万输入词元2美元、输出10美元,在同类前沿模型中具有明显的价格竞争力。
这种“各有胜场”的格局意味着,单一维度的领先已经不足以定义模型的竞争力。Carbon的出现,是谷歌试图在Anthropic最擅长的编码体验维度上发起正面挑战的信号。
3.3 定价策略的隐藏信号
Argon的定价策略值得深入分析。每百万输入词元2美元的价格在前沿模型中处于较低水平,缓存输入词元的价格更是比一般输入词元便宜95%。这一定价反映的不仅是商业策略,更是谷歌对自身推理效率的信心。将输出词元上限从6.4万扩展至100万,同时保持相对低廉的定价,意味着Argon在推理基础设施层面实现了显著的效率提升。
如果Carbon能够在保持或优化这一成本结构的前提下,将编码体验提升至Opus 5.5的水平,谷歌在“性能—成本”坐标系中的位置将变得极具竞争力。
四、深度解读:这场泄露揭示的行业逻辑
4.1 迭代节奏的范式转换
Carbon泄露事件中最值得关注的,不是某一个具体的技术指标,而是它揭示的迭代节奏。Argon于2026年10月1日正式官宣。Carbon在10月10日前后被曝进入内部测试。这意味着谷歌在旗舰模型公开发布不到两周的时间内,就已经在测试性能更强的后续版本。
这种“发布即过时”的节奏,标志着前沿AI模型的研发已经从“版本驱动”转变为“流水线驱动”。传统的软件发布模式——开发、测试、发布、再开发——正在被一种持续迭代的流水线模式所取代:模型在内部以检查点为单位持续演进,公开发布只是流水线上一个经过安全审查的“快照”。
Kavukcuoglu的表态印证了这一判断:谷歌不会等待所有优化工作完成才发布模型,而是选择“尽快放出早期版本并持续迭代”。这一策略的代价是发布版本的“完成度”可能不如传统软件,但收益是更快的用户反馈循环和更短的竞品追赶窗口。
4.2 代码能力为何成为核心战场
谷歌员工拿Carbon与Opus 5.5进行比较,这一行为本身透露了谷歌内部的优先级判断。代码能力之所以成为前沿模型竞争的核心战场,原因是多层次的。
代码任务是检验模型推理能力的“硬约束”场景。在自然语言生成中,语义的模糊性允许一定程度的灵活性,而代码的语法严格性和逻辑完备性要求模型在每一步推理中都保持精确。一个能在复杂代码库中稳定工作的模型,其底层推理能力必然是扎实的。
代码能力与谷歌的核心业务高度耦合。Argon已经在谷歌内部承担大规模代码库迁移任务,包括将C/C++代码迁移至Rust,涉及Fuchsia Zircon核心的80多万行代码。在libgav1视频解码器的迁移中,Argon自动替换了3.2万行SIMD代码,产出的Rust版本比原有版本快2.7倍。这些内部应用场景为模型提供了真实的、高难度的训练和评估环境。
4.3 内部测试文化的组织意义
谷歌允许员工在Jetski平台上日常使用Carbon进行编程,这一做法本身具有组织层面的深意。内部大规模使用产生的反馈,比任何外部评测都更真实、更细粒度。员工在日常工作中遇到的边界情况、失败模式和性能瓶颈,构成了模型改进的高质量信号。
这种“内部先跑”的策略,在谷歌的内部工作流中已经有成熟先例。Argon在公开发布前已经在数千名谷歌员工中投入使用,在专业编程、深度研究和写作质量方面获得了内部认可。Carbon的测试路径很可能复制了这一模式。
这也解释了一个看似矛盾的现象:为什么谷歌官方对Carbon拒绝评论?因为Carbon仍处于内部测试阶段,其存在和性能本身就是谷歌研发过程的一部分,而非面向市场的产品声明。官方沉默是对测试阶段不确定性的合理尊重。
五、FAQ:关于Gemini 4 Carbon的常见问题
Carbon是什么?它与Argon是什么关系?
Carbon是谷歌内部正在测试的Gemini 4系列新版本,很可能是Argon架构下的一个新检查点更新。它于近日接入谷歌内部代码平台Jetski供员工测试,目前尚未对外发布。Carbon与Argon的关系类似于同一架构下经过额外训练迭代产生的新版本,其最终发布形态(独立模型还是Argon的更新)尚未确定。
Carbon的代码能力真的能和Opus 5.5相比吗?
这一评价来自谷歌内部员工的主观使用体验,而非标准化基准测试结果。目前没有任何公开的Carbon基准数据可供验证。体验评价反映的是实际使用中的“手感”,具有参考价值,但需要后续的量化评测来确认。
Gemini 4 Flash也会很快发布吗?
社区用户已在谷歌SDK中发现了疑似“gemini-4-flash-preview”的模型标识,表明Flash系列的开发工作正在进行中。但谷歌官方尚未公布Gemini 4 Flash的具体发布时间。
Argon目前可以通过什么渠道使用?
Argon目前通过Fairwind计划向受信任的网络安全防御专家开放,同时面向付费API客户和Google AI Ultra订阅者提供。谷歌表示将逐步扩大访问范围。
Carbon会带来哪些实际使用场景的改善?
从内部反馈推断,Carbon的主要改善方向可能集中在终端操作类编程任务上——这是Argon目前相对于Opus 5.5存在明显差距的领域。如果这一推断成立,Carbon将更适合需要频繁与命令行工具交互的开发者工作流。
谷歌的内部代号体系有什么规律?
Gemini 4系列目前曝光的代号包括Argon(氩)、Barium(钡)、Carbon(碳),均取自化学元素名称。内部代号与最终发布名称没有一一对应关系,例如以Argon名义发布的模型内部代号实为Barium-B。代号体系反映的是谷歌在多版本并行测试中组织管理的方式。

