文章摘要
2026年8月24日,英伟达在HotChips2026大会首次公布VeraRubinNVL72实测数据,每兆瓦吞吐量较GB300NVL72提升30倍,每百万Token成本降35倍。该测试采用AgentX基准,更贴合真实工作负载。其基于七芯协同架构,性能优势明显。这一数据重塑了AI产业评估标准,推动其向“能效竞赛”转变,产品已量产。

2026年8月24日,英伟达在Hot Chips 2026大会上首次公布Vera Rubin NVL72实测数据,引发全球AI产业震动。基于SemiAnalysis AgentX智能体工作负载、运行DeepSeek V4 Pro(1.6万亿参数)模型的测试显示,英伟达首次公布Vera Rubin NVL72实测数据中每兆瓦吞吐量较上一代GB300 NVL72提升30倍,每百万Token成本降低35倍。以H200 NVL8为基准,GB300 NVL72实现15倍提升,Vera Rubin NVL72在此基础上再跃升30倍,两代累积性能增幅达450倍。这一英伟达首次公布Vera Rubin NVL72实测数据标志着AI基础设施的评估标准从峰值算力全面转向“每瓦产出”能效指标。

英伟达首次公布Vera Rubin NVL72实测数据

英伟达首次公布Vera Rubin NVL72实测数据:一场改变AI游戏规则的性能革命

从Hot Chips 2026到全球AI工厂:英伟达首次公布Vera Rubin NVL72实测数据的台前幕后

2026年8月24日,美国加州,Hot Chips 2026大会现场。英伟达在这一天向全球AI产业投下了一枚重磅炸弹——英伟达首次公布Vera Rubin NVL72实测数据。这不仅是技术参数的发布,更是一次对AI基础设施评估体系的彻底重构。

英伟达首次公布Vera Rubin NVL72实测数据的时机耐人寻味——就在英伟达季度财报发布的前一天。三条消息同时释放:Groq 3 LPX推理加速器宣布全面投产、英伟达首次公布Vera Rubin NVL72实测数据、SpaceXAI宣布采用Vera CPU并计划将优化版Vera Rubin系统送入近地轨道。英伟达创始人兼CEO黄仁勋在大会上表示:“推理是AI的增长引擎。Vera Rubin通过针对代理式AI时代设计的工作负载优化AI工厂配置,扩展了这一愿景。”

英伟达首次公布Vera Rubin NVL72实测数据的核心价值在于其测试方法论的根本革新。传统AI性能测试采用固定长度的输入输出序列(通常为1K至8K Token),无法反映真实世界中智能体工作负载的复杂性。英伟达首次公布Vera Rubin NVL72实测数据采用了SemiAnalysis旗下的AgentX基准测试,通过回放真实世界智能体编码任务的完整会话轨迹——包括上下文累积、工具调用和子智能体生成——来全面评估系统性能。

为什么英伟达首次公布Vera Rubin NVL72实测数据要选择智能体工作负载而非传统大语言模型推理?OpenRouter的数据揭示了答案:一个智能体AI任务消耗的Token数量是普通聊天对话的15倍。智能体在执行复杂任务时,上下文可以从6万Token一路堆叠到接近40万Token。每一次推理的输出都成为下一次推理的输入,这种累积效应使得长上下文处理成为智能体AI性能的核心瓶颈。

英伟达首次公布Vera Rubin NVL72实测数据宣告了一个新时代的到来——LLM时代正在让位于Agent时代。传统的AI跑分基准已无法衡量真正的智能体能力,必须采用能够捕捉完整工作流的全新评估体系。

英伟达首次公布Vera Rubin NVL72实测数据的核心指标:30倍吞吐与35倍降本

英伟达首次公布Vera Rubin NVL72实测数据中最引人注目的两项指标是:每兆瓦吞吐量较GB300 NVL72提升30倍,每百万Token成本降低35倍。

“每兆瓦吞吐量”是衡量AI数据中心在固定电力额度下能产出多少AI Token的核心能效指标。在电力与数据中心容量成为AI扩张关键限制因素的背景下,每兆瓦吞吐量——而非原始峰值算力——正成为决定AI工厂竞争力的关键指标。英伟达首次公布Vera Rubin NVL72实测数据显示,在每秒160 Token的交互目标下,Vera Rubin NVL72相比上一代GB300 NVL72实现了质的飞跃。

具体到测试细节,英伟达首次公布Vera Rubin NVL72实测数据基于以下配置:采用SemiAnalysis AgentX工作负载,运行DeepSeek V4 Pro(1.6万亿参数)模型。AgentX基准测试通过四项指标评估智能体编程推理工作负载:端到端归一化交互性(按请求提交至最终Token到达的完整时间计算)、标准交互性(仅统计首个Token至最后一个Token之间的生成阶段)、端到端延迟(单次请求从提交到最终输出Token到达的总时长)以及首个Token延迟。

英伟达首次公布Vera Rubin NVL72实测数据中,GB300 NVL72本身在相同工作负载下每兆瓦吞吐量已经比H200 NVL8高出15倍。在更大的混合专家模型(如Kimi K3 2.8T)上,这一差距甚至可以达到80倍。而Vera Rubin NVL72在GB300的基础上再提升30倍。英伟达首次公布Vera Rubin NVL72实测数据意味着,从H200到Vera Rubin,同一度电能完成的智能体工作量翻了约450倍。

成本方面,英伟达首次公布Vera Rubin NVL72实测数据显示每百万Token成本降至GB300 NVL72的35分之一。虽然整机柜的标价每一代大约翻一倍,两代下来贵了约四倍,但同一度电产出的Token翻了四百多倍,相应的每百万Token成本反而大幅下降。英伟达首次公布Vera Rubin NVL72实测数据揭示了AI基础设施经济学的根本转变——单位成本才是决定商业可行性的关键。

英伟达首次公布Vera Rubin NVL72实测数据背后的架构解析:七芯协同的AI超级计算机

要理解英伟达首次公布Vera Rubin NVL72实测数据为何能实现如此惊人的性能跃升,必须深入剖析Vera Rubin NVL72的硬件架构。

Vera Rubin NVL72是一个机柜级AI超级计算机系统。根据英伟达首次公布Vera Rubin NVL72实测数据所基于的硬件配置,该系统集成72颗Rubin GPU和36颗Vera CPU。Rubin GPU基于台积电3纳米工艺制造,单颗GPU配备288GB HBM4显存,显存带宽高达22TB/s。整个机柜的GPU总内存达到20.7TB HBM4,总快速内存达75TB。Vera CPU采用88个自研Olympus Arm核心,在NVL72机架配置中总计提供3,168个核心,系统内存(LPDDR5X)总容量为54TB。

英伟达首次公布Vera Rubin NVL72实测数据所体现的性能优势源自多个层面的协同创新:

第一,NVFP4量化精度。Vera Rubin NVL72支持NVFP4推理精度,将模型权重压缩至4位精度。系统提供3,600 PFLOPS的NVFP4推理性能和2,520 PFLOPS的NVFP4训练性能。相比前代Blackwell GPU约8TB/s的显存带宽,Rubin GPU的22TB/s带宽提升了2.75倍。

第二,第六代NVLink互连技术。NVLink 6提供每GPU 3.6TB/s的GPU间互联带宽,配合NVLink Switch系统实现机柜内9个L1 NVLink交换机的高速互联。英伟达首次公布Vera Rubin NVL72实测数据证明,这种高速互联让DeepSeek这类专家混合模型能够在72颗GPU间实现无缝调度。

第三,异构计算协同。英伟达首次公布Vera Rubin NVL72实测数据所验证的系统整合了七款全新芯片:Rubin GPU负责大规模模型计算与长上下文处理;Vera CPU专为强化学习和智能体AI设计;Groq 3 LPX推理加速器针对延迟敏感的解码阶段进行优化;ConnectX-9 SuperNIC和BlueField-4 DPU负责网络与存储加速。

第四,软件栈优化。英伟达首次公布Vera Rubin NVL72实测数据的达成还得益于系统层面的软件优化:MoE服务运行时(SGLang、TensorRT-LLM、vLLM)、基于DeepGEMM的内核、混合精度格式(MXFP4、MXFP8),以及NVIDIA Dynamo具备KV缓存感知路由的会话感知服务堆栈。

英伟达首次公布Vera Rubin NVL72实测数据的三代横向对比:从H200到GB300再到Vera Rubin

英伟达首次公布Vera Rubin NVL72实测数据最直观的呈现方式是与前两代产品的横向对比。以下基于英伟达首次公布Vera Rubin NVL72实测数据及相关官方信息,对三代旗舰平台进行系统比较:

对比维度 H200 NVL8(Hopper架构) GB300 NVL72(Blackwell架构) Vera Rubin NVL72(Rubin架构)
GPU数量 8颗H200 72颗Blackwell GPU 72颗Rubin GPU
CPU配置 8颗Grace CPU 36颗Grace CPU 36颗Vera CPU(88核Olympus Arm)
GPU显存 HBM3 HBM3e HBM4(单GPU 288GB,总20.7TB)
GPU显存带宽 - 约8TB/s 22TB/s(单GPU)
NVLink代际 NVLink 4 NVLink 5 NVLink 6(3.6TB/s每GPU)
NVFP4推理性能 - - 3,600 PFLOPS
每兆瓦吞吐量(基准) 1x 15x(相对H200) 30x(相对GB300)/ 450x(相对H200)
每百万Token成本(基准) 1x 约1/10(相对H200) 1/35(相对GB300)

英伟达首次公布Vera Rubin NVL72实测数据揭示的代际跃升令人震撼。GB300 NVL72在DeepSeek V4 Pro模型上每兆瓦吞吐量已经达到H200 NVL8的15倍。而英伟达首次公布Vera Rubin NVL72实测数据显示,Vera Rubin NVL72在此基础上再提升30倍。这意味着从H200到Vera Rubin,两代产品的累积性能提升达到惊人的450倍。

成本端的改善同样显著。英伟达首次公布Vera Rubin NVL72实测数据显示,GB300 NVL72的每百万Token成本约为H200的十分之一。Vera Rubin NVL72在此基础上再降至GB300的35分之一。两代累积,每百万Token成本降至H200时代的约350分之一。

英伟达首次公布Vera Rubin NVL72实测数据还揭示了架构升级的另一维度——训练效率。与GB200 NVL72相比,Vera Rubin NVL72在训练混合专家模型时所需的GPU数量仅为前者的四分之一。这意味着同样的训练任务可以用更少的硬件资源完成,或者在相同硬件投入下完成更大规模的模型训练。

值得注意的是,英伟达首次公布Vera Rubin NVL72实测数据中的GB300与Vera Rubin对比是基于相同功耗条件下的性能比较。这揭示了英伟达的核心策略:不是简单堆砌算力,而是在不增加电力消耗的前提下大幅提升产出。英伟达首次公布Vera Rubin NVL72实测数据证明,AI工厂的第一性原理已经从“有多少算力”变成了“电表上的读数”。

英伟达首次公布Vera Rubin NVL72实测数据对AI产业的影响:重新定义AI工厂经济学

英伟达首次公布Vera Rubin NVL72实测数据的意义远超技术参数本身,它正在重塑整个AI基础设施产业的经济学逻辑。

首先,英伟达首次公布Vera Rubin NVL72实测数据确立了新的行业标准。过去衡量AI算力平台优劣的核心指标是峰值算力(FLOPS),但英伟达首次公布Vera Rubin NVL72实测数据证明,在电力成本占AI工厂运营成本比重持续上升的背景下,每兆瓦吞吐量才是决定AI工厂盈利能力的真正关键。这一转变意味着,AI基础设施的评估体系将从“算力竞赛”转向“能效竞赛”。

其次,英伟达首次公布Vera Rubin NVL72实测数据为AI应用的商业化铺平了道路。每百万Token成本的大幅降低——从H200到Vera Rubin下降约350倍——使得大规模部署智能体AI在经济上变得可行。英伟达首次公布Vera Rubin NVL72实测数据显示,在相同电力预算下,AI工厂可以支撑的智能体任务数量呈数量级增长。这将加速AI从“技术演示”向“规模化商业应用”的转变。

第三,英伟达首次公布Vera Rubin NVL72实测数据正在改变云服务商和AI实验室的采购决策。Nebius已成为Vera Rubin NVL72的首个客户,其Token工厂计划在年内上线。CoreWeave、谷歌云、微软智能云和甲骨文云基础设施等合作伙伴的数据中心已开始部署Vera Rubin NVL72机架。英伟达首次公布Vera Rubin NVL72实测数据让这些云服务商有了明确的商业理由进行升级——更低的单位成本和更高的产出效率。

第四,英伟达首次公布Vera Rubin NVL72实测数据验证了“七芯协同”架构路线的正确性。Vera Rubin平台将Vera CPU、Rubin GPU、Groq 3 LPX、NVLink 6、BlueField-4 DPU等七款芯片整合到一个统一的机柜级平台中。英伟达首次公布Vera Rubin NVL72实测数据证明,这种异构计算协同能够实现远超单一芯片迭代的性能提升。Groq 3 LPX作为专用推理加速器,在Gemma 4 31B模型、10万Token上下文的测试中达到每秒3,400个输出Token的成绩。对于对延迟敏感的代理编码任务,生成5,000个Token的耗时从约50秒大幅缩短至1.5秒。

第五,英伟达首次公布Vera Rubin NVL72实测数据正在影响更广泛的供应链。Vera Rubin平台覆盖全球30个国家、超过350个工厂节点,超过80家MGX生态系统合作伙伴支持该平台的快速部署。英伟达首次公布Vera Rubin NVL72实测数据的商业价值已经转化为实际的供应链订单和部署计划。

英伟达首次公布Vera Rubin NVL72实测数据的未来展望:从地面到太空的AI算力版图

英伟达首次公布Vera Rubin NVL72实测数据只是开始。在Hot Chips 2026大会上,英伟达同时宣布了整个Vera Rubin产品线进入全面量产。

量产进度方面,Vera Rubin系统的出货正在加速,量产早在2026年上半年就已启动。英伟达首次公布Vera Rubin NVL72实测数据发布时,系统已进入全面生产阶段。台湾顶级服务器制造商与全球供应链领导者正在进行大规模制造并推出基于Vera Rubin的系统。

英伟达首次公布Vera Rubin NVL72实测数据发布同日,英伟达还宣布了Groq 3 LPX推理加速器的全面投产。Groq 3 LPX采用英伟达于2025年12月以约200亿美元从Groq公司获得的技术授权打造。每个2U液冷托盘搭载16颗Groq 3 LPU,配备500MB片上的SRAM。机架级部署最多可整合256颗LP30加速器。英伟达首次公布Vera Rubin NVL72实测数据所验证的Rubin GPU负责大规模上下文处理与预填充,而Groq 3 LPX则加速对延迟敏感的解码阶段——这种分工使得整个系统在处理兆级参数模型和百万Token上下文时达到全新性能等级。

更令人瞩目的是英伟达首次公布Vera Rubin NVL72实测数据背后的太空野心。SpaceXAI宣布采用Vera CPU,并计划把优化版Vera Rubin系统送入近地轨道。第一代Starmind AI卫星计划于2027年第四季度发射,单星功率达120kW。英伟达首次公布Vera Rubin NVL72实测数据所展示的每瓦性能优势,在太空这一电力极为稀缺的环境中显得尤为关键。

英伟达首次公布Vera Rubin NVL72实测数据正在推动AI基础设施从“地面工厂”向“天地一体”的算力网络演进。正如黄仁勋所言,Vera Rubin通过针对代理式AI时代设计的工作负载优化AI工厂配置,扩展了这一愿景。

从更长远的角度看,英伟达首次公布Vera Rubin NVL72实测数据所代表的不仅是硬件迭代,更是AI计算范式的转变。随着智能体成为AI应用的主流形态,衡量算力平台的标准正在被彻底改写。过去的算力竞赛比的是训练峰值算力,现在比的是同样一兆瓦电力能支撑多少智能体任务、能以多低的价格卖出每一个Token。英伟达首次公布Vera Rubin NVL72实测数据已经证明,Vera Rubin NVL72在这场新竞赛中占据了压倒性优势。

常见问题解答(FAQ)

问:英伟达首次公布Vera Rubin NVL72实测数据的具体时间是什么?

答:英伟达于2026年8月24日在Hot Chips 2026大会上首次公布了Vera Rubin NVL72的片上实测数据。这一时间点正值英伟达季度财报发布前一天。

问:英伟达首次公布Vera Rubin NVL72实测数据中采用了什么测试模型和基准?

答:英伟达首次公布Vera Rubin NVL72实测数据采用了SemiAnalysis AgentX智能体工作负载,运行DeepSeek V4 Pro(1.6万亿参数)模型。测试回放了真实世界智能体编码任务的完整会话轨迹,包括上下文累积、工具调用和子智能体生成。

问:英伟达首次公布Vera Rubin NVL72实测数据中的核心性能指标是什么?

答:英伟达首次公布Vera Rubin NVL72实测数据显示,其每兆瓦吞吐量较GB300 NVL72提升30倍,每百万Token成本降低35倍。以H200 NVL8为基准,GB300 NVL72实现15倍提升,Vera Rubin NVL72在此基础上再跃升30倍,代际累积达450倍。

问:英伟达首次公布Vera Rubin NVL72实测数据为何选择智能体工作负载而非传统LLM推理?

答:英伟达首次公布Vera Rubin NVL72实测数据选择智能体工作负载是因为OpenRouter数据显示,一个智能体AI任务消耗的Token数量是普通聊天对话的15倍。智能体执行任务时上下文可从6万Token堆叠到近40万Token,传统固定长度测试无法反映真实性能。

问:英伟达首次公布Vera Rubin NVL72实测数据中的Vera Rubin NVL72硬件配置是怎样的?

答:英伟达首次公布Vera Rubin NVL72实测数据所基于的系统集成72颗Rubin GPU和36颗Vera CPU。单颗Rubin GPU配备288GB HBM4显存、带宽22TB/s;Vera CPU采用88个自研Olympus Arm核心;系统总GPU内存20.7TB HBM4,总快速内存75TB;NVLink 6提供每GPU 3.6TB/s互联带宽。

问:英伟达首次公布Vera Rubin NVL72实测数据后,产品是否已量产?

答:是的。英伟达首次公布Vera Rubin NVL72实测数据的同时宣布整个Vera Rubin产品线已进入全面量产。量产早在2026年上半年就已启动,覆盖全球30个国家、超过350个工厂节点。CoreWeave、谷歌云、微软智能云和甲骨文云等合作伙伴的数据中心已开始部署。

问:英伟达首次公布Vera Rubin NVL72实测数据对AI行业意味着什么?

答:英伟达首次公布Vera Rubin NVL72实测数据标志着AI基础设施评估标准从峰值算力全面转向“每瓦产出”能效指标。在电力成本成为AI扩张关键限制因素的背景下,每兆瓦吞吐量正成为决定AI工厂竞争力的核心指标。这一转变将深刻影响云服务商、AI实验室和企业的基础设施采购决策。

以上内容不代表本平台立场,仅供读者参考