文章摘要
2026年8月24日,英伟达宣布Groq3LPX推理加速器全面量产,这标志着其200亿美元收购Groq技术授权完成商业化落地。该加速器每秒可输出3400个Token,性能比竞品快4倍。首批产品将部署在Nebius平台,与VeraCPU、RubinGPU组成集群。这一量产引发低延迟推理市场竞争,也体现英伟达战略转向,未来产能、市场接受度等仍存悬念。

2026年8月24日,英伟达正式宣布Groq 3 LPX机架系统进入全面量产阶段。这款专为AI智能体(Agentic AI)打造的推理加速器,每秒可输出3400个Token,性能比最接近的竞品快4倍。英伟达Groq 3 LPX推理加速器全面量产,标志着英伟达史上最大规模收购——200亿美元拿下Groq技术授权——正式完成商业化落地。首批系统将部署在云服务商Nebius平台,与Vera CPU、Rubin GPU组成异构算力集群。AI推理的低延迟大战,就此拉开序幕。

英伟达Groq 3 LPX推理加速器全面量产

英伟达Groq 3 LPX推理加速器全面量产:200亿美元收购案的首次大考

2025年12月,英伟达以约200亿美元现金获得Groq的核心AI推理技术知识产权和相关资产,同时吸纳了创始团队与核心工程人员。Groq创始人Jonathan Ross出任英伟达首席软件架构师。这笔交易是英伟达成立以来规模最大的一笔收购。

Groq的主体公司依旧保持独立运营,原有云业务继续开展。英伟达拿到的并非Groq的全部,而是其最核心的资产——LPU(Language Processing Unit,语言处理单元)芯片架构技术授权。

8个月后,英伟达Groq 3 LPX推理加速器全面量产的消息正式对外公布。英伟达高级总监Dion Harris在Hot Chips 2026会议上宣布,Groq 3 LPX机架已进入全面量产阶段。首批产品将部署在新型云服务商Nebius的数据中心,预计2026年下半年正式上线。

从200亿美元的豪赌到全面量产,英伟达用不到一年时间完成了一次关键的技术整合。但量产只是起点,真正的考验在于市场是否买单。

每秒3400个Token:英伟达Groq 3 LPX推理加速器全面量产背后的性能密码

英伟达Groq 3 LPX推理加速器全面量产的核心竞争力,藏在三个数字里:3400、256、500

3400——每秒输出Token数。在Artificial Analysis基准测试中,Groq 3 LPX运行开源Gemma 4 31B模型、启用10万Token上下文窗口时,每秒可输出3400个Token。这一结果被Artificial Analysis记录为该模型测得的最快速度。英伟达表示,在延迟敏感的工作负载上,Groq 3 LPX比最接近的替代平台快4倍。

256——单台机架集成的Groq 3芯片数量。每个2U液冷计算托架搭载16个Groq 3 LPU,配备BlueField-4 DPU或ConnectX-9网卡,正面设有32个LPU芯片间光链路和400Gb/s以太网接口。整个机架通过专用扩展接口将256颗芯片互联。

500——每颗LPU芯片集成的片上SRAM容量(单位:MB)。256颗芯片的片上SRAM合计128GB,对应40PB/s的SRAM带宽。每个LPU加速器还提供150TB/s的SRAM带宽和2.5TB/s的垂直扩展带宽。在片上SRAM不足以覆盖任务需求时,每个托盘还可通过结构扩展逻辑和头节点CPU扩展合计384GB的DRAM。相比之下,英伟达顶级规格的Rubin GPU拥有288GB板载内存,而每个Groq 3 LPU仅有500MB——相差576倍。

大内存容量的GPU处理海量上下文,小内存但超高速的LPU专注极速Token生成——英伟达Groq 3 LPX推理加速器全面量产,本质上是在用两种完全不同的芯片逻辑,覆盖AI推理的两个不同阶段。

Vera Rubin的第七块拼图:英伟达Groq 3 LPX推理加速器全面量产如何重塑AI工厂

英伟达Groq 3 LPX推理加速器全面量产,不是孤立事件。它是Vera Rubin平台的第七款芯片。

理解Groq 3 LPX的价值,必须先理解Vera Rubin平台的异构推理架构。英伟达将AI推理拆解为三个阶段:

  • 预填充阶段:Rubin GPU负责处理海量输入数据集的上下文信息采集和预填充计算。
  • 解码阶段:Groq 3 LPX聚焦高速Token生成,处理对延迟敏感的输出。
  • 通用计算阶段:Vera CPU承接工具调用、代码执行等任务。

三者各司其职。Harris强调:“这不是要取代GPU,而是针对工作负载的不同环节,使用价格合适、处理能力合适的处理器。”

这种分工带来的效率提升相当可观。英伟达声称,在14万Token的智能体编码工作负载下,Vera Rubin NVL72搭配Groq 3 LPX的每兆瓦Token吞吐量比GB300 NVL72高出30倍。对于兆参数模型,搭配LPX的Vera Rubin NVL72可提供高达35倍的每兆瓦推理吞吐量提升。

黄仁勋在3月的发布会上透露了自己的资源分配规划:数据中心里原本用于编码类应用的空间,四分之一分配给Groq芯片,剩余全部部署Vera Rubin产品。他预计,Blackwell与Vera Rubin平台到2027年累计销售额有望达1万亿美元。

黄仁勋的万亿美元预测,建立在英伟达Groq 3 LPX推理加速器全面量产的基础上。没有LPX,Vera Rubin就只是一半的推理平台。

三星4nm代工:英伟达Groq 3 LPX推理加速器全面量产的供应链暗线

英伟达Groq 3 LPX推理加速器全面量产还有一个容易被忽视的细节——芯片由谁制造。

Groq系列LPU由三星电子晶圆代工部门采用4nm工艺生产。而英伟达的传统GPU产品线始终由台积电代工制造。

同一家公司,两套芯片,两家代工厂。英伟达在供应链上刻意维持着双轨制。Groq芯片全部通过三星代工。

这一安排可能有多重考量。一方面,GPU产能被台积电牢牢占据,新增的LPU产能如果也押注台积电,一旦出现产能瓶颈将全线受制。另一方面,Groq的技术路线本身与GPU差异巨大——片上SRAM为主的架构对制程节点的依赖逻辑与GPU不同,三星4nm足以满足需求。

供应链分散化的战略意图很明显:英伟达Groq 3 LPX推理加速器全面量产,不仅是产品线的扩张,更是供应链风险的对冲。

4倍差距:英伟达Groq 3 LPX推理加速器全面量产引爆低延迟推理军备竞赛

英伟达Groq 3 LPX推理加速器全面量产的消息一出,直接引爆了低延迟推理市场的竞争。

最直接的对手是Cerebras。这家近期刚刚上市的公司,业务重点同样是低延迟推理。Artificial Analysis的排行榜显示,在相同条件下,Cerebras实现了882 Tok/s。而Groq 3 LPX是3400 Tok/s——正好4倍。

OpenAI近期推出的“Ultrafast”模式承诺每秒处理750个Token,由Cerebras提供支持。AMD今年早些时候宣布,将把其机架级系统与Cerebras的芯片进行整合。

低延迟推理赛道正在快速升温。英伟达的Groq 3 LPX、Cerebras的晶圆级芯片、AMD与Cerebras的联盟——不同技术路线、不同商业模式在同一战场上交锋。

但低延迟芯片并不能取代作为AI芯片主力的GPU。GPU既能训练也能推理,灵活性无可替代。低延迟芯片主要专注于模型服务中的一个环节——解码阶段。英伟达Groq 3 LPX推理加速器全面量产,本质上是在GPU的护城河之外,再建一道专门针对低延迟场景的防线。

从“快”到“值”:英伟达Groq 3 LPX推理加速器全面量产的商业逻辑

英伟达Groq 3 LPX推理加速器全面量产,商业逻辑清晰——让云服务商有能力提供“高级服务套餐”。

Harris的原话是:“对于提供Token服务的企业而言,这让他们能够为那些对延迟极其敏感的用户提供高级服务套餐。”

搭载Groq 3 LPX的云服务商,可以针对高实时性的Token服务收取更高溢价。Nebius是第一家部署Groq 3 LPX的AI云服务商,计划将其集成到Nebius Token Factory生产推理服务中。Groq公司本身也预计将成为该平台的首批采用者之一。

英伟达官方宣称,当LPX与Vera Rubin结合时,AI工厂能释放高达10倍的每瓦营收。推理正在成为AI的增长引擎。英伟达Groq 3 LPX推理加速器全面量产,瞄准的正是这个正在爆发的市场——AI智能体消耗的Token最高可达传统AI应用的15倍。

从“快”到“值”的转化,才是英伟达Groq 3 LPX推理加速器全面量产真正的商业闭环。

横向对比:主流低延迟AI推理加速器性能对比

对比维度 英伟达 Groq 3 LPX Cerebras CS系列 AMD + Cerebras 整合方案 OpenAI Ultrafast
每秒Token数 3,400 Tok/s 882 Tok/s 待公布 750 Tok/s
测试模型 Gemma 4 31B Gemma 4 31B
上下文窗口 10万Token 10万Token
单机架芯片数 256颗Groq 3 LPU 晶圆级单芯片 机架级系统整合
片上存储 每颗500MB SRAM,合计128GB 晶圆级SRAM
代工厂 三星4nm
首批部署 Nebius云平台 Cerebras提供支持
上市时间 2026年下半年 已上市 2026年宣布 已推出

这份对比揭示了一个残酷的事实:英伟达Groq 3 LPX推理加速器全面量产之后,低延迟推理市场的性能天花板被瞬间拉高了近4倍。Cerebras的882 Tok/s在几个月前还是行业标杆,如今已被大幅超越。

独到见解:英伟达Groq 3 LPX推理加速器全面量产背后的战略转向

英伟达Groq 3 LPX推理加速器全面量产,表面上看是一次产品发布,实则是英伟达战略转向的标志性事件。

第一,英伟达正在从“通用计算”转向“分工计算” 。过去十年,英伟达的叙事一直是“GPU能做所有事”——训练、推理、渲染、科学计算,一块芯片通吃。Groq 3 LPX的出现打破了这一叙事。英伟达首次承认:GPU不是万能的,在某些特定场景下,专用芯片比通用芯片更高效。这是一个重要的战略转折——从“我的芯片什么都能做”到“针对不同任务用不同芯片”。

第二,200亿美元买的不只是技术,更是时间。 Groq从2016年成立到被收购,在低延迟推理领域积累了近10年的技术储备。英伟达如果自研同类芯片,从零开始至少需要3-5年。200亿美元买下的是宝贵的时间窗口——在低延迟推理市场爆发的前夜直接拿到成熟方案。

第三,SRAM路线 vs HBM路线的路线之争正在分出胜负。 Groq的核心技术路线是“用片上SRAM替代外部DRAM”。这种设计大幅降低了内存访问延迟,但代价是存储容量极小——每颗芯片仅500MB。而GPU走的是HBM高带宽内存路线,容量大但延迟相对较高。英伟达Groq 3 LPX推理加速器全面量产意味着英伟达同时在两条路线上押注——大容量的Rubin GPU负责预填充,超低延迟的Groq LPU负责解码。两条路线不是替代关系,而是互补关系。

第四,“Token经济”正在成为新的商业模式。 英伟达明确提出了“高级Token服务”的概念。未来的AI服务将不再按调用次数或订阅时间收费,而是按Token的质量和速度分级定价。英伟达Groq 3 LPX推理加速器全面量产,正是为这个“Token经济”时代打造的基础设施。

未来挑战:英伟达Groq 3 LPX推理加速器全面量产之后的三个悬念

英伟达Groq 3 LPX推理加速器全面量产之后,还有三个悬念有待揭晓。

悬念一:产能能否跟上需求? 三星4nm产线能否稳定供应256颗芯片组成的复杂机架系统?英伟达Groq 3 LPX推理加速器全面量产只是开始,真正的挑战在于大规模交付。

悬念二:客户是否买单? Nebius是第一家客户。但更多云服务商——AWS、Azure、GCP——是否会大规模采购Groq 3 LPX?还是选择自研或竞争对手的方案?市场的选择将决定英伟达Groq 3 LPX推理加速器全面量产最终的商业成败。

悬念三:Groq团队能否融入英伟达? Groq创始人Jonathan Ross出任英伟达首席软件架构师。一个被收购的创业团队融入一家芯片巨头的文化,从来不是易事。技术可以买来,但团队协同需要时间。

英伟达Groq 3 LPX推理加速器全面量产,是AI基础设施演进的一个分水岭。从训练到推理,从通用到专用,从“快”到“值”——AI芯片行业的游戏规则正在被重写。而英伟达,选择用200亿美元和8个月时间,在这场重写中占据了先手。

常见问题(FAQ)

问:英伟达Groq 3 LPX推理加速器全面量产是什么时候宣布的?

答:2026年8月24日(当地时间),英伟达在Hot Chips 2026会议上正式宣布Groq 3 LPX机架系统进入全面量产阶段。

问:英伟达Groq 3 LPX推理加速器的性能指标是多少?

答:在Artificial Analysis基准测试中,运行Gemma 4 31B模型、10万Token上下文时,每秒可输出3400个Token。在延迟敏感的工作负载上,比最接近的竞品快4倍。

问:英伟达Groq 3 LPX推理加速器和英伟达GPU有什么区别?

答:Groq 3 LPX是专用推理加速器,主要聚焦AI推理的解码阶段,负责高速Token生成。GPU则既能训练也能推理,更具通用性。两者是互补关系而非替代关系。

问:英伟达Groq 3 LPX推理加速器由谁代工生产?

答:Groq系列LPU由三星电子晶圆代工部门采用4nm工艺生产。英伟达的传统GPU则由台积电代工。

问:英伟达Groq 3 LPX推理加速器的首批客户是谁?

答:AI云服务商Nebius是第一家部署Groq 3 LPX的客户。系统将部署在Nebius的数据中心,预计2026年下半年上线。

问:英伟达收购Groq花了多少钱?

答:2025年12月,英伟达以约200亿美元现金获得Groq的核心AI推理技术知识产权和相关资产。这是英伟达史上最大规模的一笔收购。

问:英伟达Groq 3 LPX推理加速器对AI行业意味着什么?

答:标志着AI推理从“通用GPU计算”向“异构分工计算”转型。云服务商可以针对低延迟Token服务收取更高溢价,推动“Token经济”商业模式的成熟。

以上内容不代表本平台立场,仅供读者参考