文章摘要
2026 年全球人工智能大会同期,AMD 在旧金山举办的大会上推出面向下一代 AI 基础设施的产品组合,包括 Instinct MI455X 及 Helios 系统。介绍了产品技术特点、针对 AI 场景的优化,还提及客户合作、对 CUDA 的看法,指出 AMD 改变市场格局需过交付、系统效率、软件生态三关。

2026年全球人工智能大会落下帷幕,AI技术落地、人机协同发展成为产业核心共识。就在同期,AMD在旧金山举办的Advancing AI 2026大会上,正式推出了面向下一代AI基础设施的全新产品组合,其中最受关注的当属全球首批采用2nm计算芯粒的数据中心GPU产品Instinct MI455X,以及基于该产品打造的Helios机架级AI计算系统。

全球首个2nm GPU的真实面目很多人被“2nm GPU”的标签吸引,但需要先厘清两个容易混淆的产品:Helios系统同时搭载了采用Zen6架构的第六代EPYC“Venice”CPU,以及MI455X数据中心GPU。其中Venice CPU拥有256核心、2030亿晶体管,基础频率超过5GHz,是首款采用台积电2nm工艺进入量产爬坡阶段的高性能计算产品,AMD已经启动了该款CPU的产能提升计划。

MI455X同样引入了2nm先进工艺,但“2nm GPU”并非指封装内所有芯片都采用2nm制程。这款产品是高度复杂的Chiplet架构,总晶体管数量约3200亿:由4颗负责计算的XCD芯粒(采用台积电N2工艺)、2颗承担缓存与互连功能的FCD芯粒(采用N3P工艺)、I/O芯粒,以及12组HBM4内存组成。因此更准确的说法是,MI455X是首批搭载2nm计算芯粒的数据中心GPU。

台积电N2工艺首次采用全环绕栅极纳米片晶体管,官方数据显示,在相同功耗下该工艺相较N3可带来最高15%的性能提升;在相同性能下,功耗最多可降低30%,芯片密度提升超过15%。对于动辄功耗达千瓦级、由数十颗GPU组成的AI机架系统来说,能效提升直接关系到机架密度、散热成本以及每Token推理成本。

针对AI场景的深度优化先进制程不会自动转化为AI性能,MI455X的技术赌注还体现在架构设计层面。这款产品采用新一代CDNA5架构,包含256组WGP计算单元,其中一个关键变化是将wavefront宽度从此前的64线程调整为32线程。

更窄的wavefront可以让GPU以更细的粒度调度任务,降低部分工作负载中的线程分歧和寄存器压力,更匹配当前AI模型大量使用的矩阵计算逻辑。不过这也意味着AMD需要重新调优大量底层算子、编译器策略和手写内核,对于依赖旧版ROCm优化路径的开发者来说,架构变化可能带来新的迁移成本。

在低精度计算方面,MI455X的理论性能表现亮眼:OCP MXFP4算力约40.26 PFLOPS,MXFP6和MXFP8算力约20.13 PFLOPS,FP16和BF16算力约5.03 PFLOPS,这些参数明显面向大模型推理、强化学习和低精度训练场景,而非传统通用浮点计算。

相比理论算力,MI455X更具现实意义的提升来自内存配置:每颗MI455X配备432GB HBM4内存,而一个完整的Helios机架搭载72颗该款GPU,总显存容量达到约31TB。更大的显存可以容纳更大的模型权重、更多并发请求和更长的KV Cache,减少模型在多颗GPU之间的切分次数,对于长上下文推理、Agent并发和混合专家模型而言,这些能力往往比单纯提升峰值FLOPS更为重要。

从单卡到机架级AI工厂如果只看单张MI455X加速器,很难理解AMD真正想要挑战的目标。完整的Helios机架采用72颗MI455X GPU和18颗EPYC Venice CPU组成,整体可提供约2.9 ExaFLOPS的FP4算力和1.4 ExaFLOPS的FP8算力。机架内部的scale-up互连带宽达到260TB/s,对外scale-out网络带宽则达到43TB/s。

这已经不是传统意义上的服务器,而是以机架为最小交付单位的AI计算系统。长期以来,AMD在单颗GPU的计算能力和显存容量上并不缺乏竞争力,但真正的短板在于如何将数十颗乃至数万颗GPU高效连接,并保证它们在大规模训练和推理任务中持续保持高利用率。大模型训练中的一次集合通信延迟、一个网络拥塞点或者一块故障GPU,都可能让整个集群停顿,GPU数量越多,系统工程的重要性就越突出。

与英伟达依靠NVLink、NVSwitch、InfiniBand、CUDA等形成的垂直整合生态不同,AMD在Helios上选择了更开放的路线:系统采用OCP开放机架规范,机架内部使用UALink和UALoE互连技术,向外扩展则采用Ultra Ethernet Consortium相关技术,并结合AMD Pensando网络芯片。AMD希望通过开放标准吸引云厂商、服务器制造商和网络设备企业共同参与,避免依赖单一供应商的互连体系。

这种开放路线的优势在于客户拥有更多供应商选择,也更容易根据自身数据中心架构进行定制;但风险也很明显:开放生态往往意味着更多兼容性测试、更复杂的责任边界,以及更高的系统集成难度。而且Helios本身只是一套参考设计,并非AMD直接销售的标准整机,最终系统仍需由OEM、ODM和云厂商完成设计、制造和部署,这意味着AMD不仅要保证芯片可用,还要协调内存、网络、电源、液冷、机架和系统软件等多个环节,从卖GPU到交付机架,AMD面临的是完全不同的执行难度。

头部客户的深度绑定AMD此次发布的产品阵容中,最具分量的筹码莫过于星光熠熠的客户名单。OpenAI在2025年10月便与AMD签署了规模最高达6GW的多代产品协议,首批1GW算力计划在2026年下半年基于MI450系列部署,同时AMD向OpenAI提供了最高可获得1.6亿股AMD股票的认股权证,兑现条件与部署进度、技术和商业里程碑以及AMD股价表现挂钩。

Meta随后也与AMD签署了最高6GW的多年合作协议,首批1GW产品预计从2026年下半年开始交付,Meta使用的并非完全标准化产品,而是双方联合定制的MI450系列GPU,AMD同样向Meta提供了最高1.6亿股的认股权证。

甲骨文的承诺更加具体:Oracle Cloud Infrastructure计划从2026年第三季度开始部署5万颗MI450系列GPU,并在2027年以后继续扩大规模,甲骨文将成为Helios架构的重要云端承载者之一。AMD还在发布会前后进一步扩大了客户阵容,Anthropic宣布与AMD达成最高2GW的战略合作,第一阶段1GW算力预计在2027年上半年上线,AMD则计划向Anthropic投资最高50亿美元,双方还将使用Claude协助优化AMD工作负载和ROCm软件。

这批协议证明,头部AI公司正在积极寻找英伟达之外的第二供应源,但也揭示了一个现实:AMD目前获得的许多大单,并非简单的市场采购,而是包含定制开发、资本投资、认股权证和长期联合优化的深度绑定合作。

CUDA“无关紧要”了?在MI455X的硬件参数之外,AMD公司副总裁兼数据中心GPU业务集团总经理Andrew Dieckman对CUDA的评价引发了广泛讨论。按照他的说法,过去与客户交流时,CUDA曾经是高频话题,但如今与大型客户的讨论中已经很少被提及,因为企业正在PyTorch、vLLM、Triton等更高层抽象框架上编程,底层究竟是CUDA还是ROCm,对应用开发者的可见度正在下降,他将CUDA称为一个“non-event”,也就是不再构成决定性事件。

这个判断并非完全没有依据:过去开发者可能直接编写大量CUDA代码,如今大部分模型训练和推理任务都通过框架、算子库和推理引擎完成,AMD也承诺MI455X和Helios在发布时将支持PyTorch、TensorFlow、JAX、ONNX Runtime、vLLM和Triton,ROCm已经提供面向vLLM的官方镜像和优化环境。生成式AI还在反过来降低软件迁移成本,模型可以帮助开发者重写内核、查找不兼容算子、调整编译选项,甚至根据硬件特征生成针对性的优化代码,从这个角度看,CUDA作为显式编程接口的重要性确实可能下降。

但将CUDA直接归结为“无关紧要”仍然过于乐观。CUDA并不只是一门编程语言或者一套API,它还包括数学库、通信库、编译器、运行时、调试器、性能分析工具和长期积累的硬件优化经验。英伟达官方CUDA工具链中包含大量加速库、编译工具和Nsight调试分析组件,这些能力已经深入到PyTorch、推理引擎和云计算平台内部。高层框架隐藏了CUDA,却没有消除对底层能力的依赖。

当模型使用标准算子时,PyTorch和vLLM确实可以让硬件差异变得不明显;但一旦涉及自定义算子、混合精度、稀疏计算、专家并行、跨节点通信、显存管理或者性能诊断,开发团队仍然要进入底层软件栈。真正困难的也不是让一个模型“跑起来”,而是让它在数千颗GPU上稳定运行,并在性能、功耗、故障恢复和运维成本上达到生产要求。因此Dieckman的判断更准确的理解应该是:CUDA正在失去作为唯一应用入口的地位,而不是CUDA生态本身已经失去价值。

距离改写格局还有三道关MI455X和Helios意味着AMD已经跨过了一个重要门槛:从销售单颗加速器,进入交付机架级AI基础设施的阶段。但要真正改变市场格局,它至少还要通过三次检验。

第一是交付能力:2nm计算芯粒、3nm互连芯粒、HBM4和复杂先进封装需要同时满足良率和产能要求,Helios能否按照计划在2026年第三季度末出货,并在2027年支持吉瓦级部署,是最直接的考验。

第二是系统效率:理论算力、内存容量和互连带宽必须最终转换为模型吞吐量、GPU利用率和每Token成本,只有当大规模生产环境中的实测数据出现,MI455X与竞品的比较才真正有意义。

第三是软件生态:ROCm能否让框架适配、算子优化、性能诊断和故障排查变成普通工程问题,而不是每次部署都需要AMD与客户联合攻关,将决定客户是否愿意长期迁移核心负载。

OpenAI、Meta、微软、甲骨文和Anthropic的加入,已经证明头部客户愿意为第二供应源签字,但这还不能证明它们愿意把最关键、最庞大的工作负载长期从英伟达平台迁走。AMD真正需要做到的,是让ROCm也变成一件“不值得讨论的事情”——模型直接运行,性能可以预测,问题能够快速定位,迁移不再需要动用双方大量工程师。到了那一天,AMD将真正在AI基础设施市场拥有一席之地。

以上内容不代表本平台立场,仅供读者参考