文章摘要
阿里在云栖大会发布真武V900AI芯片,其单芯性能为前代三倍,搭载216GB显存、1200GB/s互联带宽,原生支持FP8/FP4低精度计算,被称为目前国内算力最强的AI芯片,计划2027年第一季度量产。此次发布标志平头哥从单点芯片突破转向全栈算力系统布局,芯片迭代压缩至一年一代,目标平替英伟达H200,已服务超650家客户,绝对算力等仍待量产验证。

阿里发布真武V900 AI芯片,216GB显存与1200GB/s互联带宽,单芯性能达前代三倍,2027年一季度量产。它不只是一颗芯片,更是平头哥从单点突破转向全栈算力系统的一次关键落子。

阿里发布真武V900 AI芯片

一个数字背后,藏着一场“速度失控”

阿里发布真武V900 AI芯片这件事,最值得关注的数字不是“三倍”。

虽然官方口径确实如此:单芯片性能达到上一代真武M890的三倍,搭载216GB显存,片间互联带宽1200GB/s,原生支持FP8和FP4低精度计算,将于2027年第一季度量产。阿里巴巴集团CEO吴泳铭在云栖大会现场将其定义为“目前中国算力性能最强的AI芯片”。

但真正让人停顿一下的,是时间线。

2026年1月,平头哥对外披露真武810E。5月,真武M890亮相,性能是810E的三倍。9月,真武V900发布,性能又是M890的三倍。从810E到V900,两代产品各涨三倍,累计算力提升约九倍,而迭代周期从两年压缩到了一年。

“一年一代”这句话,在此之前更像路线图上的愿景。但现在它被工程交付验证了。这意味着阿里发布真武V900 AI芯片,不只是发布了一款新产品,而是把芯片迭代本身变成了一种可预期的工业节奏。

节奏一旦稳定,博弈的规则就变了。

芯片参数之外,真正被重新定义的是什么

216GB显存:解决的是“记忆常驻”问题

如果只看216GB这个数字,很容易把它理解为“堆料”。但平头哥半导体副总裁高慧在发布会上的表述透露了真实意图:216GB大容量显存“解决了记忆常驻问题”,片间互联带宽达1200GB/s后,“模型再大、结构再分散,通信也不会拖算力的后腿”。

翻译一下:当前主流大模型几乎全面转向MoE架构。MoE的“稀疏激活”机制让每个Token只调用部分专家,参数量可以做得很大,但代价是通信变得极其复杂。专家分布在不同芯片上,Token要被动态路由到对应专家,计算完再汇集,产生大量All-to-All通信。如果带宽跟不上,稀疏激活带来的计算效率收益会被通信开销吃掉。

216GB显存和1200GB/s互联带宽的组合,本质上是在回应这个结构性矛盾。单卡能装下更多“专家”,需要跨卡通信的数据量就减少;即使需要通信,1200GB/s的带宽也让等待时间大幅压缩。

这不是简单的性能升级,而是在适应模型架构本身的变化方向。

低精度计算:每降一档,能效翻一倍

真武V900原生支持FP8和FP4,这一点在高慧的表述中有一个值得注意的细节:“精度每降一档,一度电换来的Token的数量基本可以翻一倍”。

这句话把技术参数拉回了运营现实。推理正在成为AI算力消耗的主体——Agent类产品需要经历规划、调用工具、读取数据、再次推理的数十轮循环,上下文窗口突破百万级,KV Cache不断膨胀。在这个场景下,单位Token的成本直接决定了AI服务能否在真实业务中被大规模使用。

FP4意味着在保持模型可用性的前提下,同样硬件可以获得数倍于FP8的有效吞吐。阿里发布真武V900 AI芯片时把低精度支持放在与显存、带宽并列的位置,说明它瞄准的不是训练benchmark上的跑分,而是推理阶段的单位经济性。

从一颗芯片到五十万张卡

超节点与统一内存编址

真武V900发布的同时,阿里推出了基于它的超节点服务器。这里面有一个容易被忽略但极为关键的技术细节:通过自研ICN Switch互联芯片连接后,超节点具备“原生内存语义和内存统一编址能力”。

内存统一编址的意思是,跨节点的数据访问发生在同一个内存空间里,而不是通过传统的网络消息传递。上千颗真武V900可以像一颗“超级芯片”一样协同工作,跨节点通信不再遇到“带宽对不上”的问题。

这是一个系统级的工程选择。当单芯片性能提升遇到物理极限时,通过片间互联和内存语义统一把多颗芯片“拼”成一个逻辑上的大芯片,是在现有工艺条件下继续提升集群有效算力的现实路径。

单一集群可扩展至50万卡,配合阿里云智算中心网络架构,目标是支撑5万亿乃至10万亿参数的前沿模型训练。

全栈自研的棋盘

如果只看AI芯片,可能会低估平头哥在2026年云栖大会上展示的全貌。

同一次大会上,平头哥首次公布了倚天服务器CPU的规划:2027年推出倚天720和倚天730,后者首次基于全自研CPU微架构,单核性能最高提升至倚天710的1.4倍。更远的倚天750将支持ICN片间互联总线协议,倚天CPU与真武AI芯片之间可通过ICN总线直接互联。

再加上ICN Switch互联芯片、磐脉智能网卡、镇岳SSD主控芯片,平头哥已经完成算力、网力、存力的全栈数据中心核心芯片布局。

这个布局的深层逻辑在于:Agent产品正在成为AI算力增长最快的场景。Agent的任务规划、状态管理、工具调用极其依赖CPU,海量数据的预处理与编排也需要CPU完成,而且需要单核性能强、内存带宽高、与GPU紧耦合的CPU。当AI芯片从“辅助”走向“核心”时,CPU不能只是通用件——它必须和AI芯片在架构层面协同设计。

阿里发布真武V900 AI芯片,真正的底牌不在V900这颗芯片本身,而在于它嵌入了这个全栈棋盘之中。

与H200的对照:显存领先,但还有悬念

横向比较是理解真武V900定位的必要环节。以下对比基于公开信息整理,部分参数官方尚未披露,以标注说明。

对比维度 真武810E 真武M890 真武V900 英伟达H200(参考)
显存容量 96GB 144GB 216GB 141GB
片间互联带宽 700GB/s 800GB/s 1200GB/s NVLink约900GB/s
低精度支持 FP32至FP4 FP8/FP4 FP8
量产时间 2026年1月 2026年5月 2027年Q1 已量产
单芯片绝对算力(TOPS) 未公开 未公开 未公开 公开数据可查

数据来源:官方发布信息及公开报道。

从表格可以读出几个信息。

显存容量上,真武V900的216GB确实超过了H200的141GB,这是目前公开信息中最直接的领先项。在MoE模型和长上下文推理场景中,更大的显存意味着单卡能承载的模型切片更大,需要的张量并行切分更少,通信开销更低。

互联带宽方面,1200GB/s对H200的NVLink带宽也形成了比较优势。

但表格也暴露了一个关键空白:真武V900的绝对算力数据(TOPS或FLOPS)官方尚未公布。所有性能表述都以“M890的三倍”作为基准,而M890的绝对算力同样未公开。这意味着目前无法在绝对算力维度上做一个严谨的横向对照。

阿里云智能集团副总裁李强曾在2026年9月初表示,V900的目标是“平替英伟达H200”。这个目标的实现程度,最终取决于两个因素:绝对算力密度能否接近或达到H200的水平,以及全栈软件生态对主流训练框架和推理引擎的适配深度。

显存领先是事实,互联带宽领先是事实,但“平替”是一个系统命题,不是单一参数的比较。

从“可用”到“好用”的距离

650家客户意味着什么

平头哥披露的数据显示,真武系列芯片已服务超650家企业客户,覆盖智驾、金融、大模型、具身智能、能源、制造等行业。基于M890的超节点已经跑通了Qwen3.8、Kimi K3等超过2万亿参数的模型。

650家客户是一个有分量的数字,但它需要被放在正确的语境中理解。客户数量反映的是“可用性”已经得到验证——这些企业确实在真武芯片上运行了真实工作负载。但从“可用”到“好用”,中间还隔着工具链成熟度、框架兼容深度、调优经验积累、以及开发者社区规模等多个维度。

生态兼容性上的进展速度,将决定这650家客户是保持“尝试性使用”还是走向“规模化部署”。

一个值得推敲的细节

2026年5月的阿里云峰会上,平头哥公布的路线图中,真武V900的计划发布时间是2027年第三季度。9月云栖大会上,量产时间调整为2027年第一季度。

提前了两个季度。

在芯片行业,提前量产通常意味着工程化进度好于预期,或者外部需求压力迫使节奏加快。无论哪种原因,这个调整说明平头哥对V900的工程成熟度有足够信心,也说明云业务端对更大规模AI算力的需求窗口比预期更早打开。

阿里同时宣布了一个更宏大的目标:到2032年,阿里云全球数据中心容量做到20吉瓦,三年投入超530亿美元。芯片提前量产,是在为这个基础设施扩张节奏做匹配。

我的判断:真正的变量不在芯片本身

写到这里,需要给出一些独立的观察。

阿里发布真武V900 AI芯片,最容易得出的结论是“国产AI芯片又追上了一点”。但这个结论忽略了真正重要的变化。

第一个变化:竞争单元从“芯片”变成了“系统”。

真武V900的参数很好看,但它的设计意图是嵌入一个由AI芯片、CPU、互联芯片、网卡、存储主控和超节点服务器组成的系统。在这个系统里,单颗芯片的峰值算力不是唯一关键指标,芯片之间的协同效率、内存语义的统一程度、以及软件栈对系统资源的调度能力,同样决定最终的有效算力。

这意味着评估国产AI芯片的维度需要更新。不再只是看单芯片的TOPS数字,而是看“算力×内存×互联”的系统乘积,以及这个乘积在真实负载下的兑现率。

第二个变化:迭代节奏本身成了竞争力。

从两年一代到一年一代,平头哥把芯片研发从“项目制”推向了“产品线制”。产品线制的好处是每一代都可以在前一代的工程基础上做增量优化,而不是每次重新来过。V900的216GB显存和1200GB/s带宽,建立在M890的144GB和800GB/s之上,而M890又建立在810E的96GB和700GB/s之上。每一代都在前一代验证过的架构上做深度迭代,而不是推倒重来。

这种节奏如果能够持续,意味着客户可以基于一个可预期的性能提升曲线来做算力规划,而不是被动等待“下一代突然出现”。

第三个变化,也是我最关心的一点:真正的考验在量产之后。

芯片发布是工程能力的展示,量产是制造能力的检验,而规模化部署中的稳定性和效率,才是产品力的最终证明。真武V900计划于2027年第一季度量产,并将在阿里云数据中心规模化部署。到那时,真正需要回答的问题是:在实际的万亿参数模型训练任务中,50万卡集群的有效算力利用率是多少?单Token推理成本相比M890降低了多少?开发者迁移到平头哥软件栈的摩擦有多大?

这些问题的答案,比任何发布会上的参数都更有说服力。

常见问题

真武V900什么时候可以买到或使用?

官方计划2027年第一季度量产售卖,并将在阿里云数据中心规模化部署。企业客户预计可以通过阿里云算力服务的形式在同期获得使用入口。

真武V900和英伟达H200相比怎么样?

在显存容量(216GB vs 141GB)和片间互联带宽(1200GB/s vs NVLink约900GB/s)上,真武V900具有参数优势。但绝对算力数据尚未公开,无法进行完整的算力密度对比。阿里云方面将V900的目标定位为“平替H200”,实际达到程度取决于绝对算力和软件生态成熟度。

50万卡集群是什么概念?

单一集群可扩展至50万张加速卡,通过自研ICN Switch互联芯片实现千卡全带宽高速互联和内存统一编址。这个规模的集群主要面向5万亿至10万亿参数级别的前沿模型训练需求,是目前公开信息中规模最大的国产AI芯片集群规划。

真武V900只能用于训练吗?

不是。它是训推一体芯片,可应用于高精度训练、低精度和超低精度推理的全场景。官方特别强调了对FP8和FP4低精度推理的支持,每降低一档精度,同等电量下可产出的Token数量约翻一倍。

平头哥的芯片迭代会一直保持一年一代吗?

根据平头哥公布的路线图,真武J900计划于2028年第三季度发布。从810E到M890到V900再到J900,节奏确实是每年一代。能否持续取决于每一代的工程交付质量和市场需求的连续性,目前来看路线图是清晰的。

以上内容不代表本平台立场,仅供读者参考