文章摘要
华为在行业全联接大会发布灵衢统一互联总线架构,针对AI Agent时代超大模型带来的通信、异构协同、存储等算力痛点,通过四大核心能力优化,使10万卡规模AI集群算力利用率提升15个百分点,覆盖从中小场景到百万卡级集群全场景部署,配套开源生态,为大模型时代提供新型算力底座。

在近期的行业全联接大会上,相关厂商发布的灵衢互联架构引发广泛关注。基于这套架构,10万卡规模的AI集群算力利用率从20%提升至35%,涨幅达到15个百分点。这套架构究竟凭借哪些核心能力,解决了AI Agent时代的算力痛点?

简单来说,灵衢是一套统一互联总线协议,能够将CPU、NPU、DPU、DDR、SSD等各类计算与存储单元打通互联,覆盖从单机、超节点到超大规模集群的全场景算力部署。

为何架构创新核心落在通信领域?

当前AI模型参数规模从万亿级迈向10万亿级,未来还可能增长至20万亿甚至50万亿;上下文长度也从几KB升级到几MB,后续将拓展到几十MB。与此同时,人与AI Agent的交互频次远高于传统大模型应用,对底层计算系统提出了更高要求。

作为AI底层的计算系统,需要同时支持超大模型推理、高频次调用、多种工具使用以及多层级信息传递与存储,面临多重核心挑战:

第一,通信量呈平方级暴涨,集群算力利用率快速下滑。数据并行域内的通信量与模型参数量近似呈平方关系,通信时间占比大幅提升,导致模型浮点算力利用率快速下降。典型MoE模型在10万卡集群上的MFU不足20%,如何打破算力利用率随集群规模扩张而下滑的趋势,成为首要难题。

第二,单一算力无法适配所有AI负载,异构协同与内存池化成刚需。当前AI业务负载呈现多样化特征,预填充与解码环节有着截然不同的计算和访存特征,需要分离环节使用不同算力适配。面向更大模型、更低时延的推理需求,解码环节的Attention与FFN模块也可通过专用算力加速提升效率。同时随着Agent应用普及,CPU与NPU配比发生变化,计算系统需要支持异构算力协同与内存资源池化,实现动态高效调整。

第三,上下文持续变长带来存储压力,旧互联架构无法支撑多级缓存。无论是模型训练还是推理,都需要构建HBM、DDR、SSD分层分级的多级缓存架构。而现有PCIe加RoCE网络难以满足缓存所需的时延与带宽要求,未来PB级的KV Cache也需要更大带宽和更低时延来匹配。

可以说,通信已经成为决定计算系统性能的关键因素,它需要超强互联能力支持异构算力协同与扩容,需要打破物理极限实现资源池化,同时还需要超大带宽与更低时延保障整体效率。灵衢架构正是针对这些行业变化给出的系统性解决方案。

四大核心能力重构算力底座

灵衢的核心在于用一套协议贯穿从芯片到集群的整个系统,将复杂协议归一、统一内存语义,消除协议转换带来的额外开销。其竞争力主要体现在四个维度:

第一,协议归一,统一内存语义。传统计算系统采用主从架构,服务器内部CPU和内存可通过load/store指令直接访问,但跨节点访问通常依赖RDMA消息传递,数据需要反复打包拆包并进行协议转换。灵衢从协议层重新设计互联逻辑,将CPU、NPU、DPU、内存、存储、网卡等核心组件统一基于灵衢协议互联,实现十几种协议归一;同时在超节点内部统一内存语义,实现全局内存统一编址。通过这一设计,互联带宽从百GB级提升到TB级,RTT通信时延从7微秒压缩至2微秒,降幅约70%。

第二,多样算力,异构协同。CPU、NPU、内存和SSD等计算与存储单元可通过灵衢实现直接对等互联,形成去中心化的平等访问模式。这让计算系统可以根据不同业务需求灵活配比CPU和NPU资源,同时具备更强可扩展性,不再受制于固定节点结构。

第三,分级存储,全局池化。随着AI模型规模不断扩大,单颗芯片、单台服务器的内存容量已难以满足需求。灵衢通过分级存储和全局池化技术,将多种混合存储介质纳入统一资源体系,有效提升内存利用率。

第四,光电互联,灵活组网。当超节点规模从千卡迈向万卡时,传统电互联会受到物理距离、带宽和功耗等多重限制。通过光电互联技术可构建超高带宽、超低时延的“数据高速公路”,让算力能够从柜内向跨柜场景延伸。

以4096卡超节点为例,其需要56个计算柜和14个灵衢互联柜,灵衢最长传输距离超过200米。通过光路保护、高速光互联以及176端口、280Tb高速互联的灵衢交换设备,单个超节点规模可从1024卡扩展到4096卡。进一步向外扩展时,4096卡超节点可作为基本扩展单元,通过1024超大Radix扇出能力、两层CLOS以及多平面、多轨道拓扑,最终让单个集群支持100万颗AI处理器。

有行业产业链人士指出,过去几年行业大多在既有PCIe加RoCE体系上优化,但Agent负载同时放大了通信、内存和存储的短板,继续在旧协议上叠加补丁的收益会越来越有限。灵衢架构相当于为AI Agent重装了算力底层逻辑,能够更好满足多样化算力需求。

覆盖全场景的灵衢算力生态

基于灵衢架构,厂商构建了光电互联、多样算力、分级池化的AI Agent超节点集群,计算、存储、联接产品全面支持灵衢协议,采用模块化设计可灵活配置。

首先是超节点“全家桶”产品。本次发布的Agentic AI超节点集群由鲲鹏950超节点、昇腾960超节点、OceanStor M900记忆存储、星河UBG交换机组成。整套集群可实现灵衢统一协议、多样化算力灵活扩展、资源分级池化,实现最优计算效率。其中基于灵衢+NPO光引擎Hi-ONE的昇腾960超节点,单节点可实现4096卡规模,最大可提供8 EFLOPS FP8算力,支持高达1PB的HBM容量,系统无故障运行时间提升1倍,系统可用度达到99.8%。昇腾960风冷超节点和液冷超节点分别将于2027年第二季度和第三季度上市。

在扩展能力层面,柜内灵衢交换刀片支持172T超大带宽,可实现72个昇腾处理器和18个鲲鹏处理器互联。通过光互联减少柜内电缆,单个4096超节点的单柜可节省196公里铜缆,长度超过上海到杭州的距离。跨柜部署时,灵衢交换设备拥有176个端口,每个端口带宽达到1.6T,单机可实现280T全光互联。通过两层CLOS组网,可构建4096卡超节点,RTT时延低至2微秒。进一步向外扩展,UBG灵衢网络交换机拥有1024超大Radix扇出能力,可支持百万卡超节点集群,适配参数向几十万亿级演进的大模型需求。由此,灵衢形成从单柜、千卡、万卡到百万卡的分层分级互联体系,支持按需弹性扩展。

算力与存储的协同同样是灵衢架构的优势所在。鲲鹏950超节点的计算刀片提供384个CPU核和6TB内存,单柜可提供12288个CPU核,支持192TB内存。基于灵衢协议,鲲鹏超节点可实现超过150万核的统一调度,以及24000TB内存的全局池化、统一编址和统一访问。昇腾960超节点计算刀片支持8颗昇腾960 NPU,提供32 PFLOPS FP4算力、4.5TB统一内存,以及17.9TB/s的灵衢互联带宽。OceanStor M900负责记忆存储,通过全新的存储控制器和ASU模组,实现网络、CPU、盘控芯片“三芯合一”,单ASU模组拥有64TB容量密度,单节点访问带宽达到480GB/s。三类硬件通过灵衢统一协议实现灵活配置、联动协同和全局访问,融合效果可达到“1+1+1>3”的协同效应。

除大规模集群场景,中小场景同样被纳入灵衢覆盖范围。当前大部分企业实际部署仍需要风冷和轻量化方案,桌面级AI应用也在快速普及。为此基于灵衢推出从1卡到8卡的系列化、多层级一体机产品和鲲鹏昇腾模组。其中Atlas 650E可通过双机灵衢直连,让16个NPU实现Full-Mesh组网,无需额外交换机。两台设备可像单台设备一样运行,支持万亿参数模型,并通过EP16并行切分让推理吞吐提升40%以上,时延低至10毫秒,让中小企业也能在本地运行万亿参数大模型,同时保障用户体验和数据安全。当后续需要扩展到16卡以上时,还可继续通过灵衢互联平滑扩容,形成小型超节点,同时支持PD分离部署,实现异构AI算力高效协同。总体而言,灵衢架构既可以支撑百万卡级别的超大规模集群,也能满足中小场景的轻量化部署需求,让灵活算力成为产业刚需。

开源生态降低落地门槛

灵衢要成为通用算力底座,不能仅依靠硬件层面的优势。官方回顾显示,去年8月5日相关CANN工具链全面开源开放,目前已跃升为中国开源项目活跃度第一。当前CANN社区月活开发者已达5200多人,来自企业、高校等不同群体的开发者持续参与其中。已有50多家行业头部客户、合作伙伴及高校科研团队参与合作,将行业知识和业务经验融入平台,已打造出26个行业专属算子库。

比如与南方电网、高校及其他伙伴共同在社区中构建了电力仿真求解、电力负荷预测、电力装备巡检等一系列专属开源算子库,让输电线路巡检更加精准,电网负荷预测更加高效,真正让AI技术落地到电力生产一线。还有企业深耕AI大模型与应用技术创新,基于该平台打造领先AI模型,开发智能客服、办公等通用方案,以及金融、教育、医疗等行业的场景化方案,为客户提供高质量AI解决方案。

在Agent开发生态层面,正在与DeepSeek Harness、OpenCode、openJiuwen等开源框架协同合作,打造智能管理系统、推理加速库、安全框架等Agent插件化组件,并进行全量开源。为进一步降低开发和部署门槛,还与90多家主流开源社区展开合作,覆盖算子编程、基础库搭建、模型训练微调、推理部署和强化学习等全链路场景。最终目标是实现AI算力应用的“开箱即用”,这也是“硅基黑土地”战略的核心逻辑。

算力底座之争的新选择

AI时代浪潮奔涌而来,算力是这场变革的核心基石。相关负责人在相关活动中表示,未来将坚持系统级技术创新,面向各行各业构筑系列化算力底座;同时坚持开源开放,联合客户、合作伙伴和开发者共建生态,为全球智能世界提供新的选择。

从灵衢架构打破通信瓶颈,到多颗关键芯片支撑超节点集群,再到百万卡集群与开源生态跨越发展拐点,相关厂商正以“计算加通信”的垂直整合能力,为10万亿级大模型时代构筑坚实的算力底座。当算力供给从“硬件变现”走向“生态共赢”,AI基础设施的竞争已经升级为体系化能力的较量,相关硅基黑土地战略,正试图为智能世界提供另一种可靠的选择。

以上内容不代表本平台立场,仅供读者参考