AI算力不再靠堆料,浪潮双产品破解两大瓶颈

长期以来,AI算力赛道的竞争逻辑似乎始终围绕着一个简单的思路:堆。堆叠计算卡、扩容机柜、加大发电功率……仿佛只要算力硬件的规模足够大,就能在行业中占据领先位置。但如今,算力是否够用的命题已经不再能通过单纯堆叠硬件解决,行业需求正在分化出越来越复杂的维度。
当前AI算力的挑战可以拆解为两个核心方向:一是智能上限,也就是算力系统能够支撑多强的智能能力;二是智能规模,即算力能够以多低的成本,生产出足够多的智能服务。这两个问题彼此独立又相互关联,只解决其中一个,无法突破全部的算力瓶颈。
在近期举办的人工智能计算大会2026上,相关行业机构发布的评估报告,正是从这两个维度展开了对当前算力格局的分析。
算力缺口的双重维度
随着智能体(Agent)技术的爆发,AI对算力的需求正在发生根本性变化。过去调用大模型更像是脉冲式的单次交互:用户提出一个问题,系统返回一次答案,算力调用仅持续短暂的时间。但当Agent接管任务后,情况完全不同——一个人类意图可能触发数十甚至数百次连续推理;当多个Agent组成协作网络时,系统连续运转的时长甚至可以达到数小时乃至数天。原本分散的单次算力请求,逐渐汇聚成持续不断的计算负载,给基础设施带来了全新的压力。
这种长时运行的算力压力,可以拆解为三个关键影响因子:
- 任务执行次数:据行业报告数据,到2030年,全球每年的AI推理任务将增长至4000万亿次;
- 单任务Token消耗量:过去一次简单问答仅消耗数十个Token,而如今一次多轮任务决策的Token消耗可达数十万;
- 多智能体协同的放大系数:单个用户操作会被拆解为多条Agent指令,Agent之间传递上下文、汇总结果进一步拉长了任务链路,放大了前两项的增长幅度。
这三个因子以乘法形式叠加,将算力需求的增长曲线推到了前所未有的高位。行业数据显示,从当前到2030年,全球Token消耗量的复合增长率将达到4822.6%,Agent消耗的Token规模正在急剧膨胀。
但算力供给的增长速度,却远远滞后于需求的变化。报告数据显示,全球AI算力需求满足率从2024年的79%持续下滑,2027年预计将跌至71%;即便后续上游半导体供应链压力有所缓解,到2030年需求满足率也仅能恢复到77%左右。看似小幅的百分比波动背后,是急速膨胀的需求基数:到2030年,算力缺口的绝对值将达到3809亿美元,规模扩大至2024年的近十倍。
过去弥补算力缺口的主要方式是“大力出奇迹”,通过扩大集群规模堆叠更多算力。但Agent时代的推理负载类型繁多,对算力设施的要求各不相同:Prefill阶段属于高并行、高计算密度的任务,Decode阶段则需要逐Token串行处理,对内存带宽要求更高;Attention模块需要频繁访问不断增长的KV Cache,MoE架构包含稀疏计算和大规模路由调度,多模态模型还拥有独立的Encoder模块……这些负载各有独特的计算特征,还会随着上下文长度、输出长度和并发规模动态变化。
以Agent任务为例,首轮对话的上下文可能仅有一两万个Token,但经过上百轮对话后会扩展到三四十万个,系统的瓶颈会在计算、显存、带宽和通信之间不断转移。因此,单纯堆叠硬件不仅无法带来线性的容量增长,反而会造成资源配比失衡,导致一部分算力长期闲置,另一部分则持续过载。
实际上,当前的算力缺口包含两个完全不同的维度:
第一个是能力上限:前沿模型的参数规模、上下文长度、推理深度都在同步提升,单台机器能否装下模型、能否快速运行、能否长时间稳定运行,成为了必须重新考量的核心问题。
第二个则关乎产能:Token需求在爆发,但不同推理阶段需要不同特征的算力,依靠单一类型算力的老路已经走不通。浪潮信息首席AI战略官刘军,将这两个方向概括为Capability(能力型智算)和Capacity(容量型智算)。
能力型智算(Capability AI Compute)用于支撑前沿模型探索过去无法触及的问题。如今,AI已经可以从靶点出发发现新的药物分子,完成筛选、设计并推进到临床试验;能够求解困扰学术界数十年的NS方程和孪生素数猜想;还可以自主设计AI芯片并持续迭代性能。这些任务的共同特征是推理链条长、模型规模大,对算力系统的承载能力和稳定性要求极高。
容量型智算(Capacity AI Compute)则致力于让智能供给更充足、更廉价,让更多个人和企业能够负担得起AI服务。算力的价值最终需要落地到普惠应用,仅有能力上限的突破还不够,让足够多的人能够使用,才能真正实现技术的价值。
两款新品破解双重难题
面对能力和产能的双重挑战,浪潮信息在本次AICC大会上发布了两款针对性产品:超节点AI服务器「元脑SD200 Ultra」和多元算力机组「元脑HC2000」。
突破单节点智能上限
SD200 Ultra主要解决前沿模型装不下、跑不快、跑不稳的核心问题。
“装得下”是实现模型运行的第一步,SD200 Ultra通过「紧致扩展」技术解决这一问题。它延续了前代SD200采用的3D Hyper Mesh架构,整机搭载的芯片数量从64颗提升至128颗,配套的显存和扩展存储也相应提升到8TB和64TB,将充足的计算、存储和通信资源整合在有限的物理空间内。目前全球最大的开源模型Kimi K3拥有2.8万亿参数,SD200 Ultra可以单机部署并高效运行;不仅如此,该服务器还支持在单机上部署10万亿参数的模型,提前为未来更先进的开源模型做好了基础设施准备。
解决了“装得下”的问题后,接下来需要提升运行速度。128颗芯片协同工作时,每秒跨芯片的数据交换可达数十万次,传统方式依赖软件调用和缓冲区中转搬运数据,会带来较大的延迟开销。SD200 Ultra通过两层技术优化解决这一问题:
第一层是「统一寻址」:通过全局统一编址、虚拟影子设备注册和跨域地址翻译,让128颗芯片的显存形成统一的地址空间,远端资源的访问从原本的消息通信加数据搬移,转变为地址空间内的直接访问。
第二层是「对称直连」:在统一寻址的基础上,通过对称内存技术实现GPU显存直连,GPU可以像访问本地显存一样直接读写远端GPU的显存,由GPU发起通信,跳过地址转换和封包中转,大幅缩短了通信路径。最终,SD200 Ultra的All to All通信时延缩短到0.69微秒,达到国际主流超节点产品的同等水平。
除了通信优化,计算效率也需要提升。以Kimi K3为例,其单步推理涉及数千个算子调用,运行时大量时间消耗在算子启动、数据搬运和同步等待上,真正用于计算的时间占比极低。SD200 Ultra构建了「超级算子」技术,将推理过程中的Attention、FFN、MoE等众多基础算子融合为计算与通信一体的大算子,算子数量降低至原来的十分之一,减少了内核启动次数和显存访问开销,同时隐藏了通信延迟。通过超级算子优化,SD200 Ultra运行Kimi K3的推理性能提升了3倍以上,Token生成时延低至5.85毫秒。值得一提的是,超级算子的优化过程正是使用K3来分析和重构推理流程,实现了模型自我改进执行效率的效果。
最后还有一个容易被忽略的稳定性问题。Agent的复杂任务可能连续运行数小时乃至数天,期间会经历大量模型调用、工具调用和数据读写,任何一次计算或通信故障都可能中断整条任务链路,导致此前所有的推理和执行功亏一篑。SD200 Ultra采用铜互联方案,减少了光电转换环节,降低了长时间运行中因电路故障导致任务中断的风险。
提升智能产能,降低使用成本
HC2000则面向另一个核心方向,解决Token产能不足的问题,其核心思路是让不同类型的算力各司其职,匹配不同推理阶段的需求。
HC2000的硬件基础是高密液冷AI整机柜,采用全液冷设计加上高通流供电,突破了传统风冷机柜的散热和供电瓶颈。单柜供电能力超过300千瓦,最多可承载256张AI加速卡,算力密度达到传统风冷机柜的4倍。其通信架构升级到Directcom 2.0,计算与通信带宽实现1:1均衡配比,柜内聚合带宽达200Tbps,能够跨柜多平面无损扩展,All to All通信性能提升50%以上。
在这个硬件底座上,HC2000实现了多元算力承载,让不同类型的芯片按照推理阶段分工协作:
- Prefill阶段选择大算力芯片配合成本更优的显存颗粒,匹配高并行、高计算密度的任务特征;
- Decode阶段选择大容量HBM芯片,兼顾显存容量和带宽需求;
- FFN计算环节选择3D RAM堆叠芯片,缩短数据搬运路径,缓存带宽可达数十TB每秒。
整机柜支持成熟的工业标准架构模组,能够适配多种算力芯片,让不同芯片承担最适合的负载。而负责协同这些不同类型算力的核心,是「MCIS多元算力协同推理软件栈」。
MCIS覆盖了从请求路由、PD分离推理到算力动态调整的全链路。在PD算力动态调整方面,MCIS构建了测量、分配、监控、调整的完整流程:在模型部署前通过性能仿真评估不同芯片组合和PD配比,找到最优配置方案;上线后则会对计算、缓存、传输各环节的实际表现进行全链路监控,识别瓶颈并与预测结果对比;当业务负载发生变化时,MCIS会重新评估PD配比和实例分配,持续优化资源分配方式。
在多元算力KV Cache管理方面,MCIS打通了不同类型算力之间的点对点数据直传,避免CPU中转和重复拷贝,数据传输性能提升近5倍。此外,MCIS还会根据KV Cache数据的冷热程度构建分级存储,结合多级流水并行聚合,使节点内磁盘I/O性能提升32倍,突破了KV Cache在大规模多元算力环境下的存储和传输瓶颈。
最终在典型的Agent任务场景中,HC2000搭配MCIS软件栈,可以在同等投资下实现10倍的Token产能提升。
从“提供算力”到“生产智能”
Capability和Capacity并非两条分道扬镳的路线,而是互为因果的循环:前沿能力的突破经过算法优化和工程迭代,会以更低的成本向下渗透,成为容量型智算可以规模化供给的服务;而容量型智算将智能服务送到更多用户手中后,会催生新的应用和需求,反过来推动下一轮前沿能力的突破,向着更高的天花板迈进。两个方向最终殊途同归,汇成了一条加速前进的螺旋。
去年,全球规模最大的开源模型是DeepSeek-R1,参数量为6710亿;今年这一位置被Kimi K3占据,参数量达到了2.8万亿。训练和运行这类超大规模模型需要极大的算力投入,仅有少数机构能够负担。但当前各模型厂商已经在通过更小的参数量和更低的推理成本,将前沿模型验证过的能力向下传递。
顶部的前沿突破不断制造新的智能能力,底部的工程优化不断将这些能力变得更廉价,中间的应用层则持续催生新的需求,推动这条螺旋不断向上。这种循环已经在企业端得到了验证:同一家企业会在需要探索突破的任务中调用前沿模型寻找未知答案,在已经验证过的日常流程中切换到更轻量的模型批量执行。能力型算力负责思考和规划,容量型算力负责执行和重复,两种算力在同一个业务场景中并行运转。
刘军在本次大会的演讲中提到了一个历史类比:“世界上第一台通用电子计算机ENIAC非常重要,但真正改变几十亿人工作和生活的是个人电脑和智能手机。最先进的发电技术非常重要,但真正改变工业社会的是稳定廉价的电力进入千家万户。AI正在经历同样的过程,前沿智能的首次突破决定了AI能做到什么,而智能的普及程度才决定它能改变什么。”
过去,知识、推理、判断、创造这些能力高度依赖人类个体,但一名科学家穷其一生能够深入研究的问题有限,高水平的智能天生属于稀缺资源。如今,AI让智能有可能像计算和电力一样,成为一种可以被大规模生产和供给的资源。这种变化正在重新定义算力产业的价值尺度:从“提供算力”,转向“生产智能”。正如刘军所说:“在生产智能的今天,用户购买算力设施,就应该像买电冰箱一样,插上电就能产Token。”

