文章摘要
针对2.8万亿参数量Kimi K3超大型开源模型的高效运行难题,近期海内外两支团队分别交出优化答卷,核心思路均为打破传统算子边界,消除数据搬运带来的效率损耗。国内团队以128颗本土AI芯片紧耦合的超节点服务器实现5.85毫秒的Token生成时延,海外团队用16颗谷歌TPU v7实现709 tokens/s的低并发解码吞吐,当前AI算力竞争已转向系统级全链条优化。

当2.8万亿参数量的超大型开源模型成为行业前沿标杆,如何让它高效稳定运行成为新的行业命题。近期海内外两支团队分别交出了各自的优化答卷,通过打破传统推理框架的固有边界,实现了超大规模模型的性能突破。

9月下旬,国内算力厂商推出了面向商业化的超节点AI服务器,通过紧耦合128颗本土AI芯片,实现单机承载完整的目标模型,Token生成时延首次突破5.85毫秒。几乎同时,海外TPU优化团队开源了全新的推理优化项目,仅用16颗谷歌TPU v7芯片就将整个超大型模型封装进单个内核,配合投机解码技术,低并发解码吞吐达到709 tokens/s。

这两条路径虽各有侧重,但核心思路高度统一:不再拘泥于传统“一个算子对应一个内核”的计算模式,而是通过打破算子边界,将大模型推理的整个计算过程融合到极致,从而消除数据搬运带来的效率损耗。如今,大模型推理的行业竞争,已经从单纯的模型算法层,深入到系统软件、芯片互联和内存管理的全链条层面。

超大规模MoE模型的推理瓶颈

不少人认为超大型模型运行缓慢是因为算力不足,但实际上真正的瓶颈更多集中在数据搬运与内存带宽的限制上。根据行业分析,该模型一次前向计算需要约1.5TB的HBM带宽,其896个专家网络需要分布在多张芯片上,每次前向传播都会触发超过120次All-to-All通信操作。即便单芯片具备强大的算力,如果数据传输速度跟不上计算节奏,大量计算资源都会被白白闲置。

在解码阶段,这个问题尤为突出。每生成一个新的Token,模型都需要持续读取大量权重参数。传统推理框架往往需要启动大量独立的Kernel,每个Kernel完成自身的加载、计算和结果写回后,再启动下一个Kernel。这种模式会在计算流程中产生大量细碎的等待空泡,这些碎片化的损耗累积起来,就形成了实际运行速度与理论算力峰值之间的巨大鸿沟。

既然内核边界是造成效率损耗的重要来源,那是否可以尝试彻底消灭这些边界?两个团队给出了各自的解决方案。

两种极致的融合思路

海外团队的思路更为激进:将整个模型的解码过程封装为一个单一的Kernel。他们基于Google Pallas框架,把模型的92个MoE层全部放进一个Pallas调用中,在单个内核内部完成整个解码流程。在计算当前层的同时,下一层的权重参数可以通过异步DMA提前从HBM搬运到片上VMEM中,充分利用芯片的本地存储资源。这套方案能够成立的核心,在于TPU v7的架构特性:每个TensorCore自带64MiB VMEM,数据进入片上内存后,其生命周期可以由程序显式控制,开发者可以主动规划数据的搬运、驻留和释放,将整个模型视为一个连续的数据流。

国内团队则选择了另一条务实的路径:将众多基础算子融合为超级算子,通过系统级的紧耦合架构榨取整体运行效率。针对目标模型的推理特点,他们把多个基础算子整合为计算与通信协同执行的大算子,将算子数量降低了10倍,模型推理性能提升3倍以上。

具体来看,这套优化方案分为两个关键步骤:首先是将小算子“焊接”为大算子,按照片上存储容量划分数据块,让前一步的计算结果直接留在寄存器或片上缓存中供后续步骤使用,减少Kernel启动次数,同时避免中间结果反复写入和读取HBM;其次是将通信和计算深度融合,超级算子按照Tile数据块组织流水线,通过异步搬运和多缓冲机制,让下一块数据的预取、当前数据的计算和上一块结果的写回同时进行,跨芯片的通信延迟也被尽可能隐藏在计算过程中。

AI辅助的循环加速范式

超级算子的设计和优化本身是一项复杂的工程,数据复用方式、计算与通信的衔接逻辑、不同阶段的流水组织,都需要结合具体的模型和硬件条件进行反复设计与验证。这类工作往往需要投入大量的人工成本,那么能否让AI参与其中,提升超级算子的生成和优化效率?

国内团队在适配目标模型的过程中,引入了“超级算子智能体”,实现了用目标模型自身来优化自身的推理流程。针对模型的推理特点,智能体自动生成通算融合、Tile级流水的超级算子,推动计算、通信与数据搬运协同执行。相关负责人打比方称,过去大模型推理由数百个算子串联执行,如同绿皮火车途经数百个小站,反复启停装卸数据,整体效率低下;而超级算子就像一站直达的高铁,省去了中间停靠的开销。

通过这种方式,模型的推理性能较此前再度提升了50%,形成了“AI优化AI”的循环加速模式。如今,大模型已经不再只是被优化的对象,也开始成为优化底层算力基础设施的工具,这可能会成为下一代推理优化的重要范式。

系统级创新的竞争赛道

随着Agent时代的到来,Token消耗量呈现爆发式增长。根据行业报告,一个Agent工作流每任务消耗的Token量是标准聊天机器人的5到30倍;另有预测显示,到2030年全球Token消耗量将较2026年增长24倍,达到每月约120000万亿Token。需求侧的爆发式增长,对算力供给提出了全新的挑战。

当前算力供给面临两个典型的困境:一是以超大型模型为代表的“向上”需求,模型规模越来越大,推理能力越来越强,长上下文、复杂推理、多Agent协同的需求不断增加,单机已经难以承载,算力系统需要不断突破模型的能力上限;二是以低成本模型为代表的“向广”需求,当越来越多的用户开始调用低成本模型,Token需求会迅速扩张,即便模型本身成本足够低,如果算力供给跟不上,低价Token的服务也难以持续。

国内厂商的应对思路是并行推进两条路线:能力型智算和容量型智算。向上的能力型智算通过超节点服务器承载前沿大模型,比如本次推出的产品实现了5.85ms/token的时延,单用户吞吐量达到170 tokens/s,让超大型模型能够跑得既稳又快;向广的容量型智算则通过多元算力机组,针对不同负载匹配不同芯片,实现同等投资下Token产能提升10倍。

单看单芯片性能,本土产品与国际领先产品仍有一定差距,无论是单卡算力、生态还是工具链都存在明显短板。但到了超节点层面,通过系统级的创新,可以追平甚至超越单卡性能更强但系统架构松散的方案。以本次推出的超节点服务器为例,其通过3D Hyper Mesh架构紧耦合128颗本土AI芯片,提供8TB统一编址显存和64TB内存,通信时延低至0.69微秒。通过对称内存技术,首次在基于本土AI芯片的超节点上实现显存直连,将AllReduce通信时间降低3.5倍。

相关负责人强调,超节点最基本的特征是显存要实现统一寻址,只有做到这一点,才能将超大型模型完整地放在单节点中,否则只能被称为节点集群,仍然需要将模型拆分为若干段分别运行。总的来说,芯片性能是基础,但系统工程的优化才是释放算力红利的关键。当芯片之间能够形成更紧密的连接,内存能够形成统一的空间,通信可以被隐藏在计算过程中,算子又可以通过AI持续优化,单芯片性能之外的系统红利就会充分释放,这对于本土算力产业来说尤为重要。

效率革命的新起点

当前AI算力的竞争,已经从单纯制造更快的芯片,转向如何将现有芯片的性能组织到极致。海外团队用16颗TPU证明了单个内核可以承载超大型模型;国内团队则用128颗本土芯片证明,通过系统级紧耦合架构结合超级算子优化,可以让本土算力进入第一梯队。

两条技术路线虽然不同,但核心方向一致:通过极致的融合优化,消除算力浪费。大模型推理的效率革命,才刚刚拉开序幕。对于中国AI产业来说,在芯片工艺受到限制的背景下,系统级创新是确定性最高的追赶路径,这类突破值得行业更多的关注和研究。

以上内容不代表本平台立场,仅供读者参考