Mooncake与CMX启示:AI SSD重构推理数据路径

近年来,AI基础设施的竞争格局正在发生深刻变化。过去行业竞争主要聚焦GPU数量、芯片算力、高带宽内存与高速网络等硬件堆叠指标,但随着大模型进入长上下文、复杂推理与多智能体阶段,系统有效Token产出能力的决定因素正变得愈发复杂。
GPU依然是AI算力的核心底座,但实际利用率越来越取决于三个关键环节的协同:模型权重、KV缓存与MoE专家能否在精准的时间点抵达对应的计算节点。如果KV缓存无法及时复用,系统需要重新执行Prefill步骤;如果MoE专家权重未能在路由前加载到内存,GPU就会陷入等待;而大量推理状态长期占用高带宽内存,则会压缩并发请求与有效批处理的空间。
- 如果KV Cache无法及时复用,系统就需要重新执行Prefill;
- 如果MoE专家权重没有在路由发生前进入内存,GPU便可能停下来等待数据;
- 如果大量推理状态长期占据HBM,又会压缩并发请求和有效批处理的空间。
这一变化标志着AI基础设施已经从单纯堆叠计算资源的阶段,迈入协同计算、网络、内存与存储数据路径的精细化运营新阶段。月之暗面的Mooncake架构与NVIDIA推出的CMX平台,正是这一趋势的两个标志性实践。
月之暗面从大规模推理软件架构出发,将集群中分散的CPU、DRAM、SSD与网络接口卡整合为可调度的KV缓存资源池;NVIDIA则在相关基础设施中搭建了专门的Pod级Flash上下文存储层。尽管二者的实现尺度与技术路径存在差异,但共同指向了一个核心产业趋势:
推理状态正在成为AI基础设施中的一级资源,存储也开始进入Token生成的实时主链路。
Mooncake的核心产业价值,并非仅仅为相关产品搭建了一套全新的推理服务系统,而是重新定义了大模型基础设施对数据的组织逻辑。传统推理节点往往将GPU、CPU、DRAM与本地SSD视为服务器内部的固定资源,KV缓存主要跟随请求与GPU实例存在,一旦缓存被驱逐或请求发生迁移,已经完成的Prefill计算便会失去复用价值。随着上下文长度增加,这种模式带来的重复计算与GPU资源浪费会愈发显著。
由相关团队联合发表在专业学术会议的Mooncake架构,采用以KV缓存为核心的分离式设计:将Prefill与Decode部署在独立的资源池中,把GPU集群中未被充分利用的CPU、DRAM、SSD与NIC整合为分布式KV缓存池。位于架构中心的调度器不再仅根据GPU负载分发请求,而是结合KV缓存分布、缓存命中率、节点负载以及相关服务目标,统筹决定缓存复用、Prefill执行与Decode调度流程。
Mooncake的请求流转逻辑清晰体现了这种变革:可复用的Prefix KV缓存会被优先送往适配的Prefill实例,新增的KV缓存会随着模型各层计算持续生成,并与Prefill计算过程重叠,通过异步流传输到目标Decode节点;待所有缓存资源到位后,请求才会进入连续批处理环节。相关模块负责KV块的放置、复制、淘汰与生命周期管理,传输引擎则通过RDMA、多NIC带宽聚合与拓扑感知路径选择,实现不同计算与存储层的高效连接。推理系统由此从“被动给GPU喂数据”,转向围绕Tensor生命周期编排整条数据路径的主动管理模式。
Mooncake的研究团队将这一架构思路概括为用更多存储换取更少计算。根据公开测试数据,在真实请求轨迹与不同约束条件下,Mooncake相比对比的基线系统,有效请求承载能力提升了59%至498%;在相关方案落地时,其生产系统已经部署在数千个节点上,每日处理超过1000亿Token。需要强调的是,这些收益是缓存、调度、网络与计算协同后的端到端架构整体收益,并非单块SSD的独立性能提升。
更值得AI SSD产业关注的是,Mooncake官方文档已经明确将DRAM与SSD/NVMe纳入多级缓存体系,并给出了从内存向本地SSD卸载数据的路径:即将从内存中淘汰的缓存数据可以在后台写入SSD,当内存未命中时再从SSD回读;数据经过预注册缓冲区后,会被送往目标DRAM或VRAM。上层系统负责决策“何时迁移、迁移至何处”,而设备侧则需要解决尾延迟、并行数据搬运、持续负载、使用寿命以及与推理生命周期协同等实际问题。这意味着SSD不再仅仅是模型启动前的文件加载来源,而是成为受相关性能指标与服务约束的推理数据层核心组成部分。
多智能体时代进一步重塑了AI基础设施的优化方向。一次复杂的智能体请求不再仅仅是单次模型前向传播,而是可能包含模型调用、工具执行、记忆检索、数据访问与多轮推理的完整长链路。KV缓存也从GPU内部的临时状态,转变为需要跨节点移动、共享与复用的基础设施级数据。此时,GPU能否持续获取正确的上下文,已经和GPU本身的计算速度同样关键。
在相关厂商提出的存储分层体系中,G1是GPU HBM,用于保存当前Token生成所需的热KV缓存;G2是系统内存,承担数据交换与暂存功能;G3是本地SSD,用于承接短期可能复用的温数据;G4则是面向持久化数据的共享文件或对象存储。随着智能体上下文延伸至多轮对话、工具调用与跨任务状态,G1至G3的容量很快会触及瓶颈,而G4的访问延迟与通用数据服务开销,并不适合频繁参与Decode路径。为此相关厂商推出专用上下文存储平台,在G3与G4之间新增了被称为“G3.5”的层级:通过以太网连接、以Flash为介质、专门针对KV缓存优化的Pod级上下文内存。这一层级主要承载短暂、派生、可重新计算但延迟敏感的推理上下文,而非替代G4的持久化存储。
该平台的核心价值并非简单为GPU Pod外挂一组大容量SSD,而是通过完整的软硬件协同实现上下文数据的高效管理:相关模块负责KV块的跨层编排与搬移;专用组件提供面向上下文缓存的通信、元数据管理、数据放置与共享能力;专用网络设备将KV I/O、队列管理、预取、完整性校验与加密等操作下沉到靠近网络与NVMe Flash的位置;高速以太网则提供RDMA数据传输通道。当Decode环节即将使用某组KV缓存时,系统可以提前将其从专用存储平台预置到系统内存或GPU HBM,大幅减少GPU等待与历史上下文重算的开销。
根据厂商披露的数据,该平台可在单个GPU Pod内提供PB级的共享上下文容量,面向长上下文与智能体负载的持续Token吞吐与功耗效率最高可达传统存储方案的5倍。尽管这一数据属于厂商发布口径,实际收益会受到模型、缓存命中率、网络与调度策略的影响,但相关方案释放的产业信号已经十分明确:
Flash开始被GPU平台厂商定义为AI推理内存体系中的正式一层。
Mooncake与该专用存储平台并非同类产品:Mooncake主要是一套分离式推理、数据传输与分布式缓存体系,而专用存储平台则是Pod级上下文存储平台。但二者共同说明,AI基础设施正在形成新的系统边界:计算芯片负责执行算子,网络连接资源,存储则需要参与推理状态的放置、迁移和复用。
将SSD纳入AI推理基础设施,并不意味着任意一块传统SSD都可以稳定承担Token生成链路中的数据供应任务。传统SSD的设计目标主要围绕顺序带宽、随机IOPS、可靠性与单位容量成本,但大模型推理需要的是带有严格时序约束的数据供应。KV缓存会在Prefill阶段集中生成,并在后续对话或智能体步骤中被反复读取;MoE模型在每一层仅激活部分专家,却需要保存远超当前显存或内存容量的专家权重。即便数据最终可以从SSD中读出,只要未能赶上模型的计算窗口,GPU、NPU或CPU仍然会陷入等待状态。
这种矛盾甚至会延伸至SSD内部:NAND Flash以页为单位读取、以块为单位擦除,FTL需要执行地址映射、垃圾回收与磨损均衡,持续写入KV缓存可能带来写放大、使用寿命压力与难以预测的尾延迟;传统的LBA排布也无法感知模型层、KV块、MoE专家及其执行顺序之间的关联,逻辑上相关且即将被共同使用的数据,在物理介质中未必能形成适合并行读取的布局。因此,AI SSD不能仅仅用“更高峰值带宽”来定义。
一款合格的AI SSD至少需要解决两个层面的核心问题:一是提供更低延迟、更高耐久性与更稳定尾延迟的介质与I/O能力;二是通过主控、固件、中间件乃至推理运行时的协同,让SSD能够参与数据分层、缓存管理与预测式预取。
当前市场上的AI SSD相关产品,已经逐渐分化为两大类别。第一类是AI负载强化型企业级SSD,这类产品依然保持标准块存储设备的形态,但围绕AI集群的高频缓存、模型加载与大容量数据场景,针对性调整了性能、耐久性与容量指标。比如相关产品采用低时延、高耐久介质,重点面向KV缓存卸载与高频临时数据读写;另一款产品则凭借超大单盘容量与顺序读取能力,承载模型、语料与向量数据。这类产品首先解决的是AI基础设施底层的I/O供给问题。
第二类推理参与型AI SSD则更进一步,不再被动响应主机的块设备读写命令,而是主动参与模型权重、KV缓存与MoE专家的运行时管理。当前市场上较有代表性的三条技术路线分别来自三家厂商。
群联:用专用缓存SSD和中间件扩展GPU运行空间
相关方案的核心产品形态,是专用缓存SSD、内存管理中间件与工具链的组合。其目标并非单独提供一块高性能存储盘,而是将SSD组织为GPU显存之外的高容量缓存层。当模型权重超过VRAM容量时,系统会将权重切分为数据块,根据执行进度在SSD与VRAM之间流式搬运,让当前需要计算的部分留在GPU附近,暂时不活跃的数据下沉至Flash存储。SSD还可以保存被显存驱逐的KV缓存,当后续出现相同上下文时再将其取回,大幅减少重新执行Prefill的成本。
从AI基础设施的角度来看,该路线的特点在于产品边界清晰:专用高耐久缓存盘负责提供容量与持续写入能力,中间件负责数据交换,经过验证的工作站或服务器配置负责快速部署交付。根据官方资料,其专用缓存SSD的耐久性最高可达100 DWPD。这一方案将云侧常见的“以存储扩展计算内存”的思路压缩到单机与小型集群中,形成了较为直接的部署路径。
江波龙:让SPU成为存储侧调度节点
该技术路线更强调SSD主控自身的处理能力。其架构以SPU作为硬件执行层,以iSA作为软件决策层:iSA负责感知推理负载并制定数据分层与预取策略,SPU则承担存储控制、硬件压缩、高速缓存与具体的数据搬运工作。根据公开的技术资料,其专用SPU采用5nm工艺,引入了存内无损压缩、高级缓存与混合NAND调度技术。高级缓存用于让SSD承接原本保存在DRAM中的温冷数据,混合NAND则按照数据的冷热程度,在高速缓存区与大容量介质区之间分配存储资源。
这一方案体现了存储侧智能化的核心思路:控制器不再仅仅执行主机发出的标准读写请求,而是开始承担压缩、冷热数据识别、缓存划分与调度执行等功能,重点面向AI PC、工作站与端侧智能设备场景。
寅谱-联芸:从AI Infra反向定义SSD的数据路径
两家厂商构成了另一条技术路线组合。相关厂商提供NAND Flash、SSD主控、固件与产品适配基础;另一厂商则从大模型推理芯片、近存计算、操作系统与主板级协同控制出发,将计算侧的数据分层与调度技术延伸到SSD领域。在本次讨论的三条技术路线中,该厂商是唯一一家以AI原生身份而非存储原生身份进入AI SSD领域的企业。它并非从传统SSD、NAND模组或存储主控业务向AI领域延伸,而是以AI推理、计算芯片与系统协同作为起点。
这种背景使其对AI基础设施的理解首先来自模型执行、数据流与调度逻辑,而非单盘容量或峰值IOPS指标。该厂商推行的相关理念,并非单纯依靠软件替代硬件,而是让芯片能力通过主控、固件、运行时与系统软件的协同实现持续迭代优化。在AI推理场景中,数据是否需要驻留、何时进行预取、放置在哪一级介质,以及如何与模型执行顺序匹配,往往无法仅由传统SSD主控独立决定。
因此,该组合方案尝试贯通计算侧缓存体系、中间件、固件、控制器与NAND介质管理全链路。该方案围绕MoE专家、KV缓存与数值精度三个维度进行数据切分、冷热分层、并行搬运与预测式预取:一方面根据模型执行过程调度专家权重与KV缓存,另一方面将模型数据中的不同精度部分按照访问热度进行特殊存放与读写。其设计目标还包括减少对模型文件与主流推理框架的侵入,并适配不同CPU、GPU、NPU及SSD模组形态。
这条路线的AI基础设施属性相对突出:它并不将AI SSD视为孤立设备,而是将其视为云侧、边缘侧与端侧推理数据路径中的可调度层级。相应地,它需要同时处理模型、运行时、操作系统、固件、主控与NAND之间的各类接口,软硬件协同范围更广,研发与验证成本也更高。相关厂商曾公开提出,AI推理正在推动SSD主控从传统“数据通道”走向面向Token成本的智能调度;其消费级与工业级主控产品基础,以及向AI推理主控方向的技术延展,也为相关技术进入不同模组与整机形态提供了产业化条件。
三家厂商的方案并非采用了三种不同的SSD技术那么简单,它们分别代表了三种不同的AI基础设施切入方式:群联从专用缓存盘与中间件切入,强调可快速部署的显存与内存扩展能力;江波龙从专用单元与智能调度层切入,将更多调度与压缩能力下沉到存储侧;寅谱-联芸则从计算与存储协同切入,试图让SSD的数据组织方式更直接地匹配模型执行过程。三者并非简单的替代关系,而是可能分别适用于工作站、AI PC、边缘设备、企业节点与云侧基础设施中的不同场景。
从更长的产业周期来看,AI SSD的行业门槛不会仅仅体现在某个主控规格或单项峰值性能上。真正决定产品能否进入推理主链路的,是企业能否建立从NAND介质、FTL、固件、驱动、中间件到推理框架与整机验证的完整协作体系。模型兼容性、缓存命中率、尾延迟、预取准确率、写入寿命与跨平台适配数据,都需要通过长期的工程实践逐步积累。
相关架构方案已经在集群与Pod层面证明,推理状态值得被单独组织与调度;而AI SSD则将这一变革进一步延伸到节点与设备内部。它不会取代高带宽内存、显存或系统内存,而是推动形成一套更细致的存储层级体系:最热的数据留在计算芯片附近,温数据进入DRAM或高性能Flash,冷数据下沉至容量更大、成本更低的存储层级,并由软硬件共同决策数据迁移的时机。
当AI产业从模型能力竞赛转向大规模应用落地时,基础设施最终需要回答的问题不再仅仅是拥有多少计算能力,还包括每瓦电力能够生成多少有效Token、每张GPU有多少时间真正参与计算,以及一段已经完成计算的上下文能否以低成本实现复用。沿着这一方向,算力、网络、内存与存储之间的边界将继续变得模糊,AI SSD也有机会从外围设备进入AI基础设施的核心数据路径。

