文章摘要
在全球人工智能行业盛会中,无问芯穹公开跨集群异构推理架构PDD。该架构依托广域以太网,重构传统推理链路,解决KV Cache传输延迟瓶颈。实际测试显示,它能将首Token延迟降51.5%,单Token推理成本降37.5%,提升用户体验,释放存量集群资源价值。PDD架构为大模型推理基础设施提供新范式。

在近期举办的全球人工智能行业盛会中,无问芯穹首次公开了其在大模型推理系统架构领域的全新突破:跨集群异构推理架构PDD。如今,该架构的完整技术细节与实现方案已正式对外发布。

这套架构依托高性价比的广域以太网,将全球各地已部署的同构数据中心串联为统一算力网络,并对传统的PD分离推理链路进行了重构:将原本的“P-D”两层结构升级为“P-RLD-MD”三级分离式架构。这套方案不仅能让性能“偏科”的硬件专注于自身擅长的任务,更突破性地解决了广域以太网环境下KV Cache传输的延迟瓶颈问题。

实际测试数据表明,该架构可将首Token延迟降低51.5%,单Token推理成本降低37.5%。这一突破不仅直接提升了用户的使用体验,更实现了全域异构算力的最优调度,让分散在各地的存量集群资源得以充分释放产业价值。接下来,我们将完整拆解这一架构的设计思路与实现细节,还原技术攻坚背后的思考路径。

技术报告开源地址:https://github.com/infinigence/pdd

过去一年间,大模型推理的成本控制与效率优化,已然成为全行业共同面临的核心挑战。行业共识指出,大语言模型的推理过程分为两个特性截然不同的阶段:计算密集型的Prefill(预填充)阶段,以及访存密集型的Decode(解码)阶段。从理论上来说,最优的解决方案是采用异构分离架构:让算力更强的硬件负责Prefill阶段,而显存带宽更高的设备承担Decode任务。

但在实际落地中,这一思路却面临诸多阻碍:在单一集群内搭建大规模异构算力资源,不仅采购成本极高,且当模型架构发生迭代时,固定配比的硬件资源极易出现闲置,造成算力浪费。于是,行业内自然产生了一个新思路:能否利用低成本的广域以太网,将分散在全球各地的已建成同构集群连接起来,实现跨集群的异构分离推理?

这一思路看似合理,但在实际工程落地时,却遭遇了难以逾越的瓶颈:跨集群传输KV Cache所带来的带宽与延迟问题。无问芯穹推出的PDD架构,正是为攻克这一难题而设计的。

在深入PDD架构的设计细节之前,我们需要先了解团队前期研究中发现的三个核心底层规律,这些规律也是跨集群异构推理方案得以成立的基础前提。

洞察一:硬件性能的极度“偏科”

大语言模型推理的两个阶段对硬件资源的需求差异极大,团队内部的基准测试结果也印证了这一点:多数商用芯片的性能表现呈现出明显的“偏科”特征。以8卡旗舰高性能GPU作为性能基线,某厂商的E芯片在计算密集的Prefill阶段仅能达到基线81%的性能,但在访存密集的Decode阶段,其性能却能达到基线的210%。如果将这类“偏科”芯片部署在同构集群中,既要承担Prefill计算又要完成Decode输出,不仅无法发挥自身的性能优势,反而会拖慢整个Prefill阶段的整体效率。这一发现直接推动了团队将Prefill与Decode拆分解耦,让两个阶段分别运行在最适配的硬件上的核心思路。

洞察二:DRC技术带来的10倍带宽优化

仅仅解决计算与硬件适配的问题还不够,跨集群传输庞大的KV Cache会快速耗尽广域网的带宽资源。不过,智能体业务有一个显著特征:请求的前缀缓存命中率极高。团队利用这一特性,在Decode端部署了前缀缓存RadixCache(简称DRC)。DRC的核心逻辑是在Decode实例上缓存历史请求的KV Cache,当Prefill端检测到某个请求命中了前缀缓存时,无需传输完整的上下文KV Cache,仅需传递少量增量数据即可。在平均命中率达到90%的场景下,DRC理论上可将跨集群的带宽需求降低10倍,初步缓解了带宽瓶颈。但即便如此,KV Cache传输的延迟问题依然没有得到彻底解决。

洞察三:智能体工作负载下的非均匀延迟特性

在DRC技术将KV Cache传输数据量降低一个数量级之后,跨集群PD分离推理最棘手的痛点,就集中到了KV Cache的传输延迟上。智能体业务的工作负载有着鲜明的“三极”特征:上下文长度动辄达到64K、缓存平均命中率高达90%、但单次输出的Token数量极短,通常不足100个。对于这类用户请求来说,整个输出过程仅需十几秒,但首字延迟却可能长达数十秒,严重影响产品体验。因此,优化跨集群KV Cache的传输延迟,成为了必须突破的核心关卡。

团队对线上真实业务的600万条请求进行了分析,结果显示:约30%的请求输出Token数少于100个,40%的请求输出Token数不超过500个。对于这类短输出请求,1~20秒的KV Cache传输时长占据了端到端总延迟的43%~56%,成为了最主要的性能瓶颈。

为了探究延迟的具体来源与分布,团队首先分析了平均90%缓存命中率背后的实际命中率分布。通过拉取真实业务Trace进行分析,团队发现请求的命中率分布极度偏斜:70%~80%的请求命中率超过95%,仅有极少部分低命中率请求会携带大量KV Cache数据包。

随后,团队在20Gbps的跨集群专线上开展了微基准测试,对比了“真实偏斜分布”与“均匀分布(85%~95%命中率)”的传输表现,结果令人意外:在真实偏斜分布场景下,P50传输延迟仅为248ms,仅有极少数低命中率请求会出现18秒以上的长尾延迟;而在均匀分布场景下,所有请求的数据包大小中等,导致网络连接池瞬间被占满(利用率100%),引发严重的排队阻塞,P50延迟飙升至1210ms,且未计入连接池耗尽带来的平均1682ms排队时长。

这一发现至关重要:极端传输延迟仅集中在极少数低命中率的“刺头请求”上。在偏斜分布场景下,大量轻量级请求借助TCP的公平性机制,不会被高负载请求阻塞,并能快速释放连接池。这意味着,解决跨集群PD传输KV Cache的延迟瓶颈,无需全局优化网络延迟,仅需针对这少量“刺头请求”进行优化即可。

基于上述三个核心洞察,无问芯穹推出了PDD(Prefill-RelayDecode-MainDecode)三级异构推理架构。与传统的PD分离两层架构不同,PDD在Prefill与MainDecode之间插入了一个“中继站”——RelayDecode(RLD)实例,正是这个中继实例实现了对广域网络延迟的精准掩盖。

整个PDD系统分为三层架构:

  • P实例:部署在主集群中,负责处理用户输入的Prompt并生成对应的KV Cache数据;
  • RLD实例:与P实例处于同一集群,通过高速RDMA网络互联,KV Cache的跨实例传输延迟仅为几十毫秒;
  • MainDecode(MD)实例:部署在异地集群中,通过广域以太网与主集群连接,KV Cache的跨集群传输延迟可达数秒甚至更长。

我们可以将PDD的工作流程类比为一场2×100米接力赛:当P实例完成Prefill阶段的计算后,会同时执行两项操作:一是通过高速RDMA网络,将KV Cache“瞬间”传递给同机房的RLD实例;二是通过延迟较高且不稳定的广域以太网,将KV Cache传递给异地的MD实例。

RLD实例拿到KV Cache后,会立刻开始解码并向用户输出Token。此时用户已经可以看到生成的文本,完全感知不到后台跨集群传输的延迟,而以太网的KV Cache传输可能还在进行中。当MD实例收到完整的KV Cache后,解码任务会无缝从RLD实例交接给MD实例,由MD完成后续大部分的Token生成工作。

这就是PDD架构的核心思想:利用本地集群的RLD算力,精准掩盖极少数低命中率“刺头请求”的跨集群网络延迟。

PDD的三级架构看似简洁,但最大的工程挑战在于:当MD实例准备就绪后,如何无缝接管RLD正在进行的解码任务?传统的解决方案是,RLD在解码的同时,将新生成的“增量KV Cache”通过以太网传递给MD实例,但这一方案再次陷入了跨域网络延迟的困境,且需要经过繁琐的H2D/D2H(显存到内存、内存到显存)拷贝,延迟高且不稳定。

为此,无问芯穹团队提出了一个反直觉但高效的机制:Extend-Decode Handoff(扩展解码交接)。该机制的核心逻辑是:RLD绝不传输庞大的KV Cache,仅将生成的“Token ID”传递给MD实例。传输几个Token ID的数据量仅为几KB,网络开销几乎可以忽略不计。

MD实例收到这些Token ID后,会利用“Extend-Decode”技术(常见于MTP多Token预测和投机解码方案)在本地重新计算这些Token对应的KV Cache,同时生成下一个新的Token。不少人会疑问:重新计算KV Cache会不会很慢?这里又有一个反直觉的硬件原理:Decode阶段属于访存密集型任务,实际的计算量非常轻量。团队在MD端测试发现,重算100个Token的KV Cache平均耗时仅为305.2ms,最大延迟稳定在321.4ms,标准差仅为4.8ms。如果Token数量更少,重算耗时会进一步降低,甚至接近单个Token的解码时间,这也是MTP和投机解码等技术能够提升解码效率的核心原因。

对比传统的以太网传输KV Cache方案:平均传输耗时185.4ms,一旦出现网络拥堵,峰值延迟可飙升至512.6ms,标准差高达96.3ms,且还未计入24.5ms的H2D/D2H拷贝开销以及实际运行中的额外排队延迟。通过“仅传输Token ID、本地重算KV Cache”的方式,团队将一个受网络波动影响极大的不可控操作,转化为一个确定性、可预测的本地计算操作。

为了平衡用户体验与RLD实例的算力负载,团队还设计了“追赶式”和“一次性”两种交接模式,可以根据系统实时负载动态切换。如果采用追赶式交接模式,PDD会以略微增加的RLD负载为代价,确保用户的首字延迟(TTFT)和每秒输出Token数(OTPS)体验与同集群PD分离架构完全一致。

尽管RLD实例能够有效掩盖延迟,但它毕竟占用了宝贵的算力资源。因此,团队制定了明确的设计原则:RLD仅负责“延迟掩盖”,仅分配极少的计算资源,绝不承担繁重的解码任务。

基于之前发现的“命中率极度偏斜”规律,团队设计了两种流水线编排方式:

  • P-MD流水线:对于命中率超过95%的高频请求(占总请求的70%以上),由于传输的数据量极小,直接通过广域以太网将请求传递给MD实例,完全无需RLD中继;
  • P-RLD-MD流水线:仅针对命中率低、数据包量大、必然会出现传输卡顿的“刺头请求”,才通过RLD实例进行延迟掩盖。

这种设计排除了单纯的P-RLD编排方式,有效避免了RLD实例被过载的请求压垮。团队的实测数据显示,RLD仅承担了系统6.2%的Token生成任务,而93.8%的繁重解码工作都由MD实例完成。

此外,PDD架构还保证了MD端的缓存命中率与P端始终保持一致,这进一步确保了RLD的负载稳定在低位。如果将请求的生命周期终结于RLD实例,将会引发恶性正反馈循环,最终导致RLD负载过高而崩溃。

无论架构设计多么精巧,最终都需要在真实业务压力下验证其价值。为此,团队基于DeepSeek-V4-pro模型,使用真实的智能体工作负载Trace,对PDD架构进行了全方位的测试。为了保证对比的公平性,团队设置了两个基线方案:

  • CDC-PD:同样采用跨集群异构芯片PD分离架构,使用DRC技术降低传输带宽,但未加入RLD延迟掩盖机制;
  • IDC-PD:传统的单机房同构芯片PD分离部署方案,P与D实例完全同构且处于同一RDMA网络域内。

实测结果不仅验证了团队的理论假设,甚至超出了最初的预期,主要体现在三个核心维度:

首先是首字延迟优化。在传统跨集群PD分离架构中,用户感知的TTFT直接受制于广域以太网的传输延迟。由于网络拥堵以及低命中率请求带来的高传输负载,传统方案的TTFT P90延迟飙升至18.3秒,P99延迟甚至接近30秒。而PDD架构将这部分传输延迟完全掩盖在了RLD的抢先输出阶段:RLD通过同机房RDMA快速获取KV Cache后立刻开始生成Token,用户完全感知不到后台以太网几到十几秒的慢速传输。最终,PDD的P90 TTFT降低了约46%,从18.3秒降至9.8秒,P99 TTFT也从29.7秒降至14.4秒。

其次是RLD实例的负载控制。团队最初担心RLD实例会成为系统瓶颈,但实测数据打消了这一顾虑:在真实流量下,RLD实例仅承担了系统6.2%的Token生成任务(约27万个Token),而远端MD实例完成了93.8%的繁重解码工作(约412万个Token),两者负载差异高达15.2倍。这证明了团队的路由策略非常有效:绝大多数高命中率请求通过P-MD流水线快速完成请求处理,仅少数携带大量KV Cache的“刺头请求”借助RLD算力进行延迟缓冲,且在MD实例完成KV Cache接收后,会迅速将解码任务交接给MD实例,不会让长输出请求长期占用RLD资源。

最后是成本与收益的显著提升。团队将PDD架构与传统单机房同构集群(IDC-PD)进行了成本收益对比:在PDD部署方案中,团队在以旗舰GPU A为核心的主机房部署P实例与少量RLD实例,在以旗舰GPU B为核心的远端机房部署MD实例。在严格的TTFT约束下(P90 TTFT <10秒,P99 TTFT <15秒),测试结果显示:PDD在总成本降低3.5%~7.1%的前提下,请求有效吞吐量(RPS Goodput)提升了27.8%,最终使得性价比(BCR)提升了37.5%。

需要特别说明的是,这一测试结果并非PDD的性能极限。受限于测试资源,本次测试中RLD仅使用了3个旗舰GPU A节点(这是通过DP并行方式跑通DeepSeek-V4-pro的最小规模)。在更大规模的实际部署中,RLD的固定开销将被进一步摊薄;如果引入比旗舰GPU B更极致的专用推理芯片,架构的性价比还将拥有更大的提升空间。此外,由于与DRC存在暂时的兼容性问题,本次测试未开启MTP等关键优化机制,在后续优化后,异构推理的性价比还将进一步提升。

PDD架构不仅仅是一项跨域以太网传输延迟优化技术,更承载着无问芯穹对下一代模型即服务(MaaS)基础设施的核心设计理念:极简局部异构+灵活远端分离

未来的大模型推理基础设施,无需在单一机房内堆砌复杂的异构芯片。仅需在主算力中心保留极小比例的“接力节点”,就能像云原生调度资源一样,将庞大的解码任务分发到全球各地的低成本算力节点上。这一思路为下一代大模型推理基础设施勾勒出了极具弹性与经济性的蓝图:各类异构算力可以以低成本的方式分散部署在多个集群中,集群之间通过可扩展性极强的跨域以太网,构建起支持“多对一”、“多对多”拓扑的复杂推理网络。当模型迭代或PD配比变化引发资源闲置时,这种“极简局部异构+灵活远端分离”的跨集群范式能够大幅盘活存量算力,降低资源空置率,最终让每一块芯片都能专注于自身擅长的任务,实现全域异构算力的价值最大化。

这一技术突破的背后,是无问芯穹推理团队长期的技术攻坚与日夜付出。大模型的规模化落地是一场漫长的技术长跑,无问芯穹也将继续在系统架构的深水区持续探索,不断突破技术边界。

欢迎大家查阅开源的技术报告原文,也期待与各位技术爱好者交流探讨。

技术报告开源地址:https://github.com/infinigence/pdd

以上内容不代表本平台立场,仅供读者参考