商汤大装置异构算力赋能AI规模化Token推理

随着Token经济进入加速爆发期,全球算力需求出现结构性反转,推理需求已经取代训练,成为拉动算力增长的核心引擎。
这一趋势也给AI基础设施带来了全新的命题与挑战:当Token调用量实现千倍级增长时,推理系统该如何承接持续攀升的业务需求?又该如何通过异构算力实现高效、稳定的Token生产与服务?
在近期举办的一场聚焦AI异构算力与Token生产的行业技术研讨会上,一位专注大模型基础设施领域的资深技术专家,以《Token工厂:以异构算力构建新一代AI基础设施》为主题发表演讲,深入剖析了规模化推理面临的系统性挑战,并分享了团队在异构推理架构、模型适配以及关键技术演进等方面的实践探索。
与传统单轮对话的推理需求相比,Agent时代的业务负载有着显著差异。
其一,长上下文场景会带来输入计算量与KV Cache占用的持续攀升;其二,连续多轮对话会导致前缀复用逻辑与热点不断变化;其三,突发与长尾需求占比提升,使得流量和输入长度的分布持续处于波动状态。
面对这些变化,相关团队的底层设计逻辑已经转向“以Token、状态与时延预算为中心”,所有资源组织和利用的核心目标都围绕着Token的生产效率、交付质量与单位成本展开。
这套以Token为核心的系统设计,有力支撑了规模化Token生产与服务能力的持续提升。据披露,相关团队的日均Token服务量已经从今年2月的0.46万亿,增长至8月的4.5万亿。
如何将单点的效率优势整合为系统级的Token产能?该专家分享了两大核心优化路径:横向编排与纵向优化,两条路径的最终目标高度一致:确保模型质量与服务SLO达标,同时提升有效吞吐、降低单位产能的成本。
横向串资源:让不同算力各展所长
首先是横向编排,核心目标是实现不同算力资源的协同调度。平台需要清晰掌握哪些模型、哪些版本可以适配哪些算力设备,明确Prefill与Decode的组合如何实现KV Cache交接,同时可以根据当前请求自动匹配最优执行路径,并在负载变化时自动调整调度策略。
针对不同品牌、不同规格的算力设备,团队构建了统一的资源画像体系,覆盖计算吞吐能力、KV Cache容量、有效带宽以及模型兼容性等核心指标,让不同算力设备都能纳入统一的编排视角。
在此基础上,平台会对推理请求进行全生命周期的精细化管控:从准入配对、Prefill执行、KV Cache状态交接,到Decode接管,每个环节都设置了标准化的协同机制,以此保障服务的稳定性。
该专家指出,平台不会将某一类芯片永久固定为P节点或D节点,而是会根据模型类型、批量规模以及上下文长度的瓶颈变化,动态调整不同芯片的角色分工,以此实现更高的资源可用性、更灵活的算力组合与配比。
纵向拉效率:让整条路径性能最大化
在横向打通资源调度的同时,团队还持续深化“模型×引擎×芯片”三层纵向优化,从模型适配到芯片运行时全链路发力,充分释放整条执行路径的性能潜力。
在模型层,团队会针对权重量化、显存预算进行精细化调优,在保证模型精度的前提下平衡吞吐能力;在引擎层,会对Attention、GEMM等核心算子进行并行优化,提升计算效率;在芯片层,会深度适配编译逻辑、访存调度与内存管理。所有的优化结果都会在真实业务负载中进行系统级验证,规避单点效率的瓶颈问题。
基于成熟的实践经验,该专家进一步分享了异构协同走向更高效率、更高灵活性的两大关键技术演进方向。
技术演进方向一:从固定P/D到动态资源池
在资源调度层面,团队正在从固定P/D配比转向动态资源池化。传统的静态P/D组合模式,在业务和时段变化的场景下,容易出现局部排队和资源错配的问题。为此,团队分别构建了Prefill Pool和Decode Pool,根据实时负载情况、KV Cache状态以及节点健康度,动态完成请求路由与P/D资源的匹配。当长输入导致Prefill压力升高时,系统可以动态增加P节点资源;当长输出推高Decode负载时,则可以增加D节点资源,甚至通过角色切换实现P/D节点的灵活转换,让算力资源跟随业务负载动态调整,在保障服务SLA的同时提升整体算力利用率。
技术演进方向二:从P/D走向模块级资源池
面向未来多模态、MoE模型的发展趋势,传统的P/D资源划分方式会逐渐显现瓶颈。团队的架构演进方向是将Encoder、Attention、FFN、视觉编码等不同模块拆分为独立的资源池,每个资源池都可以根据自身负载特点进行弹性扩缩容,让资源匹配更加精准,进一步提升整体算力利用率。
演讲的最后,该专家表示,作为专注大模型基础设施的团队,未来将持续推动产品与技术的迭代升级,携手生态伙伴共同加速AI基础设施的升级迭代,助力普惠AI的落地,共创智能未来。

