文章摘要
智谱近日正式推出GLM-5.3-FlashX模型,其推理速度最高可达200 tokens/秒,相较上一代GLM-5.3-Flash实现5倍性能提升,服务定价提升2.5倍,目前相关API已开放调用。该模型性能提升依托10万张国产芯片算力,由智能代理配合人类工程师完成推理基础设施优化。

近日推出的GLM-5.3-FlashX模型,推理速度最高可达200 tokens/s,相较上一代GLM-5.3-Flash实现了5倍的性能提升,同时服务定价提升2.5倍,目前相关API已正式开放,开发者可通过标识GLM-5.3-FlashX调用该模型。

这一性能突破的背后,是团队基于10万张国产芯片提供的推理算力,进一步加大了基础设施侧的投入,并针对推理流程完成了全方位的优化。

自研推理基础设施的高效落地

支撑GLM-5.3-FlashX运行的这套推理基础设施,是由GLM-5.3驱动的智能代理完成搭建的,从最初的模型适配到最终的生产上线,整个流程仅耗时不到两周,最终端到端吞吐能力达到初始基线的3倍

在这套基础设施的构建过程中,人类工程师主要负责制定整体目标、划定优化边界、搭建反馈调试环境,以及对关键修改进行审核;而诸如测试执行、日志分析、性能追踪、微基准测试这类重复性工作,则全部交由智能代理完成。智能代理可以自主排查问题、修改代码、开展多组实验,在局部验证通过后,再将优化方案接入完整服务中进行验收,形成了完整的稠密反馈优化闭环。

案例一:精度偏差的根源排查

KDA模块的CP路径出现了精度偏差问题,在长上下文场景下表现尤为明显。智能代理顺着状态合并与更新的流程逐步排查,最终定位到两处tl.dot操作:虽然输入数据采用FP32格式,但计算过程默认使用了TF32精度,导致误差随着计算逐步累积放大。

针对这一问题,团队在两处操作中显式添加了input_precision="tf32x3"参数,该修复方案已被合并至Flash Linear Attention的上游代码仓库中。

案例二:KV传输的并发瓶颈修复

在相同的工作负载下,添加KV传输后的Prefill流程,与单独执行Prefill的性能差距要求应不超过5%,但实际测试中该差距超过了20%。智能代理通过追踪调用日志发现,KV传输的Python侧执行始终无法与DeepEP的dispatch/combine调用实现重叠。

进一步排查后发现,DeepEP v1.2.1版本中的两处C++调用没有释放全局解释器锁,导致负责Mooncake传输的Python线程无法获取锁资源,传输任务迟迟无法提交。完成修复后,在相同测试条件下,性能差距被压缩至1%以内。

案例三:冗余计算的优化

KDA Decode模块沿V维度进行分块计算时,同一组FP32归一化和门控计算被不同分块重复执行了四次,造成了不必要的算力浪费。

智能代理将这些分块合并至同一线程块中,提前完成批量计算并共享中间计算结果。虽然并行度有所降低,但彻底消除了重复计算,这一优化将算子性能提升至优化前的1.71倍

以上内容不代表本平台立场,仅供读者参考