智谱发布GLM-5.3-FlashX 提速5倍提价2.5倍

近日推出的GLM-5.3-FlashX模型,推理速度最高可达200 tokens/s,相较上一代GLM-5.3-Flash实现了5倍的性能提升,同时服务定价提升2.5倍,目前相关API已正式开放,开发者可通过标识GLM-5.3-FlashX调用该模型。
这一性能突破的背后,是团队基于10万张国产芯片提供的推理算力,进一步加大了基础设施侧的投入,并针对推理流程完成了全方位的优化。
自研推理基础设施的高效落地
支撑GLM-5.3-FlashX运行的这套推理基础设施,是由GLM-5.3驱动的智能代理完成搭建的,从最初的模型适配到最终的生产上线,整个流程仅耗时不到两周,最终端到端吞吐能力达到初始基线的3倍。
在这套基础设施的构建过程中,人类工程师主要负责制定整体目标、划定优化边界、搭建反馈调试环境,以及对关键修改进行审核;而诸如测试执行、日志分析、性能追踪、微基准测试这类重复性工作,则全部交由智能代理完成。智能代理可以自主排查问题、修改代码、开展多组实验,在局部验证通过后,再将优化方案接入完整服务中进行验收,形成了完整的稠密反馈优化闭环。
案例一:精度偏差的根源排查
KDA模块的CP路径出现了精度偏差问题,在长上下文场景下表现尤为明显。智能代理顺着状态合并与更新的流程逐步排查,最终定位到两处tl.dot操作:虽然输入数据采用FP32格式,但计算过程默认使用了TF32精度,导致误差随着计算逐步累积放大。
针对这一问题,团队在两处操作中显式添加了input_precision="tf32x3"参数,该修复方案已被合并至Flash Linear Attention的上游代码仓库中。
案例二:KV传输的并发瓶颈修复
在相同的工作负载下,添加KV传输后的Prefill流程,与单独执行Prefill的性能差距要求应不超过5%,但实际测试中该差距超过了20%。智能代理通过追踪调用日志发现,KV传输的Python侧执行始终无法与DeepEP的dispatch/combine调用实现重叠。
进一步排查后发现,DeepEP v1.2.1版本中的两处C++调用没有释放全局解释器锁,导致负责Mooncake传输的Python线程无法获取锁资源,传输任务迟迟无法提交。完成修复后,在相同测试条件下,性能差距被压缩至1%以内。
案例三:冗余计算的优化
KDA Decode模块沿V维度进行分块计算时,同一组FP32归一化和门控计算被不同分块重复执行了四次,造成了不必要的算力浪费。
智能代理将这些分块合并至同一线程块中,提前完成批量计算并共享中间计算结果。虽然并行度有所降低,但彻底消除了重复计算,这一优化将算子性能提升至优化前的1.71倍。

