GLM驱动Agent优化推理系统 两周就绪吞吐提升三倍

近期,大模型驱动的智能体在AI基础设施优化领域展现出了亮眼的应用价值。据行业观察,基于GLM-5.3打造的Infra Agent参与了同系列轻量化模型GLM-5.3-Flash的推理系统全流程优化工作。工程师与智能体协同推进,仅用不到两周时间就完成了从初始适配到正式上线生产环境的全部环节,优化后的系统端到端吞吐能力达到初始基线的三倍左右,目前GLM-5.3-Flash的所有生产推理业务都稳定运行在这套系统上。
异步KV传输的性能瓶颈修复
在本次优化过程中,一个值得深入拆解的性能修复案例藏在KV Transfer环节中:底层硬件明明已经支持异步数据传输,但在加入KV传输步骤后,系统整体性能反而出现了明显下降。
项目团队为这项优化任务设定了明确的验收标准:在相同负载条件下,完成Prefill处理并加上KV缓存传输的整体耗时,与仅执行Prefill处理的耗时差距不应超过5%。其中Prefill负责处理输入数据并生成KV缓存,而KV Transfer则负责将这些缓存数据进行跨节点或跨设备传输,理论上传输过程可以与后续的模型计算并行重叠,因此额外的传输步骤不应该将全部传输时间计入总耗时。
但智能体在测试中发现,部分实际场景下的性能差距超过了20%,远高于预设的验收标准。这个异常结果快速缩小了排查范围:在负载完全一致的前提下,仅增加KV传输步骤就出现了显著耗时差异,需要深入追踪传输加入后系统执行流程的变化。
通过执行时间线分析,团队发现了关键线索:原本应该并行重叠的计算与传输操作没有实现充分重叠,传输任务的调度和提交出现了明显延迟。沿着调用链路逐层向下追溯后,问题最终定位在Python与C++的边界层:相关底层调用在执行过程中没有释放全局解释器锁(GIL)。
在同一个进程中,负责Mooncake Transfer的Python线程需要获取GIL才能推进传输任务的调度与提交,如果锁被其他调用占用,该线程就无法及时运行。这就导致尽管底层具备完整的异步传输能力,但上层应用迟迟无法将传输任务下发,原本可以与后续计算重叠的时间被白白消耗,最终拉低了整体性能。
异步传输能力要转化为实际吞吐收益,首要前提是任务能够及时提交。
本次修复的核心动作正是针对这个边界层问题:让相关底层调用在执行期间主动释放GIL,使得传输线程能够及时获取锁并提交任务。根据官方测试数据,修复完成后,在相同测试条件下,Prefill+KV Transfer与单独Prefill的性能差距已经降至1%以下,远低于最初设定的5%验收目标。
智能体优化依赖精准的反馈机制
如果仅向智能体反馈“系统吞吐下降”这样笼统的问题,那么计算、传输、调度等多个环节都可能成为怀疑对象,排查范围会变得非常宽泛。本次排查过程中,通过设置“有无KV传输”的对照实验快速缩小了范围,结合执行时间线定位到任务提交延迟,再通过线程与调用的详细信息进一步锁定GIL锁的问题。
相关技术团队将这种优化方式称为“密集反馈”:让反馈结果对应到具体的输入、线程或单个调用,这样的反馈获取成本低、可以及时返回,并且能够通过测试和对照实验进行验证。其核心价值在于,一次小型实验就能快速回答当前的问题,让智能体能够准确判断是否保留当前改动、继续推进排查,或是放弃当前假设转向新的方向。
这项优化工作被归类在递归自我改进(RSI)的研究方向下。本次案例直观展示了大模型智能体参与优化承载同系列模型的推理系统,并且优化效果可以通过实际运行结果得到验证的完整流程。不过目前仍需要工程师负责设定优化目标与系统约束、搭建智能体可以直接使用的反馈环境,以及审核涉及系统架构、异步并发逻辑和生产风险的关键变更,官方也明确表示目前尚未实现完全的递归自我改进。但模型参与推理系统优化、再由优化后的系统承载模型服务的闭环,已经拥有了可落地的工程实践案例。

