吴恩达开源Prefix Sliding:大模型推理无需训练提速3倍

大家好,今天我们来聊聊一个正在改变大模型长上下文推理效率的技术——Prefix Sliding,这项由行业专家团队开源的方案,正在重新定义我们对模型推理成本的认知。
你有没有想过,当大模型进行复杂推理时,那些长长的推理链真的需要保留每一个生成的token吗?传统的全注意力机制要求模型在生成每一个新token时,都要回顾之前所有的上下文,这导致每生成一个token的成本随着序列长度线性增长,面对需要数万token的复杂推理任务时,成本高到难以落地。
从注意力分布看推理效率瓶颈
通过对模型推理过程的注意力分布可视化分析,研究者们发现了一个反常识的现象:模型的注意力其实只集中在两个区域——最开始的系统提示和任务描述前缀,以及最近生成的少量token,中间的推理过程token几乎完全没有被关注。
举个简单的例子,当我们计算((42 + 84) × 4) - 5时,一旦算出42+84=126,这一步的推导过程就不再重要了,下一步只需要使用结果126即可。这就是中间推理token快速"贬值"的直观体现。
而前缀部分则承担了"注意力水槽"的重要作用,包含了系统指令、任务描述和可用工具信息,最近的token则代表了模型当前正在处理的上下文,这两部分是推理过程中必不可少的。
Prefix Sliding的核心设计
Prefix Sliding的设计思路非常简洁:保留任务前缀和滑动窗口内的最新token,丢弃中间已经贬值的推理token,不需要额外的训练就能直接提升推理效率。
具体来说,如果我们有100个token的系统提示和任务描述作为前缀,再搭配4096个token的滑动窗口,那么无论模型已经推理了1万还是100万token,内存中永远只需要保存最多4196个token。这使得每生成一个新token的成本保持恒定,彻底解决了传统全注意力机制随序列长度增长成本线性上升的问题。
位置编码的两种处理方案
当滑动窗口不断移动时,token的绝对位置也在持续变化,如何处理位置编码成为了一个关键问题。研究团队提出了两种解决方案:
- Reset PE:当丢弃旧的token后,将剩余token重新编号,这种方式效果略好但需要重新计算位置编码,会破坏KV缓存的复用性
- Continue PE:保留token的原始位置编号,直接复用已有的缓存,实现更高效的推理
实验验证表明这两种方案的性能差异并不显著,因此项目中默认采用更高效的Continue PE方案。
训练端的扩展能力
Prefix Sliding的价值不仅限于推理阶段加速,在训练端同样有着巨大的想象空间。在强化学习训练中,超长的生成轨迹一旦超出上下文窗口,通常的做法是直接截断丢弃,导致大量训练样本浪费。
借助滑动窗口的有限感受野特性,Prefix Sliding允许我们延长rollout至任意长度,同时解决了反向传播爆显存的问题。理论上模型的感受野为窗口大小乘以层数,实际应用中由于信息瓶颈,有效感受野约为1.5倍窗口大小。
针对超长轨迹的反向传播,论文提出了两种方案:分块反向传播和截断反向传播,其中截断反向传播更符合实际应用需求。例如对于10万token的推理轨迹,只需将最后8192个token送入训练器,其中前6144个作为上下文(loss mask置零),只对最后2048个token计算RL损失,既保证了梯度精度,又大幅降低了计算成本。
实验效果验证
在AIME25、GPQA Diamond、MATH500三个基准测试中,Prefix Sliding(窗口大小4096)在相同推理时间下的准确率全面优于传统全注意力机制。值得注意的是,性能提升的核心原因并不是模型变得更聪明了,而是相同时间内可以生成更多的token,提升了思考预算的性价比。
吞吐量对比实验显示,传统全注意力机制的推理速度会随着序列长度增加持续变慢,而Prefix Sliding则能在窗口填满后保持稳定的吞吐量,最高可实现3倍的推理提速。在相近的内存预算下,Prefix Sliding甚至能取得比全注意力机制更高的任务性能。
与其他长上下文方案的对比
Prefix Sliding并不是唯一的"有界成本"长上下文方案,研究团队还与其他三种主流方案进行了对比:纯滑动窗口、Last-k和Summary方法。
实验结果显示,Prefix Sliding实现了最优的性能-效率权衡,并且只需要设置窗口大小这一个超参数。纯滑动窗口在推理时间较长时会迅速失效,因为前缀一旦滑出窗口,模型就会忘记初始任务要求。Last-k和Summary方法虽然能获得不错的性能,但重复处理token和额外的总结步骤会带来结构性的开销。
成本有界:无限扩展的必要条件
研究团队提出了一个清晰的分类视角,将长上下文方法按照"每新增一个token的渐近成本"分为两类:
- 无界方法:包括全注意力机制及各类次二次复杂度方法,生成新token的成本随序列长度持续增长
- 有界方法:如RNN/SSM、Last-k、Summary和Prefix Sliding,单token的生成成本存在上限
要实现真正的无限长上下文推理,有界成本是必不可少的前提条件。在各类有界方案中,Prefix Sliding是唯一同时满足"有界成本""现有模型开箱即用""成本曲线平滑"三个条件的方案,不需要从头预训练,也不会出现GPU利用率波动的问题。

