腾讯混元开源AngelSpec,DFly权重加速推理2.4倍

国内AI大模型团队近期正式开源了全链路投机解码框架AngelSpec,同时开放了新一代draft模型DFly的预训练权重与完整训练代码,该方案可实现从模型训练到线上部署的端到端推理加速,最高可将推理速度提升2.4倍。
本次开源的核心亮点在于覆盖了完整的投机解码落地全流程:不仅提供了训练工具链,还同步放出了Hy3-A21B模型配套的MTP与DFly draft权重,开发者可以直接获取从训练到部署的全套资源,无需自行适配不同环节的技术细节。
新一代并行draft架构DFly的创新改进
此前的DFlash方案通过扩散方式并行生成block内的所有token,让draft延迟几乎与block长度无关,但存在明显短板:所有draft层共享同一份target上下文,且block内的token互相不可见,导致后段的接受率快速衰减。
DFly针对性地推出了三项核心改进:
- 混合target条件注入:结合DFlash的全连接共享投影与DFlare的逐层加权融合,让每个draft层同时获得全局语义和匹配自身深度的target特征,兼顾跨层交互与层特异性视角。
- 隐状态校正自回归头:在并行主干之上增加一个轻量校正头,通过前一位置已选token修正当前位置的token分布,主干保持全并行状态,仅校正头按从左到右顺序执行。
- 面向接受率的训练目标:先通过D-PACE加权的LK损失进行冷启动训练,再切换到端到端TV损失直接优化期望接受长度,让训练目标与线上实际效果对齐。
三项改进叠加后,DFly的平均接受长度达到4.79,明显高于DFlash的3.69与MTP的3.00;在结构性较强的场景中优势更为突出,Math500测试集上接受长度达5.23,HumanEval测试集上达5.52。
高并发场景优化:D-cut调度策略
较长的block会带来部署侧的额外代价:在高并发场景下,target验证会成为计算瓶颈,被拒绝的draft后缀会白白占用batch容量。实测显示,DFly在并发数达到48之后吞吐就会饱和,继续增加并发只会拖慢单用户的响应速度。
D-cut在每个解码步完成两件核心工作:
- 通过drafter的逐token置信度,估算各请求在不同验证深度下的期望推进量,进行跨请求全局排序,保留收益最高的前缀内容;
- 结合启动时预先测试好的延迟表,选择「期望收益/实际成本」比值最大的验证比例,动态调整每个请求的验证深度。
在实际线上流量回放测试中,当并发数分别为48、56、64时,D-cut相比纯DFly方案分别提升吞吐3.0%、9.2%与15.7%;在同等单用户延迟的前提下,整体聚合吞吐提升可达14%,突破了高并发场景下的吞吐天花板。
MTP + TTT:适配高熵对话场景
没有一种draft方案可以通吃所有生成场景:对话场景的信息熵较高,长block的后段大概率被拒绝;而代码、数学类场景的可预测性较强,短block又会浪费加速空间。因此AngelSpec采用了双draft路线:DFly负责代码、数学类结构化场景,MTP则专门适配高熵对话场景。
原始的MTP块按照单步teacher forcing方式训练,但在推理时需要递归消费自身的预测结果,导致深层位置的接受率大幅下降。团队通过TTT方案修复了训练-推理不一致的问题:在训练时对共享MTP块进行同策略自回归展开,配合target模型rollout生成的训练数据,让模型的训练目标更贴合线上推理的实际表现。
经过优化后,MTP的平均接受率从52.8%提升至66.4%,平均接受长度从2.58提升至2.99,大幅改善了对话场景下的生成效率。
AngelSpec全链路训练框架
本次开源的draft模型均由AngelSpec框架训练得到,该工具链基于TorchSpec构建,采用分离式设计:推理引擎运行target模型,隐状态通过Mooncake RDMA流式传输至训练进程,两侧可以独立扩缩容。框架针对投机解码方案做了全链路扩展,主要包含三个核心特性:
- TTT与长上下文训练:支持逐深度增长的draft KV cache,免去每步重展开前缀的开销;配合序列并行与序列打包技术,可以支持128k长度的长上下文训练。
- 真实接受率评估:内置评估服务器周期性使用vLLM对最新的checkpoint执行真实投机解码,直接报告服务侧的平均接受长度与逐位置接受率,无需依赖损失等间接代理指标。
- 插件化架构:target模型、优化器等组件均可通过配置灵活组合,新的架构与训练目标可以通过统一接口接入,无需修改训练主循环代码。
实测效果:DFly表现稳健全面
在Hy3-A21B模型与其他主流开源模型上的测试显示,DFly在接受长度与真实吞吐上均有更优表现:平均接受长度进一步提升,且在线上真实流量的各个并发档位上都能取得更好的吞吐效率。
本次测试的配置为:DFly、DFlash、DSpark三种块扩散draft均采用block8配置,MTP使用3个投机token。
- 接受长度:DFly的draft质量更优,在Hy3-A21B模型上平均接受长度达4.79,主流开源模型上达5.41,相比DFlash提升约30%,相比MTP提升约1.6倍;在HumanEval这类结构性较强的场景中,接受长度更是高达5.60与5.52。
- 端到端吞吐:在全并发档位上表现更出色,以Hy3 295B-A21B模型(TP=8,temperature=1)为例,DFly-8在4-64的全部并发档位上均可实现1.98-2.40×的平均加速比,在代码、数学类任务上的峰值加速比可达2.86×;再叠加D-cut调度策略后,高并发场景下还能额外获得15.7%的吞吐提升。
目前,该项目的技术报告、GitHub仓库、官方文档与预训练权重均已公开,开发者可通过以下链接获取完整资源:
- 技术报告:https://arxiv.org/abs/2607.25852
- GitHub仓库:https://github.com/Tencent/AngelSpec
- 官方文档:https://angelspec.readthedocs.io
- 预训练权重:https://modelscope.cn/collections/AngelSlim/AngelSpec
欢迎开发者试用与共建该项目,共同推动大模型推理加速技术的落地与发展。


