腾讯AngelSpec开源:DFly架构+D-cut优化大模型推理

近期相关团队正式全链路开源了AngelSpec投机解码框架,这套工具覆盖了从draft模型训练、架构设计到线上部署的完整流程,同时同步开放了Hy3-A21B版本的MTP与DFly两类drafter权重,以及对应的训练代码。本次开源的核心亮点在于提供了端到端的完整解决方案,而非仅开放单一模块,开发者可以直接获取从训练到部署的全套资源。
新一代DFly drafter已经达到了全新的性能标杆:在4到64的全并发档位、六大基准测试中均实现了更高的吞吐表现,相比传统AR基线平均加速1.98到2.40倍,在代码和数学场景下峰值加速可达2.86倍,相较于DFlash框架提速10.5%到11.8%。同时DFly的平均接受长度比DFlash提升30%,约为MTP方案的1.6倍。
除了draft模型本身的优化,配套的D-cut策略可以充分榨取高并发场景下的吞吐能力,在真实线上流量场景中实现了15.7%的额外吞吐提升;而MTP结合TTT训练策略则解决了对话场景下训练与推理不一致的问题,将平均接受率从52.8%提升至66.4%,平均接受长度从2.58提升至2.99,让投机解码加速真正实现了从训练到线上部署的全流程可用。
DFly:重构并行draft架构
传统的DFlash框架通过扩散方式并行生成block内的所有token,其draft延迟几乎与block长度无关,但存在明显短板:所有draft层共享同一份target上下文,且block内的token之间互相不可见,导致后段的接受率快速衰减。
针对这些问题,DFly针对性地做了三项核心改进:
● 混合target条件注入:结合DFlash的全连接共享投影(支持跨层交互)与DFlare的逐层加权融合(保留层特异性视角),让每个draft层同时获得全局语义信息和匹配自身深度的target特征。
● 隐状态校正自回归头:在并行主干之上新增一个轻量校正头,利用前一位置已经选中的token修正当前位置的token分布。主干部分保持全并行执行,仅这个小头按照从左到右的顺序执行。
● 面向接受率的训练目标:先使用D-PACE加权的LK损失进行冷启动训练,再切换到端到端TV损失,直接优化期望的接受长度。
经过这三项改进的叠加,DFly的平均接受长度达到了4.79,明显高于DFlash的3.69和MTP的3.00;在结构性较强的场景中优势更为明显,在Math500数据集上达到5.23,在HumanEval数据集上达到5.52。
D-cut:优化高并发下的batch资源利用
长block架构在部署时面临一个明显的痛点:高并发场景下target验证会成为计算瓶颈,被拒绝的draft后缀会白白占用batch容量。实测显示,DFly在并发数达到48之后吞吐会进入饱和状态,继续增加并发只会降低单用户的响应速度。
D-cut在每个解码步会完成两件核心工作:
- 利用drafter的逐token置信度,估算每个请求在不同验证深度下的期望推进量,然后跨请求进行全局排序,保留收益最高的前缀部分。
- 结合启动阶段预先测量好的延迟表,选择「期望收益/实际成本」比值最大的验证比例。
实际效果显示,D-cut可以根据负载情况自动调整:在负载较低时保留较深的draft,在负载较高时主动裁剪draft长度。在Hy3线上流量回放测试中,并发数为48、56、64时,相比基础DFly方案分别提升了3.0%、9.2%和15.7%,在同等单用户延迟的情况下,聚合吞吐提升了14%。
MTP+TTT:适配高熵对话场景
没有任何一种drafter方案可以通吃所有场景:对话场景的熵值较高,长block的后段大概率会被拒绝;而代码和数学场景的可预测跨度较长,短horizon方案会浪费加速空间。因此AngelSpec采用了双drafter路线:DFly负责代码和数学场景,MTP负责高熵的对话场景。
原始的MTP块采用单步teacher forcing方式训练,但在推理时需要递归消费自身的预测结果,导致深层位置的接受率大幅下降。团队通过TTT策略(训练时对共享MTP块进行同策略自回归展开)修复了训练与推理不一致的问题,配合target模型rollout生成的训练数据,最终将平均接受率从52.8%提升至66.4%,平均接受长度从2.58提升至2.99。
AngelSpec全链路框架
前文提到的各类drafter均由AngelSpec框架训练得到。这套工具基于TorchSpec构建,采用分离式设计:推理引擎运行target模型,隐状态通过Mooncake RDMA流式传输至训练进程,两侧可以独立扩缩容。同时框架针对本次公开的方法做了全链路扩展:
● TTT与长上下文训练:采用逐深度增长的draft KV cache,避免每步都需要重新展开前缀;配合序列并行与序列打包技术,支持128k的长上下文训练。
● 真实接受率评估:内置评估服务器会周期性使用vLLM对最新的checkpoint执行真实投机解码,直接报告服务侧的平均接受长度和逐位置接受率,无需依赖损失等代理指标。
● 插件化架构:target模型、优化器等组件都可以通过配置进行组合;新的架构和训练目标可以通过统一接口接入,无需修改训练主循环。
实测表现:DFly性能稳健领先
在Hy3-A21B和主流开源模型上的测试显示,DFly在接受长度和真实吞吐方面都表现更优:平均接受长度得到进一步提升,在线上真实流量的各个并发档位都取得了更好的吞吐表现。
本次测试的配置为:DFly、DFlash、DSpark三种块扩散drafter均采用block8,MTP方案使用3个投机token。
1. 接受长度:代表了更好的draft质量,DFly在Hy3-A21B上的平均接受长度达到4.79,在主流开源模型上达到5.41,相较于DFlash提升约30%,相较于MTP提升约1.6倍;在结构性越强的场景中优势越明显,在HumanEval数据集上分别达到5.60和5.52。
2. 端到端吞吐:在全并发档位都实现了更高的性能(测试基于Hy3 295B-A21B,TP=8,temperature=1,对比的是AR基线的平均加速比)。DFly-8在4到64的全部并发档位中,平均加速比达到1.98到2.40倍,在代码和数学场景下峰值加速可达2.86倍;再叠加D-cut策略后,在高并发场景下还能额外实现15.7%的吞吐提升。
目前团队已经在Hy3及其他开源模型上,基于MTP、DFly等方法训练的drafter权重,以及完整的AngelSpec框架全部开源,欢迎开发者使用和共建。
●技术报告:
https://arxiv.org/abs/2607.25852
●GitHub:
https://github.com/Tencent/AngelSpec
●文档:
https://angelspec.readthedocs.io
●Huggingface:
https://huggingface.co/collections/AngelSlim/angelspec
●modelscope:

