文章摘要
2026 年以来,在线策略蒸馏(OPD)成推理模型后训练新前沿。与传统离线蒸馏不同,它能缓解师生失配问题。半年间,ESR、OPD+ 等研究让其成为独立分支。蒸馏技术历经三阶段发展至 OPD 阶段。OPD 有三条核心研究线索,推理模型后训练正从“离线、静态、教师主导”转向“在线、动态、学生主导”,报告将梳理相关成果。

2026年以来,在线策略蒸馏(On-Policy Distillation,简称OPD)相关研究在推理模型后训练领域大量涌现,成为继长思维链(Long CoT)蒸馏之后又一个受到广泛关注的前沿方向。

与传统离线蒸馏不同,OPD不再依赖教师模型静态生成训练数据,而是让学生模型在自身策略采样得到的执行轨迹上接受教师的监督指导,从数据分布的根源上有效缓解了师生失配的核心问题。

短短半年时间里,从ESR提出的早停rollout蒸馏方案,到OPD+对advantage项的重新设计,再到Direct OPD对弱到强泛化场景的探索,一系列研究将OPD从一个简单的方法论描述发展为独立的研究分支,围绕“如何在学生自身的轨迹上开展蒸馏”这一核心问题形成了密集的研究产出。

OPD+重构了OPD目标函数中的advantage项核心模块。过往基于教师概率比的advantage设计在能力迁移过程中存在效率瓶颈,OPD+通过显式构造奖励项,大幅提升了教师模型向基础学生模型的能力迁移效率。

Direct OPD则打破了“教师必须强于学生”的默认假设,允许弱模型在自身rollout生成的轨迹上蒸馏强模型,避免了每轮模型升级后都需要重新生成训练数据的高额算力开销,在弱到强的泛化场景中验证了OPD作为持续改进机制的可行性。

紧随其后的弱到强OPD系列进一步拓展了教师的范围,将其覆盖到弱教师、同质教师等多种类型,系统地探究“什么样的教师、以何种方式、在哪些轨迹上实施监督,才能最有效地提升学生模型的能力”这一关键问题。

从更宏观的视角来看,OPD并非凭空出现,而是蒸馏技术长期演进的必然结果。整个蒸馏技术的发展大致经历了三个阶段:首先是教师静态生成数据的离线蒸馏阶段,随后是教师与学生迭代交互的蒸馏阶段,最终发展到学生自主采样数据、教师在线监督的on-policy蒸馏阶段,也就是OPD阶段。

离线阶段的典型工作包括DeepSeek-R1的数据蒸馏方案以及ReasonLite的两阶段长短CoT蒸馏技术。这类方案通过强模型生成高质量的推理链,经过筛选过滤后对学生模型进行监督微调,验证了“数据质量比数据总量更为重要”的核心观点。

在线阶段的代表则是ESR、OPD+以及弱到强OPD系列研究,它们将训练数据的选择从“教师能够提供的内容”转向“学生实际需要的内容”,在推理长度控制、能力迁移效率以及持续自我改进三个维度上开辟了全新的研究空间。

在这一演进脉络中,有三条核心研究线索分别处于OPD谱系的不同位置,且各自都经历了清晰的方向演变。

长/短CoT监督微调(SFT)是OPD的离线前身:该方案由教师产出长链或短链的推理轨迹,再对学生模型进行监督微调,其发展方向从最初的“获取更多训练数据”逐渐转向“量化评估数据质量与推理粒度”。比如s1仅使用1000条精选数据就能激发模型的推理能力,TokenSqueeze与ConPress则证明了长推理链可以被压缩为短链且不会损失模型精度。

自蒸馏 / 自我进化是OPD的核心:该方案将教师替换为模型自身或旧版本的模型,SPIN开创了自对弈微调的先河,R-Zero与Absolute Zero则展示了零数据条件下模型自我进化的可能性,其演进方向从“基于自我奖励的训练”逐步走向“完全自主的进化模式”,但reward hacking与迭代崩溃始终是尚未解决的稳定性难题。

DPO / 偏好优化则是OPD的监督信号维度:这类研究回答的是“使用何种信号进行训练”而非“使用何种数据训练”的问题,从SimPO、ORPO等免参考的离线变体,逐步演进到OAIF的在线数据采集、Step-DPO的推理步级偏好优化,当这类技术实现在线化之后,便会与OPD的核心框架直接汇合。

这三条研究线索共同指向了一个明确的行业趋势:推理模型的后训练正从「离线、静态、教师主导」转向「在线、动态、学生主导」

OPD正是这一范式转向的理论锚点,它将数据来源、监督信号与训练范式三个核心维度统一在同一个框架之下,也让长/短CoT SFT、自蒸馏与偏好优化在整个蒸馏谱系中的位置变得清晰可辨。

本报告将以此脉络为基础,系统梳理2025年1月至2026年8月间约120篇经过核实的相关研究成果,厘清三大子方向在OPD主线上的位置与演变逻辑,并结合当前的研究空白提供针对性的选题参考。

以上内容不代表本平台立场,仅供读者参考