Agentic RL:大模型训练破局新方向

在后训练阶段,强化学习与知识蒸馏始终是大模型性能优化的核心方向。不少从业者会疑惑:为何部分模型仅通过蒸馏就能获得出色的效果?强化学习在后训练流程中的定位究竟是什么?本文将结合具体案例与技术逻辑,拆解这些问题的核心本质。
监督微调(SFT)阶段的核心职责之一,是为模型定型后续优化的思维链(CoT)模式,这几乎决定了模型在后训练阶段能达到的性能上限。我们可以用一个简单的乘法题举例说明:给定计算式997 × 1003,存在三种典型的思维链模式。
- 优质模式:利用平方差公式简化计算,997 × 1003 = (1000 − 3)(1000 + 3) = 1000² − 3² = 999991
- 普通模式:分步展开计算,997 × 1003 = 1003 × (900 + 90 + 7) = 902700 + 90270 + 7021 = 999991
- 劣质模式:直接给出结果,997 × 1003 = 999991
这三种模式都能在这一道题上得到正确结果,但在泛化到同类计算题时表现差异巨大:优质模式可以稳定输出正确结果;普通模式需要执行多次乘法和加法,步骤更多,出错概率更高,且令牌利用率更低;劣质模式则会让模型在遇到类似题目时直接输出固定结果,完全失去泛化能力。
由此可见,优质的思维链模式具备输出简洁、准确率高、泛化性强的特点。虽然SFT定型的思维链会在后续的RL阶段发生变化,但很多优质的模式很难在RL阶段被自主探索出来,这就像在智能体任务中,如果不在SFT阶段教会模型基础的分工思路,主智能体不会主动开启子智能体处理局部任务,子智能体也很难自发想到和其他子智能体交换信息。进入智能体时代后,我们构建和筛选的环境轨迹,本质上仍是在延续推理时代的工作:寻找更优质的思维链模式。
不过,仅拥有优质的思维链模式并不足以训练出优秀的模型,就像思路开阔的人未必能清晰表达自己的想法。模型同样需要将思维链转化为适配自身能力的表达方式。
不同模型在预训练阶段学到的知识结构不同,使用的分词器也存在差异,即使面对相同的思维链模式,不同模型的最佳表达方式也不一样。比如两个模型都掌握了99×99=99×(100-1)=9801的思维链,但实际应用时:
- 性能较强的模型会直接简化计算:99 × 99 = 99 × (100 - 1 ) = 9900 - 99 = 9801
- 性能较弱的模型则需要更细致的步骤:99 × 99 = 99 × (100 - 1 ) = 99 × 100 - 99 × 1 = 9900 - 99 = 9900 - (100 - 1) = 9900 - 100 + 1 = 9800 + 1 = 9801
大多数情况下,我们获取的思维链模式都来自更强的模型或人工编辑,往往具备表述简洁、思路优雅的特点,但我们训练的模型未必有足够的能力直接适配这类模式,需要结合自身能力对SFT阶段的思维链进行本土化改造。这正是强化学习发挥作用的关键:在给定思维链模式的前提下,通过探索足够多的回复,找到与模型自身知识储备、分词规则最契合的表达方式,强化这种表达形成专属的思维链模式。
在推理任务中,SFT的思维链只会告诉模型“做完题后反思会更好”,但具体反思多少次效果最优、效率最高,则需要模型在RL阶段自主摸索。比如性能较强的模型会发现思维链中的部分步骤可以省略,而性能较弱的模型则会发现补充被省略的步骤能提升准确率。
在智能体任务中,SFT数据会告诉模型可以使用哪些子智能体、何时调用子智能体,但具体的调用逻辑则需要模型在RL阶段自行探索。比如1T参数的模型仅需调用2个子智能体就能获得正确的奖励信号,而100B参数的模型则需要调用5个子智能体才能达成目标,不同模型会在RL过程中找到最适合自身的智能体配置方案。
这也解释了一个常见现象:SFT后起点较低的模型,有可能在RL后获得更高的最终性能。我们看到的SFT起点低,往往是因为思维链模式与模型能力不匹配,而非SFT数据本身质量不佳。如果使用sota模型的回复进行SFT,常会因为其思维链质量过高导致SFT阶段的指标不尽如人意,因此验证一个思维链模式的潜力,往往需要SFT与RL共同协作,这也是当前后训练的标准流程。
除此之外,强化学习还带有“基因突变+进化”的属性。当算力充足、采样轮次足够多时,模型有机会在RL阶段探索到全新的优质思维链模式。优秀的RL算法(如GRPO)需要充分捕捉这类高质量数据,给予足够强的学习信号让模型记住这种模式。
除了对思维链模式进行本土化改造,RL更重要的意义是让模型输出变得可控。传统观点认为,只要精准控制SFT的数据分布,就能控制模型的输出,但随着大量合成语料进入预训练和中期训练阶段,后训练阶段出现异常模式的概率越来越高,即使所有SFT数据都规范合规。
预训练阶段仅关注数据质量和纯净度,并不会考虑后训练阶段为用户体验制定的规则。那些质量很高但格式不优雅的数据,经过几十万亿token的训练后,绝非几条SFT数据就能压制,而且SFT本身也不具备压制异常模式的能力。比如SFT后的模型可能会输出多个<think>标签,影响推理服务的切分;可能会中英混杂,影响用户体验;可能会输出长度极不稳定,有时不反思有时过度反思。这类让产品团队头疼的问题,在奖励建模面前很容易解决,只需在RL阶段加入对应的惩罚损失,就能大幅减少这类异常情况。
现在常见的“思考档位/思考深度”功能,作为模型可控输出的重要模块,看似复杂,实则只需在RL阶段为不同档位配置不同的上下文窗口就能轻松实现。
既然讨论RL的重要性,就不得不提及知识蒸馏,二者的优先级争论从2023年一直延续至今。目前并没有直接证据表明,经过RL优化的模型相比SFT模型获得了质的提升,实际上RL带来的收益可以通过蒸馏实现。RL的本质仍是在寻找更好的思维链模式,通过投入算力找到的优质模式价值不菲,但寻找这个模式的过程本身未必具备不可替代的价值。
我们完全可以让经过RL优化的模型作为教师模型,通过蒸馏将其探索到的行为分布迁移到其他模型上,得到指标接近教师模型的学生模型。这也是业界常用的合并方案之一:对多个RL子模型进行拒绝采样的SFT训练(另一种方案是OPD)。当我们赞叹某款模型的指标优异、令牌利用率高时,很可能这款模型背后有更强的教师模型帮助它走了捷径。
举个简单的例子,1T参数的模型在RL阶段探索到的思维链模式,会比100B参数的模型探索到的更丰富。将1T模型找到的优质模式喂给100B模型,再通过RL适配这种模式的具体表达方式(通常会让小模型的输出变长),小模型的指标就能接近大模型的水平,这种方法在同尺寸、同分词器的模型上效果尤为明显。
甚至,蒸馏可以通过调整数据分布让学生模型超过教师模型。比如教师模型的思维链随机混合中英文,而英文思维链的整体质量更高,我们可以在蒸馏阶段仅保留英文思维链的数据,从而获得更高的指标。但需要注意的是,任何能让学生模型效果超过教师模型的操作,都应该用于提升教师模型本身的效果——要么让学生模型使用质量更高的数据,要么让学生模型使用更准确的奖励信号,而非纠结于操作本身的技巧。
概括来说,蒸馏就像是“偷看学习笔记”:无论是蒸馏sota模型的回复,还是蒸馏自家模型经过RL优化后的回复,都能让模型快速学到优质的思维链模式,得到起点高、潜力大的SFT模型。在此基础上,通过RL适配思维链模式、修正异常模式,进一步消化笔记中的知识,就能得到优秀的后训练模型。这也是为什么很多团队选择仅做SFT而不做RL:这种方案节省算力,且效果同样出色。一言以蔽之:认为蒸馏无用的人,大多没有亲自训练过大模型;认为蒸馏是后训练全部的人,大多只想做追赶者。
聊完常规蒸馏,我们可以再谈谈“软蒸馏”。直接蒸馏思维链模式是最常用的蒸馏方法,但也是相对基础的蒸馏方式。真正高级且常用的蒸馏方法,是借助sota模型的能力优化自身模型,包括但不限于:利用sota模型生成模型能力边界的训练数据、利用sota模型分析现有模型的思维链缺陷、利用sota模型优化RL阶段使用的验证器等。
只要国外模型仍领先于国内模型,国内模型就拥有源源不断的进步空间和优化手段。软蒸馏是行业普遍存在的现象,国内的模型厂商几乎都在优化过程中借助过外部先进模型的帮助,只能说技术追赶仍在路上,差距依然存在。
除了基础设施的硬实力竞争,大模型在纯训练阶段的竞争已经十分透明,比拼的是谁更能实现规模化:规模化模型参数、规模化RL训练数据、规模化智能体环境。因此,想要成为行业领头羊的团队,必须加大对RL的投入,早日摆脱对外部sota模型的软蒸馏依赖;而如果仅追求模型在特定场景下的应用价值,蒸馏已经是最优的选择。

