文章摘要
OpenClaw - RL是在线强化学习框架,支持三种训练模式,能提升模型训练效率与性能。文中解析了教师模型设计与工作机制,包括角色特性、推理控制、流程构建等;阐述了Teacher log - probs计算流程及Top - K变体扩展;分析了四种logprobs类型与用途。还介绍了Top - K蒸馏原理与实现,提出实践注意要点,称其为智能体学习提供了高效方案与可行路径。

OpenClaw-RL源码阅读笔记:教师模型与Top-K蒸馏全解析

OpenClaw-RL是一款专为智能体工具使用场景设计的在线强化学习框架,通过从环境反馈中提取过程奖励信号来训练语言模型。它支持三种核心训练模式:基于二元奖励的强化学习、基于后见之明提示的在线策略蒸馏,以及联合训练方法,能够将延迟反馈转化为即时的token级别监督信号,显著提升模型训练效率与最终性能表现。

一、教师模型的核心设计与工作机制

在OpenClaw-RL框架中,教师模型是实现高效在线蒸馏学习的核心组件,主要用于在线策略蒸馏训练阶段,为学生策略模型提供细粒度的token级监督信号。默认情况下,教师模型采用Qwen3-4B系列权重,通过独立的服务端点与学生模型协同工作。

双重角色与架构特性

教师模型采用统一的服务端点设计,可以同时承担提示提取评估和对数概率计算双重功能,通过不同的请求参数区分具体任务,实现硬件资源的高效复用。在配置上,教师模型默认使用与学生策略相同的基座模型,运行时不加载LoRA适配器,确保能够提供稳定、高质量的监督信号,同时支持通过环境变量或命令行参数灵活指定不同的教师模型。

确定性推理与并发控制

教师模型采用temperature=0.0的确定性推理配置,确保在相同输入下始终产生一致的输出分布,同时通过设置max_new_tokens=0,仅计算已有token的对数概率而不生成新内容,大幅提升计算效率。为防止服务过载,系统通过信号量机制限制最大并发查询数量,默认并发数由环境变量OPENCLAW_OPD_TEACHER_LP_MAX_CONCURRENCY控制。

增强Prompt构建流程

教师模型的工作流程首先从用户反馈中提取有效的hint提示,将提取的提示注入到原始对话历史中构建增强的prompt,再基于这个增强prompt查询教师模型的对数概率分布,从而将延迟的用户反馈转化为即时的token级别监督信号。

二、Teacher log-probs计算全流程解析

教师模型的对数概率计算是OPD训练的核心环节,主要包括以下几个关键步骤:

1. 构建带hint的输入序列

首先通过提示提取模型从用户反馈中获取有效提示,将提示注入到原始对话的最后一条用户消息中,构建增强的对话历史。随后应用tokenizer模板将对话历史转换为模型可接受的输入格式,最终得到包含hint信息的完整输入序列。

2. Teacher前向计算

通过向教师模型服务端点发送POST请求,传入包含增强prompt和原始响应的完整token序列,设置max_new_tokens=0仅进行前向传播计算,同时通过logprob_start_len参数指定只返回响应部分的对数概率,节省传输带宽。

3. 解析与对齐logprobs

从模型返回结果中提取输入token的对数概率,跳过位置偏移修正后,对齐到响应token的长度,最终得到每个响应token对应的对数概率值。当返回结果长度与响应长度不匹配时,系统会自动进行填充或截断处理。

4. Top-K变体扩展

当启用Top-K蒸馏时,教师模型会返回每个位置概率最高的K个token及其对数概率,通过Tail Trick将词表压缩为K+1维分布,为学生模型提供更丰富的监督信号。

三、Logprobs类型与应用场景分析

在OpenClaw-RL框架中,主要存在四种类型的对数概率数据,各自具有不同的来源与用途:

  • Rollout Logps:学生模型在采样阶段生成的对数概率,反映当前策略模型的输出分布,用于计算策略梯度和蒸馏优势。
  • Teacher Logps:教师模型在增强prompt基础上计算的对数概率,提供token级别的监督信号,是标准OPD模式的核心数据。
  • Teacher Top-K Logps:教师模型返回的Top-K token对数概率分布,为学生模型提供更丰富的监督信息,支持更高级的蒸馏训练。
  • Reference Logps:参考模型计算的对数概率,主要用于KL正则化,防止训练过程中策略偏离过远。

不同类型的logprobs在训练流程中扮演不同角色,共同构成完整的监督信号体系,为模型训练提供多维度的优化目标。

四、Top-K蒸馏原理与实现机制

传统的单tokenOPD存在信息瓶颈,教师模型每个位置仅传递一个标量值,丢失了候选token的排序信息。Top-K蒸馏通过引入教师模型的Top-K候选分布,为学生模型提供更全面的监督信号。

Tail Trick与分布压缩

由于完整词表维度通常高达15万以上,直接传输全词表分布不现实。Tail Trick将词表压缩为K+1维分布,前K个bin对应教师模型概率最高的K个token,第K+1个bin包含所有剩余token的总概率,在保留关键信息的同时大幅降低数据传输量。

Reverse KL散度优化

Top-K蒸馏采用反向KL散度作为损失函数,具有众数寻求特性,能够引导学生模型专注学习教师模型最强的行为模式,而不是试图覆盖所有可能的输出分布,这在智能体训练场景中尤为重要,能够帮助模型快速学习最优行为。

Teacher Top-K vs Student Top-K

OpenClaw-RL采用教师Top-K的实现方式,与原版SDFT/SDPO的学生Top-K不同。教师Top-K只需一次API调用即可获取所有Top-K信息,实现成本更低,同时在教师模型强于学生模型的场景下表现更优,能够更有效地引导学生模型学习正确的行为模式。

五、实践注意事项与工程优化

在实际部署和训练过程中,需要注意以下几个关键要点:

  • Tokenizer一致性:教师与学生模型必须使用相同的tokenizer和模型权重,否则response_ids与teacher_log_probs无法正确对齐。
  • 长度对齐策略:API服务器会对长度不一致的logprobs进行裁剪或填充,确保与响应token长度严格对齐。
  • 并发性能优化:教师查询并发受环境变量控制,Top-K蒸馏会增加一定的计算开销,需要根据实际硬件资源合理配置。
  • 训练监控:可以对比rollout_log_probs与训练时new_log_probs的差异,监控训练过程中的策略漂移情况。

六、总结与展望

OpenClaw-RL通过教师模型和Top-K蒸馏技术,为智能体强化学习提供了高效的在线训练方案。教师模型将延迟反馈转化为即时的token级别监督信号,而Top-K蒸馏进一步丰富了监督信息的维度,帮助学生模型更快更好地学习到最优行为模式。

这种设计不仅提升了训练效率和最终性能,还为复杂智能体系统的在线学习提供了可行的技术路径,未来可以在此基础上进一步探索更高效的蒸馏策略和更丰富的监督信号来源。

以上内容不代表本平台立场,仅供读者参考