文章摘要
文章围绕大模型上线后无额外标注下自我进化问题展开。测试时强化学习(TTRL)提供路径,但现有多数方法难处理开放式场景。SERPO方法解决此痛点,通过回答、判据与策略的闭环进化实现自我提升。实验表明,SERPO在性能提升、跨分布迁移等方面表现出色,其性能增益接近特权监督方法,且能避免过拟合。同时,研究指出自进化需评估能力大于生成能力及外部反馈。

当大模型完成部署上线,能否在没有额外人工标注的前提下,持续适配真实场景并实现自我进化?这是当前AI落地过程中备受关注的核心问题之一。

测试时强化学习(TTRL)为这个问题提供了一条直接路径:让模型围绕当前测试任务自主采样、构建奖励信号并更新参数。但现有的多数TTRL方法依赖答案投票机制——先从多条生成结果中抽取最终答案,再通过多数票生成伪标签。这种方式适用于数学题、选择题等答案可归一化的任务,却很难处理开放式生成场景。

以医疗咨询场景为例,两份针对孕晚期持续头痛的建议可能给出相同的主推荐,但在禁忌症说明、不确定性表述和转诊指引上可能存在显著差异。此时,多数共识未必代表高质量的回答,甚至可能是所有参与者共同遗漏了某个关键的判断标准,比如先兆子痫的红旗信号。

近期提出的SERPO(Self-Evolving Rubric Policy Optimization)方法,正是为了解决开放式TTRL的这一痛点。它不再通过投票选择最优答案,而是让模型从自身生成的回答差异中,自主总结高质量回答应满足的判据,再基于这些判据评估每条回答的质量,实现回答、判据与模型策略的共同进化。

论文:SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
链接:https://arxiv.org/abs/2607.26873
代码:https://github.com/chiefovoavicii/SERPO
主页:https://chiefovoavicii.github.io/SERPO/
  

无监督适配的核心逻辑

SERPO采用固定任务集合上的直推式(transductive)设定,整个适配过程仅依赖测试集的原始提示词、模型自主生成的回答,以及从这些回答中提取的统计量,完全不需要参考答案、人类反馈、外部奖励模型、额外语料或更强的裁判模型。

该框架中的rubric生成器和评估器(judge)均来自初始部署的模型权重,并且在整个训练过程中保持冻结状态,唯一需要更新的只有策略网络(actor)。也就是说,模型完全依靠自身生成的回答之间的质量差异,来转化为训练信号,实现无监督的自我进化。

回答、判据与策略的闭环进化

SERPO同时维护三类核心状态:每道题目独立的Good-Normal-Bad三级回答池、随回答动态更新的rubric池,以及所有题目共享的actor参数。三者形成了完整的闭环:回答为rubric提供质量差异的证据,rubric为策略生成奖励信号,更新后的策略再生成新的回答,推动整个循环持续进化。

回答池进化:三级样本的设计逻辑

每道题目都会保留一组模型生成过的代表性回答,并按照质量划分为Good、Normal、Bad三个档位。如果只比较最优和最差的回答,模型很容易学到“区分优秀与糟糕”的粗粒度规则,但很难捕捉到真正决定回答质量的细节差异。Normal档位正是为了填补中间地带,让有效的质量判据必须能够稳定地区分三个质量层次。

SERPO会使用当前的rubric对新生成的回答进行临时排序,再选择分离度最大的Good-Normal-Bad组合来更新回答池。这样保留的样本并非随机选取,而是一组具有明确顺序和间距、能够支持判据对比的高质量证据。

Rubric进化:动态筛选有效的质量标准

rubric生成器会读取当前的提示词、已有的判据和最新的回答池,从优质和劣质回答的差异中提取新的原子判据。新旧判据会被统一归并和筛选:重复的要求会被整合为统一表述,相关但不同的要求则分别保留。

筛选判据时会同时考虑两个维度:一是该判据能否拉开不同质量回答的分数差距,二是能否正确将Good、Normal、Bad三档回答按质量排序。那些始终给出恒定分数、频繁出现平局,或者排序颠倒的判据会被逐步淘汰;而偶尔失效的判据则会保留恢复的机会,避免单次噪声判断造成误删。

策略进化:将判据信号写入模型权重

SERPO会利用存活的判据及其区分能力,为模型生成的回答分配奖励,再通过GRPO(Generative Reinforcement Policy Optimization)更新actor网络。与传统的硬Pass/Fail判定不同,该框架的judge会读取布尔判定token的概率,区分“确信满足判据”和“勉强满足判据”。实验显示,如果退回到硬判定模式,HealthBench数据集的性能会下降6%,这说明连续分数保留了更多组内的细节差异。

actor更新后,新的生成回答会刷新回答池,而新的回答差异又会推动rubric池的更新。整个过程中rubric生成器和judge始终保持冻结,actor则将这些训练信号沉淀为模型的权重参数。

为何选择测试时强化学习:适配真实任务的分布差异

很多垂直领域的AI应用瓶颈,并非模型完全不具备相关能力,而是通用预训练和对齐阶段的数据,很难完整覆盖真实场景的细节。比如患者如何描述症状、科研问题如何精准提出、用户会省略哪些默认的背景信息,这些都难以在预训练阶段被完全覆盖。如果模型部署后参数始终保持冻结,就无法持续适应新的输入分布。

TTRL直接利用测试阶段的真实提示词进行适配,即使没有参考答案,这些提示词也能反映用户的真实需求、问题的表达方式,以及模型需要适配的任务形态。选择强化学习而非监督微调,是因为SFT需要确定的目标回答,而RL可以直接优化模型自身的生成轨迹,在已有的生成空间中提升高质量回答的概率。SERPO则进一步解决了开放式任务中“奖励信号从何而来”的核心问题。

这里需要区分两类自进化方式:修改提示词、记忆或工具,主要是在上下文范围内进行搜索;而更新actor参数,则能将进化收益直接保留在模型本身。SERPO同时利用回答池和rubric生成训练信号,再通过GRPO将其写入模型权重。消融实验显示,一旦冻结actor,即使回答池和rubric继续变化,模型性能也会退回到基础模型的水平。

实验效果:无标注下的显著性能提升

实验覆盖了Qwen3-4B-Instruct-2507和Qwen3.5-9B两款模型。模型分别在HealthBench和ResearchQA数据集上进行进化,再通过MedQA、LLMEval-Med、GPQA-Diamond和RaR-Science测试跨分布迁移能力。整个过程中仅在最终评测时使用GPT-5.1作为外部裁判,全程不参与适配过程。

研究团队还为开放式生成任务构造了两个更强的投票基线:response vote将回答压缩为主推荐内容,再奖励最大语义簇;claim consensus则将回答拆分为原子声明,根据声明的支持频率构造奖励。

在Qwen3-4B模型上的核心实验结果如下:

方法 HealthBench (ID) ResearchQA (ID) 六项评测平均分
Base 32.30 57.29 53.92
TTRL (response vote) 34.27 57.91 54.47
+ claim consensus 43.71 69.39 57.98
RGSD(静态rubric, TTS) 27.13 58.20 51.32
+ rubric 自进化 32.06 65.51 55.43
SERPO(ours) 49.83 77.60 61.98
外部裁判 + 官方rubric(非无标注) 56.14 82.73 62.89

以基础模型为起点,SERPO在HealthBench和ResearchQA上分别追回了特权监督方法73.5%和79.8%的性能增益,六项评测的平均分与特权监督方法仅相差0.91分。在9B模型上的结果一致:HealthBench从44.68提升到65.31,ResearchQA从68.62提升到83.18。

claim consensus基线已经明显优于整句投票,但仍受制于统计频率的局限:如果一组生成回答共同遗漏了某个关键信息,高支持度的声明仍然可能是不完整的。SERPO在每个域内设定上都比claim consensus高出5%-14%,说明演化而来的质量判据,比基于统计的回答共识能提供更有效的训练信号。

静态rubric的表现同样不佳:随着模型策略变强,原有判据会逐渐失去区分能力;只有让rubric随生成回答动态更新,才能持续发现新的质量差异。

跨分布迁移能力:8个OOD设定全部超越基础模型

在测试集上更新模型参数,最容易引发的质疑是模型是否会过度拟合当前的基准测试。但SERPO的实验结果显示,在单个测试集上训练30个epoch后,8个跨分布(OOD)设定的性能全部超越基础模型,最高提升11.4%,同时也全部超过了外部裁判基线。相比之下,投票类方法的OOD表现有升有降,稳定性不足。

这说明SERPO学到的并非特定题目的答案模板,而是从回答差异中生长出的通用质量标准。相比仅贴合当前基准的官方判据,这种动态演化的质量标准更容易迁移到同领域的其他任务中。

消融实验:收益来自完整闭环,而非更长的回答

研究团队通过消融实验验证了各个模块的必要性,结果如下:

变体 HealthBench 三项平均 相对长度
Base 32.30 48.64 1.00×
w/o actor 进化 32.06 48.26 1.31×
w/o rubric 进化 43.54 53.52 2.29×
w/o G-N-B 进化 43.98 53.06 1.55×
w/o 概率化 judge 46.73 54.12 1.44×
w/ 训练 judge 43.22 53.03 1.76×
w/ 训练 rubric 生成器 43.82 53.53 1.94×
SERPO(完整) 49.83 55.69 1.38×

完整的SERPO框架取得了最高的平均分,同时生成的回答长度比所有更新actor的消融变体更短。其中w/o rubric进化的变体回答长度达到基础模型的2.29倍,但性能仍低于完整方法,这说明性能提升不能简单归因于回答变长。

如果冻结actor网络,HealthBench的性能会降到32.06,甚至略低于基础模型。训练judge或rubric生成器也会导致性能下降,因为如果评估标准随actor一起变化,奖励的坐标系会不断漂移。SERPO选择冻结辅助模型,仅更新回答池和rubric,在稳定性和适应性之间取得了良好平衡。

长程进化与跨基准测试:持续提升的能力

将训练轮次从30个epoch延长到45个,SERPO又获得了3.6%的相对性能提升,曲线仍未进入明显的平台期。研究团队按40-45epoch的局部斜率进行了描述性线性外推,显示大约在99epoch时会接近特权监督的性能基线。虽然外推并非正式的实验结论,但直观展示了曲线后段仍保持的上升速度。

response vote方法会逐渐回退到基础策略的水平,仅使用rubric进化的方法则会较早进入平台期。随着生成回答趋于同质化,基于频率的奖励很快会失去区分能力;而持续刷新的rubric仍能从新的回答差异中提取有效的训练信号。

跨基准测试的顺序进化实验让同一个actor先在HealthBench上训练30个epoch,再切换到ResearchQA训练30个epoch。到60epoch时,SERPO在两个基准测试上分别领先TTRL-claim方法23%和19%。切换任务后,ResearchQA和HealthBench的阶段最佳性能分别提升19%和4%,说明模型在学习新任务时,旧任务的性能仍能持续提升。

自进化的边界:评估能力与外部反馈

研究团队认为,模型自进化有一个基本前提:评估能力必须大于生成能力。从实验结果来看,在信息受限的场景下,自进化存在一个性能上界,这个上界由评测系统的能力决定。

模型不一定能稳定生成最优答案,但至少要能识别哪些回答更好、问题出在哪里。在很多任务中,“判断回答哪里存在问题”本来就比“一次生成正确答案”更容易;如果评估器连当前策略生成的回答都无法区分,奖励信号就会失去方向。

SERPO改进的是由judge和rubric共同组成的评估系统,而非直接训练judge。评估器的漂移不一定来自参数变化:当actor的分布发生改变后,旧的rubric可能已经无法覆盖新的错误形态。SERPO让judge保持冻结,提供稳定的判断坐标;回答池不断暴露新的质量差异,rubric再随之更新。这相当于让评估标准渐进式地跟上策略的进化,避免actor和judge同时变化带来的坐标系漂移。

长期的自进化还需要外部反馈。无人工标注并不等于没有外部反馈:工具执行结果、环境状态、用户后续行为、单元测试和真实任务的成败,都可以为内部评估器提供锚点。否则,封闭的自评循环很容易反复强化已有的偏好,甚至放大当前分布中的盲点。

任务自进化的下一步需要进一步增强评估器的逻辑推理能力,让它能够发现内部判断与外部结果之间的差距。比如,当rubric判断一条回答已经合格,但环境反馈显示任务失败时,评估器需要沿着证据、判据、判断和结果逐步回溯,定位是判据缺失、推理链断裂,还是judge对证据的理解出现偏差。找到断裂点后,再针对性地补充rubric、修正判断逻辑或更新评估器,而非让反馈回路盲目追随当前策略。

SERPO已经验证了这条方向的前半段:用回答差异推动rubric生长,再将判据信号写入模型参数。未来如果将真实环境反馈接入这个循环,并让评估器持续识别和修复自身的盲点,自进化将可能从固定任务的测试时适配,走向长期、开放的能力积累。

以上内容不代表本平台立场,仅供读者参考