HiSME:大模型测试时分层技能元演化与性能优化

当大语言模型驱动的智能体被部署到工具调用、长周期任务以及开放世界场景中时,一个核心问题随之浮现:能否在不更新底层模型参数的前提下,将智能体的执行经验沉淀下来,让后续同类任务的完成效果得到持续提升?
「技能演化」正是针对这一需求提出的测试时学习范式。智能体完成任务后,系统会从执行轨迹中总结可复用的经验,比如工具调用流程、API调用前置条件或是特定领域的操作逻辑;当再次遇到相似任务时,这些提炼出的技能会被作为上下文补充给智能体,辅助其完成任务。不过现有的技能演化流程大多是静态的:技能的抽取、重构、修订和过滤策略往往由人工预先设定,缺乏灵活适配的能力。既然技能可以从执行经验中演化而来,那么「生成技能的算法本身」是否也能在测试阶段实现动态优化?
来自国内高校与企业的研究团队在最新论文中给出了肯定的答案:HiSME,一个轻量级的层次化技能元演化框架。该框架不会修改底层大模型的参数,而是在文本空间中同时优化两类对象:一类是面向具体任务执行的实用技能,另一类是面向技能生成与维护流程的「元技能」。
论文标题:You Live More Than Once: Towards Hierarchical Skill Meta-Evolving
静态技能演化的局限
传统的静态技能演化存在两个明显的短板。其一,难以适配多样化的应用场景:比如工具调用场景更注重API参数配置和状态追踪,而开放世界的具身交互任务则更依赖长序列动作组合和失败后的恢复机制,单一固定的演化策略很难兼顾所有场景的需求。其二,维护成本难以控制:如果演化算法本身存在系统性偏差,系统会持续生成低质量的技能,后续还需要投入额外成本进行修复、回滚或者过滤,进一步增加了运营开销。
HiSME的核心思路是将技能演化视为对智能体测试时边际性能收益的优化。在不修改模型参数的前提下,技能库可以为固定的执行器提供额外的经验支撑;而如果技能演化算法本身并非最优,那么它与理想演化算法之间仍然存在更高阶的边际收益空间,可以继续从测试时的执行经验中挖掘。
HiSME:为经验沉淀机制再做一层沉淀
HiSME将整个系统划分为三个层级:轨迹层、技能层和元技能层。
第一层级是智能体执行任务产生的轨迹数据。系统会根据成功率、执行正确性、计算开销等效用指标对每条轨迹进行评估,并从中抽取可复用的技能。无论本次任务执行成功还是失败,只要系统能够完成对轨迹的评价,就可以从中沉淀出「后续应该如何操作」或者「后续需要避免的操作」的经验。
第二层级是基础的技能演化流程。HiSME设计了一套完整的演化框架:使用抽取模块从单条轨迹中发现候选技能,使用重构模块从多条相似轨迹或者已有技能中抽象出共享的通用结构。为了避免技能库被噪声污染,系统还通过校验模块、信用分配模块、修订模块和过滤模块来检查技能的合规性、分配后验信用,并据此修订、禁用或者保留对应的技能。
同样,只要系统能够对技能的效果进行评价,就可以从中沉淀出「后续应该如何提炼或修改技能」的经验。HiSME对技能的评价主要关注两个维度:第一个是有效性,即某个技能被提供给智能体后,后续任务轨迹的效用是否真的得到提升;第二个是复用性,即这个技能是否会在后续任务中被频繁检索或调用。有效但不可复用的经验同样需要不断完善,而经常被检索但带来负反馈的技能,则需要收窄触发条件、重写接口,甚至直接丢弃。
第三层级则是元技能演化。HiSME不仅会记录「某个技能是否有效」,还会追踪该技能是由哪个算法组件生成或修改的:是从单条轨迹中抽取得到的,还是从多条轨迹中归纳得到的,或是在维护阶段经过修订得到的。当技能后续积累了有效性和复用性的反馈数据后,系统可以反过来评价对应的演化策略,通过专门的元修订模块进行总结,沉淀为元技能。
这类元技能本质上是面向算法组件的方法论,也就是可复用的提示词规则。比如,抽取模块可能会学到:不要仅凭表面的情绪词汇来抽取工作流,除非该流程对应可验证的状态、API前置条件或者跨轮次依赖关系;修订模块可能会学到:当技能出现误触发时,应该优先收窄其触发条件。这些元技能会被写回技能抽取、重构和修订模块的提示词中,让后续的技能演化算法可以根据测试时的反馈动态调整自身的策略。这也是HiSME轻量化的核心所在:通过简单的文本规则来维护元经验,并将其作为上下文指导后续的演化流程。
实验验证:性能提升与可迁移的演化策略
研究团队在BFCL-v3多轮基础基准和MineDojo平台上对HiSME进行了验证。前者聚焦于多轮工具调用场景,后者则关注Minecraft开放世界中的长程具身交互任务。实验除了设置无技能基线和静态演化基线SkillX之外,还加入了AWM、Memento两个测试时学习基线,用于对比不同测试时学习范式的优劣。
从核心实验结果来看,HiSME在两个基准数据集上都展现出了稳定的性能优势。相较于无技能基线、静态技能演化方法以及其他测试时学习基线,HiSME的性能提升来源于其更擅长生成、修订和筛选技能的演化流程。尤其是在MineDojo这类长程交互任务中,HiSME还展现出了明显的Token开销优势:高质量的技能减少了无效探索、失败恢复和重复重试的次数,让智能体能够更快地找到可执行的任务路径。
消融实验的结果显示,重构模块是HiSME的关键组件之一。可复用的结构往往不会孤立地出现在单条轨迹中,而是需要跨多条轨迹的证据来支撑;同时,抽取模块、修订模块和信用过滤模块共同构成了技能生成与维护的完整闭环。
研究团队还对算法的演化过程进行了详细的统计分析:在训练过程中定期保存中间的技能库,并在测试集上重新进行评估。结果显示,随着训练任务数量的增加,HiSME和静态版本的HiSME都能够逐步优化技能库的质量,但HiSME在大多数中间阶段都保持了更高的测试性能,这说明元演化能够在技能生成、修订和过滤的过程中持续改善整体的演化策略。
信用分析进一步解释了这一优势:随着训练的推进,HiSME生成的有效技能占比不断提升,而有害技能的占比得到了有效控制;元演化能够将后续的反馈信息写回技能抽取和维护流程,减少了重复生成错误技能模式的情况。
为了验证HiSME不仅能够生成高质量的技能,还能够沉淀出优质的元技能库,研究团队进行了元测试:将一次HiSME运行中学到的元技能冻结下来,作为新一轮静态技能演化的初始化规则。实验结果显示,基于预训练元技能的静态演化方法显著优于从零开始的静态演化方法,并且性能接近完整的HiSME框架,这说明元技能本身具备较高的质量和一定的迁移性。
从技能到驾驭:迈向自动系统优化
HiSME的价值不仅仅体现在基准测试的分数上,它更提出了一种全新的智能体系统优化范式:测试时学习不必仅局限于模型参数的更新,也不必仅停留在经验库的层面;围绕模型运行的外部驾驭系统,包括提示词、工具路由、记忆模块、评测器、技能库维护策略等,都可以成为可演化的对象。
由此可以延伸出两个重要的研究方向:其一是「学习如何演化」,将文本化的元技能与轻量级参数学习相结合,让系统同时学习经验内容和演化能力;其二是「自动驾驭工程」,针对不同的模型和任务场景,自动调整外部驾驭系统,让智能体在部署后能够形成更适配自身的工作模式。
对于日益复杂的智能体系统而言,真正的挑战或许不只是「让模型一次完成任务」,而是让智能体能够在真实的反馈中做出判断:哪些经验值得保留,哪些规则需要收窄,哪些失败模式说明演化算法本身需要调整?HiSME给出的答案是:让智能体不止「活一次」,同时也让它的学习方式本身拥有被学习的可能。


