上海AI实验室Self-Harness:让AI模型自己优化Harness性能提升超100%

让智能体自主优化自身运行框架的Self-Harness方案,已经获得了全球顶级智能体社区的广泛关注。由上海人工智能实验室团队提出的这项技术,近期被LangChain CEO、联合创始人Harrison Chase转发,也被前OpenAI副总裁Lilian Weng收录进自进化智能体相关的博客专栏。
这项研究的核心并非升级底层AI模型,而是聚焦于包裹在智能体外层的运行框架——Agent Harness。
Agent Harness可以理解为智能体的运行管控系统,涵盖系统提示词、工具调用规则、结果验证机制、运行时控制策略以及轻量中间件等内容。在多轮工具调用任务中,它决定了智能体何时发起工具调用、何时终止流程、失败后如何恢复,以及最终产物如何完成校验。
在过往的开发中,这套运行框架主要依靠工程师手动调试:需要逐一分析大量的任务执行轨迹,定位失败原因,调整提示词或工具规则,再反复运行基准测试验证效果。当智能体模型数量增多、任务场景愈发复杂时,这种“一对一人工调参”的模式很难实现规模化扩展。
Self-Harness将整个优化流程浓缩为三个核心步骤:先挖掘系统弱点,再提出针对性修改方案,最后通过回归测试验证修改效果。
首先,系统会使用当前的Harness驱动固定模型完成一批测试任务,完整记录执行轨迹、工具调用细节与评测结果。与传统方式将失败样本视为孤立案例不同,Self-Harness会结合验证器反馈、智能体行为与失败结果之间的因果关联,将可复用的失败模式归类整合——比如缺失最终产物、重复执行无效命令、工具报错后未恢复、探索阶段过长却未进入实质实现等问题,都会被提炼为统一的Harness缺陷。
在获取结构化的失败证据后,同一模型会切换为提案生成角色,针对已识别的失败机制提出候选的Harness修改方案。这些修改仅能在预先定义的可调整范围内进行,不会推翻整个智能体的控制架构。每一项修改提案都需要明确说明拟改变的行为、可能带来的回归风险,以及为何能够修复当前的失败模式。
生成的候选Harness会在相同的评测协议下重新运行,并与当前的Harness进行对比。其采纳规则十分保守:只有当修改在held-in或held-out拆分数据集上至少实现一项性能提升,且另一项拆分数据集未出现性能退化时,才会被采纳为下一代Harness。这也是Self-Harness与普通的自动Prompt修改方案的核心区别:它不会让模型仅凭主观判断拍板,而是将每一次改动都纳入可记录、可复现、可回退的评测闭环中。
研究团队在Terminal-Bench-2.0上开展了系统性的评测。该基准测试是一个运行在容器化终端环境中的多轮智能体评测集,覆盖文件管理、命令执行、错误恢复、产物验证等真实工具使用场景。
在保持底层模型、工具集、任务环境与评测配置完全不变的前提下,仅对Harness进行优化,三款模型都实现了显著的性能提升:MiniMax M2.5总提升28%,Qwen3.5-35B-A3B总提升104%,GLM-5总提升24%。
这一结果的核心价值并非推出了更强的AI模型,而是证明了在相同模型基础上,Harness本身也可以通过自动化流程完成搜索、验证与迭代优化。更关键的是,每一项候选修改都经过了held-in与held-out回归测试的双重校验,也就是说,Self-Harness并非通过堆砌更长的提示词来提升效果,而是经过多轮验证门控,只保留真正带来性能收益且未出现明显回退的Harness修改。
值得注意的是,不同模型在初始Harness下暴露的失败模式存在明显差异,这也体现了Self-Harness的定制化优化能力。例如,MiniMax M2.5在初始框架下有时会陷入持续的数据集探索:即便已经找到关键元信息,却迟迟不创建评测所需的答案文件,最终因缺失产物或超时导致任务失败。Self-Harness为其设计的修改方案,会鼓励智能体更早识别必需输出,优先创建初始产物,并在工具调用过长时引导其转向具体实现与验证环节。
Qwen3.5-35B-A3B的常见问题则是工具调用失败后陷入重复编辑、重复覆盖或重复执行命令的循环,甚至在任务终止前删除评测必需的文件。针对这一问题,Self-Harness引入了依赖预检查、失败后产物恢复、避免重复执行相同命令,以及由工具错误触发的产物聚焦提醒等优化措施。
GLM-5暴露的弱点则集中在Shell会话状态管理,以及从探索阶段切换到实现阶段的时机把控。优化后的Harness会提醒智能体在修改环境变量、安装工具或调整路径后,确认这些变更能够在跨命令会话中持续生效;当长时间探索未形成有效产物时,系统会主动推动其转向实现与测试环节。
这说明Self-Harness并非为所有模型套用通用的提示词模板,而是会根据每个模型在真实任务轨迹中暴露的独特弱点,生成并筛选适配的Harness修改方案。随着智能体的发展,其角色已经从单一的问答模型转变为运行在工具环境中的完整系统,此时模型本身的能力只是基础,外层的Harness才决定了智能体是否知道何时调用工具、如何从错误中恢复、是否保留正确产物,以及退出前是否完成必要验证。
过往的Harness开发更依赖工程师的经验积累,而Self-Harness给出了全新的方向:让AI模型自身参与到经验挖掘与框架优化的过程中,但最终的决策仍由客观的评测结果而非模型的自评来完成。尽管这项研究并未证明智能体可以完全自主进化,也未突破现有基准测试的范围,其核心结果均来自Terminal-Bench-2.0与固定模型后端的实验,但作为自进化智能体的一个核心组件,它清晰定义了智能体框架优化的边界:改什么,怎么改,怎么验,什么时候拒绝。
该研究由上海人工智能实验室团队完成,论文题为《Self-Harness: Harnesses That Improve Themselves》。目前团队已公开论文与项目地址,感兴趣的读者可以查看具体的实验设置、Harness修改案例与源代码:
论文:https://arxiv.org/abs/2606.09498
项目地址:https://github.com/qzzqzzb/Self-Harness


