文章摘要
过往智能体研究多聚焦模型本身能力,新加坡国立大学LV-Lab推出JIT-Agent-27B,瞄准影响智能体表现的Agent Harness,对其做模块化设计,可针对具体任务实时定制专属运行框架,具备故障修复、持续优化能力。实验验证其可提升不同基座模型性能、降低调用成本,为智能体发展提供新方向。

在智能体的性能评测中,过往研究往往将模型本身的能力视作核心变量,但即便使用完全相同的基座模型,只要调整记忆组织方式、规划逻辑、工具调用接口或是错误恢复流程,最终的任务表现也会出现显著差异。这种表现差距的核心来源正是Agent Harness——它定义了模型在推理时的状态环境、行动调用接口,以及如何将任务轨迹推进至完成的完整流程。

近期,新加坡国立大学LV-Lab推出了JIT-Agent-27B,一款聚焦于Harness Intelligence的基座模型。与传统专注于模型能力的训练思路不同,这款模型以Agent的Runtime运行层作为训练目标,能够针对具体任务实时构建完全定制化的运行框架,并学习如何修复执行中出现的失败结构,同时依据任务执行的反馈持续优化自身的运行策略。

    
      
        
        
        
      
    
    
      
        论文标题:JIT-Agent:Scaling Harness Intelligence via Just-in-Time Harness Evolution
        
论文主页:https://bingreeky.github.io/JIT-site
代码仓库:https://github.com/bingreeky/JIT
模型与资源:https://huggingface.co/JIT-Agent

为了让模型能够生成完整的运行时框架,JIT-Agent将Harness统一拆解为四个核心模块:

  • • Memory模块:负责存储任务证据、历史交互记录与中间执行状态

  • • Planning模块:用于维护当前任务的下一步执行目标与整体规划逻辑

  • • Action模块:定义任务执行的控制循环与错误恢复路径

  • • Capability Orchestration模块:确定当前任务可调用的工具、API与专属技能

四个模块共同形成一份包含状态与控制语义的可执行协议,输入任务经过这四个模块的组合,就能得到面向具体问题的执行结构。这套模块化的表示还对接了HarnessFactory,研究团队将ReAct、ReSum、Flash-Searcher等13种主流的智能体运行框架重新适配到这套统一协议中,让原本分散独立的运行框架成为可比较、可组合的结构样本。通过统一的接口标准,JIT-Agent能够学习跨不同运行框架的结构规律,并根据具体任务需求选择、重组对应的运行机制。

Insight|可组合性把 runtime 变成模型可以操作的对象
《A Programming Paradigm for Spatiotemporal Composability》[1] 把依赖关系置于智能体运行框架的组织中心,并用 “Everything is a Plugin” 为每个运行单元赋予可组合的位置。
JIT-Agent 进一步将模块接口转化为生成约束。模型面对的是具有类型和依赖关系的组件空间,运行框架合成由此获得稳定的结构语义。

研究团队将这种能力正式定义为Harness Intelligence,它包含三个核心维度:一是针对具体任务适配合适运行结构的适应性,二是从编译错误、执行故障中快速恢复的可靠性,三是基于真实执行结果推动运行框架持续迭代优化的演化能力。在此基础上,智能体模型的角色也从单纯的动作生成器,延伸为完整运行系统的构造者,也就是Model-as-a-Harness。

让Agent为每个任务定制化专属运行框架

JIT-Agent-27B的训练流程围绕运行框架的完整生命周期展开,整体分为三个核心阶段:

首先是Customize阶段,通过教师监督学习建立任务到适配运行框架的映射关系,并结合价值加权偏好学习,筛选出高任务收益、低延迟与低成本的最优方案;其次是Repair阶段,将编译错误、接口不匹配、工具调用失败与运行异常等问题整理为短程修改轨迹,让模型学习故障诊断与修复补丁之间的对应关系;最后是Evolve阶段,采用Evo-GDPO算法,让同一任务下的多组候选运行框架与存档中的最优实例进行对比,分别对奖励、延迟与成本信号进行归一化处理,推动运行框架的持续进化。

这些训练过程共同更新JIT-Agent-27B的参数,模型权重保存跨任务复用的构造与修复规律,而存档记录近期执行中形成的优秀实例,为后续生成提供参考。部署期间模型权重保持固定,长期参数知识与运行时存档在不同时间尺度上协同工作。

同一协议可以生成完全不同的运行程序

研究团队通过两个具体案例展示了任务条件如何嵌入到运行框架内部:

Palimpsest面向联系人整理、工作簿生成与邮件交付的跨应用任务,将任务编译为制品依赖图,通过受限并行完成内容发现、过滤、构建与发送全流程,并将中间产物持久化存储到Memory模块中。

Trapdoor则面向多跳身份验证研究,动态生成子问题,通过带有步数上限的delegate调用启动私有研究分支,再将返回的事实信息纳入FactGraphMemory。两款运行框架共享统一的模块接口,但各自拥有完全不同的状态结构与控制语义。

这些案例说明,基于任务条件的运行框架含义远超简单的提示词改写,生成结果会改变数据结构、工具调用策略、执行顺序、并行宽度与验证条件,进而改变基础模型处理长程任务的方式。

性能、成本与迁移实验结果

在性能验证实验中,研究团队固定基座模型,对比了不同运行框架对任务表现的影响。在GLM-5.2与DeepSeek-V4-Flash两款基座模型上,18组同模型、同基准测试的对照实验全部实现了性能提升:DeepSeek-V4-Flash配合JIT生成的运行框架后,在DeepSearchQA基准测试上的表现超过GPT-5.6,提升幅度达到9.1个百分点;即便GLM-5.2本身已经具备较强的智能体能力,单项任务增益仍达到20.2个百分点。

研究团队还针对DeepSeek-V4-Flash与Qwen3.6-Flash两款模型开展了六组受控对照实验,JIT-Agent在其中四组取得了最高的任务表现,且全部六组实验都使用了最少的Token数量,同时产生了最低的API调用成本。以每组成本最低的固定运行框架作为基准,平均单例成本降低了36.0%。

实验还揭示了固定运行框架的任务依赖性:某一款运行框架在某一类基准测试上表现领先,但切换到其他任务类型时性能可能出现明显回落。而JIT-Agent的即时生成机制将运行框架的选择推迟到任务明确之后,能够根据当前任务的具体需求定制运行策略。

研究团队选取了六个不同尺寸的基座模型,包括DeepSeek V4、Qwen3.6与MiMo-V2.5,将它们与ReAct运行框架配对开展了24组实验,全部都获得了正向性能增益,平均提升7.6个百分点。这说明JIT-Agent-27B参数中积累的结构先验知识能够跨模型家族与模型规模迁移,为不同的基座模型生成高效的专属运行框架。

Harness Intelligence带来新的智能体缩放方向

模型参数决定了智能体推理与生成的基础能力,而运行框架则决定了这些能力如何在真实环境中被组织与调用。JIT-Agent-27B将运行框架的构建、修复与演化能力纳入模型训练,让智能体运行框架的合成、修复与迭代成为可以积累、迁移与复用的参数化能力。

这一研究也为智能体模型与运行框架的协同设计提供了新的思路:生产系统可以保留稳定的核心模型,将记忆策略、规划方式、能力编排与局部控制逻辑交由模型根据具体任务动态生成。随着更多运行经验被纳入基础模型的训练过程,智能体的性能缩放将同时发生在模型本身与承载模型行动的运行系统之中。

引用链接

[1] 《A Programming Paradigm for Spatiotemporal Composability》: https://github.com/cordiverse/paper

以上内容不代表本平台立场,仅供读者参考