LongHorizon-Harness:解决AI长任务失败与假完成难题

近期,长程智能体的开发成为行业热点,多款开源框架通过全新的设计思路解决了传统智能体的痛点。其中一款框架通过显式任务状态管理机制,将长程任务的执行效率提升了数倍,成为了新的关注焦点。
传统的长程智能体在执行复杂任务时,往往会陷入“上下文膨胀”的困境:一边执行任务一边自我评价,导致上下文随着任务推进不断膨胀,不仅消耗大量算力,还容易因为上下文过载出现逻辑混乱,无法稳定完成跨时长、多步骤的任务。
这款名为LongHorizon-Harness的框架,彻底改变了这一模式。它不再让智能体在不断膨胀的上下文语境中完成任务,而是将任务状态独立抽离出来进行统一管理,通过管理(Manage)、执行(Execute)、审计(Audit)三段式循环来驱动长程任务,从根源上解决了上下文溢出的问题。
管理-执行-审计循环的核心架构
LongHorizon-Harness将长程任务拆分为多轮动态确定的执行单元,每一轮都完整执行一次MEA循环:
- 管理者(Manager):作为任务的统筹者,它拥有持久化的任务状态,但不具备任何直接访问运行环境的权限——既不能查看屏幕内容,也不能修改文件或执行命令。管理者的所有决策都基于审计者产出的环境证据,它会根据当前任务状态和历史审计报告,构建一份边界清晰的子任务契约,其中包含任务目标、验收标准、约束条件以及相关历史证据。
- 执行者(Executor):每次执行都会在全新的独立上下文环境中运行,仅包含当前轮次的子任务契约信息,不会携带之前轮次的执行轨迹。执行完成后,所有内部推理和过程轨迹都会被丢弃,仅返回执行报告供审计。框架还将执行能力进行了分离:GUI执行者负责处理应用界面的交互,包括截图、点击、输入等操作;CLI执行者则负责终端、文件编辑、代码开发等工作。同时框架支持通过统一的适配器接口接入现有智能体后端,无需修改原有逻辑即可对接。
- 审计者(Auditor):作为独立的第三方校验角色,它拥有只读权限,不能创建或修改任何受保护的产物,也不能执行改变环境状态的命令。审计者会从全新的上下文出发,独立检查当前的运行环境,参考执行报告定位相关的文件、窗口或日志,但最终的完成判定必须基于直接从环境获取的真实证据。如果检测到环境被篡改,会标记为完整性违规,该结果不能作为任务完成的依据。审计者最终会产出三类结论:任务完成状态、环境完整性状态以及核实后的事实和未解决的缺口。
管理者维护的任务状态是结构化的记录集合,包括从原始任务推导的需求、执行过程中产生的产出物,以及后续轮次需要的环境事实。每条记录都会被标记为完成、待处理、阻塞或不可信,并保留支持其状态的审计证据引用。最重要的规则是:执行者的自我声明不会直接改变持久化的任务状态,只有当独立的审计证据支持时,记录才能被标记为完成。
实测效果:同一模型,换个框架就像换了模型
该框架的实际效果远超预期,多项基准测试中都实现了大幅性能提升:
- 在WeaveBench基准测试中,Qwen 3.7-Plus的得分从51.8%提升至80.7%,Claude Opus 4.7的得分从20.0%提升至34.3%,多个模型都获得了显著的性能提升,且八个领域全面覆盖,说明增益并非集中在某一类特定应用。
- 在OSWorld 2.0测试中,任务完成率从2.8%提升至8.3%,提升幅度超过3倍。
- 在Terminal-Bench 2.1测试中,基础得分从69.7%提升至77.2%,如果更换为Codex后端,得分更是达到了83.1%。
即使跨骨干模型测试也同样有效:在OSWorld 2.0的Opus 4.7子集测试中,34个任务的表现也获得了提升。这说明该框架并不是用来弥补弱模型的不足,而是与模型能力形成互补:模型负责提升每一轮执行动作的质量,而框架则负责确保这些执行成果能够被可靠地保留和复用。
更令人惊讶的是,Qwen模型搭配LongHorizon-Harness的综合得分达到0.733,超过了Opus搭配原版Claude Code的0.680。
测试细节分析
- 成本与性能的平衡:虽然使用该框架后,每个任务的平均输出token数从28.9K增加到104K,但整体将模型推到了更强的性能上限,说明更完善的框架能够有效提升固定模型的任务级上限。
- 算力分配情况:管理者的算力开销极小,仅占总token的2.8%、2.0%或8.1%,显式状态维护的成本非常低。而审计者是框架的主要算力投入,占比分别为19.4%、24.8%和38.1%。
- 适用任务类型:在WeaveBench测试中,设计类和空间/3D类任务的收益最大,提升幅度超过60和50个百分点;在OSWorld测试中,流式交互、人机协作、教程跟随类任务的提升最为显著。整体规律清晰:需要跨长轨迹保存、检查和修订多个相互依赖的环境状态的任务,收益最为明显;而瓶颈集中在单步能力的任务,比如视觉感知、数学推理、算法设计等,收益相对较小。
典型失败模式的修复
该框架能够有效解决传统智能体的两类典型失败场景:
- 卡死交互的恢复:在WebRTC simulcast审计任务中,传统智能体在发现Wireshark的“Decode As”对话框无响应后,在同一个交互流程中重试了400多步,最终得分仅0.59。而LongHorizon-Harness会将“交互失败+未解决的证据缺口”记录到任务状态中,后续的执行者会直接针对缺失的图表和包级证据进行针对性执行,最终得分达到0.92,从最近的已审计状态恢复任务,而非在失败的轨迹中反复挣扎。
- 假完成的审计校验:在标题样式规范化任务中,传统智能体直接编辑文档XML,仅通过视觉确认标题“正确”就停止执行,最终得分仅0.00,因为任务要求必须遵循LibreOffice的标准工作流。而LongHorizon-Harness会按照规范的GUI流程执行操作,审计者会逐页解析XML文件,确认全部15个标题的底层样式符合要求,最终得分达到0.89,将执行者看似合理但违规的自我声明,通过独立审计挡在了持久任务状态之外。
该LongHorizon-Harness项目已经开源,为长程智能体的开发提供了全新的思路和实践方案,有望推动长程AI任务执行能力的进一步提升。

