文章摘要
由北京航空航天大学、香港中文大学、新加坡国立大学团队研发的OmniHarness,可让AI将验证有效的视觉创作任务流程整理为可复用经验存储,无需微调模型即可调用。该系统在ComfyBench创意任务中解决率达95%,其经验可跨系统、跨模态迁移,能显著提升其他AI的任务表现,目前仍存在计算开销等可优化空间。

当AI完成一项视觉创作任务后,除了最终的输出结果,还能为后续的工作留下什么?

由北京航空航天大学、香港中文大学和新加坡国立大学的研究团队推出的OmniHarness,给出了一套完整的解决方案:让视觉智能体主动开展练习、校验执行结果,将经过验证的有效流程留存下来,帮助AI在面对新的任务需求时,拥有更多经过实战检验的方法储备。

亮眼的任务表现

在ComfyBench创意任务测试中,OmniHarness的解决率达到了95%,比同场测试中表现最佳的对照模型SymbOmni高出27.5个百分点。当采用Codex GPT-4o作为推理骨干配置时,系统的总体任务解决率为92.5%。

测试中的Pass指标代表流程能否正常执行,Resolve指标代表输出结果是否满足任务要求。OmniHarness的两种配置的Pass率均为100%,和ComfyMind、SymbOmni的表现持平,而三者的核心差异在于最终产出合格结果的占比。

当将推理骨干统一设置为GPT-4o时,OmniHarness的总体任务解决率为89.5%,ComfyMind为83%;在创意任务场景下,两者的解决率分别为95%和57.5%。

这一结果让业界开始关注:除了模型本身的能力之外,经验如何被高效调用、工具如何被合理组织,同样是影响AI任务表现的关键因素。

通过Codex进行任务规划后,OmniHarness的总体解决率从89.5%提升至92.5%,复杂任务的解决率从76.7%升至83.3%,不同的规划配置会对应不同的多步任务完成效果。不过该系统的优势也有范围限制,复杂任务83.3%的解决率仍未超过ComfyMind的85%,并非在所有任务子集上都能保持领先。

贴近真实需求的应用场景

OmniHarness的任务输入可以非常简单,比如一张随手绘制的花朵涂鸦。系统会先将涂鸦重绘为写实风格的红花,再借用该红花的风格生成一片完整的花田,两次生成任务通过中间生成的图像形成了连贯的工作流。

另一个典型场景是四格漫画创作,任务要求完整呈现一个周日早晨的剧情:从醒来、拿起手机查看时间、发现当天是周日后继续躺平,整个故事需要动作和文字都服务于整体叙事。

在海报和书封设计任务中,系统需要同时满足主题、标题、版式等多重要求,将多个约束条件整合到最终的设计结果中。

餐桌编辑任务则需要更精细的调整:比如移除画面中的叉子并替换为勺子,同时还要尽量保留周围的食物、杯子和桌面的整体布局,确保修改后的画面自然协调。

如何将单次成功转化为可复用的经验

真实的创作需求总是在不断变化:红花可能会换成其他主体,重绘后的图像也可能需要进一步调整布局。那么一次成功的任务执行,如何才能为后续的工作提供帮助?

OmniHarness采用符号策略学习的思路,将验证有效的执行流程整理为可用于一类任务的通用策略。以花田生成任务为例,虽然花朵的种类和颜色可以替换,但“先重绘草图、再借助参考生成新画面”的连接方式,可以成为可灵活调整的通用工作方法。

系统留存的策略包含三个核心部分:工作流模板、适用条件和资源依赖,而具体的输入图片、任务描述等实例化信息则会被抽离。在后续调用时,系统会先检查该策略是否适应当前任务,再绑定新的输入内容,按需调整执行步骤或组合多条已有策略。

从选题到积累,完整的经验迭代流程

第一步:选择值得探索的练习任务

OmniHarness的自主练习环节发生在下游任务明确之前。只重复熟悉的任务无法补齐能力短板,而挑战过难的任务又会因为缺乏方法支撑而无法推进,系统会结合已有的练习记录和当前的模型能力,让探索过程更有迹可循。

每轮练习默认生成10道候选任务,通过新颖性和能力边界评分的乘积来选择最终的练习题目: 首先衡量任务的练习稀缺性,反映当前模型能力是否能为探索提供适度的支撑,同类情境的练习次数越多,该任务的新颖性得分就越低; 系统会记录每个任务所需的能力和对应的“情境—能力”练习次数,图生图任务通过源图来区分情境,文生图任务则共享统一的情境标记; 得分会按照所需能力取平均,避免能力项更多的任务天然占据优势; 每项能力的可靠性由适用且未停用的流程中的最高可靠性提供支持,可靠性通过95% Wilson置信区间下界来估计; 整道题的能力估计取所有能力中的最低值,这相当于优先关注能力短板:哪怕大部分执行步骤都很熟练,只要有一处缺乏可靠的方法,就会拖累整体的任务完成效果; 最后将能力估计转换为选题分数,当能力估计处于中间值时得分最高,趋近于0或1时得分都会下降,因此系统会优先选择有一定基础但仍存在挑战的任务进行练习。

第二步:对每次执行结果进行严格校验

系统会先规划任务的执行步骤和依赖关系,将代码编译为ComfyUI工作流,随后检查流程能否正常运行、各步骤的执行效果是否符合预期,以及最终结果是否达成任务目标。

以花田生成任务为例,如果生成的红花颜色或形态偏离了要求,继续沿用该流程会将偏差带入后续的花田生成步骤,此时系统会自动定位问题并进行局部修复,尽量保留已经验证有效的部分;如果需要,系统还会调用子智能体协助处理,在预设的重试预算内再次执行检查和修复。

第三步:让成败都成为后续的经验储备

验证成功的执行流程会被抽象并存储到策略库中,而失败的任务则会记录失败的证据、原因和对应的修正方法。等价的流程会被自动合并,策略的可靠性会随着调用次数不断更新,这些积累的经验会继续影响后续的选题和执行流程。同时,留存的策略也会接受后续任务的检验,新的成败记录会持续调整其可靠性和调用优先级。

经验的跨系统与跨模态迁移

研究团队将自主练习完成后的策略库冻结,再将其适配到其他智能体的知识接口中,宿主系统保留原有的控制流程,不需要对模型进行任何微调。交付的策略库既包含成功的流程模板,也包含失败的证据和修正办法,其他智能体可以通过自身的检索、规划和执行机制来使用这些经验。

将这份通用经验应用到三个不同的智能体系统后,它们的总体任务解决率都得到了显著提升:

  • ComfyAgent的解决率从32.5%升至57.0%
  • ComfyMind的解决率从83.0%提高到88.0%
  • SymbOmni的解决率从86.0%达到89.0%

对应的创意任务增幅分别为27.5、17.5和10个百分点,创意任务的提升幅度均超过各自的总体增幅,说明已有的流程和纠错经验能够为不同系统应对新需求提供有效的帮助。

除了跨系统迁移,该策略库还可以实现跨模态迁移:仅在图像任务上训练的冻结策略库,能够被直接用于视频工作流。视频任务的总体解决率达到85.9%,比同场测试的最佳对照模型高出5.1个百分点;视频到视频的任务解决率达到80.0%,高出对照模型13.3个百分点。其中图像策略负责内容构建、参考保持等操作,时序处理则交给视频专用组件,两者需要经过适配和组合才能发挥最佳效果。

一次任务的结束,正是经验使用的开始

这种经验积累的模式也需要付出一定的计算成本:自主练习、多轮校验和修复都会增加系统的开销,检索效率和推理预算仍有进一步优化的空间。

不过OmniHarness展示了一种全新的AI能力积累方式:不需要对模型参数进行微调,系统可调用的方法可以随着实践不断更新。今天留存的任务经验,有望成为明天处理全新需求的起点。

相关资源链接:

论文全文:https://arxiv.org/abs/2609.16057

项目主页:https://omniharness.github.io/

代码与运行说明:https://github.com/OmniHarness/OmniHarness

以上内容不代表本平台立场,仅供读者参考