文章摘要
智能Agent投入真实业务后,安全隐患会随多步执行逐步扩散,早期微小状态变化往往数十步执行后才引发安全失效,风险潜伏周期超出传统单次测试覆盖范围。OpenART将Agent红队评测升级为持续演化环境下的系统性评测,配套EMHA算法,可有效挖掘传统测试遗漏的长程潜伏安全风险,破解该领域安全盲区。

当智能Agent进入真实业务工作流后,安全隐患并不会立刻显现,而是会随着多步执行逐步扩散。文件权限、工具返回结果、记忆内容和计划状态等信息会在后续流程中被反复读取与修改,早期的微小状态变化可能在数十步执行后才会引发安全失效,风险潜伏周期往往远超单次测试的覆盖范围。

针对这一长程安全传播的问题,OpenART框架将Agent红队评测从固定环境下的单次测试,升级为持续演化环境中的系统性评测,核心解决三个关键问题:如何构建足够长的真实可执行测试场景,如何让同一个测试场景适配不同的Agent运行框架,以及如何在任务目标不变的前提下持续演化环境并挖掘新的风险状态。

长程可执行测试场景的构建

OpenART基于超过50万个工具、MCP和技能组成的通用能力库,在50个垂直应用领域中搭建并验证了超过1万个带状态的测试场景。每个场景都需要通过执行检查和评估器的双重验证才能纳入测试集,平均每个任务需要调用工具的次数中位数达到97次。这种长依赖链的场景设计,能够让早期产生的状态在后续流程中被持续读取、组合和修改,为研究长期状态依赖下的安全问题提供了真实的执行基础。

跨Agent框架的适配机制

不同的Agent在接口标准、状态组织方式和能力入口上存在显著差异,OpenART首先采用与目标Agent无关的统一方式描述测试场景,再通过轻量适配器将统一的任务目标、安全约束和评估标准映射到各个Agent的原生运行框架中。该研究覆盖了15个已部署的Agent和5个基础模型,形成了75种Agent-模型配置组合,能够直接对比不同系统在相同场景和评价标准下的表现,分析基础模型、Agent实现和接口差异对安全测试结果的影响。

持续演化的环境测试流程

当测试场景接入目标Agent后,OpenART将环境状态纳入红队的搜索范围。每一轮测试都会从当前的环境状态和历史攻击状态出发,由策略生成一组候选的环境变化,这些变化会经过目标Agent的适配器检查,只保留对应框架支持且允许修改的状态维度,得到真正写入环境的更新。

之后目标Agent继续执行原始任务,生成执行轨迹和新的环境状态,评估器会给出本轮的反馈结果,这些信息会被写回攻击状态,用于下一轮的环境演化。整个过程中,任务目标和安全约束保持固定,而环境状态会随着多轮执行持续变化,OpenART支持工作区、指令、技能、工具、MCP、短期记忆、计划状态和长期记忆共八类状态维度的修改。

EMHA搜索算法

在这个框架之上,研究团队提出了Evolutionary Markov Hypergraph Attack(EMHA)作为参考搜索方法。EMHA采用黑盒反馈的方式,保持目标模型和攻击模型的参数固定,适应过程发生在外部的攻击状态中,其中保存了历史反馈、路径价值和不断演化的图池。

EMHA使用超图来表示需要协同发生的环境变化,每一轮的超图顶点代表一个攻击子目标,超边则连接其前置条件和后续子目标。系统会从当前可执行的超边中逐步采样,形成一条攻击路径,再通过冻结的攻击模型将这条路径转换为实际的环境更新,其中路径信息来自历史攻击状态中的检索结果。这样一次环境演化可以同时协调多个状态维度的修改,并将前一轮得到的反馈带入下一轮搜索。

评估器的反馈还会更新不同路径的价值,EMHA会在给定的轮数预算内关注搜索过程中得到的最佳结果。当某一轮获得更高的评估器分数时,该增益会被重新分配到该轮路径中的超边上,影响后续的路径选择。同时,存档模块会保留不同搜索区域中表现较好的图结构,新的环境演化会从这些历史结果中继续演化,经过多轮执行后,EMHA会逐步积累有效的环境组合,并持续探索新的风险组合。

核心实验发现

在75种Agent-模型配置上,EMHA的 pooled Strict ASR达到了85.0%。在针对DeepSeek-V4-Pro的五轮环境演化实验中,累计Strict ASR从第一轮的42.9%逐步上升到第五轮的94.7%,这说明随着环境的持续变化,后续的执行状态仍然能够暴露初始测试无法发现的安全问题。

随着场景复杂度的提升,完整环境演化和仅修改指令的演化方式之间的差距也在扩大:当依赖深度增加时,最大差距达到17.6个百分点;当工具调用次数增多时,最大差距达到17.2个百分点,这表明流程越长、状态依赖越复杂,仅测试局部输入越容易低估环境变化带来的风险。

研究还发现,风险本身具有明显的延迟特性:在1万条转换后的执行轨迹中,变化状态首次被使用时,执行进度的中位位置约为23%,而首次出现不安全行为则在64%的进度位置,两者中位相隔37个目标动作,对应整个执行流程约41%的延迟。

此外,在控制基础模型和正常任务完成情况后,加入目标Agent的身份信息可以额外解释7.6%的攻击成功率变化,这意味着Agent的安全不仅取决于基础模型的能力,还与Agent框架的设计、状态组织方式和接口设计密切相关。

总结

OpenART的三个核心设计共同推动了Agent红队评测的发展:长程可执行场景让持续状态真正进入测试流程;与目标无关的场景描述和适配器机制,让同一个任务能够适配不同的Agent框架;持续演化的环境测试则在任务目标和安全约束不变的前提下,持续挖掘新的风险状态。

因此,OpenART将评测的关注范围扩展到完整的Agent系统,考察其在复杂状态依赖、不同框架和持续环境变化中能否长期保持安全,对于长期运行、持续调用工具并依赖环境状态的Agent来说,这类评测能够覆盖静态测试难以发现的风险传播和安全失效问题。

以上内容不代表本平台立场,仅供读者参考