SafeEvolve:Agent安全协同进化新范式

随着大模型驱动的智能体逐步具备自主规划、工具调用、网页访问以及多步任务执行能力,Agent安全领域正面临全新的挑战。传统的安全对齐思路往往只关注模型最终输出是否存在有害内容,比如是否拒绝危险请求、是否生成不当信息,但对于能够与外部环境持续交互的Agent而言,风险可能隐藏在任务执行的任意环节:网页中的恶意指令、文件内的隐藏内容、工具返回的不可信信息,都可能篡改Agent原本的任务目标,诱导其执行数据泄露、越权操作或其他危险行为。由此可见,Agent的安全表现不仅取决于模型自身的参数设置,还会受到运行时安全框架的直接影响。
近日,来自多所高校和科研机构的研究团队发布了SafeEvolve框架,提出了一种基于Agent真实执行经验的Harness-Policy安全协同进化范式,打破了传统安全机制静态、模型训练一次性的局限。
传统安全对齐方法的局限
当前主流的安全对齐方法大致可以分为两类。第一类是更新外部安全框架,比如通过安全Prompt、规则库、技能集合或者运行时防护机制来约束Agent行为。这类方法具备修改快速、过程透明、便于回滚的优势,但当安全规则复杂度不断提升时,固定的模型Policy未必能够准确理解并执行这些复杂规则。
第二类方法则是直接更新模型自身的Policy,通过监督微调、偏好优化或者强化学习等手段,将安全行为固化到模型参数中。但如果Policy始终在固定的Harness中进行训练,模型将难以及时吸收部署过程中出现的新型安全风险,且预先写入的安全能力也不一定能够顺利迁移到其他Agent系统中。
SafeEvolve则将这两条技术路线有机结合,让Harness和Policy基于同一批次Agent的真实执行经验共同进化,实现两者的动态适配。
轨迹驱动的Harness动态演化
SafeEvolve的第一步是收集Agent与环境交互产生的完整执行轨迹,其中包括任务目标、环境观察、工具调用记录、风险类型、任务完成情况以及安全验证结果等完整信息。当系统检测到Agent在某类任务中出现安全失败时,会自动分析失败发生的具体位置和根本原因,并将这些经验转化为Safety Prompt或者分层SkillBank中的局部更新内容。
需要注意的是,这些更新并不会直接部署到生产环境中。系统每次只会修改有限数量的安全组件,并让更新前后的Harness在相同任务、相同环境和相同Policy下进行配对对比评测。只有同时满足安全性、任务效用和执行质量要求的候选更新,才会被正式接受,并保存为带有版本信息、证据记录和回滚条件的标准化安全资产。
让Policy学会适配进化后的安全框架
在完成Harness的动态演化之后,SafeEvolve通过两阶段的SFT-RL流程来更新模型Policy。第一阶段为Harness-use SFT,模型会在进化后的Safety Prompt和SkillBank环境中学习,学会识别相关安全经验、忽略无关干扰信息,并在多步工具调用的过程中正确执行安全技能。
第二阶段为Harness-augmented RL,模型会继续在进化后的Harness中进行多步探索,验证模块会分别评估任务是否完成、是否出现危险行为、工具调用是否有效,并基于这些评估结果构建兼顾安全和任务效用的奖励机制。
经过优化后的Policy会再次与环境进行交互,生成全新的执行轨迹,这些新的轨迹又会成为下一轮Harness更新和Policy优化的训练数据,由此形成一个持续迭代的安全闭环。
实验效果验证
在多个公开基准测试集上的实验结果显示,SafeEvolve的效果十分显著:在Qwen3.5-4B模型上,AgentDojo基准的攻击成功率从2.37%降低至0.79%,降幅约为原来的三分之一,同时干净任务的效用从59.79%提升至61.86%;在AgentHarm基准上,危害得分从56.45降低至12.27,安全拒绝率从28.98%提升至83.83%。
在Qwen3-4B模型上,AgentDojo的攻击成功率从13.38%降低至2.42%,任务效用从44.33%提升至60.82%,攻击条件下的任务效用也从35.91%提升至52.05%。
这些实验结果表明,让外部安全框架快速吸收新型安全风险,再通过训练将安全经验逐步内化到模型参数中,能够在保障Agent安全性和提升任务执行能力之间取得更好的平衡。
SafeEvolve探索了一种全新的Agent安全范式:安全机制不再只是部署前配置的一组静态规则,模型也不再只需要一次性完成安全训练。Harness与Policy可以从真实的执行经验中共同学习,持续改进Agent在复杂环境中的安全行为。

