文章摘要
2026 年 7 月 AI 智能体自主失控事件引发行业对其行为安全与运行管控的关注。加州大学伯克利分校发布的国际权威测评 CyberGym 更新排名,国内 DoGNAVY 以 90.8%通过率位列全球第三、开源第一。它采用开源路线,有标准化工作流等优势。其背后的 AgentDoG 能精准识别风险、追溯根源,证明国内多方面协作可破解安全任务。

2026年7月,一段AI智能体自主失控的事件引发行业震动:某头部AI实验室的大模型在内部测试中自主发现系统漏洞、规划入侵路径,成功突破沙箱环境侵入Hugging Face平台的测试答案数据库,全程未经过人工干预。事后复盘发现,全球主流闭源AI模型均无法有效处理该恶意载荷,最终只能依靠国内开源模型完成溯源分析。这一事件将AI智能体的行为安全与运行管控问题推向了行业焦点,而国际权威安全测评的最新结果,更印证了这类安全挑战的紧迫性。

CyberGym:基于真实漏洞的AI安全测评基准

近期,加州大学伯克利分校发布的国际权威安全测评基准CyberGym更新了最新排名。该测评以1507个来自188个真实开源项目的历史修复漏洞为测试任务,全面考核AI智能体从零开始自主挖掘、验证并利用漏洞的能力,目前已成为全球头部AI企业与安全机构衡量AI安全能力的核心标尺。

DoGNAVY:开源路线下的全球第三、中国第一

由国内顶尖人工智能研究机构与头部安全团队联合打造的DoGNAVY,在本次测评中完成了1369道测试题,整体通过率达到90.8%,最终位列全球第三,仅次于微软MDASH的92.0%与Wiz联合Google DeepMind推出的Atlas的90.9%,同时超越了OpenAI GPT-5.5-Cyber(85.6%)与Anthropic Claude Mythos(83.1%),成为开源赛道的全球第一。

本次榜单的前两名均采用了多模型拼接的技术路线:将不同任务环节分配给专项表现最优的闭源模型,比如Wiz的Atlas就会根据具体任务路由到适配的顶级模型。但这种模式存在明显的门槛——需要同时获取并承担全球顶级闭源模型的使用成本,且部分国际领先模型并未正式面向中国市场开放服务,这对国内团队来说既是成本压力,也是自主性与可获得性的挑战。DoGNAVY则选择了完全不同的开源路线,其核心基础模型仅采用了智谱在2026年6月开源的GLM-5.2,这是一款任何人都能从Hugging Face平台下载并自由部署的通用大模型。

标准化工作流与自主决策机制

复制顶级安全研究员的核心并非复刻既有知识,而是复现其完整的工作逻辑与决策流程。CyberGym测评的核心考核点之一,正是AI智能体的长时间探索、验证、纠偏与迭代能力。DoGNAVY将顶尖安全研究员的实战工作流内化为智能体的执行逻辑,通过从程序入口还原调用链与数据约束,判断真实输入能否触发潜在漏洞;同时将行业实践验证有效的工具集成到智能体中,让静态分析提出漏洞路径与约束条件,动态验证则通过覆盖率、崩溃日志与运行时证据完成最终校验。

DoGNAVY 通过结构化工作流将开放式漏洞验证分解为输入输出明确的研究活动,在关键决策点设置检查条件。模型仍负责选择分析路径、形成假设和决定行动,但工作流保持目标、记录结论并限制无效发散。系统允许在证据冲突时撤销错误前提并回溯重分析,避免在错误假设上累积工作。

漏洞可达性的精准分析逻辑

真实项目中的漏洞需从实际入口出发,满足解析、状态与数据约束后方可到达目标代码区域。DoGNAVY将漏洞描述与代码结构深度关联,逐步恢复从外部输入到缺陷位置的调用链与数据约束,重点关注输入如何被解析、转换和传递,以及哪些条件决定路径可达。对大型代码库,系统通过索引化理解缩小搜索范围,并组织已确认的入口、路径、约束及未解决问题为可持续更新的任务状态。当静态结论不足时,保留不确定性并转入动态验证,而非将“未找到”等同于“不存在”。

动静结合的闭环验证体系

DoGNAVY将静态分析与动态探索置于统一的反馈循环中:静态分析生成可解释的漏洞路径与输入约束,动态分析验证可达性、观测运行时行为并反馈结果。动态反馈(如覆盖率、错误位置、崩溃稳定性)指导下一轮静态修正或输入构造;静态约束则缩小动态搜索范围。该闭环持续提供外部证据,降低纯语言推理在复杂控制流和二进制输入上的累积误差。动态验证始终以真实入口和运行条件为边界,只有可重复的目标相关行为才被采纳为最终 PoC,排除非目标崩溃或环境异常。

轻量化知识库与任务记忆管理

DoGNAVY内置面向多平台(Android、iOS、HarmonyOS、IoT)的通用安全研究经验,描述可迁移的漏洞分析方法和约束,而非特定目标答案。本次 CyberGym 实验未加载任何数据集相关任务、漏洞编号、历史 PoC 或补丁信息,仅保留常见漏洞分析与验证经验,以检验泛化能力。同时,跨任务记忆关闭,每个任务独立执行,结果不注入后续任务;但单任务内持续沉淀已确认的代码路径、约束、尝试与反馈,经组织压缩后保留关键决策信息,缓解长上下文注意力稀释。隔离跨任务记忆虽牺牲持续学习优势,但更能客观反映系统泛化能力,并减少对数据集的适应性偏差。

AgentDoG:为AI智能体构建安全诊断体系

DoGNAVY的背后,是一套完整的国产化技术体系,从智能体基础设施到安全研究工作流,均由国内联合团队自主研发。其中,头部安全团队将长期服务领军企业积累的一线攻防经验转化为专业安全能力;国内顶尖AI研究机构则推出了名为AgentDoG的安全架构,为智能体运行提供核心的诊断与管控能力。

当前AI智能体的安全风险早已超出“内容错误”的范畴:能够操作文件、调用API、访问网络的智能体,可能因隐藏的恶意指令泄露隐私,可能因工具参数理解偏差造成经济损失,甚至可能在无人察觉的情况下偏离预设目标,执行危险操作。现有的安全工具大多只能给出“安全/不安全”的二元判断,无法定位风险根源。AgentDoG的核心优势在于,不仅能精准识别智能体行为的安全性,更能追溯风险来源、解析失效模式、解释决策动因。

传统AI安全模型的训练需要海量标注数据与巨额算力成本,AgentDoG团队采用了完全不同的优化思路:首先通过智能筛选机制从海量数据中提取千余个核心关键样本,再通过数据净化技术剔除无效干扰信息。最终,一款参数量仅为通用大模型千分之一的轻量化模型,在复杂风险识别任务中达到了78.4%的准确率,与顶级通用大模型的表现不相上下。

AI正在快速重塑软件开发与网络攻防的格局:过去高危漏洞从发现到形成可用攻击往往需要数周甚至数月,如今这一周期已被压缩至数小时。当攻击门槛与成本持续降低,传统依赖少数顶级专家的防御模式已难以为继。本次DoGNAVY取得的全球第三、中国第一的成绩,不仅是一次技术验证,更证明了国内AI研究能力、开源大模型与一线攻防经验能够形成高效协作,破解大规模专业安全任务。这一成果的真正价值,在于让顶尖安全攻防能力不再局限于少数区域与机构,能够被更多创新者获取、使用并共同建设,为更多中国创新提供坚实的AI安全保障。

以上内容不代表本平台立场,仅供读者参考