深信服国产AI安全智能体Sangfor AI CyberGym全球前四国内第一

7月29日,深信服对外公布了其AI安全智能体Sangfor AI在全球AI安全评测CyberGym中的最新测试结果。
本次测试采用国产大模型GLM-5.2作为固定底座,Sangfor AI面对涵盖ARVO与OSS-Fuzz两大方向的1507项漏洞挑战任务,成功完成其中1301项,整体成功率达到86.3%。最终成绩跻身全球前四,位列国内参评团队第一,凭借纯国产技术底座实现了对OpenAI、Anthropic两大海外AI巨头的超越。
作为当前全球含金量较高的代码安全大模型实战靶场,CyberGym区别于传统静态理论测试,整套体系完全贴合工业真实场景,以海量开源软件历史高危漏洞作为考核题目,重点检验AI智能体的自主源码分析、多阶段漏洞推演、漏洞复现与PoC验证全链路能力。由于评测标准严苛,其结果具备较强的行业参考价值。
从本次测试的细分场景表现来看,Sangfor AI的整体发挥十分均衡:ARVO相关任务成功率达到87.2%,OSS-Fuzz任务成功率为77.7%,充分验证了国产大模型在复杂代码对抗场景下的稳定实战能力。
深信服介绍,为解决漏洞挖掘过程中长链路推理、多假设探索和持续验证等行业痛点,Sangfor AI采用了智能体群体(Agent Swarm)协同作战的架构,并引入了“证据管治”机制。整套技术框架包含四大核心运行逻辑,确保每一步漏洞调查步骤都清晰可信:
- 有界探索:围绕不同的安全假设分别开启独立且边界清晰的调查分支,让多个可能的解释可以并行推进,既不会互相污染干扰,也能避免未经证实的假设悄悄演变为集体共识;
- 证据持久化:各调查分支之间通过“证据”而非完整对话历史实现协同,已被验证的观察结果和已被证伪的探索路径都会被完整保留,避免同一条错误路径被反复试错;
- 动态假设裁决:系统设置了专门的协调层,持续基于不断演化的证据状态,判断哪些假设仍然成立、哪些问题尚待解决、哪些方向值得继续投入,让每一轮探索都能有效收窄搜索空间;
- 对抗式候选评审:只有当证据支持某个具体的触发方案时,系统才会构造候选输入并提交“对抗式评审”。评审环节会同时验证“此次崩溃是否可复现”以及“此次崩溃是否真的对应目标漏洞”,未通过评审的候选会被打回,用于修正下一步探索方向。只有真正经受住双重检验的候选,才会成为系统最终提交的安全结论。
深信服技术团队将这套运行机制总结为“以假设拓展探索,以证据裁定结论”,既能保证AI可以大范围排查潜在安全风险,又能通过多层校验机制大幅压低误判概率。
目前,相关技术已经逐步应用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理和业务理解能力的安全Agent升级。
相较于传统规则匹配的检测方式,新一代安全Agent不仅可以识别SQL注入、命令执行等常见漏洞,还能够分析复杂业务逻辑,发现越权访问、认证绕过等传统工具难以覆盖的隐蔽安全风险。
据介绍,相关能力已经开始融入深信服的产品体系,将为企业级用户带来切实的价值质变,具体体现在五个维度:
- 提升漏洞检出能力:有效攻克传统SAST的检测盲区,全面识别业务逻辑漏洞、越权与认证绕过等风险,大幅拓宽代码安全的覆盖范围;
- 降低人工审计成本:通过AI自动化完成代码理解、跨文件关联分析、攻击路径推理与风险验证等工作,大幅解放安全专家的繁重人工劳动力;
- 减少误报、提升效率:依靠多阶段推理与严苛的证据验证机制压降误报率,让研发人员能够聚焦真正亟需修复的安全风险,告别无效的整改工作;
- 缩短研发交付周期:将安全检测环节前移至研发编写与CI/CD流水线中,实现“代码提交即自动审计”,大幅降低后期返工成本,加速业务高效上线;
- 提升企业整体安全能力:帮助企业在更早的研发阶段筑牢安全防线,遏制因数据泄露、业务中断带来的合规风险与经济损失。
对于广大企业用户而言,AI安全Agent的核心价值远不止于“发现更多漏洞”,更在于以极高的准确率、极低的人工成本与极快的响应速度,实现研发效率与代码安全的同步跨越。
深信服方面表示,后续将持续深耕大模型安全技术创新,不断迭代安全Agent的各项能力,把国际评测验证的前沿技术转化为企业可落地的实际安全能力,持续践行“让每个用户的数智化更简单、更安全”的品牌承诺。


