微软MDASH系统95.95%领跑CyberGym安全测试

在行业通用的CyberGym网络安全基准测试中,一组全新的成绩刷新了所有人的认知:95.95%的漏洞复现成功率,直接将一众顶尖模型甩在了身后。拿下这一成绩的,并非单一的前沿大模型,而是微软推出的MDASH多模型安全系统。
紧随其后的四款主流模型,成绩分别为85.6%、83.8%、83.6%和83.2%,MDASH以超过10个百分点的优势断层领跑。更值得关注的是这套系统的部署成本,仅为微软此前最强安全配置的一半。微软CEO纳德拉曾在社交平台公开评价:
世界级的安全能力,一半的价钱。
很多人会被95.95%的亮眼成绩吸引,但真正体现这套系统设计思路的,是另一个数字:90%。
这九成的日常检测任务,由一款激活参数仅5B的轻量模型完成。这款名为MAI-Cyber-1-Flash的模型,是微软自研的首款网络安全专用模型,总参数规模137B,本质是其代码模型MAI-Code-1-Flash的网安场景微调版本。微软AI负责人苏莱曼在介绍MDASH时提到,MAI-Cyber-1-Flash负责处理90%的常规查询,剩余10%的高难度任务,则交给参数规模约为其10倍的GPT-5.4旗舰模型收尾。
网络安全攻防是一场7×24小时不间断的持久战,每日涌入的攻击流量如同潮水,待扫描的代码库也持续累积扩容。在这种场景下,真正的瓶颈并非模型的绝对智能水平,而是计算Token的使用成本。过往的安全方案往往简单粗暴地堆砌顶级大模型进行反复扫描,而MDASH的设计思路则是用轻量高效的小模型承接绝大多数常规任务,将旗舰级大模型的算力节省下来,仅处理最复杂的疑难场景,这正是一套全新的AI网络安全经济学。
根据MAI-Cyber-1-Flash的官方测试数据,初始版本的MDASH在CyberGym测试中仅取得88.4%的成绩,当将其中80%的模型调用替换为这款轻量模型后,测试成绩反而提升至95.95%,同时整体成本相比此前使用GPT-5.4、5.4 mini和5.3 codex的最优配置降低了整整一半。需要明确的是,「90%任务比例」指的是MDASH内部的模型路由分配规则,并非指系统自动修复了90%的漏洞,整套流程仍是由多模块协同完成的流水线作业。
不是模型封神,而是系统跑出来的
这一95.95%的成绩,并非MAI-Cyber-1-Flash单个模型的功劳,而是整个MDASH多模型漏洞识别与修复系统的综合结果。这套系统内部搭载了超过100个专用智能体,各自承担不同的分工:有的负责代码审计,有的负责漏洞验证,有的会针对发现结果进行交叉辩论确认,有的负责去重降噪,还有的会生成漏洞验证的PoC文档。模型在这套系统中,仅仅是其中一个核心组件。
微软将这套方案的核心拆解为Model、Data、Harness三个维度,即模型、数据与编排,三者的协同调优才造就了这一跑分成绩。其中,竞争对手最难复制的便是数据优势:微软每日可捕获超过100万亿条安全信号,覆盖身份、终端、云服务与网络全场景,服务超过160万家客户,从安全响应中心到实战攻防场景中的漏洞利用、拦截效果、补丁有效性等全链路数据都被完整积累。微软方面曾强硬表态,这类长期积累的安全历史数据无法凭空构建,模型能力可以追赶,但数据壁垒难以复制。
这也印证了一个核心观点:模型只是输入,真正的产品是整套调度系统。当行业内各模型的基础能力逐渐拉平后,真正拉开差距的,便是谁能更高效地调度模型资源,以及谁拥有更全面、更长期的安全数据积累。
这95.95%,测的是漏洞复现成功率
很多人可能会好奇,95.95%的测试成绩到底意味着什么?首先需要明确CyberGym基准测试的规则:它会向智能体提供一段打补丁前的代码与对应的漏洞描述,要求智能体生成可复现该漏洞的PoC代码,再通过补丁前后的代码版本验证复现结果。简单来说,这项测试考验的是「根据已知线索复现漏洞」的能力,而非从零开始在陌生代码中寻找未知漏洞,准确来说,它衡量的是漏洞复现成功率,而非漏洞发现准确率。
那么这一成绩的含金量究竟如何?根据CyberGym的原始论文,一年多前最强的组合OpenHands加Claude-3.7-Sonnet,复现率仅为11.9%。从11.9%到95.95%,这一数字的跃升幅度足以体现技术的突破性。
不过需要说明的是,截至当前,95.95%的成绩尚未进入CyberGym的公开榜单,目前榜单上仍是微软5月发布的88.4%的旧成绩,因此这一成绩目前仅为微软官方公布的数据。但值得一提的是,MDASH在5月12日首次发布时的88.45%成绩,已是当时CyberGym公开榜单的最高分,领先第二名约5个百分点。此外,MAI-Cyber-1-Flash目前并非公开模型,仅在MDASH内部通过Azure AI Foundry的私人预览向审核通过的客户开放。
造了自己的模型,最难的活还得交给OpenAI
尽管微软已经推出了自研的安全模型,试图降低对OpenAI的依赖,但那10%的高难度任务,最终仍需要交给GPT-5.4来完成。有行业评论指出,微软虽然拥有了自研的网络安全模型,但最核心的复杂场景仍需依赖OpenAI的旗舰模型。微软的角色已经从「OpenAI模型的分销商」升级为「系统编排者+自研专用模型提供商」,但在模型层面对OpenAI的依赖仍未完全解除。
从安全Copilot到安全行动系统
就在同期,微软还推出了规模更大的智能体安全系统Project Perception。这套系统相比MDASH覆盖了更完整的安全闭环:红队智能体负责模拟攻击路径探索,蓝队智能体负责检测并判断风险真伪,绿队智能体则负责执行修复与系统加固。三支智能体团队形成了自主发现、自主研判、自主修复的闭环流程,该系统已于8月3日进入公开预览阶段。
不过微软仍坚持将关键决策权限保留在人类手中。这一动向也体现了网络安全行业正在发生的核心转变:网络安全工具正在从「安全Copilot」转向「安全行动系统」。早期的安全系统往往侧重于生成更多告警信息,而新一代系统则比拼持续感知、推理决策并直接执行行动的能力。
有安全研究者曾指出,行业的护城河正在从「模型访问权限」转向「验证能力」。如今仅需花费30美元调用公开模型,就能实现Mythos级别的漏洞狩猎,但真正稀缺的,是既能准确验证漏洞真实性,又不会让开发者被海量误报淹没的整套系统。
未来的网络安全赛道,比拼的将不再是谁能调用最强的单个模型,而是谁能将模型、数据、智能体与验证机制整合为一套持续运转且值得信赖的安全行动系统。系统级的竞争,才刚刚拉开序幕。


