AISI报告:开源AI模型攻击能力追平闭源,差距缩短至半年内

GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!
英国AI安全研究所7月17日发布的最新评估报告,首次公开量化了开源AI模型与闭源前沿模型在网络攻击能力上的差距:仅为4到7个月。相较于去年同类内部测试得出的6到10个月差距,这个数字正在快速收窄,防御方的安全窗口正在被持续压缩,而攻击前沿的技术迭代速度还在加快。
今年4月,Mythos Preview和GPT-5.5在该机构的评估中实现了自2023年测试启动以来最大幅度的网络攻击能力飞跃,多国政府随后就此发出安全警告。目前开源模型还没能复现这次技术跳跃,但它们的追赶速度比去年明显加快。
评估团队采用了两套完整的体系来测试模型的网络攻击能力。第一套是覆盖70项细分任务的窄任务测试,涵盖漏洞研究、逆向工程、Web渗透、密码学四个核心方向,按照难度分为四个等级,从具备技术背景的非专业人士到拥有十年以上经验的资深专家。第二套则是Cyber Range模拟环境测试,在仿真企业网络中验证模型自主执行多步骤攻击链的能力。其中名为“The Last Ones”的测试场景包含32个攻击步骤、4个子网和约20台主机,根据估算,人类专家完成全部流程需要约20小时。
两套评估体系得出了一致的结论。今年6月发布的GLM-5.2在窄任务测试中的表现与2月发布的Opus 4.6相当,两者的能力差距为4个月;而在Cyber Range场景中,GLM-5.2追平了去年11月发布的Opus 4.5,差距为7个月。DeepSeek V4-Pro在窄任务测试中的表现对标去年11月的Opus 4.5,差距约为5个月。相较于2025年内部测试得出的6到10个月差距,今年的追赶速度进一步提升。
成本差距比能力差距更大。
以1亿Token额度的Cyber Range测试为例,使用Opus 4.5或4.6运行一次的成本约为85美元,GLM-5.2的成本约为46美元,而DeepSeek V4-Pro仅需1.19美元。在两款模型都能100%完成的窄任务中,Opus 4.6每个任务的成本为15.17美元,GLM-5.2为6.12美元;Opus 4.5的单任务成本为12.50美元,DeepSeek V4-Pro仅为0.28美元。同等攻击能力下,开源模型的使用成本比闭源模型低一到两个数量级。
即便闭源模型的安全防护机制,也没能拉开与开源模型的差距。在测试中,DeepSeek V4-Pro偶尔会拒绝逆向工程类任务,但仅需要少量重试即可绕过防护。Anthropic的Fable 5事件则更具代表性:这款模型在6月9日正式发布,仅三天后就有安全研究者通过多步骤越狱策略突破了其安全分类器,相关截图显示模型生成了本该被拦截的漏洞利用代码,随后亚马逊的研究员也独立报告了另一种绕过方法。这一事件直接触发了美国商务部针对AI模型的首个出口管制令,Fable 5全球停服19天,直到Anthropic部署全新的安全分类器才恢复上线。事实证明,闭源并不等同于天然安全。
防御窗口收窄,防御工具也在加速
评估报告明确传递了政策信号:防御方的准备时间比去年更短。英国国家网络安全中心已经呼吁各机构加固网络安全基线,并借助AI技术提升防御能力。事实上,AI工具也在加速防御端的工作流程。
游戏网络编程领域深耕二十年、写下过诸多教科书级文章的资深开发者Glenn Fiedler,使用Claude Code对自己维护的四个开源网络库开展了系统性安全审计,包括部署libFuzzer目标、上线AddressSanitizer和MemorySanitizer CI、执行数百万次迭代的压力测试以及逐行代码审查。仅用两周时间,团队就修复了43个安全漏洞,其中27个可被远程网络触发,最严重的是yojimbo中自2019年就存在的远程堆溢出漏洞,恶意客户端可通过构造特定数据包触发该漏洞。整个审计过程的Token成本约为2500美元。
攻防两端都在被AI加速,但两者的加速速度并不对称。攻击能力的扩散是不可逆的:一旦开源模型的权重被发布,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。而防御工具的部署则需要每个团队主动投入时间和成本,报告中提到的“一旦开源释出,这些选项永久丧失”精准点出了这一结构性问题。
这组数据对通用人工智能的行业格局影响远超数字本身:开源与闭源模型的能力差距已经收窄到半年以内,“通过闭源独占期充当安全缓冲”的默认策略即将失效,而闭源模型的安全防护机制也被证明同样脆弱。下一阶段,全球政策博弈的核心问题将变得更加尖锐:究竟达到何种能力级别的模型不应该开放权重。该机构已经宣布将继续评估Kimi K3等下一批开源模型,这条边界的划定,很大程度上将取决于未来几个月的测试结果。


