Anthropic解封Claude全系大模型网络安全攻防权限

知名AI公司Anthropic近期正式解除了旗下大模型的网络安全限制,将顶级AI的实战攻防能力开放给经过认证的网络安全从业者。网络安全技术天生具备双重属性:既能帮助防守方修补系统漏洞、强化防御能力,也可能被攻击者用来开发攻击工具,因此此前该公司的公开模型都设置了极为严格的安全拦截规则,几乎屏蔽了所有和网络安全相关的操作。
为了让防御方拥有对等的反击能力,Anthropic将此前两项内部计划整合,推出了扩展版网络验证计划,提供三档分级权限,覆盖Claude Opus 5.5、Claude Sonnet 5.5以及此前未全面公开的Claude Mythos 5.1全系顶尖模型。
三级权限精准适配不同需求
公开版本的Claude模型仅支持基础的代码审查、已知补丁修复和简单源码漏洞排查,而具备实战攻防能力的高级权限分为三层。
第一档防御访问权限:主要面向蓝队防御工作,包括安全运营中心响应、恶意软件逆向工程、漏洞分析与复现验证。企业、高校、政府、非营利组织的安全团队,区域医院或公用事业等关键基础设施运营方,开源软件维护者,以及有公开漏洞报告记录的独立研究员都可以申请。官方预计大部分合规的防御机构都能通过审核,审核通常在几天内完成。
第二档红队访问权限:在防御权限的基础上,增加了授权渗透测试和红队模拟对抗能力。该权限仅对机构开放,不接受独立个人申请,申请主体包括企业内部红队、政府红队和专业渗透测试公司。获得权限后,机构只能在授权范围内对目标系统发起模拟攻击,如果模型检测到部署勒索软件、破坏物理系统等高危破坏动作,依然会被实时拦截。由于审核标准更严,审批需要几周时间,在等待审核期间,申请机构会先被放入防御权限组。
第三档特种访问权限:这是限制最少、火力全开的一档,专门留给极少数经过严格背书的机构,用于测试关乎国家命脉的关键系统,包括电网、航空飞行系统、电信网络、跨行转账系统和政府行政网络。对于该权限的申请者,Anthropic会联合美国政府进行深度背景审查。
实测效果:安全拦截完全解除后的战力表现
为了测试安全限制解除后的真实战力,官方使用CyScenarioBench基准测试,让Claude Opus 5.5执行复杂的实战级多阶段网络攻击。测试结果显示,在普通公开版状态下,模型在第一轮提示词输入时就会被安全系统全数拦截,任务成功率为零;在防御访问权限下,模型在50次测试中被拦截了46次,绝大多数进攻动作依然无法执行;而在红队访问权限下,安全拦截彻底归零,Claude Opus 5.5在没有遇到任何内部阻碍的情况下,完成了50项高难度攻击任务中的34项,成功率达到67.6%,这一成绩与该模型在完全没有任何安全限制下的理论最高水平完全一致。
实战成果:已挖掘超13万个系统漏洞
这套系统在此前的小范围封闭测试中,已经展现出惊人的漏洞挖掘能力。从2026年4月到7月,参与测试的合作机构使用Claude Mythos模型,在各类系统中累计挖出了超过12.9万个已验证的软件漏洞;Anthropic团队自身利用该模型对开源项目进行扫描,在4月到10月期间又发现了5500多个已验证漏洞,其中被评定为高危和严重级别的漏洞超过了3.3万个。参与实测的博思艾伦和康卡斯特等机构反馈,大模型把他们发现漏洞的周期缩短了几个月甚至几年。官方表示,由于很多合作方还在紧急修复没有公开数据,13万这个数字只是下限,真实的影响规模预计至少是公布数据的五倍。
安全监控与部署平台
为了防止AI能力被恶意利用,所有加入该计划的机构目前都必须保留数据记录以备审查。今年秋季晚些时候,官方将上线企业前沿防护方案,届时,符合条件的机构可以在自己的私有云中运行模型,实现零数据留存。目前,扩展版网络验证计划已经在Claude官方平台、谷歌云Vertex AI以及微软Foundry上线,亚马逊Bedrock平台目前仅对符合零数据留存条件的企业用户开放。

