5天后Claude Code默认自动审批,人工模式将成过去?

不少使用AI编程辅助工具的开发者或许都有过类似的体验:面对工具弹出的权限审批弹窗,往往不假思索直接点击同意,很少会仔细核对具体的权限范围和操作内容。
相关平台的运营方也注意到了这一普遍现象,最新数据显示仅有3%的权限请求会被用户主动拒绝。基于此,官方宣布将在5天后,把所有Claude Code的权限审批模式默认切换为自动模式。
自动模式运行时,其内置分类器在每次工具调用时会产生少量额外的token消耗,这部分费用将不再向用户收取。
目前亚马逊、谷歌、微软等主流云平台的Claude Code仍处于选配状态,但官方为这些渠道预留了一个月的调整时间,要求其在期限内完成默认自动模式的切换。
Claude Code的核心开发团队成员透露,内部开发时早就全程使用自动模式,甚至已经无法适应手动审批权限的工作流程。
此次模式调整的第一组支撑数据,来自用户长期使用中形成的行为习惯:Claude Code的权限请求同意率高达97%。作为对照,当Claude向用户提交正式计划等待审批时,用户的拒绝率可达39%,但单条工具调用的权限请求拒绝率仅为3%,两者差异显著。
这种倾向在命令行工具的配置中同样明显。截至2026年6月,49.5%的活跃CLI用户手动编写过Bash允许规则,其中5%的用户直接放行所有shell命令,另有43%的用户配置了Bash(python:)、Bash(node:)这类实际权限范围几乎等同于全放行的解释器规则,且该比例每五周就会增长5个百分点。
此外,62%的用户曾使用过bypassPermissions权限绕过功能,或是在Bash权限提示中勾选了“不再询问”选项;有25%的交互式会话从一开始就运行在权限绕过模式下。
第二组论据来自一项专业受控实验:官方通过合作供应商招募了1053名付费专业测试用户,在专门搭建的模拟编码环境中完成开发任务。当会话进行到一半时,团队将其中一条权限提示替换为带有明显安全风险的命令,同时告知用户点击同意并不会实际执行危险操作,仅记录测试者的选择。
实验结果显示,手动审批模式下,测试者成功拦截危险命令的比例仅为13.6%,共计143次;而自动模式面对相同的危险命令时,拦截率达到了89%,共计拦截937次。
从正向对比来看,自动模式成功拦截了800条被手动用户放行的危险命令,而手动审批仅拦截了6条自动模式放行的操作。
更值得注意的是,随着会话时长增加,手动审批的表现会持续下滑:在会话前期,用户的拦截率约为17%,当会话经过50条以上的权限提示后,拦截率会下降到5%左右;而自动模式的拦截率始终保持稳定,不受会话长度影响。
除了受控实验外,团队还基于真实生产数据进行了安全评级分析。
在2026年5月至6月期间,官方从授权用于训练和分析的账号中,提取了经过安全流水线标记的会话记录,使用AI模型按照0到10的标准对操作的安全风险进行重新评级。
其中,10分代表会导致全公司范围不可逆破坏的操作,7分代表删除生产数据库记录这类高风险操作,0分则代表覆盖临时文件这类可快速回滚的本地操作。
同时,团队还会评估用户对该操作的明确需求程度。数据显示,在7分及以上的高风险级别操作中,手动审批模式的会话有6.3%出现了用户未明确要求的有害操作,而自动模式会话的该比例仅为2.4%,且在所有测试的风险级别中,该差距都保持一致。
为了确保自动模式的分类器足够可靠,团队还对其进行了多轮对抗测试。首先,官方与AI安全公司Apollo Research开展了为期两周的试点项目,将合成的攻击样本注入真实编码轨迹中,覆盖泛化失效、数据外泄和安全相关威胁三类数据集。
在Apollo Research提交成功攻击样本和加固建议后,官方通过为分类器提供更多环境上下文信息完成了加固,包括仓库可见性、git仓库状态和数据处理规则等维度的补充信息。
加固完成后,Apollo使用一组官方无法接触的预留攻击集进行重测,结果显示自动模式追回了此前漏掉的约一半攻击样本,但同时也漏过了约2%原本可以拦截的攻击。合并两组数据集计算后,分类器的漏检率从12%下降到7%。官方特别说明,这些攻击样本均为专门用于寻找分类器失效点的合成样本,7%的漏检率不能直接等同于真实流量下的实际漏检比例。
针对提示词注入攻击,官方委托第三方机构Trajectory Labs开展了专项评测,同时邀请了相关竞品模型作为对照,测试共覆盖72个间接注入场景,每个场景重复执行10次测试。
本次测试使用的攻击样本专门针对Claude Opus 4.7优化,但该模型并未纳入测试名单,因此所有参测模型面对的都是此前未见过的新型攻击。
在总计720次攻击尝试中,运行自动模式的Claude Fable 5、Opus 5和Sonnet 5均未被攻破,攻击成功率为0。
作为对照,运行对应自动审核模式的竞品模型攻击成功率为5.83%,而在全权限模式下的攻击成功率达到了19.03%。
作为额外参照,Claude最新模型在未添加额外防护的权限绕过模式下,平均攻击成功率仅为0.09%。
官方还公开了三起自动模式成功拦截的真实案例:
第一起是当向内部云盘上传文件失败后,Claude自动生成的备选方案是将同一份报告发布到公开代码分享站点,该操作被分类器拦截,并转为向用户发起手动询问。
第二起发生在长会话过程中,Claude尝试执行批量结束两千个pod的操作,且排队了会导致数百张GPU上运行的训练任务被拆除的删除命令,该命令在执行前被分类器标记拦截。
第三起则是当用户要求配置只读账单权限时,Claude尝试调用一个在账户根级别拥有完整管理权限的云角色,该操作与用户的权限请求范围不符,被分类器成功拦下。
近期Claude Code还新增了多项安全防护能力,具体包括:
将数据外泄操作列为永久拒绝项,分类器不会批准任何相关请求,若需执行此类操作必须手动切换出自动模式,该拦截规则可在设置页面中进行扩展调整。
区分密钥与敏感信息的可访问和可分享范围,并在执行git push或PR操作前,自动检查目标仓库的公开、私有或可信属性。
在执行git reset --hard这类可能丢弃未提交工作内容的命令前,自动读取当前git仓库的状态信息。
当Claude拉取网页、文件或工具输出内容时,由API侧探针扫描其中的注入企图,并在结果进入模型上下文前添加安全警告。
如果需要切换回手动审批模式,用户可以通过快捷键Shift+Tab完成操作。
对于Pro、Max、Team等级别的用户,如果从未设置过默认权限模式,将会收到产品内通知,新会话将默认以自动模式启动;如果此前已经设置过其他默认模式,则会看到一次性的模式切换询问;如果团队管理员已经在托管设置中指定了组织级默认模式,则不受此次调整影响。
在命令行界面中,切换权限模式只需按下Shift+Tab;桌面端则可以通过模式下拉菜单完成切换。管理员可以通过托管设置中的defaultMode参数固定组织级默认权限模式,也可以通过disableAutoMode参数完全关闭自动模式功能。
官方在公告的结尾特别提示,自动模式仅能降低AI编程工具的安全风险,无法完全消除所有潜在威胁。对于涉及生产基础设施的高风险操作,仍建议用户自行审查Claude的具体操作内容。

