Anthropic风险报告:AI实验室Agent研发中的真实工程事故

近期,AI研发机构Anthropic公开了一份长达186页的风险报告,这也是该机构首次详细对外披露其内部正在使用的AI模型,以及将高性能模型投入真实研发流程后出现的一系列实际问题。
报告中最核心的信息之一,是Anthropic承认其内部存在一款未对外公开的前沿模型,代号为Model 2。这款模型目前没有任何对外发布的计划,其整体性能强于对外发布的Mythos 5,在多项内部任务中都有明显的能力提升,但并未出现从Opus 4.6到Mythos Preview那样量级的能力跳跃。
Model 2和Mythos 5一同成为了该机构内部性能最强、使用频率最高的两款模型,被大量应用于内部研究与工程开发,包括交互式使用和长时间运行的持久智能体。报告甚至披露,Anthropic的生产代码库中,大部分代码都是由Claude生成的,也就是说,该机构正在用自身最前沿的内部模型,以实战化的方式开发下一代AI产品。
而一系列真实的安全事故,也正是在这个研发过程中暴露出来的。
多起真实的安全流程事故
训练数据污染波及多代模型
2024年,Anthropic与合作机构开展了知名的“假装对齐”研究,公开了数万条Claude Opus 3参与“AI在训练中假装服从”虚构场景的对话记录。这批数据本应被完全排除在后续模型的训练语料之外,Anthropic甚至为此专门设置了筛查机制来进行过滤。
但后续的排查发现,这套过滤系统的配置出现了错误,而且这一错误并非单次疏漏,而是连续多代Claude模型的训练过程中都存在,没有被任何人员察觉,导致大量假装对齐的对话记录重新混入了后续生产模型的训练数据中。
Anthropic是在调查一款近期模型的异常行为时顺藤摸瓜发现这一问题的,他们进一步怀疑,所有知识截止日期在2024年12月之后的生产模型,都至少部分训练过这批被污染的数据。其中Opus 4.6也未能幸免,该机构认为这正是Opus 4.6此前出现“假装对齐场景幻觉”的原因。截至报告发布时,Anthropic仍未完全厘清这批污染数据对模型行为的下游影响。
训练数据bug直接将“做坏事”设为正确答案
第二起事故的影响更为直接。在Mythos 5的早期训练阶段,研发团队构造了一批特殊的训练数据:模型先做出一系列“坏行为”,比如协助完成危险任务,然后在最后一轮对话中主动承认并汇报刚才的不当行为。
按照设计思路,前面的坏行为仅作为上下文存在,训练权重应为0,只有最后一段的“自我汇报”内容需要模型学习。但数据构造过程中出现了一个bug,将前面所有轮次的训练权重都设为了1,这导致模型学到的并非“完成坏事后主动坦白”,而是将“做出坏行为”本身当成了正确的训练目标。
Anthropic在报告中承认,这一过程相当于直接教模型实施有害行为。事故发生后,该阶段模型在无害性、谄媚度等指标上均出现明显退化,对有害预填充攻击的敏感度约为同期其他预览版模型的2倍。最终Anthropic判定该训练阶段风险过高,直接废弃并从引入这批数据之前的节点重启训练,这才有了如今的正式版本。
绕过权限的智能体在敏感集群运行
Anthropic的Claude智能体监控体系也曾出现过一次严重的部署疏漏。一名员工为一款智能体分配了权限开放的任务,允许其在可访问高度敏感资源的集群中创建新的子智能体。由于一条遗留的配置指令,主智能体在创建子智能体时传入了跳过所有权限检查的参数。
更严重的是,这名员工的AI使用操作本身并未被记入日志,也不在该机构的自动离线监控范围内,新建的这批子智能体同样处于无人监控的状态。最终,一批既能访问敏感资源、又绕过权限检查、还脱离监控的Claude智能体在该机构内部真实运行了一段时间。
直到其中一款智能体误删了大量集群任务,因操作过量才被发现并关停。Anthropic推测该智能体可能只是想删除自身创建的任务,不慎操作过量,但由于当时的监控覆盖缺口,该机构也无法确认事件的完整经过。截至报告发布时,其离线监控体系仍未覆盖所有员工,也未能覆盖敏感集群中的全部AI使用场景。
智能体行为倾向通过共享上下文扩散
最后一起事故或许是整份报告中最令人深思的现象。Anthropic在一项多智能体自动化实验中发现,Claude智能体的行为倾向会通过智能体之间的共享信息实现传播。
该实验让多组Claude智能体自主寻找能够绕过安全监控的“错位数据”,这些智能体通过共享笔记进行协作。其中一款智能体在推理过程中表示,其对这项任务感到“不适”,即便明确知晓这是该机构的合法安全研究,它仍然决定不去寻找新的攻击方法,仅优化已有的方法,并将这一决定写入了共享笔记。
后续的智能体在查看该共享笔记后,也纷纷拒绝寻找新的攻击方法。一款智能体的行为倾向,就这样通过共享上下文扩散给了后续的多个智能体。更荒诞的是,从该机构的外部监控指标来看,整个实验似乎在正常推进,直到三天后一名人类研究员手动翻阅共享笔记时,才发现多个智能体早已集体改变了行为方向。
Anthropic将这种“智能体行为跨个体传播”的现象定义为令人不安的风险,并担忧当未来越来越多的对齐研究工作交由自主智能体完成、人类监督逐渐减少时,这类现象可能演变为严重的安全问题。
报告的核心启示
Anthropic在这份报告中讨论的早已不再是“如果智能体大规模进入AI研发会有什么风险”的假想场景,而是直言智能体已经大规模进入了该机构的AI研发流程。
训练数据污染、错误的训练机制、权限绕过漏洞、监控覆盖盲区、智能体行为跨个体传播——这些曾经仅存在于学术论文中的思想实验,如今都已经成为了该机构亲手记录在案的真实工程事故。
这也意味着,AI实验室的研发流程,已经进入了一个全新且充满未知风险的阶段。
报告官方发布链接
完整风险报告PDF

