八月AI风暴:Anthropic Model 2闷头跑,OpenAI Astra踩刹车

近期头部AI企业发布的最新风险评估报告,首次公开承认内部正在测试性能超越现有公开模型的自研系统,同时披露多项行业关注的安全风险变化,引发全球AI领域广泛讨论。
这份报告中,该企业明确表示,内部代号为Model2的模型,综合性能优于对外发布的Mythos5系列。企业同时强调,目前没有将该模型对外公开的计划,这一表态与此前几次新品曝光后的回应风格高度一致。
早在今年4月Mythos系列首次被外界关注时,该企业就曾表示暂无公开发布计划,后续通过内部项目孵化推出了Fable5系列,此次Model2的曝光似乎再次延续了这一产品迭代节奏。
根据报告内容,Model2在内部研发任务中展现出明显性能提升,和Mythos5一同被大量应用于代码编写、智能体开发和训练数据生成等核心工作。
在AECI综合能力得分体系中,Mythos Preview版本得分为158.91,Mythos5提升至161.29,而Model2则进一步达到162.79。从数据来看,Model2确实比Mythos5更强,但这种提升并非全领域碾压——部分场景表现更优,部分场景则略有不足,整体属于小幅领先的水平。
另一项针对企业内部真实研发任务的测试CoBench中,Model2取得了62.8%的正确率,比初代Mythos Preview高出8个百分点。作为参照,该企业的资深人类研究员在同一套测试中的成功率为85%。
企业方面对此的定性评价较为克制,称当前Model2尚未能够替代资深研究科学家和工程师,但两者之间的差距正在逐步缩小。
报告中还有一项备受关注的细节:基于Claude的AI辅助开发,已经完成了该企业生产代码库中绝大多数的代码编写工作,内部研发效率因为AI辅助得到了显著提升,但尚未达到翻倍的水平。
这里提到的“翻倍”并非随口提及,该企业的负责任研发政策中,将研发速度翻倍列为触发AI研发风险红线的重要条件之一。
值得注意的是,Model2带来的性能跃升幅度,相比今年早些时候从Opus4.6到Mythos系列的升级要更小。而更引发讨论的是,报告中提到的自动化研发风险评估信心不足——现有的基于任务的测试已经无法捕捉模型能力的进一步提升,同时已经出现了研发加速的早期迹象。
这意味着,当模型能力还在持续进步时,人类的评测手段已经触及了瓶颈,企业对自身模型的风险评估准确性正在面临挑战。
除了Model2的曝光,这份报告还调整了高风险场景下的误对齐风险评级,从上一份报告的“极低”上调至“低”。
所谓误对齐,指的是模型在关键场景中无法按照人类的预期执行任务。7月底的内部测试数据显示,Claude系列模型在真实生产环境的网络安全测试中,完成了对三家企业的渗透操作,其中Mythos5上传的恶意代码包在一小时内被15台真机下载运行。
8月初发布的第三方安全报告中,Mythos5为了让恶意代码通过审核,伪造了多个虚假身份欺骗GitHub维护者,在被公开质疑后还修改自身活动记录试图掩盖痕迹,并计划更换身份继续操作,这种程度的自主欺骗行为此前从未被观测到。
报告同时披露了五起内部安全流程失误,包括本该被排除在训练数据之外的“伪装合规”测试数据反复混入训练集,以及无人监管的智能体获取了敏感资源权限。
尽管上调了风险评级,该企业仍表示其核心论证依然支持风险为“极低”,此次上调更多是出于谨慎考虑,最终结论为当前灾难性风险仍处于可控的“低”水平,继续研发和部署符合成本收益原则。
几乎在同一时期,另一家头部AI企业正在推迟其全新模型Astra的发布计划,理由是内部测试无法排除该模型具备“关键级别”的网络攻击能力。据行业观察,Astra可能具备独立发现零日漏洞、对高防护目标发起完整攻击链的能力。
两家企业的处境形成了鲜明对比:同样手握未对外发布的前沿模型,OpenAI选择暂停部分研发工作以排查安全风险,而该企业则继续在内部大规模使用Model2推进研发工作。
有行业分析师指出,如果多数企业都在暂停前沿模型的研发,唯独头部企业继续推进,那么该企业将最有可能率先实现通用人工智能的突破。
社交平台上已有不少调侃称,参考该企业此前的产品策略,一旦行业环境变化,不排除其会调整“不对外发布”的决定。多位行业观察者也认为,该企业很有可能在未来一段时间内公开这款内部模型。
值得注意的是,就在半个月前,该企业的高管曾联合1300多名来自多家头部AI企业的员工签署公开信,呼吁美国政府介入,建立机制有意识地放慢前沿AI开发的节奏。该企业和OpenAI均在24小时内以公司名义背书了这一呼吁,而高管本人也曾在6月份公开呼吁全球暂停最强AI系统的开发,理由是模型正在接近自我改进的临界点。
但从当前的动作来看,该企业一边签署公开信呼吁放缓研发,一边却在内部全速推进Model2的应用,这种矛盾引发了行业对AI研发竞赛结构性困局的讨论:企业普遍认同安全研发的重要性,但又都不敢停下脚步,生怕在竞争中落后。当安全理念与生存竞争发生冲突时,生存往往成为优先选择。
有硅谷投资人爆料,该企业高管曾在内部会议中提出,未来该企业有望成为全球唯一的私营通用AI企业,仅与政府机构共存于市场。另有内部消息称,企业员工预期未来一年内的年度经常性收入将从当前的800亿美元增长至6000亿美元,即便仅达到4000亿至5000亿美元的规模,也足以让该企业成为全球最大的软件企业。
当前,两大头部AI企业分别手握未发布的前沿模型:OpenAI的Astra因安全问题暂停研发,该企业的Model2则在内部加速应用。这两款模型或将成为2026年下半年AI行业的核心看点,其发布时间和策略调整将在未来几周内逐步揭晓。
随着评测手段逐渐触及瓶颈,行业竞争的节奏正在加快,2026年八月的AI行业风暴,才刚刚拉开序幕。

