文章摘要
OpenAI以违反敏感信息访问处理规则为由,解雇三名深耕AI安全与模型对齐领域的研究员。三人发布公开信反驳该解雇理由,称被解雇因坚持AI安全优先于公司短期商业利益,同时呼吁OpenAI兑现与第三方审计机构合作承诺、保障前沿模型可监测性、维护开放透明的内部文化,该事件引发行业对AI企业内部安全治理的讨论。

不久前,人工智能研发机构OpenAI传出一起引发行业热议的人事变动:三名深耕AI安全与模型对齐领域的研究人员被公司解雇,事件的后续发酵让外界对AI企业的内部安全治理与开放文化产生了新的讨论。

此次被解雇的三名研究员分别是负责模型对齐工作的Jasmine Wang、参与过AI安全研究及外部安全评估机构技术对接的Tomek Korbak,以及同样从事AI安全与模型对齐研究的Mikita Balesni。

据OpenAI官方披露,解雇三人的原因是内部调查发现其违反了敏感信息访问与处理规则,涉嫌绕过既定流程向第三方AI安全评估组织共享机密信息。不过就在事件曝光后不久,三人在社交平台发布了致OpenAI领导层的公开信,对解雇理由提出了不同的解释。

Mikita Balesni在公开信中表示,他们被解雇的核心原因是将AI安全放在了OpenAI短期商业利益之前;Jasmine Wang则透露,公司给出的解雇理由仅为“访问了一位高管的邮箱”,她希望澄清事件全貌,因为OpenAI过往已有不少员工突然离职,但背后的真实情况常被模糊说辞掩盖;Tomek Korbak则指出,自己数月来一直在担忧一个关键的安全问题:AI代理的思维过程监测能力正在逐步丧失,而这正是发现AI行为异常的最有效手段之一,他认为这才是自己被解雇的真正原因,同时他还担心公司会以此次解雇为借口,减少与外部审计机构METR的合作。

公开信中披露了大量此前未对外公开的细节,同时三人也介绍了各自在AI安全领域的从业经历:Tomek Korbak早在GPT-2时代就开始研究基于强化学习的语言模型对齐技术,并以此完成博士论文,之后曾在Anthropic开展相关应用研究,加入OpenAI后专注于思维链可监测性方向,参与撰写公司安全战略,分析过Astra级模型可监测性下降的原因,也是Hugging Face事件调查中对接外部机构的技术联系人;Jasmine Wang于2019年在OpenAI政策研究团队实习,参与撰写了《可信AI开发》报告,之后曾在英国AI安全研究所带队开展工作,2025年重返OpenAI后负责安全论证项目,还提出了“Pacing”概念,相关概念因获得394名员工签名的《Pacing the Frontier》请愿书被广泛知晓;Mikita Balesni是2023年Apollo Research的创始成员之一,主攻AI失对齐问题,也是最早注意到AI能够意识到自身处于评测环境中的研究者之一,在OpenAI期间负责对齐评测、失对齐科学及思维链可监测性研究,同样参与了Hugging Face事件调查。在加入OpenAI前,三人还共同发起了一份跨行业立场文件《思维链可监测性:AI安全领域一个全新而脆弱的机遇》,其中两人担任主要作者。

在公开信中,三人首先澄清自己并非某媒体报道的消息泄露者,该报道涉及一款新型可监测性更低的模型架构,他们既不知道消息来源,也没有泄露信息的动机——事实上,当时他们正推动跨公司合作,限制开发无法有效监测的模型架构。

三人还分别解释了各自的工作行为:Tomek Korbak表示,自己在与外部机构的接触中并未超出工作职责范围,Hugging Face事件调查没有先例,相关内部政策也是在调查过程中逐步制定的,他始终遵循公司当时的规则,延续了OpenAI早期与第三方合作的惯例,谨慎处理与外部合作方的沟通;Mikita Balesni则称,自己负责推动跨公司合作,争取各方承诺限制不可监测模型的开发,这项工作需要与外部机构大量沟通,期间他始终与公司董事会及高管协调,确认相关事项,对外分享材料前也会删除敏感信息,所有行为均符合当时的工作规范;Jasmine Wang则解释,她获得高管邮箱访问权限是出于招聘工作需要,且事先获得了授权,之后权限不再需要时她主动申请撤销,但IT部门未完成移除,且两个邮箱的邮件合并显示在收件箱中,未明确标注来源,当她意外点开敏感邮件后,第一时间向该高管报告并再次申请撤销权限。

三人强调,他们并未向媒体透露被解雇的消息,也未收到公司关于共同撰写董事会备忘录的指控,因此没有机会回应相关误解。他们表示,此次事件引发的传言与模糊的处理方式,已经让OpenAI内部的员工产生了寒蝉效应,不敢再像以往一样自由发声、开展工作,而这种开放文化正是OpenAI过往引以为傲的特质。

在公开信中,三人向OpenAI的多个监督委员会提出了三点明确建议,希望公司能够坚守安全使命:

第一,兑现此前对第三方安全审计机构的合作承诺。三人强调,与AI安全生态的持续合作对OpenAI实现自身使命至关重要,今年夏天的Hugging Face事件调查及与外部审计机构的合作,是他们引以为傲的工作成果,帮助外界更清晰地了解前沿AI技术的真实情况。他们担心公司会以此次解雇为借口终止与METR的合作,或大幅限制外部机构的访问权限与工作范围,希望OpenAI能够兑现Sam Altman在9月12日做出的公开承诺,让独立评估人员能够持续进入公司开展工作,获得与内部员工相当的访问权限。

第二,保障前沿模型的可监测性。三人指出,当前行业尚未找到安全开发和部署无法有效监测的模型的方法,而前沿模型的可监测性正在持续下降。只要行业仍依赖可监测性保障AI安全,OpenAI及其他前沿AI企业就不应继续推进会进一步削弱模型可监测性的技术开发。他们认同相关业内人士的公开表态,即思维链可监测性十分脆弱且整体趋势不容乐观,希望能够防止行业陷入竞相开发不可监测架构的竞赛,支持员工推动相关协调工作。

第三,维护开放透明的内部讨论文化。三人认为,如果OpenAI的员工无法在内部安全提出担忧,或不敢通过高效渠道与外部安全机构合作,那么全球面临AI灾难性风险的概率将会大幅上升。他们敦促OpenAI公开重申对透明开放文化的承诺,让员工能够放心在内部和外部提出安全担忧,同时明确员工与外部安全机构合作的规范,消除大家对规则边界的模糊猜测。

三人最后表示,虽然已经不再是OpenAI的员工,但他们依然尊重过往的同事,希望内部员工能够继续督促公司坚守使命,因为OpenAI的核心价值离不开每一位员工的付出。

以上内容不代表本平台立场,仅供读者参考