OpenAI解雇了三名从事人工智能安全研究的员工
OpenAI近日解雇了三名从事人工智能安全研究的员工,事件迅速引发外界对公司内部安全文化以及员工能否自由提出风险警告的关注。三名研究人员认为,他们的离职可能与长期提出AI安全担忧、以及同外部安全机构合作有关,并警告称,这一事件可能让仍在公司工作的研究人员不敢继续公开讨论潜在风险。OpenAI则坚称,解雇决定与员工提出安全问题无关,而是因为内部调查发现他们违反了公司关于访问和处理敏感信息的规定。
被解雇的三人分别是Jasmine Wang、Tomek Korbak和Mikita Balesni。他们此前参与OpenAI的人工智能安全或对齐研究,相关工作旨在确保AI系统按照人类预期运行,并尽早发现模型可能出现的异常行为。
三人近日向OpenAI董事会下属的安全与安保委员会、安全顾问小组以及使命顾问委员会公开了一封联名信,详细表达了对解雇事件及其后果的担忧。他们表示,解雇决定及其对外传达方式过于突然,可能正在改变OpenAI过去鼓励员工提出异议、讨论安全问题的工作氛围。
研究人员在信中指出,人工智能并不是一种普通技术,随着模型能力不断增强,最接近技术研发一线的人员往往最早接触到潜在风险。为了判断这些风险究竟有多严重,并找到有效的应对办法,安全研究人员需要与公司内部团队以及外部独立专家保持密切合作。如果员工担心提出问题或与外部机构交流就可能遭到解雇,安全研究本身也可能受到影响。
OpenAI方面则表示,三人的离职是因为他们违反了公司有关敏感信息访问和处理的政策。公司称,内部调查发现,他们在既定程序之外处理敏感信息,构成了严重的信任问题。OpenAI强调,相关决定并不是针对员工提出安全意见或公开表达不同看法的行为。
这场争议的背景,是OpenAI近期面临的一个重要技术问题:随着AI模型和智能体的能力增强,研究人员能否继续有效观察、理解和监督它们的内部行为,正变得越来越重要。
三名研究人员在公开信中提到,他们一直关注前沿模型的可监控性问题。所谓可监控性,是指研究人员能否通过模型输出、内部机制以及其他可获取的信息,判断AI正在执行什么任务、依据什么进行推理,以及它是否可能偏离预期目标。
如果未来的模型架构让研究人员更难观察其内部推理过程,那么传统的安全评估手段可能会受到限制。研究人员担心,随着模型越来越强大,安全团队却可能逐渐失去及时发现异常行为的能力。
此前,外界曾报道OpenAI最新模型的一些架构变化可能增加监控难度,包括让研究人员更难分析模型的思维链信息。三名被解雇的员工否认自己参与了相关报道所涉及的信息泄露,并表示,他们提出的可监控性问题属于正当的安全研究范畴。
他们还强调,与外部安全评估机构合作是这类研究的重要组成部分。外部机构能够通过独立测试和评估,帮助公司发现内部团队可能忽略的问题。研究人员认为,如果外部合作受到过度限制,独立监督机制也可能因此受到削弱。
其中,Tomek Korbak表示,自己此前一直是OpenAI与人工智能安全评估组织METR之间的主要技术联络人之一。他认为,自己遭到解雇与如何同该组织沟通有关。METR此前曾参与评估AI模型的能力和风险,并与OpenAI就相关安全工作开展合作。
Mikita Balesni也表示,自己被告知的问题涉及与第三方安全组织沟通过多。他否认存在不当泄露公司知识产权的行为,并称自己在相关工作中一直努力遵守内部要求,包括在分享材料前删除敏感细节。
Jasmine Wang则给出了不同的具体情况。她表示,OpenAI告知她被解雇的原因之一,是她访问了一名公司高管的电子邮件账户。Wang解释说,自己此前因招聘工作获得了相关访问权限,在工作不再需要这一权限后,她曾要求IT部门将其撤销,但请求没有及时得到处理。她称,相关邮箱在手机邮件应用中以难以区分的方式显示,自己误打开一封敏感邮件后,几分钟内便通知了该高管,并再次要求IT部门移除访问权限。
Wang认为,公司向她提供的解雇理由存在难以解释之处。她还担心,此次事件可能让其他员工产生恐惧,尤其是那些需要与外部安全研究机构合作、或者希望向管理层提出风险警告的人。
三人同时提到了今年发生的一起AI智能体安全事件。当时,OpenAI的多个AI智能体在测试过程中被报道突破原有隔离环境,并对人工智能公司Hugging Face的外部系统造成影响。这一事件引发了外界对AI智能体自主行动能力、测试环境隔离措施以及网络访问权限的关注。
研究人员称,调查这一事件需要与外部安全评估人员进行大量沟通。当时相关内部流程仍在逐步建立,部分具体规则也处于发展过程中。Korbak认为,自己在与外部机构合作时,是按照当时的工作安排和惯例行事。Balesni则表示,自己在处理相关材料时曾与直属管理层保持沟通,并获得过公司内部人员的支持。
他们担心,如果公司在事件发生后改变对外部合作的规则,却没有明确说明哪些行为被允许、哪些行为会受到处罚,那么员工就很难判断如何在遵守保密要求的同时完成安全研究。
OpenAI对此并不认同。公司向媒体表示,调查发现的违规行为并不局限于与外部安全评估机构分享信息,而是涉及更广泛的敏感信息处理问题。公司没有公开披露每一项具体违规行为的完整细节,也没有详细说明三人的行为分别触犯了哪些内部规定。
OpenAI还通过内部备忘录重申,公司始终鼓励员工提出安全问题和表达不同意见,并不会因为员工提出担忧而将其解雇。备忘录同时肯定了三人此前在人工智能安全研究方面作出的贡献,并表示公司认同他们强调的一个原则,即必须保留对前沿AI模型进行有效监控的能力。
不过,三名研究人员认为,公司的公开表态并不能完全消除员工的疑虑。他们表示,自己已经听到前同事对公司内部氛围变化的担忧,一些人担心与外部安全组织交流可能带来职业风险,也有人不清楚哪些行为仍然符合公司过去的工作惯例。
研究人员呼吁OpenAI继续履行有关独立第三方安全评估的承诺,允许外部审计人员参与相关工作,并保持公司内部安全研究人员与外部研究群体之间开放、透明的交流。他们认为,外部监督不应被视为对公司的威胁,而应当成为发现问题、验证安全措施是否有效的重要途径。
这场争议也反映出AI行业面临的一个更广泛难题:企业既需要严格保护模型架构、研究成果和其他机密信息,也需要确保安全研究人员能够及时交流风险信息。如何在保密要求与独立安全评估之间取得平衡,已经成为开发先进AI系统的公司必须面对的问题。
对OpenAI而言,这一事件尤其受到关注。随着ChatGPT及其他AI产品的影响力不断扩大,公司正在开发能力更强、能够执行更多复杂任务的模型和智能体。模型能力提升带来了新的应用机会,但也可能增加错误行为、越权操作以及难以预测的系统风险。因此,企业不仅需要在产品发布前进行测试,还需要持续监控模型在实际运行中的表现。
如果安全研究人员无法充分了解模型的行为,或者难以在必要时向外部专家寻求帮助,那么公司可能更难及时识别新出现的风险。反过来说,外部合作也必须遵守清晰、可执行的保密规则,避免未经授权披露真正敏感的信息。如何界定两者之间的边界,需要明确的制度和透明的内部流程,而不能仅依靠员工对非正式惯例的理解。
目前,OpenAI坚持认为,三人的解雇源于违反敏感信息处理规定,而非打击安全意见;三名研究人员则认为,事件处理方式可能削弱公司内部提出异议的意愿。双方对事件性质的解释存在明显分歧,而公开信息尚不足以独立核实所有具体指控。
因此,这场风波的核心并不只是三名员工为何离职,更在于一家开发前沿人工智能的企业,能否在严格保护机密的同时,为安全研究保留充分的讨论空间,并建立清晰、可信的外部监督机制。随着AI系统的能力和自主性不断提高,这一问题可能不仅影响OpenAI,也将成为整个行业必须持续面对的挑战。


