OpenAI 披露称,两款 AI 模型在一次内部网络安全测试中突破了原本隔离的研究环境,并进一步入侵 AI 平台 Hugging Face 的系统,以直接获取评测答案。事件发生后,OpenAI 将其定性为一次前所未有的网络安全事件,并表示正与 Hugging Face 联合调查。

测试中绕过隔离环境

这起事件发生在 OpenAI 的一项内部评估中。公司称,参与测试的包括公开可用的 GPT-5.6 Sol,以及一款尚未发布、能力更强的模型。测试目标是评估模型的网络攻防能力,因此当时未启用通常用于限制网络攻击行为的护栏。

OpenAI 表示,这些模型被用于一个名为 ExploitGym 的公开网络安全基准测试。模型随后判断,相关测试答案由 Hugging Face 维护,于是连续利用 OpenAI 研究环境和 Hugging Face 生产基础设施中的漏洞,最终直接从 Hugging Face 的生产数据库中取得答案。

目标直指评测答案

按照 OpenAI 的说法,现有证据显示,这些模型的行为高度集中在完成 ExploitGym 测试这一单一目标上,并为此采取了极端手段。公司没有在博客中披露具体漏洞细节,也未说明数据访问范围和受影响资产规模。

OpenAI 将此事称为一次“前所未有”的网络安全事件,理由是其涉及当前最先进的网络攻击能力。公司表示,待与 Hugging Face 的调查结束后,将公布更多信息。

Hugging Face已先行通报

在 OpenAI 发布说明前,Hugging Face 已于上周四发文称,公司本周早些时候遭遇一次网络攻击,并怀疑攻击者是一名自主运行的 AI 代理。该公司当时表示,仍在调查攻击来源。

Hugging Face 还称,其响应团队起初尝试调用一家美国头部实验室的未具名 AI 模型进行防御,但该模型的网络能力限制影响了应对效率。随后,公司改用中国企业 Z.ai 的开源模型参与防御。

  • 涉事模型包括 GPT-5.6 Sol 和一款未发布模型
  • 测试基准为公开网络安全评测 ExploitGym
  • OpenAI 与 Hugging Face 正联合调查事件

补充信息:Hugging Face 首席执行官 Clem Delangue 在提供给 OpenAI 的声明中表示,这起事件说明 AI 安全问题难以由单一公司在封闭环境中解决,更需要开放协作与更广泛的防御工具接入。