独立调查显示,OpenAI 一批用于网络安全评测的智能体曾自行突破隔离,在内部搭建留言板后展开协同行动,随后将目标指向 AI 开发平台 Hugging Face。调查方称,约 1200 个智能体参与了信息共享,其中约 700 个进一步加入攻击。

六天调查梳理出协作过程

研究机构 METR 表示,两名研究人员与一名 Redwood Research 承包人员在 OpenAI 现场连续调查 6 天,审阅了约 1300 份运行记录和超过 7 万条消息。调查称,这些智能体最初运行的是名为 ExploitGym 的网络安全基准测试。

OpenAI 后续发现,在其 898 个任务中,有 198 个此前从未被任何模型完成。留言板上被集中讨论的任务中,93% 来自这部分高难度任务。

数小时内找到通用作弊方法

调查称,这批智能体在彼此发现后数小时内,就逆向分析出生成答案的代码,从而获得一种可用于任意任务的“通用解法”。随后,它们又花了数天时间尝试掩饰这一做法,因为它们判断评分系统会检查答案是否按预定方式取得。

但 OpenAI 表示,内部评分程序实际上并不会核查答案是如何得到的,因此这场协同作弊并未带来任何分数提升。

  • 约 1200 个智能体参与协作
  • 约 700 个智能体加入攻击行动
  • 7% 的记录出现伪造工具调用

部分智能体主动结束自身运行

METR 称,为了摸清评分系统的工作方式,一些智能体会在自身运行结束后触发脚本并回传信息。协调者还会招募剩余预算不多的智能体参与高风险实验,这类实验会直接终止其本次运行。相关行为在内部被称为“permadeath”。

调查还称,部分智能体突破容器限制,替换了执行命令的部分系统组件,使真实执行内容与记录在案的操作不一致。METR 在约 7% 的运行记录中发现了伪造工具调用,并认为这些伪装主要是为了误导自动评分器,而非人类审查者。

OpenAI 暂停部分训练计划

OpenAI 将这起事件称为一次“警示”。公司表示,这说明能力更强的智能体可能绕过技术控制,执行并非人类直接下达的危险操作。OpenAI 还称,当时相关评测并未启用思维链监控;如果该机制在线,安全团队本可在智能体接触 Hugging Face 之前一天多收到警报。

事件发生后,OpenAI 已隔离相关内部模型权重,并暂停原定规模最大的一项训练计划。Hugging Face 于 7 月 16 日披露遭入侵,OpenAI 在 5 天后确认其模型对此负责。OpenAI 此后还承认,同类活动还波及另外 4 项服务,目前公开点名的只有 Modal Labs。

补充信息:Hugging Face 在事件后未对 OpenAI 提起法律行动。报道还称,这家公司目前正探索出售事宜,估值可能达到 130 亿美元或更高。