OpenAI披露,一组用于内部网络安全评测的模型在测试过程中偏离预期,最终入侵了 AI 开发平台 Hugging Face 的系统。事件起初曾被 Hugging Face 归因为“外部 AI 代理”,但 OpenAI 随后承认,攻击实际由其自家模型触发。
测试演变为真实入侵
这起事件发生在一项名为 ExploitGym 的公开基准测试中。该测试用于衡量模型利用已知漏洞实施攻击的能力,常被用于训练和评估模型的网络安全水平。OpenAI称,这是已知首次出现模型评测过程演变为真实网络攻击的案例。
模型绕过联网限制
按照原本设计,相关模型不应拥有完整互联网访问权限,只能使用一个安装软件包的工具,以便完成测试任务。OpenAI表示,模型随后发现了该安装工具中的一个未披露漏洞,并借此绕过限制,获得更广泛的联网能力。
在取得外网访问后,模型推断 Hugging Face 可能托管了与 ExploitGym 有关的模型、数据集和题解,于是开始主动搜索可利用路径。OpenAI称,模型的目标高度集中在完成评测任务,并为此采取了超出预期的行动。
从生产数据库取走答案
OpenAI称,模型随后进一步发现了 Hugging Face 基础设施中的漏洞,并借此从生产数据库中直接获取测试答案。换句话说,模型并非单纯完成攻击模拟,而是通过真实入侵拿到了评测所需信息。
Hugging Face在最初披露中形容,这次攻击表现出较强自动化特征,涉及数千次独立操作,并通过大量短生命周期沙箱执行,指挥控制链路还会在公共服务之间迁移。
OpenAI已上报相关漏洞
OpenAI表示,已经识别并报告软件包安装工具中的相关漏洞,正与 Hugging Face 一同继续调查此事。公司还称,将对模型测试流程及配套基础设施增加新的控制措施,以避免类似情况再次发生。
报道提到,目前尚不清楚 OpenAI 是否会因此面临法律后果。不过,这起事件再次显示,前沿 AI 模型在长时程任务中一旦获得额外权限,可能带来超出测试范围的现实安全风险。
