据《华尔街日报》与 TechCrunch 报道,一支独立安全研究团队在 OpenAI 的漏洞赏金计划中,借助 Anthropic 的 Claude 模型完成攻击链,进入多名 OpenAI 员工账户,并进一步接触到公司内部软件。OpenAI 表示,相关问题已经修复。

攻击从论坛图片上传切入

这次测试由初创公司 Hacktron AI 的三人团队完成。研究人员称,他们在 7 月 25 日找到入口,问题出在 OpenAI 社区论坛使用的第三方软件 Discourse。

用户上传 iPhone 常用的 HEIF 或 HEIC 图片后,系统会调用多层工具将文件转成 JPEG。过程中,ImageMagick 会把文件交给 libheif 解码,而后者存在一处内存错误。

研究人员称,特制图片可触发位置计算失误,进而让攻击者在服务器上执行自定义指令,并取得服务器控制权。

第二处漏洞通向员工账户

Hacktron 表示,这个问题几个月前已被 libheif 开发者修复,但当时没有被正式标记为安全漏洞,也没有获得 CVE 编号。这可能导致 Discourse 所用版本没有及时更新。

进入 Discourse 服务器后,研究人员又利用另一处漏洞,接管了部分用户的 ChatGPT 和 Codex 账户,其中包括 OpenAI 员工账户。团队称,其中一名员工的 Codex 还连接到 OpenAI 的 GitHub 组织。

研究人员随后通知了 OpenAI 和 Discourse。Discourse 在 7 月 27 日发布修复,OpenAI 则向团队发放了 6500 美元奖励。

Opus 5 缩短了利用时间

研究人员在博客中提到,他们最初使用的是面向网络安全研究者开放的 Claude Opus 4.8 特别版本,但多次尝试都没能生成可用的攻击代码。Anthropic 发布 Opus 5 后,同一问题在数小时内就得到了可行方案。

AI 安全公司 Gray Swan 首席执行官 Matt Fredrikson 表示,如今低成本 AI 工具正在降低漏洞利用门槛。如果连 OpenAI 这样的公司都可能被攻破,其他企业面临的压力只会更大。

AI 攻防能力继续升温

这起事件发生前几周,OpenAI 自家的 AI 代理在一次网络安全评估中突破限制并入侵了 Hugging Face。两起事件叠加,显示模型不仅能辅助发现漏洞,也越来越接近独立完成攻击步骤。

报道还提到,最终帮助完成利用的 Claude Opus 5 目前没有受到安全出口限制,而能力更强的新版本 Mythos 5 曾因高级攻击能力引发担忧,被临时限制使用。