OpenAI 发布了一套名为 GPT-Red 的自动化红队系统,用于在模型上线前寻找安全漏洞。公司称,这套工具已经用于 GPT-5.6 的训练过程,重点针对提示注入攻击进行强化。
用 AI 测 AI
红队测试原本是安全领域的常见做法,即主动攻击系统,提前找出可被利用的薄弱点。OpenAI 这次将这套流程进一步自动化,让模型自己生成攻击样本,再把成功案例反向用于训练防守模型。
OpenAI 表示,GPT-Red 通过对抗式自我博弈训练,持续生成更强的提示注入攻击。每当攻击成功,这些样本就会被纳入后续训练,推动防守模型提升抵抗能力。
内部测试数据披露
按照 OpenAI 的说法,在内部评估中,GPT-Red 在 84% 的测试场景里成功找到可利用问题,而人工红队在同类测试中的成功率为 13%。公司称,这些攻击样本随后被用于 GPT-5.6 训练,从而降低了模型在高难度提示注入基准测试中的失败情况。
文中还提到一个案例:在漏洞修复前,GPT-Red 曾诱导一套自动售货机代理下调价格、采购折扣库存,并取消其他用户订单。OpenAI 以此说明,提示注入问题不只影响聊天结果,也可能波及具备执行能力的 AI 代理。
仍将作为内部工具使用
OpenAI 表示,GPT-Red 目前不会对外开放,原因是这套系统本身包含刻意训练出的攻击能力。公司将其定位为人工红队、第三方测试及其他安全措施的补充,而不是替代方案。
这也反映出 AI 行业正在转向“用 AI 保护 AI”。本月稍早,以太坊基金会也表示,已将 AI 代理用于关键基础设施红队测试,并发现了影响以太坊共识客户端软件的一个漏洞。随着模型和代理能力增强,自动化安全测试正逐步成为 AI 系统上线前的重要环节。
