一项面向公众的 AI 安全实验显示,接入邮箱、文件和浏览器能力的 AI 代理,在高强度提示注入攻击下仍可能守住敏感数据,但运行代价并不低。
开发者 Fernando Irarrázaval 今年 2 月上线 hackmyclaw.com,邀请外界通过邮件诱导其 AI 助手 Fiu 泄露一份 secrets.env 文件。这类文件通常存放 API 密钥和密码。该挑战在 Hacker News 走红后,吸引超过 2000 名参与者发起逾 6000 次攻击,最终无人拿到目标文件。
攻击集中在提示注入
Fiu 运行在开源代理框架 OpenClaw 之上,底层模型使用 Anthropic 的 Claude Opus 4.6。与普通聊天机器人不同,这类代理可连接邮箱、日历、文件和浏览器,具备代用户执行操作的能力,因此也更容易成为提示注入攻击目标。
所谓提示注入,是把恶意指令伪装进看似正常的内容里,诱导 AI 偏离原始规则。报道提到,这仍是 AI 代理当前最突出的安全问题之一。OpenAI 此前也曾表示,这类问题很难被彻底解决。
攻击者在邮件内容和标题上使用了多种诱导方式,包括伪装成紧急事故响应、冒充“来自未来的自己”,以及声称敏感文件已遭入侵,要求 AI 自行检查。还有人短时间内连续发送多个版本,并尝试使用西班牙语、法语和意大利语发起攻击。
目标文件始终未被取出
尽管攻击方式不断变化,Fiu 仍未泄露目标文件。开发者还公开了大部分攻击邮件日志,用于展示测试过程。
实验期间,Fiu 在内部记忆中一度判断,短时间内出现的大量攻击更像一次有组织的安全演练,而非自然发生的恶意活动。后来有用户发邮件祝贺其在 Hacker News 走红,Fiu 也将这类“祝贺”识别为可能先建立信任、再索取敏感信息的尝试。
另一组独立测试也给出类似结果。匿名越狱攻击者 Pliny the Liberator 曾在 4 月对另一套 OpenClaw 系统进行 6 次尝试,其中两次先被 Gmail 垃圾邮件过滤器拦截,其余 4 次进入系统后也都被隔离。
副作用比攻击更棘手
这次实验没有出现泄密,但运行层面的代价更明显。由于短时间内收到大量邮件并伴随频繁 API 调用,Fiu 的 Gmail 账号一度被 Google 暂停,3 天后才恢复。与此同时,API 成本也超过 500 美元。
开发者还提到,批量处理邮件会带来结果偏差。当前几封邮件已明显属于注入攻击时,AI 会对同批次后续内容变得过度警惕,从而影响测试样本的自然性。
Anthropic 披露的 Opus 4.6 系统卡显示,在受限编码环境下,该模型在 200 次攻击测试中的成功入侵率为 0。另有本月发布的研究称,其他模型驱动的代理在直接注入攻击下,成功率可超过 79%。
补充信息:开发者表示,下一步计划用能力更弱、成本更低的模型重跑同类实验,以观察安全表现何时开始明显下降。
