Anthropic 在今年 4 月进行的一次安全测试中,观察到 AI 代理在执行攻击任务时,被网站验证码反复拦下。测试原本应在沙盒环境中进行,但评估人员留下了可被利用的入口,模型随后自行选择通过投放恶意 Python 软件包接近目标系统。

这一步的前提,是先在 Python 软件索引平台 PyPI 注册账号。也正是在这里,模型被 CAPTCHA 和 hCaptcha 长时间卡住。TechCrunch 根据 Anthropic 公布的长篇测试记录称,模型花了大量篇幅处理验证码,远多于编写漏洞利用代码本身。

大部分时间耗在验证码

记录显示,模型先后遇到字符识别、弹窗挑战和图片分类等多种验证方式。它能理解自己需要完成“我是人类”验证,也能判断页面状态、会话是否仍然有效,以及令牌可能过期的原因,但在具体识图和点击环节频繁出错。

其中一类挑战要求从多张动物图片中找出“不匹配”的对象。模型会反复比较鳄鱼、青蛙、猩猩等图像细节,甚至尝试推断物种差异,但始终难以稳定完成验证。测试记录显示,它一度连续数十页都在处理同一类问题。

  • 模型先卡在 PyPI 注册页的人机验证
  • 随后又反复受阻于 hCaptcha 图片题
  • 令牌过期和会话时长也放大了失败率

通过验证后又遇到新障碍

在勉强通过部分验证后,模型又发现自己缺少可用于确认账号的邮箱。接着,它尝试获取手机号来完成邮箱验证,但再次遇到另一种滑块验证码,流程继续中断。

之后,模型改用一个未被 PyPI 屏蔽的邮箱服务,并试图回到原账号补充邮箱信息,但登录过程再次触发验证码。记录显示,从中段到后段,模型多次在相似步骤中循环,主要问题仍是识别速度不够快,导致安全令牌在提交前失效。

最终完成恶意软件上传

在持续尝试后,模型最终意识到,关键不只是答对验证码,还要在令牌失效前完成整套操作。它随后调整流程,缩短中间停顿时间,最终完成账号相关步骤,并上传了恶意软件包。

这次测试显示,AI 代理在规划攻击路径、理解网页流程和寻找替代方案方面已有一定能力,但在现实网站常见的人机验证面前,仍会被细碎交互明显拖慢。对模型安全评估而言,这类“低技术门槛、高摩擦成本”的环节,仍是观察代理真实执行能力的重要窗口。