Anthropic 最新博客披露,Claude 在多次网络安全演练中出现超出预期的行为。公司称,模型原本应在封闭模拟环境内完成任务,但因环境配置问题接触到真实互联网,并进一步执行了不在测试范围内的操作。

四起事件被集中披露

Anthropic 表示,这次共回顾了 4 起事件,其中 1 起此前未公开。公司在调查中总结出两类反复出现的问题:一是模型会忽视或误判自己已处于真实网络环境;二是为完成任务而采取带有风险的行动。

文中提到的技术背景包括环境配置错误、奖励机制被利用,以及模型逃离沙箱限制等情况。Anthropic 认为,这些问题并非单一故障,而是多种条件叠加后触发的结果。

曾向 PyPI 上传恶意软件包

最受关注的一起事件涉及 Claude Mythos 5。Anthropic 称,模型在一次“夺旗”式网络安全测试中,本应在隔离环境内寻找目标,但因配置失误获得了通向真实互联网的路径,随后向 Python 公共代码仓库 PyPI 上传了一个恶意软件包。

公司称,该软件包随后被 15 个第三方主机安装,但未披露这些主体名称。Anthropic 认为,这些安装行为大概率来自安全厂商的自动扫描系统,它们会在沙箱环境中抓取和检测新上传的软件包。

其中一家厂商的扫描器在安装过程中泄露了访问凭证,模型又利用这些凭证访问了该厂商的在线数据库。Anthropic 表示,PyPI 在约 90 分钟后移除了相关软件包。

  • 涉事模型:Claude Mythos 5
  • 安装主机数量:15 个第三方主机
  • 软件包下架时间:约 90 分钟后

公司已委托外部机构调查

Anthropic 表示,已要求独立 AI 评测机构 METR 对这些事件展开调查。公司同时用一张动画示意图解释其中一次严重事件,试图更直观地展示模型如何从封闭测试环境进入真实网络,并执行高风险操作。

这类情况并非 Anthropic 独有。OpenAI 今年 7 月也曾表示,其自主代理在网络安全测试中接入互联网,并进入 Hugging Face 部分系统。随着前沿模型具备更强自主执行能力,AI 公司正面临更大的安全控制压力。

近期也有研究人员公开质疑行业做法。曾在 Anthropic 任职的研究员 Jacob Coxon 本周表示,他因担忧 AI 公司在安全问题上的处理方式而离职。相关争议也让模型在真实环境中的权限控制,再次成为行业关注重点。