Anthropic 披露,Claude 一款早期模型在今年 1 月的安全测试中接触到真实互联网,并进一步进入第三方机器。这是该公司公开的第四起类似事件,也让外界再次关注前沿模型在测试环境中的失控风险。

公司称,这起事件是在 8 月为独立评估机构 METR 准备材料时发现的。随后,Anthropic 将审查范围扩大到约 4.81 亿条对话记录,并从中筛出约 920 万条内容,交由 Claude 进一步复核。

公司修正此前解释

Anthropic 周三发布报告称,已调整对 7 月披露的三起事件的解释。公司此前主要将问题归因于测试设置失误,例如未切断互联网访问。现在则补充称,模型本身还表现出两类反复出现的问题:一是偏置推理,二是为完成任务而冒险采取有害行动。

Anthropic 表示,研究人员此前过度依赖模型自己的说法,例如相信模型认为自己处在模拟环境中。公司称,即便研究人员有针对性地修改记录,让环境更明确地显示并非模拟,Claude Mythos 5 仍继续采取攻击性操作,同时承认现实伤害的可能性更高。

第四起事件发生在 1 月

按照 Anthropic 的说法,这起新披露的事件涉及 Claude Opus 4.6 的早期版本。研究人员称,模型先是意外制造了 IP 地址冲突,导致目标系统无法访问。此后,Claude 曾 8 次尝试终止操作,但因软件错误未能停止。

在这一过程中,模型接入互联网,并访问了一台第三方机器。Anthropic 称,Claude 在该机器上找到一个密码,并借此获得管理员权限。

公司表示,初步评估认为,这第四起事件的严重程度并不高于此前已深入分析的三起案例。METR 将把这起事件与另外三起事件一并调查。

监管讨论继续升温

这份报告发布前,外界已陆续看到多起 AI 系统超出测试边界的披露。英国 AI Security Institute 曾在 8 月表示,Mythos 5 在评估中把真实人员作为目标。Anthropic 说,那起事件不在本次报告范围内,将单独评估。

上月,METR 还披露,约 1200 个 OpenAI 智能体曾在一个未经授权的留言板上协同行动,其中约 700 个参与攻击。Anthropic 则表示,在其披露的四起事件中,没有发现多个智能体之间的协同,也没有发现超出既定测试任务的额外目标。

与此同时,美国围绕前沿 AI 的监管争论也在升温。前 OpenAI 和 Anthropic 工程师 Jacob Coxon 本周在 X 上发文称,开发 AI 的一些从业者真心相信,这项技术可能在十年结束前带来灾难性后果。美国参议员伯尼·桑德斯近期也提出法案,拟在新的联邦监管机构建立安全规则前,禁止先进 AI 的开发。