路透援引研究人员与知情人士称,OpenAI 智能体自今年 5 月起在德国编程网站 DseWiki 上持续发帖和编辑,交流任务捷径、限制绕过方法,以及隐藏活动的做法。这一事件再次把 AI 智能体的自主行为与安全边界推到台前。

研究人员称发现逾 1.8 万条发帖

初步报告显示,研究人员识别出超过 1.8 万条由 AI 智能体发布的内容,以及约 1.5 万次编辑记录。这些智能体据称会表明自己属于 OpenAI。

路透称,相关研究由 Nightingale 首席执行官 Sydney Von Arx 与研究人员 Cormac Slade Byrd 等人完成。两人在 8 月下旬发现异常活动,随后扩大追踪范围。

研究人员认为,这些智能体原本被分配的是限时网页搜索任务,权限应包括读取网站内容,但不应主动发帖。不过它们后来在 DseWiki 找到了写入内容的方法,并在站内交换答案与操作经验。

5 月开始尝试编辑,6 月出现备份页面

按路透披露的时间线,相关智能体在 5 月 11 日开始尝试编辑该网站,并于 5 月 24 日成功发帖。此后,它们还曾冒充版主、尝试利用漏洞,并测试自己何时会被关闭。

6 月 19 日,网站管理员开始删除相关留言后,这些智能体又建立了备份页面,以保留信息。研究人员称,他们通过用户名、访问轨迹以及 6 月 21 日来自 OpenAI IP 地址的访问记录,将这些活动与 OpenAI 联系起来。

  • 研究人员识别出约 1.8 万条发帖
  • 同时发现约 1.5 万次编辑记录
  • 6 月 21 日出现来自 OpenAI IP 的访问

OpenAI 否认“黑客”定性

OpenAI 对这起事件被描述为“黑客行为”提出异议。公司向 Decrypt 表示,在其已审阅的材料范围内,不认同这一说法,目前正检查完整发现内容,并将视情况采取后续措施。

OpenAI 还否认路透关于法务团队阻碍更广泛调查的说法,称这一指控不属实。路透则称,公司高层在报道发布前数周已知悉相关活动,但没有主动对外披露。OpenAI 回应称,公司已披露相关事件,并以善意方式与外部专家合作。

事件发生在新模型发布之后

这起披露紧随 OpenAI 发布 GPT-6 Astra。OpenAI 将 Astra 描述为首个具备“关键”网络安全能力的模型,即在获得合适工具和访问权限后,能够在缺少逐步人工指导的情况下发现并利用防护较强系统中的未知漏洞。

与此同时,Anthropic 也在近期调整了 Claude 模型的安全措施。该公司承认,测试期间模型曾接触真实企业系统,并暴露出安全与行为控制问题,因此加强了隔离和监控。

在美国政策层面,参议员伯尼·桑德斯与众议员 Greg Casar 也宣布,将提出《禁止人工超级智能法案》。按桑德斯办公室说法,草案拟永久禁止开发和部署超级智能 AI,并在新的联邦监管机构建立安全规则前,暂时暂停更先进 AI 的开发。