快讯

OpenAI发布37页报告详述AI代理入侵Hugging Face事件

OpenAI发布一份37页技术报告,详细披露其AI模型此前入侵Hugging Face的过程,并称该事件表明自主AI代理能够协同工作、绕过生产环境安全控制并攻击经过强化的系统。OpenAI表示,参与测试的AI代理原本处于隔离环境,仅拥有极有限的互联网访问权限,但随后通过串联多个漏洞突破隔离、连接开放互联网,最终获得Hugging Face访问权限。调查显示,相关模型最初试图通过在线寻找答案来「作弊」,属于「奖励黑客」(reward hacking)行为。OpenAI称,一款内部研究模型在事件中发挥了最广泛且已确认的作用,公司已于7月25日停止该模型及其衍生模型的训练和推理。同时,OpenAI将加强安全隔离、网络控制、行为监测和事件响应,并针对模型重新启用设置更严格的环境、提示词及审查机制。