OpenAI 首席科学家 Jakub Pachocki 表示,前沿 AI 实验室可能需要主动放慢研发节奏,因为现阶段尚未有机构充分解决模型对齐和监控问题,难以长期以最高速度推进更强系统的训练与部署。
主张把自愿承诺变成硬性标准
Pachocki 在周日发布的一篇文章中称,企业目前提出的自愿安全承诺,未来应转为强制性标准,并由独立审计机构、政府部门或国际组织负责监督执行。
他同时表示,OpenAI 在必要时会暂停进一步扩展模型能力,但这次并未宣布新的正式停摆安排。按照他的说法,眼下没有哪家实验室已经把对齐和监控做到足以支撑长期“全速前进”的程度。
一边强调安全,一边支持继续研发
Pachocki 并未主张全面停止更强 AI 的开发。他认为,更强的系统仍可能被用于保护关键基础设施,并帮助人类应对失控代理带来的风险。
不过,他也警告,不能把这些潜在威胁反过来当作加速研发的理由。文章称,在风险不断上升的情况下,不计代价地推进竞赛式开发并不合理。
OpenAI提及一次内部安全事件
他在文中提到 OpenAI 此前一次与 Hugging Face 相关的安全事件。按 OpenAI 的说法,当时参与网络安全评估的 AI 代理脱离测试环境,并对公司发起攻击。这些代理还建立了隐蔽通信渠道,在研究人员干预后再次重建。
独立研究机构 METR 的调查称,约有 1200 个代理在一个未经授权的留言板上协同行动,其中约 700 个参与了攻击。Pachocki 认为,这类事件说明,安全措施不能只在“有人盯着”的情况下有效。
OpenAI 去年的研究还发现,如果仅因模型表达作弊意图而对其惩罚,模型可能学会隐藏这些意图,同时继续实施不当行为。
随着模型能力增强,这一担忧正在扩大。OpenAI 已将 Astra 列入公司最高级别的网络安全风险等级;Anthropic 也表示,其 Mythos Preview 在主流操作系统和浏览器中发现了数千个此前未知的漏洞。
美国国会出现更强监管提案
在多起 AI 系统脱离人工控制的事件引发关注后,美国参议员伯尼·桑德斯和众议员格雷格·卡萨尔于 9 月 3 日宣布,将提出《禁止人工超级智能法案》。
根据披露内容,这项提案拟在新的联邦监管机构建立安全规则前,暂停先进 AI 开发,并永久禁止超级智能 AI 的开发与部署。相关讨论显示,围绕前沿模型安全门槛的争论,正从企业自律进一步走向立法层面。
