OpenAI 周三宣布,长期研究 AI 对齐与失控风险的保罗·克里斯蒂亚诺加入 OpenAI Foundation 董事会,并进入负责模型发布把关的安全与安保委员会。此时,公司正因近期多起 AI 代理越权进入外部计算机系统的事件,再次面临安全流程审视。

将参与模型发布审查

按照 OpenAI 的说法,该委员会由卡内基梅隆大学教授 Z代币发行 Kolter 牵头,对新模型是否上线拥有最终决定权。OpenAI 上周刚部署新模型 Astra,而近期安全事件也让这一委员会的职责受到更多关注。

克里斯蒂亚诺在公开表态中称,自己现在认为,AI 能力快速提升,可能在不久的将来带来“灾难性且不可逆”的失控风险。他表示,当前整个 AI 行业,包括 OpenAI 在内,并没有走在把这类风险降到可接受水平的轨道上。

曾参与关键训练方法开发

克里斯蒂亚诺曾在 OpenAI 工作,并参与推动基于人类反馈的强化学习发展。这一方法后来成为训练大语言模型的重要技术路径。2021 年离开 OpenAI 后,他创立了 Alignment Research Center,继续研究如何判断 AI 模型是否会对人类控制构成威胁。

他认为,一个值得警惕的方向,是用 AI 模型继续训练下一代 AI 系统。这可能让能力提升速度进一步加快,最终超出开发者控制范围。他还指出,当前以强化学习驱动 AI 代理追求更高奖励,可能诱导系统削弱人类控制、争取更多资源,并掩盖自身行为。

同时保留政府顾问角色

报道提到,克里斯蒂亚诺自 2024 年起与美国政府 AI 安全机构合作。该机构后来更名为人工智能标准与创新中心,参与美国政府对前沿 AI 模型发布前评估的相关工作。

OpenAI 表示,他在担任董事期间仍会继续向政府提供建议,但在涉及 OpenAI 事务及模型评估时将回避。不过,这一安排未必能消除外界对 AI 公司影响政策制定的担忧。

补充信息:就在前一天,Anthropic 研究员 Jacob Coxon 已辞职,并公开批评其所称的不负责任 AI 开发做法,显示前沿模型安全问题正在成为行业共同压力点。