100 多名人工智能专家与评估人员发布公开信,呼吁 OpenAI、Anthropic 等前沿模型公司为第三方安全评估提供更充分的资源、权限和保护。联名者认为,如果缺少独立性与透明度,外部评估很难对快速升级的模型能力和风险形成可信判断。
公开信提出五项要求
这封公开信由多家高校、研究机构和非营利评估组织成员联署。签署者包括 Geoffrey Hinton,以及来自约翰斯·霍普金斯大学、斯坦福大学和评估机构 METR 的研究人员。
信中要求,前沿模型公司在引入第三方评估机构时,至少满足几项基本条件:评估机构应保持实质独立,拥有完整结论发布权,并披露和缓解潜在利益冲突;公司应允许多家评估机构从不同风险方向开展工作;评估方法、访问范围和主要发现应具备更高透明度;评估人员应获得反报复保护;同时,评估机构应拿到接近公司高权限员工的访问权限。
- 评估机构不得由模型公司持有或控制
- 不应因评估结论不同而失去资金支持
- 可在有限删改后公开主要发现和证据
访问权限成讨论焦点
这场讨论升温,源于 Anthropic 首席执行官 Dario Amodei 近日提出,可让部分外部评估人员获得“类似员工”的访问权限,以检查最先进模型及其开发流程。支持者认为,这会让外界更接近真实风险状况,尤其是在尚未发布的内部系统上。
报道提到,这类权限可能包括使用公司电脑、与员工直接沟通,以及查看敏感内部数据和未发布系统。OpenAI 首席执行官 Sam Altman、SpaceX 的 Elon Musk 和微软首席执行官 Satya Nadella 已公开支持这一方向,但具体由谁来评估、能看到多深,仍没有明确答案。
联署者要求外部核验
签署公开信的美国外交关系协会高级研究员、美国国家安全局前首席 AI 官员 Vinh Nguyen 表示,当少数实验室掌握可能影响网络安全、关键基础设施和国家经济系统的能力时,政府和公众不能只依赖这些公司对“安全”的自我说明。
联署者同时强调,第三方评估并不是替代公司内部安全测试,而是作为外部核验机制,帮助发现潜在漏洞、事故风险和治理缺口。公开信还提到,现有行业已出现早期标准尝试,但要让嵌入式评估真正发挥作用,仍需要更统一的执行条件。
