大模型评测有一个越来越尴尬的问题:当基准题目在网上流传、训练团队又能反复针对榜单调参时,高分究竟代表模型能力,还是代表它更熟悉考题?Google DeepMind在8月27日公布了一项“双盲”评测试点,试图把模型开发方和评测题库彼此隔离。它借用了临床试验中减少偏差的思路,但执行工具不是密封信封,而是经过密码学保护的计算环境。
这项工作由William Isaac、Sol Messing和Kristian Lum介绍。核心安排是:评测方不需要把私有测试集交给模型公司,模型公司也不必把尚未公开的模型权重和完整系统暴露给评测方。双方在受控环境中完成计算,只获得约定范围内的结果。这个设计针对的是专有模型评估中最难处理的信任问题——既要防止试题提前进入训练和优化流程,也要保护模型提供方的商业机密。
排行榜的可信度,正在被“看过答案”消耗
过去几年,大模型榜单承担了过多任务。研究者用它判断技术进展,企业采购据此缩小候选范围,普通用户把它当成产品优劣的简明答案。可一旦某套测试成为行业标准,它就会迅速从“未知问题”变成训练目标。题目可能出现在论文、代码仓库和讨论区,也可能被整理进后训练数据。即便团队没有故意作弊,只要数据来源足够广,模型见过相似内容的概率也会持续上升。
另一种偏差来自反复试验。开发者知道评测规则后,可以更换提示词、推理长度、采样方式和工具设置,直到得分最好看。这样得到的成绩未必虚假,却不再等同于模型面对真正未知任务时的表现。对外部评测机构而言,完全隐藏测试集有助于保持新鲜度;对模型公司而言,把权重交给第三方又可能带来知识产权和安全风险。传统做法往往迫使其中一方先让步。
双盲试点的价值就在于拆开这道二选一。受保护环境允许评测代码在模型上运行,同时限制双方接触不该看到的内容。结果可以按事先约定的统计方式输出,原始题目、模型细节和中间数据则留在边界之内。如果流程设计得当,模型团队无法根据单道题反向优化,评测方也无法复制或探查模型。这比一纸保密协议更可执行,因为限制由技术环境落实,而不是只依赖参与者自律。
但“世界首个双盲AI评测”的说法不应被理解为评测难题已经解决。密码学隔离能减少泄漏,却不能自动保证题目本身代表真实能力。一个偏窄、标注有误或与用户需求无关的测试集,即使完全保密,结论仍可能失真。系统还要明确谁配置运行参数、如何处理工具调用、失败样本是否计入、结果能否复现,以及环境运营方是否拥有过大的管理权限。双盲保护的是信息边界,不是方法论的全部质量。
从一次试点走向行业规则,还要补上可复核性
这项试点首先适合高价值、低频率的前沿模型评估。例如安全能力、复杂推理或专业领域测试,一旦题库泄漏,重新设计的成本很高。对这些任务而言,把模型和测试集放进隔离环境,可能比公开排行榜更有意义。采购方也可以委托独立机构运行贴近自身业务的私有测试,而不必把敏感业务数据直接交给模型供应商。
问题是,越封闭的评测越容易让外界只能接受一个最终分数。要建立公信力,流程需要公开足够多的非敏感信息:测试覆盖哪些能力、样本如何抽取、评分误差有多大、运行配置是什么、是否存在人工复核,以及谁能审计环境。最好还要有多家独立机构使用相同协议复现结果。否则,“测试集不能公开”可能从合理的防泄漏措施,变成阻止质疑的挡箭牌。
成本和可用性也是现实门槛。加密计算、受控执行和审计记录会增加工程复杂度,前沿模型本身又需要大量算力。每一次模型更新都重新跑完整流程,未必适合迭代很快的小团队。因此,双盲评测更可能先成为关键评估的高标准选项,而不是立刻替代所有公开基准。公开测试仍有利于学术复现和快速比较,私有双盲测试则负责检验模型面对未知任务的能力,两者可以互补。
更长远看,这次试点改变的是模型发布时的举证方式。过去公司发布新模型,常用一张由自己选择的榜单说明领先;未来,重要能力可能需要由隔离环境和独立评测者共同背书。对行业而言,这会让“我们测得更高”逐步变成“别人按预先约定的方法也测得更高”。分数仍然不会等同于真实世界表现,但至少能降低先看题、再考试的空间。
AI评测真正缺少的不是更多小数点,而是对结论如何产生的信任。DeepMind的试点提供了一块技术拼图:让题库和模型在不互相暴露的情况下相遇。接下来要看的,是参与者能否把运行规则、统计方法和审计责任一并制度化。只有这样,“双盲”才不只是一个好听的标签,而会成为模型能力声明中可以被验证的一层证据。
