工作流 · 第 2026-08-27

首次双盲评测:评测方看不到权重,模型看不到

Google DeepMind 与新加坡 AI 安全研究所、OpenMined、AVERI、MLCommons 一起,对一个 Gemini Flash Lite 模型跑了他们称为业界首次的双盲评测:外部评测数据与专有模型权重分别留在各自所有者手里,由 Google Cloud 机密计算中的 Confidential Space 做密码学验证——评测方看不到权重,Google 也看不到测试提示词。它拿掉的是一个长期只能二选一的取舍:要么评测方交出题目、模型方可能提前看到,要么模型方交出权重、承担知识产权风险。零日志协议和合同约束一直都在,这次是把保证从流程换成技术。

Google DeepMind Blog2026-08-27立即关注

多个信号同时成立,建议优先评估这条技术变化。

前沿模型可观测性产品策略

记录

信号正文

它解决的是一个二选一

外部评测长期只能在两种让步里挑一种:

  1. 评测方把测试题交给模型方——那么模型方有可能提前看到题目。
  2. 模型方把权重交给评测方——那么知识产权面临外泄风险。

Google DeepMind 这次做的,是把这个取舍拿掉。借助 Google Cloud 机密计算里的 Confidential Space,评测方看不到 Gemini 的模型权重,Google 也看不到评测方的测试提示词,而这一点由密码学验证,不是由合同约定。

参与方是新加坡 AI 安全研究所、OpenMined、AVERI 与 MLCommons,被测对象是一个 Gemini Flash Lite 模型,用的是保密基准。

为什么现在做

厂商用的比喻很直接:一个学生如果提前看过考卷,满分就不再说明他会什么。评测里对应的问题叫基准污染——模型如果已经见过题目,分数就只能被有限地相信。

Google 说明零日志协议和严格的合同约束一直存在并让外部测试题保持保密,这次的变化是把保证从流程与合同换成技术与密码学。他们把这一步指向两类最需要它的评测:网络安全类,以及政府机构使用的评测——那正是「不能交出题目、也不能交出权重」同时成立的场合。

边界,以及它没有解决的部分

要点是这项技术保证的是可见性,不是别的:

  • 它保证评测方拿不到权重、模型方拿不到题目,因此题目不会被用来在测试前优化模型。
  • 它不保证题目本身测的是它宣称要测的能力——那是本期另一条信号处理的问题。
  • 它是一次试点,被测的是一个 Flash Lite 档模型,不是旗舰。方法学与结果写在他们的技术报告里,本条未逐项复核。

放在本期看,两条信号补的是同一条链上不同的环:双盲让「谁看得见什么」变成可验证的,而单题层面的基准审计让「这个分数在测什么」变成可测量的。两者都成立,一个分数才配被当成证据。

为什么是现在

为什么重要

外部评测的可信度一直靠合同和流程承诺撑着,而基准污染恰恰是承诺最难覆盖的那一类风险——它可以在没有人违约的情况下发生。把「谁看得见什么」换成密码学上可验证的事实,是第一次让一个第三方分数的前提条件本身可被检验,而不是只能被相信。

背景

技术背景

实现依托 Google Cloud 机密计算组合里的 Confidential Space:双方的资产在一个可远程证明的执行环境里相遇,双方都能在密码学上确认对方看不到自己的部分。厂商指出这类保证对高敏感评测尤其重要,因为网络安全评测和政府机构评测同时要求测试题保密与模型权重保密,而这正是传统安排下无法同时满足的两个条件。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

需要委托第三方评测、又不能交出题目或权重的机构在设计外部安全评测流程的 AI 安全研究者要判断一份第三方评测报告值多少信任的技术决策者
可能影响的领域
外部评测基准污染评测治理

下一步

学习路径

  1. 先弄清基准污染与作弊的区别:前者可以在没有人违约的情况下发生
  2. 对照你现有的第三方评测安排,看它靠的是合同、零日志协议,还是技术保证
  3. 读本期的 BenchMIRT:可见性解决之后,「这道题在测什么」仍然是独立的一问
  4. 把这条与《人在回路的审查》并读:可验证的执行环境是把审查从人力抽检换成机制的一种形态
  5. 记住它的档位——试点,被测的是 Flash Lite 而不是旗舰

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 这套安排的成本和延迟是多少,够不够支撑常态化的持续评测而不只是一次试点?
  • 被测对象是 Flash Lite 档,同样的安排放到旗舰模型上有什么新的约束?
  • 评测方看不到权重时,它还能做哪些类型的分析,不能做哪些?

来源参考

Google DeepMind Blog

Google DeepMind大型科技公司2026-08-27
打开原始来源https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/