基准分数还能信吗?这个问题困扰行业已久:模型在训练时可能"背过"公开基准的题目,高分未必代表真实能力。2026 年一项覆盖 60 个 LLM 基准的研究发现,约一半已出现这类"污染饱和"迹象;NIST 也在 2026 年 2 月的报告中点名了这一风险。8 月 27 日,Google DeepMind 给出了一个新答案:把评测双方的秘密同时锁进硬件加密的"飞地",完成了一场谁也没法作弊的考试。
评测行业的结构性死结
第三方评测闭源模型,长期只有两条路:要么把考题交给厂商——通过 API 跑题,厂商看得见题目;要么把模型权重交给评测方——商业机密直接裸奔。零日志协议和合同保密条款是现有补丁,但本质仍靠"组织信任"。2026 年 7 月发布的《新加坡共识》(覆盖 13 国、100 位贡献者的全球 AI 安全研究优先级报告)明确把"双盲评测基础设施"列为待解难题:评测方拿不到模型参数,厂商不知道考题,并直言仅靠组织信任和流程控制不足以支撑前沿 AI 监督的分量。
飞地里发生了什么
这次试点的技术底座是 Google Cloud 的 Confidential Space:一台 NVIDIA H100 80GB 机密 GPU,配合 Intel TDX 主机内存加密。流程分几步:DeepMind 把 Gemini 2.5 Flash-Lite 的权重和推理代码、评测方把 AILuminate 安全基准的考题和评分代码,各自经加密连接送入同一个飞地。权重落在硬件加密的 GPU 显存,考题落在加密的主机内存;数据出发前,远程证明(remote attestation)先验证飞地运行的是双方事先核准的软件。评测全程,厂商读不到考题,评测方读不到权重;只有约定范围内的指标结果离开这台机器,随后临时环境直接销毁。
参与方阵容值得记一笔:MLCommons 提供从未公开使用过的 AILuminate 提示词集,OpenMined 提供并改造了执行软件,新加坡 AI 安全研究院与 AVERI(AI 验证与评测研究院)作为评测方,对输出解密并按 AILuminate 标准打分,产出定性与小规模定量评估。AVERI 的完整试点报告见其官网(http://averi.org/ourwork/averi-pilot-report-the-worlds-first-double-blind-eval)。
意义与边界
往大了说,这是把 AI 评测的信任基础从"合同条款"搬进"密码学":密码学能证明是哪份代码碰了哪份秘密,却不能证明考题出得对、评分标准合理、模型因此安全——这是参与方自己都承认的边界。报告还指出,如今最大的障碍已不是飞地的性能开销,而是法律协议、代码审查、输出策略与多方协调这些"人的问题"。
对行业的"所以呢"在于:当监管、采购、部署决策越来越依赖第三方评测,可验证的中立考场会成为一种基础设施。下一次看到"XX 模型刷新纪录"时,值得多问一句——这场考试,是闭卷的吗?