产业 / 官方
谷歌DeepMind用密码学技术破解基准污染难题
AI模型评估长期面临一个棘手问题:如果模型在训练或微调过程中已经「见过」测试题,评估结果便会失真,这一现象被称为基准污染。传统的零日志协议和合同约束虽能提供一定保护,却缺乏技术层面的强制保障。2026年8月27日,谷歌DeepMind宣布完成全球首次针对专有前沿AI模型的双盲评估,合作方包括新加坡AI安全研究院、OpenMined、AVERI和MLCommons。此次评估以谷歌云的Confidential Space为基础,通过密码学手段构建隔离环境:外部评估机构无法看到Gemini模型权重,谷歌也无法获取评估方的测试提示词。双方数据在密码学意义上相互不可见,从根本上消除了传统评估中「要么暴露测试题、要么暴露模型权重」的两难困境,为AI监管与安全评估树立了新的行业标准。
AI基准测试的可信度危机由来已久。随着大型语言模型训练数据规模不断扩大,模型在预训练阶段接触到评估数据集的概率也随之上升。一旦模型提前「见过」测试题,其在该基准上的得分便无法真实反映其能力边界,政策制定者、企业采购方和安全研究人员据此做出的判断也将存在系统性偏差。这一问题在网络安全评估、政府合规测试等高敏感场景中尤为突出。
谷歌DeepMind此次推出的双盲评估方案,核心在于将整个评估流程封闭在一个密码学可验证的「盒子」里。技术底座是谷歌云Confidential Computing产品组合中的Confidential Space,它能够在硬件可信执行环境中运行评估任务,确保模型权重对外部评估方不可见,评估提示词对谷歌同样不可见。双方均可通过密码学证明验证对方确实无法访问己方数据,从而在不建立相互信任的前提下完成严格测试。
此次试点选用的是Gemini Flash Lite模型,评估基准由合作机构提供并保密。参与方包括新加坡AI安全研究院、隐私计算组织OpenMined、评估机构AVERI以及机器学习标准组织MLCommons。这一多方协作结构本身也具有示范意义——它表明双盲评估框架可以在不同司法管辖区、不同类型机构之间落地,而无需任何一方放弃对核心资产的控制权。
从行业背景看,外部评估一直是AI安全生态的重要组成部分。谷歌DeepMind在内部评估之外,长期与专业研究机构、公民社会组织及各国AI安全研究院合作,对模型进行压力测试。然而,传统外部评估存在固有矛盾:评估方若要保护测试题不被模型提供商提前获取,就必须在封闭环境中运行,而这又要求对模型提供商的基础设施有一定程度的信任。双盲方案通过密码学手段将这种信任需求降至最低。
谷歌DeepMind表示,希望此次试点能够为整个行业确立新的评估标准,推动更多独立机构在不损害数据主权的前提下对前沿模型进行严格测试。随着AI能力持续提升,评估的可信度将直接影响监管政策的有效性和公众对AI系统的信任程度。该团队已发布详细技术报告,供研究人员和机构参考复现。
要点
- 谷歌DeepMind完成全球首次专有前沿AI模型双盲评估,通过密码学隔离环境同时保护模型权重和测试提示词,从技术层面防止基准污染。
- 评估基于谷歌云Confidential Space构建,密码学证明可验证双方均无法访问对方核心数据,消除了传统评估中信任依赖的根本矛盾。
- 合作方涵盖新加坡AI安全研究院、OpenMined、AVERI和MLCommons,多方参与结构表明该框架具备跨机构、跨司法管辖区的可扩展性。
- 双盲评估对网络安全测试、政府合规评估等高敏感场景尤为重要,有望成为AI监管体系中技术可信评估的基础设施。
原始标题:Piloting the world's first double-blind AI evaluations
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。