CodexQA

行业与实践研究与基准测试

双盲评测:解决人工智能安全审计中的双重保密困境

CodexQA 团队阅读约 23 分钟

评测方要藏住基准提示,模型方要守住权重。DeepMind 与 AVERI 在 GCP 的 NVIDIA H100 机密飞地里,用 PySyft 对 Gemini 2.5 Flash Lite 跑了封闭的 AILuminate 评测,双方都看不到对方的资产。

本文目录

双盲评测:解决人工智能安全审计中的双重保密困境

Andrew Trask、Sol Messing、Vai Pahwa、Pegah Maham、Rene Kolga、Austin Frantz、Andrew Tash、Kate Thomas、Sean McGregor、George Balston、Patricia Paskov、Miles Brundage、Akriti Vij、Bennett Hillenbrand、Alexandros Karargyris、Tin Acosta、Joel Fenster、Madeleine Eilish、Rasmi Elasmar、Myriam Khan、Koen van der Veen、Rasswanth S、Sameer Wagh、Stephen Gabriel、Pedro Werneck、Lacey Strahm、Kevin McDonough、Ronnie Falcon、Kristian Lum 与 William Isaac

机构:1 AVERI;2 Google;3 Singapore AISI;4 OpenMined;5 ML Commons

译注:主标题直译,不改成转述。作者姓名保持原文拼写,顿号只为中文排版,顺序与原文一致,没有合并或省略任何一位。机构编号也保持原文:一为 AVERI,二为 Google,三为 Singapore AISI,四为 OpenMined,五为 ML Commons。

摘要

人工智能安全评测常常涉及敏感提示和专有模型。评测方希望对模型拥有方保密自己的评测提示,以防止有意或附带的数据泄漏,从而让自己的基准在更长时间里保持有用。模型拥有方则希望把专有模型权重和推理代码留在自己的安全基础设施之内,以保护知识产权。我们为「双盲评测」提出一条前进路径:它提供密码学保证,使评测方的提示不会被分享给模型拥有方,同时维持模型权重和推理代码的保密性。为实现这一点,我们使用在硬件层面加密内存中数据的安全飞地。在一次世界首创的试点中,我们检验这一做法:在 Google Cloud Platform 上的 NVIDIA H100 安全飞地里,对照私人 AILuminate 基准语料的一个选集,评测一个专有的 Google DeepMind 模型(Gemini 2.5 Flash Lite),并用 OpenMined 的 PySyft 维持数据和模型隐私。我们相信,这项工作标志着第一次用这项技术,为一个机构的前沿级专有模型权重和另一个机构的封闭基准提供相互保密。

1 引言

现代人工智能系统评测中的一个核心问题,是公众能否信任这些基准。Singh 等人(2025)表明,「基准黑客行为」是一个紧迫问题:有一家前沿实验室在 Chatbot-Arena 上测试了 27 个私人模型变体,然后只发布得分最高的那个。然而,意外的基准污染同样是一个严重问题,而且单靠信任、合同和零日志策略,可能无法解决。Xu 等人(2024)表明,在他们测试的 31 个模型里,大约一半在训练前和训练后都有基准数据泄漏的有力证据。此外,Schaeffer 等人(2026)表明,测试集污染会抬高测得的基准表现,而且这种抬高既随着污染量增长,也随着模型规模增长。

为了同时防止对基准提示做附带的训练后加工和蓄意的训练后加工,模型评测方可以决定把自己的基准提示完全保密。对开放权重模型来说,这很简单:评测方只需下载权重,并在自己控制的基础设施上运行评测。然而,对专有模型来说,事情更为复杂。尽管零日志协议和严格的合同保障长期以来一直让外部测试提示保持保密,它们仍然要求各方之间相互信任:私人评测数据不会泄漏进未来的训练前运行或训练后运行。

评测方不能简单地经由模型拥有方的 API 来测试专有模型。这些 API 会以明文把基准提示暴露给模型拥有方,并可能损害测试集的完整性。即便是合同安排和零日志系统,也可能无法防止私人评测数据被无意泄漏进未来的训练前运行或训练后运行。

双盲评测框架

图 1:双盲评测(DBE)框架。(1)模型拥有方发布一个通向模型的模拟接口。(2)基准评测方使用该模拟接口起草私人基准提示和代码。(3)双方以密码学方式核验远程硬件证明。(4)模型权重和私人基准提示经由加密的 TLS 隧道,直接流入一个硬件加密的飞地。(5)基准在这个隔离环境中接受评测,汇总指标被发送给评测方,最后飞地被停用。

一种替代做法,是这些持有私人基准的评测方向对方索取专有模型权重的一份副本,这样他们就可以自己评测该模型,并有信心:自己没有向任何其他方披露基准。事实上,许多评测方在某些高利害的安全、对齐和能力评测中,要求并获得对模型权重的直接访问,包括激活探测、表征引导、词元级对数似然审计,以及确定性的离线核验。然而,大多数评测方很难拿到前沿权重的副本,因为这些权重代表着巨大的资本投入、知识产权,以及模型开发者有必要加以防护的潜在两用能力。因此,往往只有与模型拥有方关系深厚的评测方(例如在这类机构里任职的评测人员)才能获得那种程度的访问。据我们所知,还没有任何外部模型评测方为了保护某一基准的完整性,而以明文收到过前沿模型权重的副本。

结果是,模型评测方和模型拥有方陷入一种两难:评测方在评测专有前沿系统时无法保护自己的基准,模型拥有方也无法获得一次真正的双盲评测所能提供的那种稳健背书(总还存在泄漏损害某一分数的微小可能)。

作为补救,我们提出双盲评测(DBE)框架(图 1)。这是一个由密码学和硬件强制执行的评测环境,提供相互保密。该框架提供一个临时的、在密码学上安全的环境,同时托管评测和专有模型,从而防止即便是无意的数据泄漏,使评测数据不会进入未来的训练运行。DBE 通过一套 PySyft Datasite 架构提供这种相互保密:评测在 Google Cloud Platform(GCP)机密空间(a3-highgpu-1g 实例)上的两层硬件飞地层级中执行,计算开销不到 5%(Apsey 等人,2023)。

这一框架能否成功,取决于它是否能在彼此分离的机构之间激发足够的信心,使它们愿意让自己的专有资产经由它得到保护。2024 年,OpenMined 与英国人工智能安全研究所(AISI)和 Anthropic 合作,在一次小规模概念验证中成功试点了作为基础的 PySyft Datasite 架构和 GPU 飞地协调模型(对照 CAMEL-bio 的一个 5 行样本评测 GPT-2;CAMEL-bio 是 AISI 托管的数据集;Trask 等人,2024)。这次试点描述了为激发机构信心仍然需要的其余安全特性。但它没有达成上面那个关键目标:保护两个机构的专有资产。

更近一些,MLCommons 的 MedPerf 平台把医学人工智能中的基准评测做成联邦形式,用以评估从不离开持有机构的私人数据(Karargyris 等人,2023),并在一个 Google Cloud 机密空间内评测了加密的医学影像模型(Kolga 与 Mattson,2026)。

下面,我们提供描述当前实现的技术细节,并报告 DBE 的第一次现场部署:一个专有模型对着一个封闭基准接受评测。我们与人工智能核验与评测研究所(AVERI)以及 MLCommons 合作,在一个隔离的、由 GCP 托管的 NVIDIA H100 安全飞地内,使用来自 MLCommons AILuminate(AIRR 1.0)基准语料的私人评测,评测了 Google DeepMind 的 Gemini 2.5 Flash Lite。我们与 Singapore AISI 合作,使用一套聚焦于新加坡语境中有害内容诱发的私人提示集,评测了 Google DeepMind 的 Gemini 2.5 Flash Lite。

2 双盲评测机制

在高层上看,一个计算在其中受到密码学保护的安全飞地,并不会开箱即用地提供双盲能力。相反,它提供两项低层保证,双盲能力可以在这两项保证之上被构造出来。为描述这一方案,我们先描述飞地所提供的低层保证,再描述我们用以构造更高层 DBE 能力的过程。

2.1 飞地的高层保证

CPU 或 GPU 飞地被设计来处理的问题,是一个(理论上的)不可信计算提供方的问题。在这个理论情景里,计算提供方可以违反两类原则:隐私和真实性(Trask 等人,2020)。

隐私:理论上,计算提供方可以看见在自己计算机内部运行的全部数据。

真实性:理论上,计算提供方可以假装执行用户所请求的某一程序或某一批数据,实际上却在运行别的程序或别的数据,并把虚假结果发回给客户。

CPU/GPU 飞地解决这个问题的方式,并不是让隐私或真实性变得完全不可能被破坏(也就是说,它并不是一个「无信任系统」),而是制造一个接近于此的情景:计算提供方和硬件制造商必须合谋,才能破坏那些保证,因为这套系统的加密是在硬件层面工作的。因此,如果计算的用户相信,计算提供方和硬件制造商不太可能合谋对付自己,那么该用户就相信,CPU/GPU 飞地提供强有力的隐私保证和真实性保证。

2.2 飞地如何提供隐私与真实性保证

CPU/GPU 飞地(例如 Intel TDX 或 AMD SEV-SNP)是一块普通的计算芯片,由硬件制造商加以改造,使之持有在制造时烧入芯片的独特秘密数字。芯片从这些秘密导出一把私钥(以及与之对应的公钥),这就是飞地信任根的基础:制造商发布证书,为每块芯片的公钥作担保,因此任何人都可以检查某一个签名是否真的来自一块正品芯片。如果这些秘密一旦泄漏到芯片之外,或者制造商不当处理自己用来为它们作担保的认证密钥,信任根就被破坏。然而,只要它们对其他所有人(尤其是云提供方)仍然是未知的,它们就构成隐私保证和真实性保证的一个有力基础。

就隐私而言,飞地确保云提供方无法看见它内部的操作。为此,芯片生成一把单独的、临时的内存加密密钥。这把密钥不同于上面那把私钥:飞地每次启动时它被全新创建,飞地停止时它被销毁,并被用来自动加密飞地保存在内存中的一切。写到磁盘上的数据同样被加密,加密由飞地内部运行的软件完成,所用密钥只曾经存在于那块受保护的内存之中。因此,即便云提供方从物理上检查内存或硬盘,它也无法以明文恢复那些数据,因为密钥位于专用硬件之中,没有任何软件、甚至云提供方自己的软件,也不能把它们读出来(Advanced Micro Devices, Inc.,2020;Young,2023)。

就真实性而言,飞地用自己的私钥,为任意给定时刻正在它上面运行的全部软件产生一个签名哈希,随后飞地把这个签名哈希分享到外部,使外部各方能够确信:如果把自己的数据送进飞地,这些数据将如何被处理(也就是,飞地里的软件会对他们的数据做什么)。

然而,仔细审视就会注意到,最后这项关于真实性的主张,在很大程度上取决于飞地内部正在运行的软件本身是否并不违反隐私或真实性。例如,如果飞地正在运行一个 SSH 服务器,而且防火墙已被禁用,那么在签名哈希已经向外部一方披露之后,管理员仍可以登录进去,并开始改动代码。又或者,就违反隐私而言,如果飞地正在运行外部一方并不信任的黑盒代码,飞地就可能取走用户的全部数据,并把它复制到飞地之外。鉴于这一风险,飞地在实践中究竟怎样才能真正提供隐私保证和真实性保证?

为此,飞地还需要一套可供外部一方加以信任的软件栈(例如开源,或以其他方式受信任),而且这套软件栈需要避免违反隐私和真实性。因此,虽然飞地所运行的,看起来可能是普通的 BIOS、操作系统、Python 库和其他软件,它常常需要这些软件的略经修改的版本。例如,它需要一个禁用了键盘、鼠标、屏幕和 SSH 的操作系统,以及这样的应用程序:其出站消息已被移除,或受到充分约束,从而不至于违反飞地在隐私和真实性上的目标。

在飞地内部运行的整套受信任或经修改的软件——固件、客户机内核、初始化系统、容器运行时,以及应用镜像本身——构成可信计算基(TCB)。如果它拥有一个漏洞,这些层中的任何一层原则上都可以颠覆飞地本应提供的保密性保证和完整性保证,因此用户必须能够确立这样一点:飞地运行的恰好是他们打算信任的那个 TCB,而不是任何别的东西。我们用三种机制做到这一点:

  1. 度量。TCB 的每一层在被加载时都经过密码学度量(也就是哈希),所得度量被放进一份证明报告,该报告由一把植根于 CPU 厂商硬件信任根的密钥签名。这条签名链回溯到厂商签发的证书,因此主机、云运营商或飞地拥有方都无法伪造这份报告。因为每一层在把控制权转交给下一层之前,都先度量下一层,而且这条度量链覆盖整个软件栈。飞地另外在启动时生成一对临时密钥,并把其中的公钥嵌入报告,因此用户所建立的安全通道,在密码学上绑定到被证明的那个 TCB,而不仅仅绑定到一台能够出示一份有效报告的机器。
  2. 可复现构建。TCB 的每一层都从公开源码确定性地构建,因此任何第三方都可以重建它,并得到一件逐比特相同的产物,因而得到相同的度量。正是这一点,把一项度量从一个不透明的数字变成一个有意义的数字:没有可复现性,用户可以观察到飞地正在运行某一套固定的软件,但无法知道那是哪一套软件。
  3. 核验。在向飞地释放任何数据之前,每个用户都独立核验证明报告:他们检查厂商签名链,通过要求报告绑定到一个用户提供的 nonce 来检查报告是新鲜的,并把报告中的度量与他们打算信任的那个 TCB 的期望度量相比较。只有每一项度量都匹配,数据才会被释放。用户可以自己从源码重建 TCB 来得出那些期望值,也可以把重建委托给自己信任会去做这件事的任何一方——审计方、同伴参与方,或独立的重建者——因为可复现性意味着每一个诚实的重建者都会到达相同的值,而只要有一个重建者重建并公布了不匹配,就足以暴露一个被替换的 TCB。核验本身由每个参与方执行;任何一方都不必信任另一个参与方的裁决,也不必信任一个中心化的核验服务。

TCB 的最低几层——CPU 微码和安全处理器固件——是闭源的,无法重建,因此这些层我们信任 CPU 厂商:SEV-SNP 上信任 AMD,TDX 上信任 Intel。这是不可避免的,而且已经隐含在前提里:一开始为证明签名的,就是同一厂商的信任根。它也受到约束:它们的安全版本被绑定进报告的签名密钥,因此平台不能误报自己正在运行什么,核验者可以拒绝任何低于所选下限的版本。关键的是,这一层对这块硬件的每一个用户都相同,不能按部署而变化,因此它不给运营商提供针对某个特定受害者的办法。可复现性适用于它之上的一切,也就是部署特定的软件所在的地方。

但是,当飞地正在运行一套开源(或以其他方式受信任)的软件栈,其中违反隐私或真实性的特性已被禁用,而且当这个飞地用自己的私钥为正在运行的软件签名,并加密所有写到内存或磁盘的数据时,这个 CPU/GPU 飞地就能向外部用户提供一项非同寻常的保证。如果外部用户信任自己的云提供方和硬件制造商没有足够的动机合谋对付自己,他们就可以有很高的信心:自己的应用数据没有被任何人看见,而且自己正在运行的就是自己相信正在运行的代码。

2.3 从飞地到理论上的 SMPC 能力

然而,针对云提供方的保护本身,并不提供双盲评测所必需的保证。双盲评测需要的是一台虚拟机的两个用户之间的隐私和真实性保证(而不是云与单个用户之间的隐私和真实性保证)。

然而,我们可以从前者建到后者。首先,如果一台虚拟机的两个用户都收到飞地里正在运行的软件的签名哈希,并且双方都同意自己的数据将如何被那套软件使用,那么他们就可以安全地把数据送进飞地,等待飞地执行那次计算,并消费输出。

这里的经典例子叫「百万富翁问题」:两个(理论上的)百万富翁想知道谁的钱更多,但他们不想向对方披露自己确切的银行存款。于是,为了计算这个简单的阈值函数,他们中的一个可以启动一个飞地,飞地运行开源软件,该软件期望从他们任何一方收到一条包含银行存款的消息,然后输出谁的钱更多,删掉一切,并关机。两个百万富翁中的一个随后用这套软件启动飞地,双方都检查签名哈希,以确认它运行的是他们期望的开源软件,然后上传自己的银行存款并等待结果。以这种方式,他们可以利用飞地在彼此之间执行安全多方计算(SMPC)。

2.4 从理论上的 SMPC 到双盲评测

然而,即便是这种形态的 SMPC,也不足以在实践中执行一次双盲评测。因为在百万富翁问题里,各方可以通过查看代码来共同同意将要运行的全部代码,而他们只提供状态;在双盲评测的语境里,模型拥有方需要提供推理代码,评测方往往需要提供评测和分析代码。而且在许多情况下,这些各自的代码库含有不应向对方披露的知识产权或商业秘密。这削弱了上面的一项要求:各方在代码于飞地中运行之前先查看代码,以确保它符合自己的策略。如果每一方都必须同意对方提交的未知代码,任何一方又如何能确信隐私或真实性得到维持?

对此,一项独特的假设提供了桥梁。虽然每一方的代码库可能含有需要隐藏的秘密,那个代码库是由更小的函数组成的,而这些函数本身又由更小的函数组成。继续向下,到某一点,计算单元会基本到不再含有任何专有知识产权。在这一认识里,一种隐私策略浮现出来。

如果可以保证隐藏代码只运行那些本身不把任何数据送出飞地(也不把数据写到会把数据送出飞地的位置)的方法,那么隐藏代码就不会把数据送出飞地,并且正在维护隐私保证。

具体地说,如果模型拥有方提交的推理代码完全用 Jax 或 PyTorch 这类库写成,那么他们全部的模型知识产权就是一系列深度学习框架方法调用,这些方法本身是开源的,并且在绑定网络的活动(例如 tensorflow server)和不绑定网络的本地计算(例如 th.Tensor.add)之间有清晰边界。因此,如果模型拥有方可以把自己的大部分代码展示给对方,但又觉得需要涂黑某些部分,他们可以以这样一种方式来做:飞地保证被涂黑的代码只调用关联深度学习框架中一份特定允许列表里的、不绑定网络的方法。合在一起,人工智能评测方可以获得高度信心:一个人工智能模型被涂黑的推理代码,不能把他们的基准或评测方法运输出去。

反过来,如果人工智能评测方希望对模型拥有方隐藏自己的一部分评测方法,他们也可以提交带涂黑的代码,只要被涂黑的代码只能利用一份允许列表中的、不泄漏知识产权、也不发起网络调用的方法。合在一起,双方都可以带来相互保密的资产(模型、基准)和代码(推理代码和评测代码),对对方隐藏那项资产,同时又了解到关于对方隐藏资产的足够信息,从而对评测整体的隐私和真实性有信心。正是这种代码的提交和批准,由 PySyft 这类库来促成;而由允许列表核验的涂黑,则由 syft-restrict 这类库在提交过程中提供。

2.5 用 PySyft 进行的实践中的双盲评测

总而言之,在正确使用时,PySyft 可以通过下列步骤,促成从 GPU 飞地的信任根一直到模型拥有方与评测方之间高层隐私和真实性保证的这一整条保证链。

  1. 要开始一次双盲评测,模型拥有方把他们希望开放评测的模型的权重和推理代码收集到一起,外部评测方把评测样本和评测代码收集到一起。他们对齐并确认合作意图。
  2. 在确立意图之后,一方选择启动(并支付)一个 GPU 飞地,也许是在 GCP 这样的云提供方之内。这一方作为飞地托管方获得一项特殊特权:关掉飞地的能力。但部署飞地的一方相对于不部署飞地的一方,并不获得任何其他特殊特权。飞地以兼容飞地的 BIOS、驱动程序、操作系统和 PySyft Docker 容器启动。
  3. 启动之后,每一方打开一个 Python 运行时(例如 Google Colab),并利用 PySyft 客户端请求飞地产生其软件的签名哈希(一份证书)。
  4. (可选)如果每一方都需要把自己的代码与对方的代码紧密对接,每一方都可以用 PySyft 客户端把自己的模型或基准的一个假的或模拟的版本提交进飞地,对方可以下载它,并在开发自己代码的最终版本时把它当作测试用具。或者,当 API 是标准的(例如基本的大语言模型推理),一方可以简单地向另一方表明自己正在使用哪些标准 API。
  5. 每一方使用 PySyft 的 Python 客户端,把自己的(可能被涂黑的)代码和私人资产上传进飞地(模型、基准等)。代码只有在双方都批准之后才会运行。
  6. 每一方从飞地收到被涂黑的代码(并附有来自 syft-restrict 的证明,表明涂黑部分只包含允许列表中的方法调用)。然后他们使用 PySyft 客户端审查并批准代码,并就此向飞地发送消息。
  7. 一旦飞地从每一方收到对这次计算的批准,它就执行代码并释放结果。在提交代码时,各方可以选择谁接收结果(双方,或只有一方)。

这就是我们为双盲评测提出的高层过程。

3 实证演示:用 AILuminate 评测 Gemini 2.5 Flash Lite

我们与 AVERI 合作,使用来自 MLCommons 的封闭基准提示和一个专有的 Google DeepMind 模型,端到端地演示 DBE。

3.1 实验设置

我们评测了 Google DeepMind 的 Gemini 2.5 Flash Lite,它通过 Google 的 JAX C++ Model Server 提供服务,在 Google Cloud 机密空间内经由 Unix Domain Sockets 运行。在初始化期间,未压缩的模型权重与 DAT 核验密钥和安全域配置一起被流入飞地。

本实验使用的基准取自 AILuminate(AIRR 1.4)的保留集(也就是从未被任何模型处理过的提示)。这些提示覆盖关键危害领域,包括化学、生物、放射性、核与爆炸物(CBRNE)危害、网络攻击、仇恨言论、自我伤害,以及暴力犯罪诱发。AILuminate AIRR 1.4 的危害和违规标准,是在 MLCommons 人工智能风险与可靠性(AIRR)工作组内产生的,其中包括来自 AVERI 的代表。这些提示是在与数据提供方的严格不披露和来源要求下产生的,并没有广泛分享给工作组成员。实验中使用的提示和输出由 AVERI 加密和解密,输出由 AVERI 工作人员评测。

我们使用了一台 Google Cloud Platform(GCP)A3 机密虚拟机(带有 Intel Trust Domain Extensions(TDX)主机内存加密的 a3-highgpu-1g 实例)。它配备一块 NVIDIA H100 80GB 机密 GPU,编排一套经过证明的软件栈,包括 OpenMined PySyft v0.10.x、Google GRTE v5 C++ 运行时库栈、一个 XLA/CUDA PJRT GPU 编译客户端、一个带有 MLRT 图执行的 TensorFlow Runtime / IFRT 会话、一个持久的 Pathways 编译缓存,以及 NVIDIA Attestation SDK。

4 讨论与未来方向

这次双盲评测的部署,构成模型基准开发者第一次在密码学保证下成功评测一个前沿级专有模型,并把损害商业秘密或基准完整性的危险降到最低。政府中的独立评测机构,例如国家人工智能安全与安保研究所,以及 AVERI 这样的非营利组织,可以为了开展评测而要求访问前沿模型权重。DBE 提供一个框架,用于严格的安全和能力评测,既不损害非公开基准的保密性,也不要求模型开发者把权重转移到评测方的基础设施上。

正如最初的多方利益相关者飞地试点所观察到的(Trask 等人,2024),安全双盲评测的主要瓶颈不再是硬件计算开销。它变成了法律协议和代码审查所需要的程序开销和人工协调。

虽然这些最初的努力需要高度的联合人工协调,长期目标应当是标准化的密码学证明流水线,其信任保证把复杂的依赖哈希和密钥抽象掉,人工开销接近于零。行业的最终目标,会是类似于网页上那个可视的「HTTPS 锁图标」。

另一项挑战涉及只用开源库中存在的层来运行 Gemini 2.5 Flash Lite。对本项目来说,消除专有方法实现被认为是过于重大的工程挑战,因此并非所有代码都能被检查或放入允许列表。AVERI 被告知了这一挑战,并接受了带有飞地的整体设置。此外,尽管 Confidential Space 客户机操作系统公布了参考值,其源码是开放的,其构建流水线经过外部验证,单个构建却不能独立复现,因为它们把私人签名密钥当作输入。再者,我们依赖 Google 的服务来签名和核验证明报告,这把 Google 放进了核验路径,从而增加了对它的信任。未来工作将重新审视这些安全改进和推理实现任务。

作为下一步,我们将探索扩大这一做法。前沿模型正在增长到超过万亿参数,因此评测工作将需要分布式的机密集群。把 DBE 扩展到多节点的 NVIDIA H100/B200 计算集群,使用加密连接,并配合掩盖内部模型架构的延迟执行框架,代表着机密人工智能评测的下一个里程碑。

再看得更远,我们推测,核验和证明所提供的保证,在安全地评测高度先进的模型的某些能力(例如网络安全)时可能有用。例如,如果一个模型试图调整自己的 harness、权重或沙箱,飞地哈希就不再与证明匹配,实例会立即停下来。

5 结论

双盲评测(DBE)提供一个密码学上安全且可核验的方案,使基准对评测方保密,使权重对模型开发者保密。通过把 PySyft 的结构化透明策略与硬件级内存加密结合起来,DBE 提供保护每一方资产保密性的密码学保证。

我们通过第一次现场部署验证了这一范式:与 AVERI 合作,把 Google DeepMind 的 Gemini 2.5 Flash Lite 对着私人的 MLCommons AILuminate 基准进行评测;并与 Singapore AISI 合作,对着一套聚焦于新加坡语境中有害内容诱发的私人提示集进行评测。DBE 为在专有系统上进行独立、安全、非公开的评测确立了一条前进路径。

致谢

作者感谢 OpenMined、Google DeepMind、Google Cloud、AVERI 和 MLCommons 的工程团队在这次合作全程中的技术贡献和支持。我们也要感谢 Google DeepMind 的 Helen King、Tim Dierks、Rohin Shah、Wei Huang、Owen Larter 和 Tom Lue 的领导。

译注:致谢中的机构名和人名保持原文拼写,名单没有增减。

参考文献

Advanced Micro Devices, Inc.(2020)。AMD SEV-SNP:以完整性保护及其他手段加强虚拟机隔离。AMD 白皮书。

译注:条目中的产品名 AMD SEV-SNP 保持原文。

Apsey, E.、Rogers, P.、O’Connor, M. 与 Nertney, R.(2023)。在 NVIDIA H100 GPU 上进行机密计算,以实现安全且可信的人工智能。NVIDIA 技术博客。https://developer.nvidia.com/blog/confidential-computing-on-h100-gpus-for-secure-and-trustworthy-ai/

Karargyris, A.、Umeton, R.、Sheller, M. J. 等(2023)。用 MedPerf 对医学人工智能做联邦基准评测。Nature Machine Intelligence,5:799–810。

Kolga, R. 与 Mattson, P.(2026)。以隐私优先的人工智能推进脑肿瘤研究。Google Cloud 博客。https://cloud.google.com/blog/products/identity-security/privacy-first-medical-ai-with-medperf-and-google-cloud

Schaeffer, R.、Kazdan, J.、Abbasi, B.、Liu, K. Z.、Miranda, B.、Ahmed, A.、Barez, F.、Puri, A.、Biderman, S.、Mireshghallah, N. 等(2026)。量化测试集污染对生成式评测的影响。arXiv 预印本 arXiv:2601.04301。

Singh, S.、Nan, Y.、Wang, A.、Dsouza, D.、Kapoor, S.、Üstün, A.、Koyejo, S.、Deng, Y.、Longpre, S.、Smith, N. A. 等(2025)。排行榜幻觉。载于 Advances in Neural Information Processing Systems,第 38 卷。数据集与基准轨道。arXiv:2504.20879。

Trask, A.、Bluemke, E.、Collins, T.、Garfinkel, B.、Drexler, E.、Ghezzou Cuervas-Mons, C.、Gabriel, I.、Dafoe, A. 与 Isaac, W.(2020)。用结构化透明超越隐私权衡。arXiv 预印本 arXiv:2012.08347。

Trask, A.、Yesilyurt, A. B.、Farkas, B.、Ezenwaka, C.、Popa, C.、Buckley, D.、van der Wel, E.、Mosconi, F.、Han, G.、Junior, I. 等(2024)。用于人工智能评测的安全飞地。https://openmined.org/blog/secure-enclaves-for-ai-evaluation/。OpenMined 技术博客,与英国 AISI 和 Anthropic 合作。

Xu, R.、Wang, Z.、Fan, R.-Z. 与 Liu, P.(2024)。对大语言模型中的基准泄漏做基准测量。arXiv 预印本 arXiv:2404.18824。

Young, J.(2023)。Oh SNP! 虚拟机变得更加机密。Google Cloud 博客。https://cloud.google.com/blog/products/identity-security/rsa-snp-vm-more-confidential

译注:标题 “Oh SNP!” 是对 AMD SEV-SNP 的双关,保留原文。参考文献共十条,作者名、年份、链接和预印本编号保持原文,没有合并或删条。各条中文题名依次是:以完整性保护及其他手段加强虚拟机隔离;在英伟达 H100 图形处理器上进行机密计算,以实现安全且可信的人工智能;用 MedPerf 对医学人工智能做联邦基准评测;以隐私优先的人工智能推进脑肿瘤研究;量化测试集污染对生成式评测的影响;排行榜幻觉;用结构化透明超越隐私权衡;用于人工智能评测的安全飞地;对大语言模型中的基准泄漏做基准测量;虚拟机变得更加机密。刊物名 Nature Machine Intelligence 与 Advances in Neural Information Processing Systems 在条目中保留原文刊名。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误