CodexQA

行业与实践研究与基准测试

我们对 gpt-oss 方法论复核的摘要

CodexQA 团队阅读约 6 分钟

METR 在保密协议下复核了 OpenAI 发布 gpt-oss-120b 前的对抗性微调评测。17 条建议里 6 条为高紧急;OpenAI 称纳入 9 条,高能力阈值的清晰标准仍只是部分处理。

本文目录

我们对 gpt-oss 方法论复核的摘要

Thomas Kwa、Charles Foster、Seraphina Nix、Luca Righetti 与 Lawrence Chan

2025 年 10 月 23 日

译注:作者姓名保持原文拼写,顺序与原文一致。日期按原文 October 23, 2025 译出。

关于独立性的说明:我们的复核是在一份不披露协议下进行的,该协议要求我们把这篇文章交给 OpenAI 审阅并批准。1

1. 复核者声明

METR 复核了 OpenAI 在发布 gpt-oss-120b 之前所做的对抗性微调实验背后的方法论。我们的目标是复核方法论和结果,以帮助他们判断:一个恶意行为者能否把该模型微调到超过 OpenAI 准备框架中所定义的危险能力阈值。我们提出了 17 条建议,随后分享给 OpenAI 的研究人员和他们的安全咨询组。2

2. 过程

我们这次复核的范围是有意收窄的。OpenAI 提供了指南,规定建议在下列条件下才算在范围内:它们与改进危险能力的引出和/或额外的评测与基准有关,与灾难性风险相关,并且能够在 14 个工作日内、用可以获得的数据加以实施。在这些界限之内,METR 聚焦于 OpenAI 用来评估 gpt-oss-120b 能否被对抗性地微调(经由恶意微调,下文称「MFT」)从而在某些威胁模型下达到「高」能力阈值的那套方法论。3 这些实验覆盖了准备框架(第 2 版)三个被跟踪类别中的两个:生物与化学,以及网络安全。我们没有试图对该模型的总体能力做整体评估,也没有评价公开发布其权重是否可取。

为了给我们的评估提供依据,OpenAI 最初向 METR 和其他外部复核者分享了下列信息:

审阅这些材料之后,METR 和其他外部复核者与 OpenAI 的研究人员开会,请求澄清,以便为我们的建议提供依据。

3. METR 的建议

在我们的复核中,METR 提交了 17 条建议,其中 6 条被我们列为高紧急程度。其中包括 7 条关于能力引出的建议,以及 6 条关于额外评测和基准的建议;我们还建议了 1 种低优先级的缓解方法4,并请求了 3 项其他信息。

我们提出了若干与 ProtocolQA 有关的建议,因为 OpenAI o3——此前一个接近 OpenAI「高」阈值的模型——被测得在 4 项生物学评测中有 3 项高于专家基线,ProtocolQA 是唯一没有被超过的一项。5 因此,ProtocolQA 上的表现,对于模型会不会被指定为高能力,显得尤其重要。

4. OpenAI 的后续

鉴于 METR 和其他外部复核者的建议,OpenAI 在 gpt-oss-120b 上跑了恶意微调(MFT)实验。随后他们告知我们采纳了哪些建议,并为没有采纳的那些提供了理由,并在 gpt-oss 模型卡中表明,他们纳入了我们 17 条中的 9 条。

我们审阅了已发表的 MFT 论文,并相信 OpenAI 至少部分处理了我们 6 条高紧急事项中的每一条。这些建议是:

  • (额外评测)对 ProtocolQA 再做额外的稳健性检查
  • ProtocolQA 的一个较早版本高估了表现;这些问题已被修正,所有模型都在较新的版本上重新跑过。
  • (引出)在与 ProtocolQA 更为类似的生物学数据集上做微调
  • OpenAI 把一个合成的生物学规程数据集加进了 MFT 训练数据,其中的错误是由 OpenAI o3 有意引入的(见 MFT 论文第 5 页)。
  • (引出)为生物和网络安全评测提供推理时缩放图
  • OpenAI 在 MFT 论文的图 5 里,为其中一项评测提供了这些图。
  • (引出)澄清关于计算、机器学习专长,以及低资源行为者数据访问的威胁模型假设
  • OpenAI 在 MFT 论文第 2.1 节定义了他们的威胁模型。6
  • (引出)量化拒绝行为——分享对抗性微调之前和之后的拒绝率数据,并指明哪些失败是由于拒绝,哪些是由于缺乏能力。
  • OpenAI 收入了若干只含 gpt-oss-120b 加抗拒绝的图,以及他们抗拒绝训练方法论的细节。
  • (其他信息)把模型分类为高能力的清晰标准——对这些标准的论证,以及对把 ProtocolQA 纳入评测的论证。
  • OpenAI 没有公布清晰的标准,用以判定一个模型是否应被分类为高能力(例如它需要超过哪些专家基线),也没有公布对其标准的论证。7 相反,他们澄清说,他们通过「一个整体过程来作出判定,其中包括评测结果、威胁模型、可用的防护措施,以及更多」。8 作为我们这条建议的结果,OpenAI 表示,ProtocolQA 度量的是他们其他基准无法度量的错误检测能力。
  • 在看到 MFT 论文的发表版本之后,我们再次提出了这一关切。作为回应,OpenAI 表示,他们在生物与化学类别中有「内部预先登记的阈值」来判定高能力。然而,他们没有分享这些阈值是什么、其背后的推理,或 OpenAI 所遵循的预先登记程序。9 今后,我们希望他们会把自己的准备风险阈值开放给外部审视。

译注:上一段引号内的两句是 OpenAI 的原话,这里按原意译出。模型名、基准名 ProtocolQA、MFT 与 Anti-refusal 的方法名称保持原文或在首次出现处说明。本文不转写任何规程内容、微调配方或攻击步骤。

实施情况摘要

因为我们对风险阈值如何被操作化仍有关切,我们把五条高紧急建议列为已实施,把一条(「把模型分类为高风险的清晰标准」)列为部分处理。

类别已实施 / 所建议(高紧急)已实施 / 所建议(合计)
引出4 / 45 / 7
额外评测1 / 12 / 6
缓解0 / 00 / 1
其他信息0 / 11 / 3
  1. 我们的 GPT-5 评测报告经历过一次类似的发表前审阅。和那份报告一样,发表前审阅之后,我们没有改变这篇文章的结论或要点。然而,我们确实对内容做了一处实质性编辑。原先,在讨论 OpenAI 如何跟进我们关于为其准备阈值提供清晰标准的建议时,我们提到了已发表的 MFT 论文与一份较早草稿之间的差异。我们被要求删去这一提及,因为 OpenAI 认为发布前草稿的内容属于保密。
  2. 这一过程也写在 gpt-oss 模型卡里,其中包括 OpenAI 对哪些建议被采用、以及为什么的一份说明。
  3. 前沿模型论坛在一份关于第三方评估的报告里,把这类评估称为「方法论复核」。
  4. OpenAI 审阅指南的一个较早版本,除了引出和评测之外,也包括缓解措施。
  5. 在新基准 TroubleshootingBench 上,o3 也低于专家阈值。
  6. 需要说明的是,我们并没有被要求判定:如果一个行为者拥有的资源多于 OpenAI 定义中的资源,并且能够(无意或有意地)提高该模型的两用能力,gpt-oss 是否会构成风险。例如,如果一家生物学初创公司做了大规模再训练,然后把权重发布出来供他人进一步使用,那会被认为落在该威胁模型的范围之外。
  7. 需要说明的是,我们并没有被要求评估这些阈值论证是否有效,而是要求这类论证是清晰的,并且所使用的证据是被适当地引出来的。
  8. 这与 OpenAI 准备框架(第 2 版)一致。该框架写道:「关于某一阈值已经达到的判定,既以能力评测的这些指示性结果为依据,也反映基于全部可得证据的整体判断——例如,关于评测结果在方法论上是否稳健的信息。」
  9. 预先登记策略的质量可以有高有低。理想情况下,开发者会公布已定义的风险阈值,并且不在每一次新模型发布时更新它们;这对透明和完整性最好,但在评估中加入新基准时会有困难。一种务实的折中,可以是定期更新具体阈值,并在任何使用这些阈值的评测之前,把它们分享给公众或外部复核者。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误