METR 对 Claude Opus 5.5 的 部署 前 评 测 摘要
METR 在 10 个工作日的 API 访问里,用五项长程任务初步评测 Claude Opus 5.5。结论是:相对 Fable 5.1 只有适度增量,不太可能完全自动化 AI 研发;模型开发本身至少被 AI 加速了一些,但不太可能已被大幅加速。

本文目录
METR 对 Claude Opus 5.5 的部署前评测摘要
METR
2026 年 9 月 22 日。
关于独立性的说明: 这项评测是根据一份无偿的 AI 研发评估协议进行的。[1] 我们起草了最初的摘要,随后 Anthropic 有机会审阅并编辑文本。我们在 Claude Opus 5.5 系统卡(https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf)中签核了这份最终文本。
我们的初步评测聚焦于 Claude Opus 5.5 可能如何影响 AI 研发,主要依据是它在困难的、长程任务上的能力。我们在这份报告里试图评估的主要主张是:(A)Anthropic 的 AI 研发现在是否会因为使用 Claude Opus 5.5 而大幅加速;以及(B)在 Claude Opus 5.5 的开发过程中,Anthropic 的 AI 研发是否已经因为 AI 而大幅加速。
请注意,我们的工作是围绕收集与 AI 研发能力相关的证据来组织的,但并不打算核实任何关于是否符合 Anthropic 政策中某一具体阈值的主张。这份报告摘要也不试图评估 Claude Opus 5.5 是否具有、或不具有某些特定的对齐属性。
证据摘要
我们对 Claude Opus 5.5 做了一项初步评测,其依据包括:
- 能力测试,通过在 10 个工作日期间获授的 API 访问进行。我们用了五项任务做这项测试:
- Budget NanoGPT Speedrun,流行的 NanoGPT Speedrun(https://github.com/kellerjordan/modded-nanogpt)竞赛的一个受限版本,用于 AI 研发。
- Language Model Conceptual Argumentation (LMCA),一个概念推理数据集,描述于 A dataset of rated conceptual arguments(Cooper 等人,2026)。
- Train a Program,一项衡量智能体训练一个机器学习模型、以复现一段软件之行为的能力的任务;
- Gaming Bot,一项任务:智能体必须编写一个能够玩电子游戏的 Python 程序,并得到一个非视觉 API 来控制该游戏。
- Sunlight,一项衡量智能体开展开放式研究并撰写相应报告之能力的任务。
- 关于以往模型的趋势与能力的背景信息,尤其是我们最近的前沿风险报告(https://metr.org/blog/2026-05-19-frontier-risk-report/#executive-summary-and-guide-to-the-report)中所报告的内容。
- 来自 Anthropic 的、关于 Claude Opus 5.5 能力的额外信息,包括对一份询问模型能力与控制因素的问卷的答复,以及与一位 Anthropic 研究人员的访谈。
- 一份来自另一项 METR 评估的、高度实验性且初步的报告,该评估针对 Anthropic 内部的 AI 研发加速。这份报告由另一个 METR 团队撰写,其访问权限高于撰写本内容的团队。由于访问权限上的这一差异,那个单独的 METR 团队与我们分享了其结论,但不能分享支撑证据或其推理的细节。
- 因此,我们把所提供的 AI 研发报告中的证据用作我们评估的一项输入,但不直接为其主张做辩护。
- 我们把将其纳入此处,视为一套更整体的评估流程的试验版本。我们预计这项单独调查会在接下来几周产出更多公开输出。
结论
我们把结论分成两类:一类涉及(A)Claude Opus 5.5 能够带来的 AI 研发加速水平,另一类涉及(B)由于 AI 而进入 Claude Opus 5.5 开发过程的 AI 研发加速水平。基于现有证据,我们得出如下结论:
(A)我们认为,来自这一模型的加速会略高于 Fable 5.1,但这一模型不太可能能够完全自动化 AI 研发。 这是因为:
- 我们有合理的信心认为,Claude Opus 5.5 并不代表在 Fable 5.1 之上的 AI 研发能力的巨大飞跃,但它很可能代表对 Fable 5.1 的适度改进。
- Claude Opus 5.5 在可验证任务(Budget NanoGPT、Gaming Bot)和较难验证的任务(LMCA、Sunlight)上都改进了 Fable 5.1,但是:
- 在问卷和研究员访谈中,Anthropic 声称 Claude Opus 5.5 在 Anthropic ECI 上延续了 Mythos 级别的趋势。
- Claude Opus 5.5 在我们的定量评测上是对 Fable 5.1 的增量改进,而不是一次不连续的跳跃。
- Claude Opus 5.5 仍然有一些定性弱点,专家人类在解决困难的长程任务或做开放式推理时不太可能表现出这些弱点。
- 这一点高度不确定,但我们预期,AI 研发的完全自动化将需要在预见、预测、建立自己的反馈回路,以及通常可能被称为研究者「判断力」或「品味」的其他技能上有大幅改进。
- 我们已有的证据并不表明,Claude Opus 5.5 在这些「判断力」技能上相对 Fable 5.1 代表一次大幅改进。
- 与此同时,我们认为 Claude Opus 5.5 仍然很可能明显加速研究者,并自动化研发中有限的方面。例如,我们预期 Claude Opus 5.5 很可能提供略高于 Fable 5.1 的生产力提升。
- 此外,在 AI 研发能力上频繁的、增量的改进,仍然与 AI 研发能力上很快的总体进展速度相一致,但我们已有的数据不足以区分一致的、加速的或减速的改进速率。不清楚还需要做出多少次这种规模的、持续的增量定量改进,AI 研发过程中的定性变化才会发生。
我们还使用了一个目前不能披露的额外信息来源。我们用这个来源来理解 Anthropic 的 AI 研发,但它与 METR 对这一特定模型的理解无关。
(B)我们认为,这一模型的开发至少在某种程度上被 AI 加速了,但不太可能已经被 AI 大幅加速。 这是因为:
- 初步 AI 研发报告所提供的估计是:「由于 AI,能力上大约 1.5 倍的总体加速(也就是 1 年里做出 1.5 年的进展),并且或许有 30% 的概率出现 2 倍加速。」
- 请注意,因为初步报告没有指明这一估计对应的时间段,所以不清楚这一估计适用于 Claude Opus 5.5 的开发,还是适用于另一个时期。
- 我们对 Claude Opus 5.5 能力的理解表明,它是相对 Fable 5.1 的、符合趋势的改进。
- 这基于我们的内部能力评测,它们表明相对 Fable 5.1 是增量改进;也基于 Anthropic 在问卷和研究员访谈中提供的信息,这些信息表明 Claude Opus 5.5 从 Mythos Preview 起延续了 AECI 趋势。
- 我们与 Anthropic 的 AI 研发评估协议包含一项透明度条款,该条款允许我们在未经 Anthropic 同意的情况下公开披露某些事实:审阅与删改流程的存在及其一般条款、Anthropic 是否行使了其删改权利、我们的任何发现是否显著依赖于被删改的信息、我们被给予的访问级别,以及适用于该评测的保密框架。
Cite
@misc{metr-2026-claude-opus-5-5,
title = {Summary of METR's predeployment evaluation of Claude Opus 5.5},
author = {METR},
howpublished = {\url{https://metr.org/blog/2026-09-22-claude-opus-5-5/}},
year = {2026},
month = {09},
}觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。