时间 期限 1.1: METR 用 更多 长 任务 重 估 Agent 能力
METR 把时间期限任务从 170 增到 228,长任务从 14 增到 31,评测从 Vivaria 迁到 Inspect。混合趋势的翻倍时间仍是 196 天;2023 年以来则从 165 天收到 131 天。

本文目录
时间期限 1.1
METR
2026 年 1 月 29 日。
我们正在发布时间期限估计的一个新版本(TH1.1),使用更多任务,以及一套新的评测基础设施。
我们对许多模型的时间期限估计做了更新。新估计大体落在我们原有的置信区间之内,不过时间期限增长的趋势看起来略有不同,下文会讨论。我们预计还会继续改评测协议,以便跟上能力仍在快速增长这一事实。
2025 年初,我们发表了时间期限方法(https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/),用来度量 AI 模型的自主能力。
我们发现,模型的人类等效「时间期限」在稳定地指数增长。整个 2025 年,我们把这套方法用到更新的模型上,测到的增速与历史趋势一致。
我们正在推出时间期限评测设置上的两项重大改动:
- 改进任务套件。我们把套件从 170 个任务增加到 228 个。我们新增了 73 个任务(全部来自 HCAST,见 Rein (2025)(https://metr.org/hcast.pdf)),删去了 15 个任务,并更新了 53 个任务(27 个任务更新了定义,13 个任务更新了人类时间估计,13 个两者都更新了)。我们把长任务(估计人类需要 8 小时或更久)的数量从 14 个增加到 31 个。新增的是原先没有进入时间期限论文、但后来通过了我们质量检查流程的 HCAST 任务。修改和删除大体对应这些情形:任务描述容易混淆,或容易被奖励破解,或评分函数有错误。
- 把评测基础设施从 Vivaria 迁到 Inspect。Vivaria 是我们 2023 年内部开发的。Inspect 是英国人工智能安全研究所开发的、被广泛采用的开源 AI 评测框架。
每个模型的估计时间期限都有一些变化。
我们用新的 TH1.1 任务套件和评测基础设施,重新估计了 14 个模型的有效时间期限。新估计大体落在 TH1 时间期限的置信区间之内。
在已有 TH1 估计的 33 个模型里,我们只重新估计了 14 个。TH1.1 的模型集合更小,原因有好几类,包括:(i)模型已不再公开可用;(ii)模型需要对工具调用脚手架做重大修改(例如 GPT-2、GPT-3 和 GPT-3.5);(iii)模型在发布时离能力前沿很远,不太可能改变所估计的趋势。
估计时间期限的变化,主要来自任务套件的变化,以及一次运行中的随机噪声。也有一部分变化可归因于评测基础设施的更换,不过我们在下文记录:这一部分所占份额相对较小。
我们的新任务套件包含更多任务,估计因此更紧,尤其是在上端。
我们把套件中的任务增加了 34%(228/170),并把 8 小时或更长的任务数量翻了一倍(31/14)。这使我们对较新模型的时间期限有了明显更紧的置信区间。例如,Opus 4.5 的上界在 TH1 中是点估计的 4.4 倍,在 TH1.1 中则是点估计的 2.3 倍。这些置信区间仍然很宽。我们正在积极补充更多长任务,以便把估计收得更紧,并在模型能力继续前进时避免饱和。
同样值得注意的是,31 个长任务(8 小时以上)里,我们只对 5 个测量了人类基线时间。其余使用的是估计时间。
时间期限的趋势对任务构成有一定敏感性。
我们原先的时间期限数据集于 2025 年 3 月发布,显示出一条平滑趋势:在 2019 年到 2025 年这段时间里,前沿时间期限大约每 7 个月翻一倍。
我们不能在整个时段上直接比较 TH1 和 TH1.1 的增长率,因为我们没有用 TH1.1 重新估计任何 2023 年之前的模型。因此我们做两种比较。
第一种,我们把 TH1 趋势与一条混合趋势比较。对 TH1.1 里缺失的更早模型(即 GPT-2、GPT-3、GPT-3.5),我们使用 TH1 估计。这条混合趋势的翻倍时间与 TH1 趋势完全相同,都是 196 天(7 个月)。新的拟合看起来略不那么线性,R^2 也略低一点。
不同任务套件和评测基础设施下,各模型 50% 时间期限的测量。灰色点是旧任务和旧评测基础设施(TH1)的估计,蓝色点是新任务套件和新评测基础设施(TH1.1)的估计。前三个点标成蓝/灰,表示它们是 TH1 估计,但两条趋势线都用它们来拟合。[1] 完整数据可以在图注上方、我们的实时仪表盘(https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/)里打开。
第二种,我们比较 2023 年以来的 TH1.1 趋势和 TH1 趋势,这一段两种方法都有数据。注意,我们用 TH1.1 估计的模型更少,因此用来估计这些趋势的模型集合大部分重叠,但并不相同。2023 年之后的翻倍时间,在 TH1.1 下是 131 天,在 TH1 下是 165 天,也就是说,按 TH1.1 估计,进展要快 20%。
不同任务套件和评测基础设施下,各模型 50% 时间期限的测量。灰色点是旧任务和旧评测基础设施(TH1)的估计,蓝色点是新任务套件和新评测基础设施(TH1.1)的估计。完整数据可以在图注上方、我们的实时仪表盘(https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/)里打开。
趋势的变化,是因为我们对较旧模型的估计下移了(GPT-4 的不同版本分别下降 35% 和 57%),而对近期模型的估计上移了(GPT-5 和 Opus 4.5 分别上升 55% 和 11%)。TH1.1 的翻倍时间落在 TH1 翻倍时间的置信区间之内。不过,那些置信区间表示的是:换一整套全新任务时,得到同一估计的可能性;而事实上,TH1.1 和 TH1 所含的任务有相当大的重叠。[2] 我们在下文也报告 2024 年以来的翻倍时间:在 TH1 下是 109 天,在 TH1.1 下降到 89 天。
总体而言,我们认为新任务很可能抽自一个略有不同的难度分布,因此它们反映的时间期限底层趋势也略有不同。这是在没有刚性筛选标准的情况下更新任务池的自然后果。我们相信新任务套件总体上是一次改进,因此值得承受被估计量上的这点变化。
更新任务套件的过程,凸显了定义我们希望在其上度量表现的任务分布有多重要。我们此前在多个地方描述过挑选任务来度量时间期限的原则。我们的时间期限论文(Kwa 等人(https://arxiv.org/abs/2503.14499))把这套套件描述为「为捕捉研究所需或软件工程所需技能而设计的数据集,并包括 RE-Bench、HCAST 的一个子集,以及一套新的短任务(SWAA)。我们也在任务悬赏的期望标准(https://taskdev.metr.org/desiderata/)里,以及跨领域时间期限的博客文章(https://metr.org/blog/2025-07-14-how-does-time-horizon-vary-across-domains/)里,描述过任务选择的原则。
我们正在提高能力测量的天花板。
如上所述,即使是 Time Horizon 1.1 套件,最新一代模型无法成功完成的任务也相对较少。我们正优先更新评测,使它们能够测量非常强的模型的能力。
附录
译注:原文这一级标题下面没有单独段落,具体内容写在随后的各个小节里。
数据
我们已经更新了我们的公开代码仓库,其中放入了关于 TH1 和 TH1.1 这两套估计的数据,参见 eval-analysis-public(https://github.com/METR/eval-analysis-public)。
新旧估计的比较
| TH1.0 | TH1.1 | |
|---|---|---|
| 百分之五十成功率下的翻倍时间 | 195.8 days [162, 223] | 196.5 days[3] |
| 百分之五十成功率下的翻倍时间,2023 年及以后 | 165.3 days [129, 211] | 130.8 days [107, 161] |
| 百分之五十成功率下的翻倍时间,2024 年及以后 | 108.9 days | 88.6 days |
| 任务数量 | 170 | 228 |
| 八小时及以上的任务数量 | 14 | 31 |
| 八小时及以上、并且有人类基线的任务数量 | 6 | 5 |
| 新增加的任务数量 | 73 | |
| 被删除的任务数量 | 15 | |
| 模型数量 | 33 | 14 |
| 前沿模型数量 | 17 | 11 |
模型期限估计的变化
| TH1 | TH1.1 | 变化 | |
|---|---|---|---|
| Claude Opus 4.5 | 289 [110,1268] | 320 [170,729] | +11% |
| GPT-5.1-codex-max | 173 [81,411] | ||
| Claude Sonnet 4.5 | 122 [59,252] | ||
| GPT-5 | 138 [68,281] | 214 [117,480] | +55% |
| Claude Opus 4.1 | 114 [56,215] | ||
| Claude Opus 4 | 86 [44,144] | 101 [58,170] | +18% |
| Grok 4 | 109 [48,235] | ||
| Claude Sonnet 4 | 75 [38,132] | ||
| o3 | 94 [48,165] | 121 [74,201] | +29% |
| Claude Sonnet 3.7 | 56 [28,94] | 60 [32,106] | +7% |
| GPT-4 1106 | 8.5 [4.0,16.1] | 3.6 [1.6,7.5] | -57% |
| GPT-4 0314 | 5.4 [2.5,10.3] | 3.5 [1.6,6.9] | -35% |
译注:这一表几乎全是模型名和数字,原文没有另写段落。逐行读是:Claude Opus 4.5 的 TH1 为 289、区间 110 到 1268,TH1.1 为 320、区间 170 到 729,变化为正百分之十一。GPT-5.1-codex-max 只有 TH1 的 173、区间 81 到 411,TH1.1 与变化两格原文留空。Claude Sonnet 4.5 只有 TH1 的 122、区间 59 到 252。GPT-5 从 138、区间 68 到 281,变为 214、区间 117 到 480,变化为正百分之五十五。Claude Opus 4.1 只有 TH1 的 114、区间 56 到 215。Claude Opus 4 从 86、区间 44 到 144,变为 101、区间 58 到 170,变化为正百分之十八。Grok 4 只有 TH1 的 109、区间 48 到 235。Claude Sonnet 4 只有 TH1 的 75、区间 38 到 132。o3 从 94、区间 48 到 165,变为 121、区间 74 到 201,变化为正百分之二十九。Claude Sonnet 3.7 从 56、区间 28 到 94,变为 60、区间 32 到 106,变化为正百分之七。GPT-4 1106 从 8.5、区间 4.0 到 16.1,变为 3.6、区间 1.6 到 7.5,变化为负百分之五十七。GPT-4 0314 从 5.4、区间 2.5 到 10.3,变为 3.5、区间 1.6 到 6.9,变化为负百分之三十五。
从 Vivaria 迁到 Inspect。
使用 Vivaria 和 Inspect 的结果略有不同。
我们只使用 TH1 任务,并对 5 个两种基础设施都估计过的模型,详细比较了 Vivaria 与 Inspect 上的任务表现。估计出的时间期限如下。
| Vivaria | Inspect | |
|---|---|---|
| GPT-4o | 9.2 mins [4.2, 18.1] | 6.0 mins [2.8, 12.4] |
| Claude 3.7 Sonnet | 56 mins [29, 94] | 59 mins [27, 114] |
| o3 | 94 mins [49, 171] | 78 mins [39, 150] |
| Claude Sonnet 4.5 | 122 mins [56, 247] | 164 mins [71, 437] |
| Claude Opus 4.5 | 289 mins [104, 1285] | 270 mins [106, 1258] |
TH1.1 的时间期限全部落在 TH1 自助置信区间之内。不过那些自助样本是在任务族、任务和运行上抽取的,因此高估了运行层面的方差。
有两个模型在 Vivaria 下得分显著更高。
对所估计的 5 个模型,我们各自做了跨任务分数的配对 t 检验。我们发现两个模型(GPT-4o 和 o3)在 Vivaria 下的分数在统计上显著高于 Inspect。这似乎是合理的证据:这些模型对脚手架(包括提示)有一定敏感,而且出于某种原因,Vivaria 的脚手架引出了略强的表现。
下图给出 Vivaria 与 Inspect 之间平均任务成功率的差异,正值表示 Vivaria 下成功率更高。蓝线是平均差异,红色和黄色是 95% 置信区间。
任务在 Vivaria 下的平均得分略高于 Inspect。
对每一个任务,我们做了跨模型分数的配对 t 检验。这张图给出各任务成功率的平均差异(Vivaria 减去 Inspect),以及 95% 置信区间。
只有 3 个任务显示出统计上显著的差异(我们使用正态近似,其置信区间偏保守)。不过我们也看到,Vivaria 得分更高的任务(51 个)多于 Inspect 得分更高的任务(31 个)。这很可能是由上面提到的 GPT-4o 和 o3 在各任务上相对更好的表现所推动的,它把 Vivaria 运行的平均分往上抬了。
下图给出 Vivaria 与 Inspect 之间平均运行成功率的差异,正值表示 Vivaria 下成功率更高。黄线是平均差异,蓝色和红色是 95% 置信区间。
我们也细看了离群任务,这些差异看起来并不是系统性的。
在新任务套件上比较 Vivaria 和 Inspect,得到的分数非常接近。
我们还让三个模型在新任务套件上同时跑了 Vivaria 和 Inspect。估计出的时间期限差异非常小。
| GPT-4o | Claude 3.7 Sonnet | o3 | |
|---|---|---|---|
| Vivaria(新套件) | 6 mins (3 - 12 mins) | 56 mins (32 - 90 mins) | 116 mins (72 - 192 mins) |
| Inspect(新套件) | 5 mins (3 - 10 mins) | 57 mins (30 - 101 mins) | 119 mins (73 - 201 mins) |
- 另请注意,两个模型(GPT-4-32k-0314 和 o1-preview)的估计是在新任务上、但在旧基础设施(Vivaria)上完成的,当时这些模型尚未被弃用。
- 从技术上说,置信区间来自对任务族、任务和运行的自助抽样。
- 这是「拼接」趋势上的翻倍时间,2023 年之前的模型使用 TH1.0 估计。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。