CodexQA

行业与实践研究与基准测试

时间期限 1.1:METR 用更多长任务重估 Agent 能力

CodexQA 团队阅读约 9 分钟

METR 把时间期限任务从 170 增到 228,长任务从 14 增到 31,评测从 Vivaria 迁到 Inspect。混合趋势的翻倍时间仍是 196 天;2023 年以来则从 165 天收到 131 天。

本文目录

时间期限 1.1

METR

2026 年 1 月 29 日。

我们正在发布时间期限估计的一个新版本(TH1.1),使用更多任务,以及一套新的评测基础设施。

我们对许多模型的时间期限估计做了更新。新估计大体落在我们原有的置信区间之内,不过时间期限增长的趋势看起来略有不同,下文会讨论。我们预计还会继续改评测协议,以便跟上能力仍在快速增长这一事实。

2025 年初,我们发表了时间期限方法(https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/),用来度量 AI 模型的自主能力。

我们发现,模型的人类等效「时间期限」在稳定地指数增长。整个 2025 年,我们把这套方法用到更新的模型上,测到的增速与历史趋势一致。

我们正在推出时间期限评测设置上的两项重大改动:

  1. 改进任务套件。我们把套件从 170 个任务增加到 228 个。我们新增了 73 个任务(全部来自 HCAST,见 Rein (2025)(https://metr.org/hcast.pdf)),删去了 15 个任务,并更新了 53 个任务(27 个任务更新了定义,13 个任务更新了人类时间估计,13 个两者都更新了)。我们把长任务(估计人类需要 8 小时或更久)的数量从 14 个增加到 31 个。新增的是原先没有进入时间期限论文、但后来通过了我们质量检查流程的 HCAST 任务。修改和删除大体对应这些情形:任务描述容易混淆,或容易被奖励破解,或评分函数有错误。
  2. 把评测基础设施从 Vivaria 迁到 Inspect。Vivaria 是我们 2023 年内部开发的。Inspect 是英国人工智能安全研究所开发的、被广泛采用的开源 AI 评测框架。

每个模型的估计时间期限都有一些变化。

我们用新的 TH1.1 任务套件和评测基础设施,重新估计了 14 个模型的有效时间期限。新估计大体落在 TH1 时间期限的置信区间之内。

在已有 TH1 估计的 33 个模型里,我们只重新估计了 14 个。TH1.1 的模型集合更小,原因有好几类,包括:(i)模型已不再公开可用;(ii)模型需要对工具调用脚手架做重大修改(例如 GPT-2、GPT-3 和 GPT-3.5);(iii)模型在发布时离能力前沿很远,不太可能改变所估计的趋势。

估计时间期限的变化,主要来自任务套件的变化,以及一次运行中的随机噪声。也有一部分变化可归因于评测基础设施的更换,不过我们在下文记录:这一部分所占份额相对较小。

我们的新任务套件包含更多任务,估计因此更紧,尤其是在上端。

任务时长分布的条形图

我们把套件中的任务增加了 34%(228/170),并把 8 小时或更长的任务数量翻了一倍(31/14)。这使我们对较新模型的时间期限有了明显更紧的置信区间。例如,Opus 4.5 的上界在 TH1 中是点估计的 4.4 倍,在 TH1.1 中则是点估计的 2.3 倍。这些置信区间仍然很宽。我们正在积极补充更多长任务,以便把估计收得更紧,并在模型能力继续前进时避免饱和。

同样值得注意的是,31 个长任务(8 小时以上)里,我们只对 5 个测量了人类基线时间。其余使用的是估计时间。

时间期限的趋势对任务构成有一定敏感性。

我们原先的时间期限数据集于 2025 年 3 月发布,显示出一条平滑趋势:在 2019 年到 2025 年这段时间里,前沿时间期限大约每 7 个月翻一倍。

我们不能在整个时段上直接比较 TH1 和 TH1.1 的增长率,因为我们没有用 TH1.1 重新估计任何 2023 年之前的模型。因此我们做两种比较。

第一种,我们把 TH1 趋势与一条混合趋势比较。对 TH1.1 里缺失的更早模型(即 GPT-2、GPT-3、GPT-3.5),我们使用 TH1 估计。这条混合趋势的翻倍时间与 TH1 趋势完全相同,都是 196 天(7 个月)。新的拟合看起来略不那么线性,R^2 也略低一点。

时间期限相对发布日期

不同任务套件和评测基础设施下,各模型 50% 时间期限的测量。灰色点是旧任务和旧评测基础设施(TH1)的估计,蓝色点是新任务套件和新评测基础设施(TH1.1)的估计。前三个点标成蓝/灰,表示它们是 TH1 估计,但两条趋势线都用它们来拟合。[1] 完整数据可以在图注上方、我们的实时仪表盘(https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/)里打开。

第二种,我们比较 2023 年以来的 TH1.1 趋势和 TH1 趋势,这一段两种方法都有数据。注意,我们用 TH1.1 估计的模型更少,因此用来估计这些趋势的模型集合大部分重叠,但并不相同。2023 年之后的翻倍时间,在 TH1.1 下是 131 天,在 TH1 下是 165 天,也就是说,按 TH1.1 估计,进展要快 20%。

时间期限相对发布日期,2023 年以来的模型

不同任务套件和评测基础设施下,各模型 50% 时间期限的测量。灰色点是旧任务和旧评测基础设施(TH1)的估计,蓝色点是新任务套件和新评测基础设施(TH1.1)的估计。完整数据可以在图注上方、我们的实时仪表盘(https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/)里打开。

趋势的变化,是因为我们对较旧模型的估计下移了(GPT-4 的不同版本分别下降 35% 和 57%),而对近期模型的估计上移了(GPT-5 和 Opus 4.5 分别上升 55% 和 11%)。TH1.1 的翻倍时间落在 TH1 翻倍时间的置信区间之内。不过,那些置信区间表示的是:换一整套全新任务时,得到同一估计的可能性;而事实上,TH1.1 和 TH1 所含的任务有相当大的重叠。[2] 我们在下文也报告 2024 年以来的翻倍时间:在 TH1 下是 109 天,在 TH1.1 下降到 89 天。

总体而言,我们认为新任务很可能抽自一个略有不同的难度分布,因此它们反映的时间期限底层趋势也略有不同。这是在没有刚性筛选标准的情况下更新任务池的自然后果。我们相信新任务套件总体上是一次改进,因此值得承受被估计量上的这点变化。

更新任务套件的过程,凸显了定义我们希望在其上度量表现的任务分布有多重要。我们此前在多个地方描述过挑选任务来度量时间期限的原则。我们的时间期限论文(Kwa 等人(https://arxiv.org/abs/2503.14499))把这套套件描述为「为捕捉研究所需或软件工程所需技能而设计的数据集,并包括 RE-Bench、HCAST 的一个子集,以及一套新的短任务(SWAA)。我们也在任务悬赏的期望标准(https://taskdev.metr.org/desiderata/)里,以及跨领域时间期限的博客文章(https://metr.org/blog/2025-07-14-how-does-time-horizon-vary-across-domains/)里,描述过任务选择的原则。

我们正在提高能力测量的天花板。

如上所述,即使是 Time Horizon 1.1 套件,最新一代模型无法成功完成的任务也相对较少。我们正优先更新评测,使它们能够测量非常强的模型的能力。

附录

译注:原文这一级标题下面没有单独段落,具体内容写在随后的各个小节里。

数据

我们已经更新了我们的公开代码仓库,其中放入了关于 TH1 和 TH1.1 这两套估计的数据,参见 eval-analysis-public(https://github.com/METR/eval-analysis-public)。

新旧估计的比较

TH1.0TH1.1
百分之五十成功率下的翻倍时间195.8 days [162, 223]196.5 days[3]
百分之五十成功率下的翻倍时间,2023 年及以后165.3 days [129, 211]130.8 days [107, 161]
百分之五十成功率下的翻倍时间,2024 年及以后108.9 days88.6 days
任务数量170228
八小时及以上的任务数量1431
八小时及以上、并且有人类基线的任务数量65
新增加的任务数量73
被删除的任务数量15
模型数量3314
前沿模型数量1711

模型期限估计的变化

TH1TH1.1变化
Claude Opus 4.5289 [110,1268]320 [170,729]+11%
GPT-5.1-codex-max173 [81,411]
Claude Sonnet 4.5122 [59,252]
GPT-5138 [68,281]214 [117,480]+55%
Claude Opus 4.1114 [56,215]
Claude Opus 486 [44,144]101 [58,170]+18%
Grok 4109 [48,235]
Claude Sonnet 475 [38,132]
o394 [48,165]121 [74,201]+29%
Claude Sonnet 3.756 [28,94]60 [32,106]+7%
GPT-4 11068.5 [4.0,16.1]3.6 [1.6,7.5]-57%
GPT-4 03145.4 [2.5,10.3]3.5 [1.6,6.9]-35%

译注:这一表几乎全是模型名和数字,原文没有另写段落。逐行读是:Claude Opus 4.5 的 TH1 为 289、区间 110 到 1268,TH1.1 为 320、区间 170 到 729,变化为正百分之十一。GPT-5.1-codex-max 只有 TH1 的 173、区间 81 到 411,TH1.1 与变化两格原文留空。Claude Sonnet 4.5 只有 TH1 的 122、区间 59 到 252。GPT-5 从 138、区间 68 到 281,变为 214、区间 117 到 480,变化为正百分之五十五。Claude Opus 4.1 只有 TH1 的 114、区间 56 到 215。Claude Opus 4 从 86、区间 44 到 144,变为 101、区间 58 到 170,变化为正百分之十八。Grok 4 只有 TH1 的 109、区间 48 到 235。Claude Sonnet 4 只有 TH1 的 75、区间 38 到 132。o3 从 94、区间 48 到 165,变为 121、区间 74 到 201,变化为正百分之二十九。Claude Sonnet 3.7 从 56、区间 28 到 94,变为 60、区间 32 到 106,变化为正百分之七。GPT-4 1106 从 8.5、区间 4.0 到 16.1,变为 3.6、区间 1.6 到 7.5,变化为负百分之五十七。GPT-4 0314 从 5.4、区间 2.5 到 10.3,变为 3.5、区间 1.6 到 6.9,变化为负百分之三十五。

从 Vivaria 迁到 Inspect。

使用 Vivaria 和 Inspect 的结果略有不同。

我们只使用 TH1 任务,并对 5 个两种基础设施都估计过的模型,详细比较了 Vivaria 与 Inspect 上的任务表现。估计出的时间期限如下。

VivariaInspect
GPT-4o9.2 mins [4.2, 18.1]6.0 mins [2.8, 12.4]
Claude 3.7 Sonnet56 mins [29, 94]59 mins [27, 114]
o394 mins [49, 171]78 mins [39, 150]
Claude Sonnet 4.5122 mins [56, 247]164 mins [71, 437]
Claude Opus 4.5289 mins [104, 1285]270 mins [106, 1258]

TH1.1 的时间期限全部落在 TH1 自助置信区间之内。不过那些自助样本是在任务族、任务和运行上抽取的,因此高估了运行层面的方差。

有两个模型在 Vivaria 下得分显著更高。

对所估计的 5 个模型,我们各自做了跨任务分数的配对 t 检验。我们发现两个模型(GPT-4o 和 o3)在 Vivaria 下的分数在统计上显著高于 Inspect。这似乎是合理的证据:这些模型对脚手架(包括提示)有一定敏感,而且出于某种原因,Vivaria 的脚手架引出了略强的表现。

下图给出 Vivaria 与 Inspect 之间平均任务成功率的差异,正值表示 Vivaria 下成功率更高。蓝线是平均差异,红色和黄色是 95% 置信区间。

平均成功率差异的折线图

任务在 Vivaria 下的平均得分略高于 Inspect。

对每一个任务,我们做了跨模型分数的配对 t 检验。这张图给出各任务成功率的平均差异(Vivaria 减去 Inspect),以及 95% 置信区间。

只有 3 个任务显示出统计上显著的差异(我们使用正态近似,其置信区间偏保守)。不过我们也看到,Vivaria 得分更高的任务(51 个)多于 Inspect 得分更高的任务(31 个)。这很可能是由上面提到的 GPT-4o 和 o3 在各任务上相对更好的表现所推动的,它把 Vivaria 运行的平均分往上抬了。

下图给出 Vivaria 与 Inspect 之间平均运行成功率的差异,正值表示 Vivaria 下成功率更高。黄线是平均差异,蓝色和红色是 95% 置信区间。

平均成功率差异的折线图

我们也细看了离群任务,这些差异看起来并不是系统性的。

在新任务套件上比较 Vivaria 和 Inspect,得到的分数非常接近。

我们还让三个模型在新任务套件上同时跑了 Vivaria 和 Inspect。估计出的时间期限差异非常小。

GPT-4oClaude 3.7 Sonneto3
Vivaria(新套件)6 mins (3 - 12 mins)56 mins (32 - 90 mins)116 mins (72 - 192 mins)
Inspect(新套件)5 mins (3 - 10 mins)57 mins (30 - 101 mins)119 mins (73 - 201 mins)
  1. 另请注意,两个模型(GPT-4-32k-0314 和 o1-preview)的估计是在新任务上、但在旧基础设施(Vivaria)上完成的,当时这些模型尚未被弃用。
  2. 从技术上说,置信区间来自对任务族、任务和运行的自助抽样。
  3. 这是「拼接」趋势上的翻倍时间,2023 年之前的模型使用 TH1.0 估计。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误