CodexQA

行业与实践研究与基准测试

度量 AI 完成长软件任务的能力

CodexQA 团队阅读约 7 分钟

METR 用人类完成任务所需的时间刻画智能体能力。过去 6 年,50% 时间期限大约每 7 个月翻一倍。若趋势再持续数年,通用智能体或能做长达一周的任务。

本文目录

度量 AI 完成长软件任务的能力

这篇帖子里的一些文字和图已经过时。

下面的交互式图表保持更新,但静态图以及正文里的一些说法(例如翻倍时间)反映的是最初发表时的数据状态。关于我们最新的方法和结果,见专门的时间期限页面和 Time Horizon 1.1。

分析代码在 GitHub 上。原始数据在这里。

这是我们对公开语言模型任务完成时间期限的最新测量。方法细节和常见问题见我们专门的时间期限页面。

摘要

我们提议用 AI 智能体能够完成的任务的长度来度量 AI 表现。我们表明,这一指标在过去 6 年里一直在指数增长,翻倍时间大约是 7 个月。外推这一趋势,预测在不到十年里,我们将看到这样的 AI 智能体:它们能够独立完成很大一部分目前要花人类数天或数周的软件任务。

AI 能做的任务长度每 7 个月翻一倍

我们认为,预测未来 AI 系统的能力,对于理解和准备强大 AI 的影响很重要。但预测能力趋势很难,即便理解今天模型的能力也可能让人困惑。

当前的前沿 AI 在文本预测和知识任务上远远好于人类。它们以人类成本的一小部分,在大多数考试式问题上超过专家。经过一些针对任务的适配,它们也可以在许多应用里充当有用的工具。然而,最好的 AI 智能体目前还不能独自完成有实质内容的项目,也不能直接替代人类劳动。它们甚至不能可靠地处理相对低技能的、基于计算机的工作,例如远程行政助理。很清楚的是,能力在某种意义上增加得非常快,但不清楚这如何对应到真实世界的影响。

AI 系统在各项能力上相对人类表现的测试分数

我们发现,测量模型能够完成的任务的长度,是理解当前 AI 能力的一个有帮助的镜头。1 这说得通:AI 智能体常常看起来更难把更长的一串动作串起来,而不是缺少解决单一步骤所需的技能或知识。

在一套多样的、多步骤的软件与推理任务上,我们记录具有相应专长的人类完成任务所需的时间。我们发现,人类专家所花的时间强烈预测模型在给定任务上的成功:当前模型在人类不到 4 分钟的任务上成功率几乎是 100%,但在大约超过 4 小时的任务上成功率不到 10%。这让我们能用「模型能以 x% 的概率成功完成的任务的长度(对人类而言)」来刻画一个给定模型的能力。

人类时长与成功率

对每一个模型,我们可以拟合一条 logistic 曲线,用人类任务长度来预测模型成功概率。在固定一个成功概率之后,我们可以把每个模型预测的成功曲线转换成一段时长,办法是看预测成功曲线与该概率相交处的任务长度。例如,下面是若干模型拟合的成功曲线,以及我们预测成功率为 50% 的任务长度:

模型正在做成越来越长的任务

我们认为这些结果有助于化解一个表面上的矛盾:许多基准上的超人类表现,以及常见的经验观察——模型似乎并不能稳健地帮助自动化人们日常工作的一部分。最好的当前模型——例如 Claude 3.7 Sonnet——能够完成一些即便专家人类也要花数小时的任务,但只能可靠地完成长达几分钟的任务。

尽管如此,看历史数据,我们看到最先进模型能够完成的任务长度(以 50% 的概率)在过去 6 年里急剧增加。

任务长度的线性上升

如果把这画在对数尺度上,我们可以看到模型能够完成的任务长度被一条指数趋势很好地预测,翻倍时间大约是 7 个月。

任务长度每七个月翻倍

一个智能体能够完成的任务长度的估计,依赖于方法选择,例如用哪些任务,以及测量的是哪些人的表现。然而,我们相当有信心,总体趋势大致是对的,大约每年 1 到 4 次翻倍。如果过去 6 年测到的趋势再继续 2 到 4 年,通用自主智能体将能够执行很大范围的、长达一周的任务。

趋势很陡,这意味着我们对不同能力何时到来的预测,即便测量有大误差,或模型与人类的比较有大误差,也相对稳健。例如,如果绝对测量偏了 10 倍,那只把到达时间改变大约 2 年。

我们在全文论文里讨论结果的局限,并详述各种稳健性检查和敏感性分析。简要地说,我们表明类似趋势在下面这些地方也成立(尽管更嘈杂):

  • 我们任务的各种子集,它们可能代表不同的分布(很短的软件任务,相对于多样的 HCAST,相对于 RE-Bench,以及按长度或对「凌乱程度」的定性评估过滤后的子集)。
  • 一个基于真实任务的单独数据集(SWE-Bench Verified),人类时间数据是独立收集的,基于估计而不是基线。它显示出甚至更快的翻倍时间,不到 3 个月。2
SWE-bench 上的时间期限

我们也在论文里表明,我们的结果看起来对纳入哪些任务或模型并不特别敏感,对我们调查过的任何其他方法选择或噪声来源也不特别敏感:

外推到一个月 AI 的日期的不确定性

然而,仍然存在实质性模型误差的可能。例如,有理由认为,AI 的近期趋势比 2024 年之前的趋势更能预测未来表现。如上所示,当我们只对 2024 和 2025 年的数据拟合一条相似的趋势时,这把「AI 何时能以 50% 的可靠性完成长达一个月的任务」的估计缩短了大约 2.5 年。

结论

我们相信这项工作对 AI 基准、预测和风险管理有重要含义。

第一,我们的工作展示了一种使基准对预测更有用的做法:用系统能够完成的任务的长度来度量 AI 表现(长度用这些任务要花人类多久来度量)。这让我们能在很宽的能力水平和多样的领域上测量模型如何改进。3 与此同时,与真实世界结果的直接关系,允许对绝对表现做有意义的解释,而不只是相对表现。

第二,我们在一个对真实世界影响重要的指标上,发现了一条相当稳健的、跨越多年 AI 进展的指数趋势。如果过去 6 年的趋势持续到这个十年的末尾,前沿 AI 系统将能够自主执行长达一个月的项目。这会带来巨大的利害,既包括潜在收益,也包括潜在风险。4

想要贡献吗?

我们非常高兴看到其他人在这项工作上继续建造,并把背后的想法往前推,正如这项研究本身建立在此前评测 AI 智能体的工作之上。因此,我们开源了我们的基础设施、数据和分析代码。如上所述,这个方向可能与未来评测的设计高度相关,所以复现或扩展会对预测 AI 的真实世界影响非常有信息量。

此外,METR 正在招聘!这个项目以某种方式涉及了 METR 的大多数员工,我们目前正在做另外几个我们觉得同样令人兴奋的项目。如果你或你认识的人适合这类工作,请看列出的职位。

作者

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

这类似于 Richard Ngo 所说的 t-AGI,并且在其他先前工作里被探讨过,例如 Ajeya Cotra 的 Bio Anchors 报告。 ↩

我们怀疑这至少部分是因为时间估计被操作化的方式。作者们不把熟悉代码库所需的时间算进任务时间。这对短任务的时间估计有很大影响(熟悉过程占了总时间的很大一部分),但对更长的任务影响较小。因此,在他们的方法里,同一组任务的人类时间估计上升得更快。 ↩

大多数基准做不到这一点,因为它们覆盖的难度范围相对窄。其他不符合这一标准的基准例子,包括在题目难度呈多峰分布时的「答对问题的百分比」这类分数,或者其中有一部分题目是不可能的。 ↩

关于 AI 系统能够完成长得多的任务意味着什么,一些具体例子见 Clarifying and predicting AGI。关于挑战和收益的具体例子,见 Preparing for the Intelligence Explosion 和 Machines of Loving Grace。 ↩

译注:上面的作者名单按原文顺序逐人保留,人名不翻译、不合并、不省略。这一节的职位邀请与开源链接也保持原地址。脚注四条均已译出,回链标记与原文一致。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误