衡量 人工 智能 完成 长 时 软件 任务 的 能力
尽管人工智能基准测试进步迅速,基准成绩在现实世界中究竟意味着什么,仍然不清楚。为了用人类能力来量化人工智能系统的能力,我们提出一项新指标:50% 任务完成时间视界(50%-task-completion time horizon),即人工智
本文目录
衡量人工智能完成长时软件任务的能力(中文全译)
翻译说明:本文是 arXiv 论文 Measuring AI Ability to Complete Long Software Tasks(arXiv:2503.14499)的中文全译,由智测团队翻译。原作者:Thomas Kwa、Ben West、Joel Becker、Amy Deng、Katharyn Garcia、Max Hasin、Sami Jawhar、Megan Kinniment、Nate Rush、Sydney Von Arx、Ryan Bloom、Thomas Broadley、Haoxing Du、Brian Goodrich、Nikola Jurkovic、Luke Harold Miles、Seraphina Nix、Tao Lin、Chris Painter、Neev Parikh、David Rein、Lucas Jun Koba Sato、Hjalmar Wijk、Daniel M. Ziegler、Elizabeth Barnes、Lawrence Chan。原文以 CC BY 4.0 许可发布。译文保留原文全部章节、数据与结论;参考文献列表从略。
arXiv:2503.14499v4 [cs.AI] 2026年7月10日
作者:Thomas Kwa(同等贡献;通讯作者,thomas.kwa@metr.org)、Ben West(同等贡献)、Joel Becker、Amy Deng、Katharyn Garcia、Max Hasin、Sami Jawhar、Megan Kinniment、Nate Rush、Sydney Von Arx、Ryan Bloom、Thomas Broadley、Haoxing Du、Brian Goodrich、Nikola Jurkovic、Luke Harold Miles、Seraphina Nix、Tao Lin、Chris Painter、Neev Parikh、David Rein、Lucas Jun Koba Sato、Hjalmar Wijk、Daniel M. Ziegler、Elizabeth Barnes、Lawrence Chan
机构:Model Evaluation & Threat Research(METR)
源文脚注另记两项机构说明:Ohm Chip(工作完成于 METR);Anthropic(工作完成于 METR)。所提供源文抽取止于致谢,附录 A–J 正文未包含在源文中,本译文不补写附录。
摘要
尽管人工智能基准测试进步迅速,基准成绩在现实世界中究竟意味着什么,仍然不清楚。为了用人类能力来量化人工智能系统的能力,我们提出一项新指标:50% 任务完成时间视界(50%-task-completion time horizon),即人工智能模型能以 50% 成功率完成的那些任务,人类通常需要花费的时间。我们首先让具备相关领域专长的人类,在 RE-Bench、HCAST 以及 66 项新的较短任务的组合上计时。在这些任务上,当前前沿人工智能模型(如 o3)的 50% 时间视界约为 110 分钟。此外,自 2019 年以来,前沿人工智能的时间视界大约每七个月翻一倍,不过这一趋势自 2024 年以来可能有所加速。人工智能模型时间视界的增长,似乎主要由更高的可靠性、适应错误的能力、逻辑推理以及工具使用能力所驱动。我们讨论结果的局限——包括其外部效度的程度——以及自主性增强对危险能力的含义。如果这些结果能够推广到现实世界的软件任务,对该趋势的外推预测:五年之内,人工智能系统将有能力自动化许多目前需要人类花费一个月才能完成的软件任务。
1 引言
图 1:通用自主前沿模型智能体能够以 50% 可靠性完成的任务长度(以人类专业人员完成这些任务所需时间衡量),在过去 6 年中大约每 7 个月翻一倍(第 3 节)。阴影区域表示通过对任务族、任务和任务尝试进行分层自助法计算得到的 95% 置信区间。即便绝对测量值偏离一个 10 倍的因子,该趋势仍然预测:不到十年,我们将看到能够独立完成很大一部分目前需要人类数天或数周的软件任务的人工智能智能体(第 5 节)。
过去五年,前沿人工智能系统的能力发生了剧烈转变,从基本的文本生成 [37] 演进到自主执行长达数小时的复杂机器学习研究项目 [46]。能力足够强的人工智能可能执行危险且高度复杂的行动,例如自主研制化学、生物、放射性或核武器(CBRN),以及在人类控制之外进行自我复制与适应 [34]。理解人工智能能力,有助于在系统日益强大时为安全护栏的开发提供信息。特别是,许多前沿人工智能开发者已承诺使用对特定人工智能能力的度量,来决定其前沿人工智能系统所需的风险缓释措施。因此,能够准确追踪并预测人工智能能力的稳健基准,构成负责任的人工智能治理与风险缓释的基础。
然而,现有基准面临若干关键局限。第一,它们往往由人造任务而非具有经济价值的任务构成。第二,基准常常被对抗性地挑选为当前模型相对人类更吃力的任务。[^1] 这会使与人类表现的比较产生偏差。最关键的是,单个基准饱和得越来越快 [24],而我们缺少一种更一般、更直观、更定量的方式在不同基准之间进行比较,[^2] 这使得能力相差极大的模型之间无法进行有意义的比较(例如 GPT-2 与 Claude 3.7)。其结果是:尽管过去几年人工智能在许多单项基准上的表现大幅提升,要理解人工智能能力的总体进展,仍不得不去估计人工智能系统能够通过的最新基准在定性上有多难。
我们建议用任务完成时间视界来追踪人工智能随时间的进展:即模型能够以某一成功概率完成的任务所持续的时长,从而相对人类提供一种对现实世界能力的直观度量。由于模型未必能可靠地完成某一给定长度的全部任务,我们将其操作化为测量 X%(任务完成)时间视界——即模型大约能在 X% 的时间里完成的任务长度。
我们用三套旨在捕捉研究或软件工程所需技能的数据集来原型化这一方法(第 2.1 节),共计 170 项难度范围很宽的任务:HCAST [38]、RE-Bench [46],以及软件原子动作(Software Atomic Actions,SWAA)——一套新的较短软件任务,可用于测量 2023 年之前的模型(附录 B.1.3)。借助熟练的人类基线测评者,我们估计一名具备领域知识的人类(但不具备该任务的特定上下文)完成这些任务所需的时长(第 2.2 节)。我们评估了 2019 年至 2025 年的 12 个前沿模型在这些任务上的表现(第 2.3 节)。随后,使用受人类心理测量研究启发的方法,我们估计模型能以 50% 成功率完成的任务时长——即 50% 时间视界(第 3.1 节)。
我们发现,在这些任务上,50% 时间视界在 2019–2025 年呈指数增长,倍增时间约为七个月(图 1)。我们将主要结果与在非 SWAA 任务上的探索性结果进行比较,发现 2023–2025 年的时间视界增长率比 2019–2025 年的增长率大约快 20%(第 F.1 节)。我们还测量了模型的 80% 时间视界(图 17),并发现类似趋势,不过时间视界大约短 5 倍。这一进展似乎由若干关键因素驱动:更好的逻辑推理、更好的工具使用,以及任务执行中更高的可靠性与自我觉察(第 3.3 节)。我们也指出当前系统的若干局限——尤其是,在结构较弱、更「杂乱」的任务上,表现低得多(第 F.2 节)。
由于我们的任务并不能完美代表研究人员与软件工程师智力劳动的平均片段,这就提出了外部效度问题(第 4 节):指数趋势在现实世界任务上是否成立。我们纳入三项补充性外部效度实验。这些实验几乎没有发现证据表明,在我们所测试的、多少更现实一些的任务上,表现趋势更慢;但它们并不能排除如下可能性:在自动化软件工程师工作所需的任务分布上,趋势会明显更慢。我们还发现证据表明,人工智能智能体的时间视界会因任务领域和参照人类群体的不同而相差一个很大的因子。
我们最后讨论对人工智能能力预测的含义(第 5 节)。朴素地外推时间视界长度的趋势意味着:人工智能将在 2028 年年中至 2031 年年中之间达到大于 1 个月(167 个工作小时)的时间视界(图 6)。然而,外推同时受到外部效度方面的担忧以及趋势未来变化的影响。
图 2:我们测量人工智能智能体时间视界的方法。首先,我们创建一套包含 170 项任务的多样化任务集。其次,我们让人类和人工智能智能体(由人工智能模型与脚手架组成)尝试这些任务,记录成功人类所花费的时间以及人工智能智能体的成功率。第三,我们拟合一个逻辑模型,找出每个人工智能智能体有 50% 成功机会时所对应的时间视界,并将其相对模型发布日期作图。
1.1 相关工作
这里我们简要讨论相关工作。扩展讨论见附录 A。
#### 智能体式人工智能能力基准
许多近期基准旨在测量人工智能系统作为一般智能体行动的能力,包括 AgentBench [22]、ToolBench [13]、GAIA [26]、TheAgentCompany [47]、Berkeley Function Calling Leaderboard [48]。在本工作中,我们研究人工智能智能体在 RE-Bench [46]、HCAST [38] 和 SWE-Bench Verified [7] 上的表现,这些基准聚焦机器学习与软件工程任务。其他类似基准包括 MLAgentBench [17]、MLEBench [5] 和 DSBench [20]。在同期工作中,Miserendino 等人 [27] 创建了 SWE-Lancer 基准,由从 Upwork 收集的 1400 项自由职业软件工程任务组成,现实世界报酬总额超过 100 万美元。
#### 人工智能能力预测
本工作建立在此前预测人工智能系统能力随时间变化的努力之上,包括用人类专家来情境化基准表现的工作(Phuong 等人 [34];Murray 等人 [28]),以及预测特定基准上表现的工作(Owen [31];Pimpale 等人 [35])。用人类时间视界来情境化人工智能能力,由 Ngo [29] 提出;Carlsmith [4] 与 Cotra [9] 讨论了类似概念。
#### 人类心理测量方法
我们的方法从人类心理测量测试中获得启发,尤其是项目反应理论(Item Response Theory)[3;10;23]。
2 在现实任务上测量人工智能智能体表现
2.1 任务集 / 数据集
我们的任务由三套彼此不同的任务集组成:
- HCAST [38] 的一个子集:97 项多样化软件任务,时长从 1 分钟到 30 小时。[^3]
- RE-Bench [46]:7 项困难的机器学习研究工程任务,全部为八小时。
- 软件原子动作(SWAA):66 项单步任务,代表软件开发者工作中的短片段,时长从 1 秒到 30 秒。
所有任务都用连续分数或二元阈值自动评分;我们如何归一化并处理分数的细节见第 3.1 节,任务集的其他细节见附录 B。
#### 示例任务
五则示例任务见表 1。不足 1 分钟的任务测量与专业软件工程相关的知识。到 10 分钟时,任务可以包括一个真实软件项目中最容易、但仍有意义的步骤(例如配置一个常见的开源软件包)。最短的、可以单独构成具有经济相关性的项目的任务大约需要一小时;到八小时时,任务代表有价值的软件项目。这些任务的更多示例见 Wijk 等人 [46] 与 Rein 等人 [38]。
| 任务族 | 时长 | 说明 |
|---|---|---|
| find_shell_script | 3 秒 | 选择题:「哪个文件是 shell 脚本?」选项:「run.sh」、「run.txt」、「run.py」、「run.md」 |
| wikipedia_research | 1 分钟 | 从维基百科检索简单的事实信息,并对直截了当的问题给出准确答案。 |
| oxdna_simple | 9 分钟 | 检测并修复使用 oxDNA 软件包进行分子动力学模拟时输入文件中的一个缺陷。 |
| munge_data | 56 分钟 | 编写一个 Python 脚本,根据所提供的示例文件推断转换规则,把 JSON 数据从一种格式变换为另一种格式。 |
| cuda_backtesting | 8 小时 | 通过实现自定义 CUDA 内核来加速一个用于交易执行的 Python 回测工具,同时保留全部功能,目标是获得 30 倍的性能提升。 |
表 1:不同时长的示例任务;更多示例见 Rein 等人 [38] 与 Wijk 等人 [46]。
2.2 建立基线
为了给人工智能智能体的表现提供参照,我们还测量了多名人类「基线测评者」在大多数任务上的表现,并记录了他们尝试的时长。总计我们使用了超过 800 条基线,合计 2529 小时;其中 558 条基线(286 条成功)来自 HCAST 与 RE-Bench,249 条(236 条成功)来自较短的 SWAA 任务。169 项任务中有 148 项具有人类基线,但对 HCAST 中的 21 项任务,我们依赖研究人员的估计。
我们的基线测评者是软件工程、机器学习与网络安全方面的熟练专业人员,其中大多数曾就读世界前 100 名大学。他们平均拥有约 5 年相关经验,软件工程基线测评者的经验多于机器学习或网络安全基线测评者。关于基线的更多细节见附录 C.1。
2.3 结果
我们测量了 2019 年至 2025 年间发布的 12 个前沿模型(以及 4 个近前沿模型);所用模型与脚手架的完整信息见附录 C.3。我们对每个智能体 / 任务配对进行 8 次运行,[^4] 并在图 3 中报告平均结果。随时间存在强劲的上升趋势:近期模型大约完成全部任务的 50%,而更早的模型表现差得多。我们发现模型能够完成的任务之间存在显著相关(图 22),平均相关约为 0.73。
图 3:左:每个模型在整个合并任务集上的平均任务成功率。与本工作正文所报告的全部结果一样,为降低大型任务族的影响,我们按任务所属任务族中任务数量的平方根的倒数对每项任务加权。右:模型成功率与人类完成该任务所需时间负相关。(\(y=-0.07x+0.66\),\(R^{2}:0.83\))
人类基线测评者完成一项任务所需时间,与该任务上(跨全部模型的)平均成功率之间存在负相关。成功率随长度下降(图 3)能被指数模型良好拟合(将模型成功率对人类完成时间的对数做回归时,\(R^{2}\approx 0.80\))。正如预期,更新近的模型能够完成更长的任务,Claude 3.7 Sonnet 与 o3 完成了若干需要人类基线测评者超过 4 小时的任务(图 4)。
3 时间视界
3.1 计算时间视界
要把智能体运行数据转换为任务完成时间视界,我们首先把智能体在每项任务上的表现转换为二元值(成功或失败)。许多任务天然是二元的,包括全部 SWAA 任务。连续评分的任务通过一个任务特定阈值二值化,该阈值被选来代表人类表现。对 HCAST,任务特定阈值就是人类基线测评者试图达到的同一个「目标分数」,我们也用它来筛选成功的运行。RE-Bench 任务的固定时间评级为 8 小时,因此任务特定阈值是 7–9 小时人类运行的平均分数。
图 4:全部模型在测试集上的成功率,展示将时间视界计算为预测的 50% 成功率时间。逻辑拟合相当好,不过在不足 1 分钟的 SWAA 任务与超过 1 分钟的 HCAST 任务之间,成功率存在一次跳跃。
一旦我们有了每项任务的智能体成功率与时间评级,就通过如下逻辑回归来拟合时间视界:[^5]
\[ p_{\mathrm{success}}(\mathrm{agent},\mathrm{task})=\sigma\left((\log h_{\mathrm{agent}}-\log t_{\mathrm{task}})\cdot\beta_{\mathrm{agent}}\right) \]
其中 \(t_{\mathrm{task}}\) 是成功人类基线的几何平均时间,\(h_{\mathrm{agent}}\) 与 \(\beta_{\mathrm{agent}}\) 是学习得到的参数,\(h_{\mathrm{agent}}\) 表示 50% 时间视界。
3.2 时间视界与发布日期
在图 1 中,我们把每个模型的时间视界相对其发布日期作图——即实验室首次公开宣布该前沿模型的日期。[^6] 此外,我们对 \(\log(\text{时间视界})\) 相对发布日期做线性回归,[^7] 发现时间视界每 207 天翻一倍,95% 自助置信区间为 166–240 天(大约 \(\pm 19\%\))。误差棒通过对任务族、然后是任务、然后是运行的三层分层自助法抽取 10000 个样本来计算。
尽管每个模型的时间视界长度都有很宽的误差棒,这些误差在模型之间高度相关。这是因为,人类时间评级相同的任务对模型而言难度差异很大,抽到容易(或困难)的任务会使所有模型的时间视界估计都偏高(或偏低)。因此,我们对时间视界趋势斜率的信心,高于对任一特定模型时间视界的信心。该拟合对正则化、任务加权、加权最小二乘相对普通最小二乘等多种超参数并不敏感(见图 6)。
从 2019 年到 2025 年初的整个时段,时间视界长度都大幅增长。GPT-2 的 50% 时间视界只有 2 秒,而 o3 的时间视界为 110 分钟,并在若干超过 4 小时的任务上取得成功。此外,o3 位于长期趋势之上(\(p = 0.006\));这一点对使用连续评分等方法论消融是稳健的(附录 H),这可能意味着 2024 年与 2025 年初的趋势更快。
#### 3.2.1 50% 成功率与 80% 成功率下的时间视界
为检查我们对 50% 成功率的选择是否影响长期趋势,我们还计算人工智能智能体以 80% 成功率完成任务时所对应的时间视界,如图 17 所示。80% 时间视界的倍增时间(204 天)与 50% 时间视界的倍增时间(207 天)相似,处于误差范围之内。然而,模型的 80% 时间视界要短 4–6 倍,这表明:即便有时能在困难且多样的任务上成功的模型,也不能可靠地完成中等长度的任务。由于数据集有限,我们无法有信心地测量非常高成功率(例如 95%)下的时间视界——见第 E.3 节。
3.3 定性分析
通过检查 31 次随机抽样的、未成功的 GPT-4 1106 智能体运行,以及 32 次 o1 运行的记录,我们观察到:模型在工具使用能力上似乎有了很大改进,表现出明显更强的适应错误的能力(而不是重复不成功的行动),并在需要逻辑推理或代码生成的任务部分表现好得多。然而,我们注意到人工智能智能体在直观上更「杂乱」的环境中似乎仍然吃力——具体而言,是在没有清晰反馈回路的环境中,或在智能体需要主动寻找相关信息的环境中。
表 2 按模型给出了分类后的失败。这些类别的定义,以及定性改进与持续存在的局限的示例,见附录 D。
| 失败类型 | GPT-4 1106 | o1 |
|---|---|---|
| 规划差 / 工具选择差 | 4 | 6 |
| 心算 / 推理不正确 | 6 | 7 |
| 过早放弃任务 | 8 | 16 |
| 重复失败的行动 | 12 | 2 |
| 其他 | 1 | 1 |
| 合计 | 31 | 32 |
表 2:对 GPT-4 1106 的 31 次失败运行与 o1 的 32 次失败运行的分类(第 3.3 节)。注意:由于 o1 在更多任务上成功,其失败所对应的任务比 GPT-4 的失败更具挑战性。
4 外部效度与稳健性
我们检查不包含 SWAA 数据集的 2023–2025 年趋势能否回溯推断自 2019 年以来的趋势,并发现两者相符。我们还进行三项实验以检查外部效度。
第一,我们在 SWE-bench Verified 上复现我们的方法。我们发现指数趋势仍然成立(图 5),尽管倍增时间甚至更短。这可能是因为 SWE-bench Verified 的难度标注意在代表高上下文的维护者时间,可能差异性地低估了人类合同测评者完成较容易的 SWE-bench 任务需要多久。
第二,我们对照一份包含 16 项「杂乱性」因素的清单,为 HCAST 与 RE-Bench 任务评分。这些因素旨在捕捉此处所研究的任务与困难的「现实世界」任务之间的某些系统性差异。例子包括任务是否受资源限制、是否新颖,或是否涉及动态环境(第 H.6 节)。在控制任务长度之后,我们发现模型在杂乱性分数更高的任务上表现更差。值得注意的是,人工智能智能体表现随时间的趋势,在这些任务的较低杂乱性子集与较高杂乱性子集上是相似的(见图 12)。特别是,我们没有发现专门针对较高杂乱性子集的表现趋势平台期的证据。
第三,我们在一小套未被污染的内部拉取请求(PR)上测量人工智能智能体的表现(第 C.2 节)。我们发现不同人类群体完成内部 PR 任务的速度差异很大,合同测评者修复问题所需时间是仓库维护者的 5–18 倍。我们还发现,若以维护者完成时间作为任务长度的度量,人工智能智能体的表现比据此所预测的更差,但与以合同测评者完成时间为度量时相一致。
SWE-bench Verified 的信息在下文给出。回溯推断与杂乱性分析的细节见附录 F,内部 PR 实验的细节见 C.2。
4.1 SWE-bench Verified
为检查我们是否在其他基准上观察到相似的表现趋势,我们把方法应用于 SWE-bench Verified,这是评估语言模型在软件工程任务上表现的一项行业标准基准 [30]。SWE-bench Verified 数据集中的全部任务都采集自大型开源仓库,如 matplotlib 或 django,然后经过筛选,以确保它们可以自动检查且规格说明良好 [19]。
图 5:使用所报告的 SWE-bench Verified 结果的前沿人工智能模型表现(第 4.1 节)。我们观察到与图 1 相似的指数趋势,尽管斜率更陡。
由 SWE-bench Verified 任务计算得到的模型时间视界,似乎从 2023 年末到 2024 年遵循指数趋势。然而,用 2024 年模型由 HCAST + SWAA + RE-bench 预测的倍增时间是 143 天,而 SWE-bench Verified 结果上的倍增时间更短——大约 70 天。
SWE-bench Verified 的时间标注基于如下预期时间:一名「已花几个小时熟悉代码库的工程师」解决该问题所需的时间 [19]。我们发现,标注者的时间估计差异性地低估了我们的合同基线测评者完成最容易的 SWE-bench Verified 任务需要多久。因此,我们对 SWE-bench Verified 的时间视界估计(使用标注者时间)很可能相对合同测评者时间低估了能力较弱模型的时间视界,进而缩短了倍增时间。更多细节见附录 H.5。
5 外推
向一个月时间视界的人工智能外推
为预测人工智能系统何时可能有能力自主产生巨大经济价值以及潜在的灾难性行动,我们选择一个月(为了与人类公平比较,大约 167 个工作小时,因为人类不能 24/7 工作),原因有二。第一,Ngo [29] 写道:一个月通用人工智能(定义为在给定 1 个月工作小时、即 167 小时来执行任务时,能够超过大多数有知识的人类的人工智能)将必然在具有经济价值的事业上超过人类表现,例如编写大型软件应用、创办初创企业,以及做出新颖的科学发现。[^8] 第二,一个月大约是公司新员工开始完成入职并产生经济价值的时段,[^9] 因此时间视界为 1 个月的人工智能可能有能力像人类员工那样获取上下文,从而既能完成高上下文任务,也能完成低上下文任务。我们不能排除:一个能够完成 1 个月任务的系统,即便可靠性只有 50%,也可能对我们的社会产生变革性影响,其中可能包括造成灾难性伤害的能力。
图 6:对前沿人工智能系统达到 1 个月时间视界的外推日期所做的敏感性分析。在每一行中,我们对数据施加 10000 次随机扰动,并找出由扰动后数据所蕴含的「1 个月人工智能」日期的分布。箱体端点表示第 25 与第 75 百分位,须线表示第 10 与第 90 百分位,离群点未显示。注意:该图没有计入趋势的未来变化或外部效度方面的担忧,而我们不确定性的大部分来自这些因素。
敏感性分析
图 6 展示了我们的结果对各种噪声来源的敏感性分析。「自助法(任务)」「自助法(运行)」和「自助法(模型)」分别代表任务数量有限、运行之间的方差,以及模型数量有限。「加权 / 正则化」代表方法论选择;这一扰动包括 10 种超参数组合,涵盖有无任务多样性加权,以及逻辑回归正则化参数在 0.01 到 0.2 之间。「独立同分布基线噪声」根据基线时间的经验分布,把每项任务的时长乘以一个随机因子。注意:我们对仅 2024–2025 年趋势的信心较低,因为这一时段只有七个前沿模型。
因为我们的分析认为,我们这些任务上时间视界的增长率远慢于每 8 个月翻一倍的概率很低,所以 1 个月人工智能的外推日期的不确定性相当小(80% 置信区间宽度约 2 年,中心估计为 2029 年年中)。如果未来进展改为遵循 2024–2025 年趋势,1 个月人工智能会更早到来,一半的概率落在 2027 年,甚至 2026 年末。
系统性偏差与替代方法有可能对预测产生更大影响,我们在附录 H 中讨论这些。此外,由于预测未来固有的困难,真实预测的误差将大于这一朴素外推,我们在下文讨论。
任务分布的局限
我们在附录 B.2 中指出本任务集与现实任务之间的若干差异:简言之,现实任务很少有自动评分,并且常常需要与其他智能体打交道、面对资源约束、动态环境,以及很高的可靠性要求。这些差异使人怀疑,在本任务集(以及其他基准)上看到的快速表现提升能否推广。可能的情况是,像 HCAST 和 SWE-Bench Verified 这样的基准不足以预测现实世界的人工智能能力,准确预测将需要有意地构建没有这些局限的、更现实的基准。
时间视界趋势的未来变化
时间视界趋势未来可能因若干因素而显著改变,包括能动性训练、算力规模扩展,以及人工智能研究与开发的自动化。能动性训练以及最终的人工智能研发自动化更可能加快这一趋势,而算力规模扩展可能使其放慢(但会被算法改进部分抵消);未来的人工通用智能(AGI)在技术上可以拥有无限的时间视界。细节见附录 E。
6 讨论
总结
在本文中,我们提出了一项直观、定量的人工智能能力指标:任务完成时间视界。它把人工智能在任务上的表现,与人类专家完成这些任务通常所需的时间长度联系起来。我们构建了一个包含 66 项较短 SWAA 任务的数据集,将其与现有基准合并,并进行基线测评以估计其难度。为测量时间视界的趋势,我们在该数据集上对 2019 年至 2025 年间发布的 11 个前沿人工智能模型做了基准测试,并发现(第 3 节):这些任务上的 50% 任务完成时间视界在 2019–2025 年呈指数增长,倍增时间约为七个月(图 1)。我们还指出当前系统的重要局限,尤其是它们在结构较弱、更「杂乱」的任务上表现较低(附录 F.2)。
最后,我们尝试把这些任务上的趋势外推到一个月(167 小时)的人工智能(第 5 节),发现:如果趋势持续,且所观察到的表现趋势能够推广到现实世界任务,那么能够完成长达 1 个月的软件任务的人工智能,其发布日期的 80% 置信区间从 2028 年年中延伸到 2030 年年中(第 5 节)——如果 2024–2025 年趋势持续,甚至可能早至 2027 年初。
局限与未来工作
尽管我们相信指数趋势是稳健的,我们仍提醒:时间视界始终是相对于某个领域、任务分布,以及人类基线测评者的技能与上下文水平来测量的,并且在实践中可能难以测量,尤其是对更长的时间视界或接近 100% 的成功率。我们在附录 E.3 讨论解释时间视界时的细微之处。最后,在附录 E.4 中,我们讨论扩展或改进我们结果的途径,例如研究多个领域、更多模型、更好的能力引出、推理规模扩展,或其他统计方法。
致谢与资助披露
作者感谢以下审阅者对本文草稿的反馈:Ryan Greenblatt、Aaron Scher、Romeo Dean、Mike Knoop、Jeff Wu、Steve Newman、Rohit Krishnan、Taren Stinebrickner-Kauffman、JS Denain、Jacob Pfau、Seb Krier、Anton Troynikov、Max Henderson、Ajeya Cotra、Max Nadeau、Tamay Besiroglu、Nate Thomas。作者感谢 Charles Foster 与 Michael Chen 在发表方面的支持。
我们特别感谢以下审阅者提供了大量反馈:Sara Fish、David Duvenaud、Eli Lifland、Holden Karnofsky,以及 Rif A. Saurous。我们还感谢 Stephanie He 为图 2 所做的平面设计工作,以及 Ryan Greenblatt 对评分方法的意见。
[^1]: 例如,HellaSwag [50] 与 Humanity’s Last Exam [33] 都是通过对当时表现最好的语言模型做对抗性过滤来生成题目的。
[^2]: SWE-bench Verified [7] 确实带有人类估计的任务完成时间。我们使用 SWE-bench Verified 任务及伴随的时间估计,在第 4.1 节验证我们的主要结果。
[^3]: 我们的结果还包括一项来自 GAIA [26] 的任务,以及五项涉及编写能够抵抗对手的代码的任务。
[^4]: 这一数字是近似的,因为少数运行因内部基础设施问题而失败。
[^5]: 可与项目反应理论(IRT)[3] 比较。与 IRT 一样,我们用逻辑回归找出智能体有 50% 成功机会时所对应的任务难度;但与 IRT 不同,我们直接使用基于人类基线时间的难度评级,而不是从智能体表现中学习得到的评级。进一步细节以及与标准 IRT 方法的比较见附录 C.4。
[^6]: 在大多数情况下,每个前沿人工智能模型的发布日期就是我们所评测的那个模型的发布日期。然而,GPT-3(davinci)与 GPT-3.5(code-davinci-002 与 text-davinci-002)是闭源的,且不再能通过 API 访问;我们对最接近的、仍可用的模型使用它们的发布日期,OpenAI 宣传这些模型具有同等表现:davinci-002 使用 GPT-3 的发布日期,gpt3.5-turbo-instruct 使用 GPT-3.5 的日期。
[^7]: 具体而言,我们对 \(\log(\text{model\_horizon})=\alpha+\beta\cdot\text{release\_date}\) 做普通最小二乘回归。在附录 H 中我们讨论其他曲线拟合方法,并得出结论:该拟合对正则化、任务加权或加权最小二乘相对普通最小二乘等多种超参数并不敏感。
[^8]: 注意:我们的预测针对的是在软件任务上具有 1 个月时间视界的人工智能,而不是 1 个月通用人工智能,因为我们只在软件与研究任务上评估模型。尽管如此,鉴于人工智能表现在不同领域过去存在相关,具有 1 个月(167 小时)时间视界的人工智能可能具有显著的一般能力。
[^9]: 入职「可以持续数周到一年以上」[52],员工常常在入职过程进行到一半时就开始产生经济价值。
署名与许可
本文为 arXiv 论文 Measuring AI Ability to Complete Long Software Tasks 的中文全译。原文链接:https://arxiv.org/abs/2503.14499 (arXiv:2503.14499v4 [cs.AI],2026年7月10日)。原文以 CC BY 4.0 许可发布。译者:智测团队。参考文献列表从略;所提供源文未包含附录 A–J 正文,故未译附录。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。