任务 替代 与 生产 率 提升
METR 区分旧任务上的提升、新任务上的提升和价值上的提升。任务替代会把三者拉开:旧任务度量偏向下界,新任务度量偏向上界,价值提升落在中间。

本文目录
任务替代与生产率提升
Tom Cunningham、Parker Whitfill
2026 年 5 月 8 日
译注:作者姓名保持原文拼写。日期按原文 May 8, 2026 译出。
摘要: 我们描述人工智能对生产率影响(又称 uplift)的三种不同定义,并表明有理由预期:
\[\text{uplift on old tasks} \leq \text{uplift in value} \leq \text{uplift on new tasks}\]
译注:上式保留原文符号。从左到右依次是:旧任务上的提升、价值上的提升、新任务上的提升。
提升的三种度量
度量人工智能对生产率的影响时,一个复杂之处在于:它对不同任务的影响并不相同,而这会使人改变自己在各项任务之间分配时间的方式。这就使谈论人工智能对总体生产率的影响变得更加困难。
我们用「旧任务」指人工智能可用之前、你在典型的一天里会做的那一组任务,比如说你在 2021 年的平均工作日。「新任务」指人工智能可用之后、你在典型的一天里会做的那一组任务。并非所有新任务都必然使用人工智能;它们只是你在知道人工智能是一个选项之后所选择的任务。
我们发现,区分人工智能提升的三种度量是重要的:
旧任务上的提升: 完成旧任务时,人工智能出现之前所需时间超过人工智能出现之后所需时间的那个倍数。
新任务上的提升: 完成新任务时,人工智能出现之前所需时间超过人工智能出现之后所需时间的那个倍数。
价值上的提升: 允许在人工智能出现之前与出现之后这两种情形之间重新安排任务之后,人工智能出现之后的价值超过人工智能出现之前的价值的那个倍数。在某些情形里,价值有一个自然的定义;在另一些情形里,可以用配套说明里讨论得更多的相关定义把它操作化。
这篇说明讨论这一区分,以及它对于解释人工智能生产率估计的含义。我们也有一份配套的短说明,其中有更多数学细节。
给三种提升排序
在一些简化假设下,下列不等式成立:
\[\text{uplift on old tasks} \leq \text{uplift in value} \leq \text{uplift on new tasks}\]
这些不等式对应于价格指数经济理论中的经典不等式。价格指数根据消费者如何因价格变化而改变支出,来估计价格变化对福利的影响。1
旧任务上的提升小于价值上的提升,因为它只计入你现有任务上节省的时间;它不包括你把时间重新安排到人工智能已经使之更有效率的任务上所能得到的好处。
新任务上的提升大于价值上的提升,原因正好相反:它用人工智能出现之后的任务组合,来给人工智能出现之前的生产率度量设置障碍。新任务可以包括你在人工智能出现之前绝不会尝试的任务,因此人工智能出现之前所需的时间可以很大,这意味着时间上的提升会大于价值上的提升。
这些不等式适用于这样的决策者:他们在各项任务之间分配时间,以最大化某个目标,并且对任务层面的提升持有准确的信念。还有许多别的实际困难,使在实践中估计提升成为难事。2
一个简单例子
假设一名软件工程师正在决定如何度过 8 小时工作日。他们可以做两项任务,每一项都要一小时:(1)写一份文档;(2)写一个拉取请求(PR)。
假设人工智能把他们写 PR 的生产率提高一倍,但不改变他们写文档的生产率。最后,假设他们在人工智能出现之前和出现之后,花在这两项活动上的时间相同。
| 任务 | 人工智能出现之前的时间成本 | 人工智能出现之前的分配 | 人工智能出现之后的时间成本 | 人工智能出现之后的分配 |
|---|---|---|---|---|
| 写文档 | 每份文档 1 小时 | 4 份文档 | 每份文档 1 小时 | 4 份文档 |
| 写拉取请求 | 每个拉取请求 1 小时 | 4 个拉取请求 | 每个拉取请求 ½ 小时 | 8 个拉取请求 |
我们可以把提升计算为:人工智能出现之前所需时间与人工智能出现之后所需时间之比。
\[\text{Uplift on old tasks} = \frac{4 \text{ docs} \times 1 \text{ hr/doc} + 4 \text{ PRs} \times 1 \text{ hr/PR}}{4 \text{ docs} \times 1 \text{ hr/doc} + 4 \text{ PRs} \times 0.5 \text{ hr/PR}} = \frac{8 \text{ hr}}{6 \text{ hr}} = +33\%\]
\[\text{Uplift on new tasks} = \frac{4 \text{ docs} \times 1 \text{ hr/doc} + 8 \text{ PRs} \times 1 \text{ hr/PR}}{4 \text{ docs} \times 1 \text{ hr/doc} + 8 \text{ PRs} \times 0.5 \text{ hr/PR}} = \frac{12 \text{ hr}}{8 \text{ hr}} = +50\%\]
译注:两道公式保留原文符号。第一道是旧任务上的提升,等于正 33%。第二道是新任务上的提升,等于正 50%。docs 为文档,PRs 为拉取请求,hr 为小时。
在一些简化假设下(更多细节见配套说明),价值上的提升会落在 \(+33\%\) 与 \(+50\%\) 之间,但确切的值取决于对这名工程师来说,拉取请求与文档在多大程度上可以相互替代。
为了得到一些图形上的直觉,让我们假设这名软件工程师的价值是 \(\text{value} = \sqrt{\text{number of docs} \times \text{number of PRs}}\),并且他们选择任务来最大化价值。图 1 展示这三种度量。子图(a)展示旧任务上的提升:它取旧任务,并与一个假想世界相比较。在那个世界里,人工智能改变每项活动的时间成本,但这名软件工程师不能改变自己所做的 PR 与文档的相对数量。子图(b)展示新任务上的提升:它取新任务,并与一个假想世界相比较。在那个世界里,时间成本回到人工智能出现之前的水平,但这名软件工程师不能改变自己所做的 PR 与文档的相对数量。子图(c)展示价值上的提升:它取旧任务,并问「在人工智能出现之前,我需要多出多少时间,才能产出与我从新任务中得到的一样多的价值?」
在所有子图中,虚线连接文档与 PR 之比相同的点。沿着任何这样一条线,到原点的距离与总时间成本成比例:例如,任务(2 份文档,2 个 PR)所花的总时间恰好是任务(1 份文档,1 个 PR)的两倍,而从原点到(2,2)的线段也是到(1,1)的线段的两倍长。红色线段与基线时间成本成比例,绿色线段与额外的时间成本成比例,因此 \(\text{uplift} = 1 + \frac{\text{length(green)}}{\text{length(red)}}\)。
译注:价值公式与提升公式保留原文符号。value 为价值,number of docs 为文档数量,number of PRs 为拉取请求数量,length(green) 与 length(red) 分别为绿色线段与红色线段的长度。
图 1:简单例子中提升的三种度量。
#### 一个更极端的例子
在图 1 里,由旧任务上的提升和新任务上的提升所给出的界限相当紧。这是由相对时间成本的变化较小所推动的。图 2 表明,如果我们加大相对时间成本的变化,界限就会变松。
假设在人工智能出现之前,一份文档要 1 小时,一个 PR 要 5 小时,而在人工智能出现之后两者都要 1 小时(PR 快了 \(5\times\))。继续假设他们有同一个价值方程。这几种提升度量现在跨过一个宽得多的范围:\(+67\%\)、\(+124\%\)、\(+200\%\)。
图 2:更极端的例子中提升的三种度量。
与现有的生产率度量相比较
Tamkin 与 McCrory(2025)估计,使用 Claude 聊天机器人造成大约 \(17\%\) 的总生产率提高。他们的逻辑如下:
- Claude 被经常用于大约 \(11\%\) 的、按工资加权的 ONET 任务(依据是把 Claude 查询分类到 ONET 任务,并按人工智能出现之前的任务分布给它们加权)。
- 当使用 Claude 时,做一项任务所需的时间下降 \(80\%\)(使用被映射到 O*NET 任务的聊天记录,以及大语言模型对有 Claude 与没有 Claude 时所需时间的估计)
- 假设替代弹性为 1(Hulten 定理),所隐含的产出增益大约是 \(17\%\)(\(\approx 0.11 \times \ln(5)\))。
在这个情形里,任务篮子取自旧任务(O*NET),因此我们也许会预期,所得估计是真实提升的一个下界。3
事实上,我们认为这个估计很可能因为另一个原因而是高估。我们可以区分一项任务和一个任务组(ONET 任务):组内的每一项任务都有自己的时间成本和价值。那 5 倍的省时估计是针对具体任务(Claude 查询)的。如果这些省时对那个 ONET 任务组里的全部任务(人工智能出现之前和出现之后都算)都有代表性,那么结论就会成立。然而,任务组内部似乎很可能存在大量替代,替代的方向是那些省时更多的任务。考虑说明中给出的两个例子:
- 「把这一段译成法语……」
- 「给定这些原材料,你能写一份备忘录吗?」
下面两点似乎都说得通:(1)用 Claude 做这些具体任务有 5 倍的加速;(2)相关 ONET 任务(任务组)所占的时间份额大致保持不变。4 然而,这 5 倍加速似乎也不大可能适用于一个人在相关 ONET 组里的全部旧任务。如果 ONET 任务组内部的替代足够广泛,那么在被观察到的任务上任意高的加速,与价值上任意小的提升是相容的,原因就是组内的任务替代。
另有一点,原文已经提到:Claude 所观察到的查询只代表新任务的一个子集,而且出于选择的原因,那个子集很可能有更高的加速(如果 Claude 能把你加速得更多,你就更可能对那项任务使用 Claude)。
Cadillac 任务
当某些任务的时间成本崩溃时,新任务上的提升与价值上的提升之间的缺口尤其相关。例如,人工智能编码智能体现在已经能够自主完成某些长达数日到数周的软件工程项目。5 因此,我们应该预期人们会向那些利用人工智能的任务替代。他们在新任务上的提升会非常高,但他们在价值上的提升可能低得多。在价值上的提升低得多、而这个人之所以做这项任务只是因为人工智能把它变得便宜的情形里,我们一直把它叫做 「Cadillac 任务」。
译注:Cadillac Task 是原文对「只因变便宜才去做」的任务的称呼,专名保留英文。
- 这些不等式归于 Konüs(1924),一份较近的参考文献是 Diewert(2017)。我们的「价值提升」可以对应于生活成本指数,所用的既可以是旧效用水平,也可以是新效用水平。但如果效用函数是位似的,那么这两个量就会相同。
- 其中包括:(1)一个人的时间分配决策反映的是他们所感知的、跨任务的提升,而不是真实的提升;(2)时间分配可以反映对未来的预期,而不是当下的生产率,例如由于学习曲线以及探索与利用的决策;(3)把时间划分成任务往往高度主观,并没有一种典范的经济学方法来把任务个体化;(4)适当地激励决策者去最大化自己的生产率非常困难。其中一些考虑在实践中可能导致不等式反过来,例如,如果这些其他因素造成了足够大的时间分配变化,新任务上的提升就可能低于旧任务上的提升。
- Appel 等人(2026)用不同的替代弹性讨论了上界和下界,但再次把 ONET 任务当作分析单位,也就是假设一个 ONET 组内的全部任务具有相同的加速因子。
- 说得通的 ONET 任务:27-3091.00 口译员和笔译员,任务是:「阅读书面材料,例如法律文件、科学著作或新闻报道,并把材料改写成指定的语言。」43-6011.00:「使用文字处理、电子表格、数据库或演示软件,准备发票、报告、备忘录、信件、财务报表和其他文件。」
- 关于这一点的证据见 MirrorCode。MirrorCode 的任务涉及复现已有软件,这是一种特定的任务类型,不一定代表一般的软件工程。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。