Industry & PracticeResearch & Benchmarks
我们 正在 改变 我们 的 开发 者 生产 率 实验 设计
METR 认为 2025 年下半年的开发者实验给不出可靠的提速信号:不愿无 AI 工作的人变多,任务也被挑着交。他们准备改设计,并继续做任务评测。

In this piece
我们正在改变我们的开发者生产率实验设计
Joel Becker、Nate Rush、Tom Cunningham、David Rein 和 Khalid Mahamud
2026 年 2 月 24 日
METR 此前发表过一篇论文,发现在有经验的开源开发者中,使用 AI 工具使完成任务变慢了 20%,所用数据来自 2025 年 2 月到 6 月。
为了理解 AI 如何随时间影响开发者生产率,我们在 2025 年 8 月开始了一项新实验,开发者池更大,使用的是最新的 AI 工具。
不幸的是,根据参与者反馈和调查,我们认为新实验的数据对 AI 工具当前的生产率效应给出的是不可靠的信号。主要原因是,我们观察到,因为不愿意在没有 AI 的情况下工作而选择不参加这项研究的开发者显著增加,这很可能使我们对 AI 辅助提速的估计向下偏。我们另外还认为,存在由于更低报酬率带来的选择效应(我们把报酬从每小时 150 美元降到了每小时 50 美元),而且对同时使用多个 AI 智能体的那一部分开发者,我们对每项任务所花时间的测量是不可靠的。
根据与研究参与者的交谈,我们认为,与 2025 年初的估计相比,开发者现在——在 2026 年初——更有可能被 AI 工具加速。然而,由于实验中的选择效应,我们的数据对这一增加的幅度只是非常弱的证据。
我们的原始结果对提速给出了一些证据。我们 2025 年初的研究发现,使用 AI 使任务多花 19% 的时间,置信区间在 +2% 和 +39% 之间。对参加了后期研究的那一部分原开发者,我们现在估计提速为 -18%,置信区间在 -38% 和 +9% 之间。在新招募的开发者中,估计的提速是 -4%,置信区间在 -15% 和 +9% 之间。
然而,在被实验选出去的那些开发者和任务上,真实提速可能高得多。有些开发者自我报告非常高的提速,不过正如我们在更早的研究里记录的,那些估计可能相当不可靠。
由于这些选择效应很严重,我们正在着手改变研究设计。下面我们提供进一步的细节,并描述我们打算用哪些其他方法来研究 AI 对开发者生产率的影响。
人工智能的更广泛采用,使测量任务级生产率变得更难
我们的第二项研究从 8 月开始,由原研究中的 10 名开发者,加上从更多样的开源项目里新招募的 47 名开发者组成。参与者的参与报酬是每小时 50 美元。
和最初的研究一样,开发者被要求预先指定他们打算做的每一项任务,然后提交任务描述以供随机化。每项任务被分配到「允许 AI」或「不允许 AI」的条件。开发者会记录完成任务所花的时间,我们因此可以比较有 AI 和没有 AI 时完成一项典型任务所需的平均时间。
整个 2025 年,开源开发者中智能体工具的使用在增加,例如 Claude Code 和 Codex。AI 的这种更广泛采用,在我们的研究里有两个重要效应:
- 招募和留住开发者变得更难。 更大比例的开发者说,他们不愿意在没有 AI 的情况下做 50% 的工作,即便我们的研究按每小时 50 美元付钱,让他们做自己选择的任务。因此,我们的研究系统性地缺了那些对 AI 的价值预期最乐观的开发者。
- 开发者在提交哪些任务上变得更有选择性。 在调查中,30% 到 50% 的开发者告诉我们,他们选择不提交某些任务,因为他们不想在没有 AI 的情况下做这些任务。这意味着我们系统性地缺了那些预期从 AI 获得高提升的任务。
合在一起,这些效应使我们上面报告的估计很可能是这些开发者身上 AI 真实生产率效应的一个下界。选择效应似乎只影响少数开发者和少数任务,这限制了偏倚的程度。然而,我们很可能缺了 AI 最活跃的采用者的数据,而他们可能是最受关注的。随着 AI 能力继续提高、开发者的预期也跟着增长,这些效应只会变得更剧烈,进一步限制这一研究设计的有效性。
根据我们的访谈和调查,我们认为选择的增加主要是因为我们的开发者对 AI 驱动的提升有了更高预期。然而第二项研究的报酬率也更低,每小时 50 美元,而不是原研究的每小时 150 美元,这很可能也促成了更高的选择。
我们也注意到另外一些问题,不过我们判断这些问题的幅度没那么严重:
- 有些开发者告诉我们,有了智能体式 AI 之后,他们尝试的任务类型变了,更靠向 AI 的长处。这有两个效应:(a)研究内的人与研究外的人,任务选择会不同;(b)研究内部的时间差异可能并不代表价值差异,因为任务类型发生了替代。
- 有些开发者告诉我们,对给定的一项任务,最终工作的质量在允许 AI 和不允许 AI 的条件之间是不同的,例如主观代码质量的差异,或者他们选择编写的文档或测试的数量。
- 有些开发者在被分配到不允许 AI 的条件时,更不容易完成他们提交的任务。有一名开发者没有完成任何被分配到不允许 AI 条件的任务。
- 有些开发者报告,在使用智能体工具时,报告完成任务所花的时间很困难,因为他们常常会在等待智能体完成工作的时候去做一项不相关的任务。
总的来说,这些问题使我们难以解释我们的中心估计,并且我们认为它很可能是这些开发者身上 AI 工具真实生产率影响的一个坏代理。
选出的开发者引语
“I’m torn. I’d like to help provide updated data on this question but also I really like using AI!” — 一名来自 2025 年初原研究的开发者,在被邀请参加 2025 年末的研究时这样说。
译注:上一句引号内是开发者原文。大意是:我很矛盾。我想帮忙提供关于这个问题的更新数据,可是我又真的很喜欢用 AI。
“I found I am actually heavily biased sampling the issues … I avoid issues like AI can finish things in just 2 hours, but I have to spend 20 hours. I will feel so painful if the task is decided as AI-disallowed.” — 一名来自新研究的开发者,在说明选择把哪些任务纳入研究时的选择效应。
译注:上一句引号内是开发者原文。省略号是原文就有的。大意是:我发现自己在抽样 issue 时其实偏得很厉害……我会避开这种 issue:AI 两小时就能做完,我却得花 20 小时。如果任务被判定为不允许 AI,我会觉得很痛苦。
“my head’s going to explode if I try to do too much the old fashioned way because it’s like trying to get across the city walking when all of a sudden I was more used to taking an Uber.” — 一名来自新研究的开发者,在说明选择把哪些任务纳入研究时的选择效应。
译注:上一句引号内是开发者原文。大意是:如果我试着用太多老办法,我的头要炸了,因为这就像我突然已经习惯坐 Uber 之后,还要走路穿过整座城市。
测量生产率的其他办法
AI 工具对开发者生产率的影响,是 AI 研发加速的一项重要输入,因此我们计划继续探索下面这些研究路线:
- 更密集的实验。 如果依从性更高,选择问题会减轻;而依从性可以通过更短、更密集的实验来达到,并且可能支付更高的报酬。
- 观察数据。 关于软件开发中 AI 使用的丰富数据源很多——从汇总统计(例如大约 4% 的 GitHub 提交由 Claude Code 撰写)到细粒度的文字记录(例如 Sarkar (2025))。我们打算继续观察我们的开源开发者池,以理解 AI 是怎样被使用的。
- 问卷。 尽管自我报告的生产率反事实很难解释,因而可能有偏,我们仍然乐观地认为:仔细选择调查问题,再加上时间使用研究,可以产生有用的信号。
- 固定任务实验。 我们原来的研究的新颖之处,是让开发者在施加随机化之前自己选择任务。我们可以退回到一种更简单的设计:给开发者一项固定任务去完成,要么有 AI 辅助,要么没有。
- 评测。 METR 在继续建造任务评测,以测量智能体自主完成任务的能力,这与采用智能体的生产率效应有明确的相关性。
- 开发者层面的实验。 另一种设计是在开发者层面而不是任务层面随机化,也就是每一名参与者要么全部任务都用 AI,要么全部都不用。这减轻了一些任务层面的选择问题,然而它使开发者层面的选择问题更严重,并且在检测生产率效应上功效更低。
随着模型能力继续提高,我们预期仍将需要重新设计我们的能力和测量技术中的某些部分。
生产率研究的细节
我们按每小时 50 美元付钱给开发者,让他们在自己已有的开源项目上工作,并把 issue 随机分到允许 AI 或不允许 AI。开发者是有经验的开源贡献者,经验的中位数是 10 年。我们有来自 57 名开发者、143 个仓库、800 多项任务的数据。
其中 10 名开发者来自原研究,其余开发者是新的,从更多样的仓库里招募——包括更小、更偏绿地、更不成熟的仓库。
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.