Industry & PracticeResearch & Benchmarks
度量 2026 年初 AI 对 技术 工人 生产 率 的 自 报 影响
METR 调查 349 名技术工人:自报工作价值中位数为 1.4–2 倍,速度为 3 倍。调查补基准和随机对照试验,但反事实问题容易高估,2025 年初实验里平均高估了 40 个百分点。

In this piece
度量 2026 年初 AI 对技术工人生产率的自报影响
Joel Becker
2026 年 5 月 11 日
译注:作者姓名按原文拼写。日期按原文 May 11, 2026 译出。
摘要
2026 年 2 月至 4 月,我们对 349 名技术工人做了一次调查(其中包括 87 名软件工程师、71 名研究人员、129 名学术界人士与博士生,以及 48 名创始人与管理者),主题是他们如何使用 AI 工具。与此前的工作相比,我们这次调查是对技术工人自报的、来自前沿 AI 工具的增益所做的较为详细的调查之一。1
我们试图按「价值」来刻画 AI 带来的增益(你用了 AI 之后多创造出多少价值),而不是按「速度」(如果没有 AI,做这些任务要花多久)。这两者原则上可以给出不同的答案,尤其是当使用 AI 改变了你所做任务的分布时。例如,研究人员可以用 AI 很快搭出一个交互式数据看板,没有 AI 时这会花长得多的时间,但对他们的项目并不那么重要。我们在先前的研究(https://metr.org/blog/2026-05-08-task-substitution-and-uplift/)里,对价值增益与速度增益的区分给了更多细节。
我们认为「价值」增益与「速度」增益的区分是重要的,因为价值更接近调查设计者通常关心的那个想法,而我们的感觉是,受访者按速度来想是常见的,并且我们预期速度变化通常会高估价值变化。方法论细节见这里。
- 参与者自报:由于 AI 工具,其工作价值的中位数变化是 1.4–2 倍。自报速度变化的中位数(我们预期它高于价值变化)是 3 倍。
- 使用同一套问题表述,受访者回溯估计 2025 年 3 月的工作价值为 1.3 倍,估计 2026 年 3 月为 2 倍,并预测 2027 年 3 月为 2.5 倍。
- 回答大体上内部一致——不同价值变化度量之间的相关是中等的;只有 3% 的受访者在答案里表现出我们认为足以将其剔除的异常。
- 在我们研究的任一子群体里,METR 员工给出的价值变化是最低的。我们预期,这可能是因为 METR 员工脑子里有以往的发现:感知到的、由 AI 驱动的生产率,与实际之间存在差距。
- 对公开产出所做的早期定性查看,合理地提示:特别高的价值变化估计是被夸大的。
详细结果见这里。
重要的是,调查结果并不必然扎根于现实。人们有理由怀疑对反事实问题的回答,例如关于 AI 对生产率的影响——举例来说,我们在 2025 年初的研究(https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)发现,人们平均把 AI 对其任务耗时的影响高估了 40 个百分点。
更广地说,来自调查的、关于生产率影响的公开估计,往往大于来自现场实验或准实验的估计。然而,很难确定调查相对于实验数据把生产率增益高估到了什么程度。2
尽管如此,我们认为调查提供了关于 AI 对生产率真实影响的一种有用信息来源。调查补足了关于 AI 能力的其他证据——基准、随机对照试验、来自广泛部署的数据——每一种都有不同的盲点(更多细节见这里)。调查便宜、覆盖面广,并且在主要 AI 公司内部直接就能做。调查也能取得某些否则会难以处理的问题类型上的信息(例如定性问题)。
我们希望看到那些有意追踪 AI 研发可能被自动化的人,例如前沿 AI 公司(https://metr.org/common-elements#automated-ai-research-and-development),在这项工作的基础上做高质量调查。我们特别建议仔细定义所要估计的指标,例如建立在这里讨论的调查问题之上。我们也建议优先调查管理者或生产率研究人员,而不是个人贡献者。更详细的建议见这里。
调查如何补足其他证据
关于 AI 能力的不同证据来源,各有利弊。例如:
- 基准是标准化的,并且高度可复现。它们制作起来相对贵,建成之后用起来又有些便宜,并且可以便宜地改了再跑,以理解方法论选择的影响。另一方面,常常有人担心外部效度(尤其是,基准结果高估了在真实环境中观察到的能力);很难想清楚如何把估计映射到我们关心的下游量;而且它们可能只抓住某个更大任务分布的一片窄切片(尤其是那些便宜就能评测的任务)。
- 随机对照试验被仔细控制,并且或许有很高的外部效度。另一方面,它们产生的估计同样有些难以映射到我们关心的下游量3,而且它们非常贵(https://metr.org/blog/2026-02-24-uplift-update/)。4
- 来自广泛部署的观察性证据规模很大,收集起来相对便宜,并且在任务分布上走得很远。然而,它通常受选择效应之苦,并且常常难以推理。
我们把调查看作关于 AI 能力的其他证据形式的一种有缺陷但有用的补充。如摘要中所讨论的,调查有问题——最严重的是,受访者难以准确回答复杂的定量问题——但它们跑起来便宜,并且可以用来研究某些否则会难以处理的问题类型。
方法论
调查在这里(https://forms.gle/TNnafiPXetVHVYNQA)。你想做就可以做!关键问题是:
- 一个问题,把 2026 年 3 月前后由于能够使用 AI 工具而带来的速度增加概念化。
- 三个问题,把 2026 年 3 月前后由于能够使用 AI 工具而带来的所生产价值的增加概念化;其中一个还要求给出 2025 年 3 月和 2027 年 3 月的估计。
完整的问题细节在附录里。
调查另外还问受访者:
- 他们的工作类型、主要开发环境、使用与不使用 AI 的例子、按活动划分的工作时间分配,以及受访者按活动使用 AI 的程度。
- 他们编程的经验时长、把基于大语言模型的工具用于编程的经验时长,以及把 AI agent 用于编程的经验时长。
- 对 AI 工具的假想接受意愿(https://en.wikipedia.org/wiki/Willingness_to_accept),以及在 AI 工具上的实际支出。
- 其他问题,以便更广地理解受访者的工作及其与 AI 工具的经验。
这次调查比过去那些关于前沿 AI 工具使用的调查规模更大、也更细,例如 Anthropic 所用的那些(https://cdn.sanity.io/files/4zrzovbb/website/037f06850df7fbe871e206dad004c3db5fd50340.pdf#page=29)。
我们这次调查的一项创新,是试图区分「价值」提升与「速度」提升。价值被整体地定义,用的是「你、你的团队或你的领导会觉得有价值」的东西。速度则是任务要花多久这一原始差别。5 我们在先前的研究(https://metr.org/blog/2026-05-08-task-substitution-and-uplift/)里展开了价值增益与速度增益的区分。
速度度量可能与价值度量不同,例如:
- 被个人所做的额外任务抬高:这些任务 AI 能做得好或做得快,但否则并不值得优先做(替代)。
- 没能抓住 AI 使更高价值的任务成为可能的那些方式。
- 没有计入完成任务的报酬递减或报酬递增。
我们认为,这次调查所定义的价值,实质上更接近我们关心的东西——员工对 AI 研发进展之贡献上的一个乘数。速度度量相对于价值度量很可能向上偏;然而,价值也更不透明,受访者更难去想。67
另一项创新,是试图用内部一致性的度量来三角定位真相。我们使用多个度量并检查一致性。8 然而,这些检查不是决定性的;并且更根本地,即使是在报告感知的内部一致性时,我们也几乎没有办法检验感知是否与现实相符。
参与者来自一个便利样本。他们主要来自 GitHub、经由机构或会议名录找到的学术界人士、METR、METR 员工的职业网络,以及 X(原 Twitter)。回复率通常很低——对我们发邮件的受访者大约是 2%,不过在 METR 员工及其网络中要高得多——因此我们的结果合理地遭受显著的选择偏差。9 大约 70% 的参与者是付费来做这次调查的(按小时或固定付款);在被付费的参与者中,平均报酬是 200 美元。
受访者平均有 12 年编程经验,使用 AI 编程 19 个月,使用 agent 式 AI 编码工具 7 个月。48% 位于美国。50% 经常使用 Claude Code。学术界人士与博士生占样本的 37%。大约一半受访者位于美国,四分之一位于欧洲。
在后面一节,我们展示一些证据:当前更多使用 AI、使用 AI 工具经验更丰富、或在初创公司工作的人,感知到的提升更高;我们在 METR 员工中看到更低的感知提升。
我们标出提示数据质量差的答案(问题之间极端不一致、逻辑上不可能,等等),并滤掉有许多被标记回答的 10 名受访者。更多信息见异常一节。
结果
2026 年 3 月前后的生产率增益
我们的 3 个价值提升度量,中位数在 1.4 倍到 2 倍之间。10
价值提升结果的排序让我们惊讶。「价值所占比例」这个问题,本意是被规定成:答案应当近似等于「你本来要花多久」这个问题的倒数,但我们看到两个问题的答案之间有意味深长的差异。另一方面,我们曾预期,「需要多少个副本」这个问题的答案会自然大于「你本来要花多久」这个问题的答案,因为把工作在人与人之间并行是有成本的,但我们在受访者的答案里并没有明显看到这一点。
我们较少感到惊讶的是:速度度量的答案在幅度上更大。速度度量考虑的是,AI 可用之后完成任务所需时间的变化。我们曾假设(顺着我们较早的、区分速度提升与价值提升的研究(https://metr.org/blog/2026-05-08-task-substitution-and-uplift/)):AI 用户正在替代进入那些因 AI 而变得「便宜」得多的较低价值任务,因此他们从使用 AI 中得到的价值,少于人们在计入任务分布变化之前会天真预期的价值。11
注意,不同受访者觉得价值提升问题的不同版本最符合直觉;如果我们改用他们在自己偏好的那个问题上给出的答案,结果大体相似。
我们以若干不同方式询问价值提升问题,部分是为了做不完美的一致性检查,部分是因为我们很早发现:如上所述,不同受访者觉得价值提升问题的不同版本最符合直觉。
注意,把问题之间的答案差异解释成一致性检查,并不必然是直截了当的(尽管我们大体上确实持这一解释):
- 受访者可能预料到我们在做这些检查,这意味着他们可能把这一事实纳入自己的答案。
- 这些问题问的是略有不同的量。例如,「如果你没有使用 AI 的途径,要交付与你上个月所交付的同等有价值的工作,你会需要多少个月?」与「如果你的团队必须用和你一样的人(同样的技能、同样的知识)来替换你,只是他们没有使用 AI 的途径,它需要雇用多少个你的副本?」这两个问题之间的差异,可能反映的是你自身副本的报酬递减。
鉴于以上所述,我们应当预期不同的价值度量相关、但并非完美相关,而这正是我们在数据里看到的。
随时间变化的生产率增益
中位数受访者回溯声称,其提升在 2025 年 3 月大约是 1.3 倍;他们预期 2027 年是 2.5 倍。
我们认为,这么高的平均数,是对典型参与者信念的合理估计。2025 年 3 月12 与今天13 的数值,与公开研究中以往的自报一致,并且我们发现参与者在调查答案上至少是中等程度自洽的。
按子群体划分的生产率增益
正如可以预期的,我们发现:更多使用 AI 的、使用 AI 工具经验更多的、或使用 Claude Code 或 Codex 的受访者,感知到的价值增益更高。
另一方面,METR 员工倾向于报告更低的价值增益。我们认为有许多可能的假设可以解释这一结果,包括但不限于:
- METR 员工更熟悉 METR 以往关于感知到的与实际的、由 AI 驱动的提升之间差距的发现,这使他们把估计下调到更接近「真实」价值。
- METR 员工过度索引 METR 以往关于感知到的与实际的、由 AI 驱动的提升之间差距的发现。
- METR 员工面对的任务分布与其他受访者不同。
- METR 员工较不能把自己的工作替代到他们可能获得特别大价值增益的任务上。
我们的直觉较弱地指向第一种解释,尽管除了记录所报告的价值乘数之差以外,很难把这一点说得明确。
定性印象
除了收集参与者的定量估计,我们的调查还提示参与者给出其定性感觉:当前最令人印象深刻的 AI 能力是什么,AI 在他们的工作中何处最有帮助,等等。这给了我们一些可以用来核对定量估计的信息,尽管方式是临时的,并且有很大的研究者偏差空间。
总体而言,虽然我们相信,我们所观察到的这么高的平均数,作为「真实」价值乘数的估计并非不可信,但在我们看来,一个仍然活着的可能性是:如果受访者把这个问题想得更久,他们给出的答案会更小。
我们详细审阅了数据中的 7 份回答:其中至少两个价值度量的值大于或等于 10 倍。我们的主要印象是:
- 在这 7 例中的 2 例里,我们能够看到用 AI 完成的工作的公开产出。我们有信心:按我们的理解,这两例中的参与者都夸大了其所生产价值的变化;至少,巨幅更有价值的工作在外部是看不见的。
- 在另外 2 例里,我们对工作价值的大幅变化有些怀疑,因为定性说法与我们对 agent 能力的直觉不相符。
- 有 1 例,我们最好的感觉是:该受访者确实让 agent 做了数量可观的生产性工作,尽管我们怀疑这些工作更好地被改进了的速度或产出数量所刻画,而不是被改进了的产出价值所刻画。
- 在其余 2 例里,我们缺少足够的定性信息来做有意义的解释。
给追踪 AI 研发加速的 AI 公司的建议,以及其他未来工作
这项工作提示了:相对于现有调查,例如 Anthropic 所用的那些(https://cdn.sanity.io/files/4zrzovbb/website/037f06850df7fbe871e206dad004c3db5fd50340.pdf#page=29),追踪 AI 工具对 AI 研发之加速的调查,有哪些关键改进。核心问题是引出对 AI 研发加速之代理指标的、经过校准的估计。两项尤其有希望的改进可能是:
- 更仔细地定义中心问题。如前所述,估计一个人的价值乘数而不是速度乘数,使我们实质上更接近真正要紧的东西(尽管它仍然是一个代理)。我们相信,我们这些以价值为中心的问题,会比历史上以速度为中心的调查信息量大得多。
- 询问管理者或生产率研究人员:他们公司员工的价值增加了多少。这些群体更接近那些就 AI 工具支出的生产率影响做决策的专家。我们可以预期,他们对价值增益问题能给出更扎根、更无偏的答案。
确保足够的样本量也很重要。
这些是我们信心最高的建议。如果你计划做这样一次调查,请考虑与我们联系,以便更详细地讨论。我们乐意帮忙。
相对于我们自己的调查,我们会做的首要改进是:
- 缩短调查长度。(许多参与者报告调查疲劳。)
- 尽管我们询问了受访者:如果失去使用 AI 工具的途径,其假想接受意愿(https://en.wikipedia.org/wiki/Willingness_to_accept)是多少,我们从这些问题中能够抽出的证据是弱的。(更多信息见相关附录一节。)我们认为,重做接受意愿问题可能是有价值的,以便(a)事实上以某个概率拿走受访者 1 个月的 AI 使用途径,(b)询问雇主的接受意愿,以绕开受访者并不直接捕获 AI 工具价值这一问题,(c)询问受访者对其他提升工作生产率的工具的接受意愿。
- 与上面建议中的第 2 条相同(询问管理者或生产率研究人员关于价值的增加)。
无论这些教训如何,我们觉得,即便用与这一次完全一样的调查,也还有更多信息可以取得:
- 我们的数据集比我们在这里有能力分析的更丰富——包含关于参与者所见过的最令人印象深刻的 AI 能力的详细信息、参与者的工作时间分配、参与者让 AI 接受的权限与复核过程、AI 采取有害行动并试图隐藏这一事实之证据的实例,以及此外的许多内容。
- 我们认为,在主要 AI 公司内部重复一次类似的工作是有价值的,以便用一致的方法论更好地理解自报上的差异。
- 我们也想随时间对同一批参与者重复这次调查。这不仅会帮助我们了解 AI 能力如何演变,还会提供另一种约束受访者答案的手段——通过理解:自报的、预期中的未来价值提升,与未来时点上自报的当下价值提升相比如何。
附录
关键问题的准确表述
译注:图中标题为 Productivity: time speed-up。问题要求受访者回想过去一个月完成的全部工作,估计如果完全不使用任何 AI 工具、要完成同等质量的完全相同的工作,所需时间会是当前实际耗时的多少倍。填写 1 表示用不用 AI 耗时没有区别;填写 2 表示不用 AI 要花现在的 2 倍时间。可以补充评论和置信度,并且要把原本没有 AI 就无法完成的工作也算进去。
译注:图中标题为 Monetary value。说明 METR 将支付报酬,换取受访者连续 1 个月完全不使用任何 AI 工具,并列出被禁止的工具范围。问题问:在其余生活与工作照常的前提下,整整 1 个月完全不使用任何 AI 工具,能接受的最低报酬是多少。选项从低于 10 美元到高于 25000 美元。
译注:图中说明要求先读前言。这一板块统计的是 AI 工具带来的实际交付价值,而不是省下的时间。价值按本人、团队或管理层所认可的产出理解。只看时间会误导:AI 可能在低价值任务上省下大量时间,也可能没有减少耗时,但使使用者转向价值高得多的任务。后续问题都围绕价值倍数,只是角度不同,不要求数学上完全自洽。评估也纳入「如果没有 AI,受访者原本会做完全不同的任务」这一情形。
译注:图中三道必填题。(1)如果完全没有 AI 的使用权限,你需要多少个月,才能产出和你上个月同等价值的工作?填 1 表示不用 AI 也刚好 1 个月;填 2 表示需要 2 个月。可以填小数,并补充评论与置信度。(2)如果团队要用技能与知识相同、但没有 AI 使用权限的人来替换你,需要雇用多少个这样的人才能匹配你当前的产出?个体经营者按自身情况作答。(3)如果现在所有 AI 工具都无法使用,你能够产出的工作价值,相当于你当前总产出价值的多少比例?填 1 表示不受影响;填 0.5 表示只能产出一半。
译注:图中标题为 Value gained in the past, in the future, and elsewhere。两道题都围绕获得的价值,而不是加速。第一题锚定 2025 年 3 月,当时可用工具大致为 Claude 3.7 Sonnet 和 o3:如果完全没有 AI,要产出同等综合价值的工作需要多少个月。第二题锚定 2027 年 3 月受访者预期会普及的工具,问同一个月数问题。填 1 表示价值不变,填 2 表示使用 AI 的产出等于不用 AI 工作 2 个月。
接受意愿分析
如果在某种意义上是真的,那么由于 AI 而导致的、大约 2 倍量级的工作价值感知变化,看起来会对显示偏好有重大含义。例如,天真地看,工人似乎应当愿意做出很大牺牲,以保留使用 AI 工具的途径。
确实,中位数参与者声称,他们会牺牲工资的 29%,以在 1 个月内保持使用 AI 工具的途径。
尽管我们把这一发现解释为:它提示我们的调查参与者之间平均答案大体一致,但我们认为证据是弱的。
第一,我们对数据质量有许多不确定。我们的工资估计来自 Claude Opus 4.6:在给定参与者的雇主与地点时,对基本工资做的最佳估计;我们对这些数字做了一些验证,但远不足以对其准确性感到有信心。此外,接受意愿(WTA)数据的方差高得令人惊讶(包括有人愿意支付超过其估计工资的 100%);平均数之间表面上的一致,掩盖了参与者之间的大量变异。
第二,我们在 WTA 度量与「价值」乘数之间的比较,解释起来并不直截了当。问人们个人愿意付多少钱来保留在工作中使用 AI 工具的途径,作为他们从 AI 中得到的价值的度量,合理地看是很有缺陷的,主要因为受雇工人并不是捕获价值的那一方(他们的雇主才是)。14 收入与消费的报酬递减构成进一步的挑战。
数据质量
由于答案存在一连串质量问题,我们从原始数据的 359 名独立受访者中滤掉 10 份回答(样本的 3%)。
为决定滤掉哪些回答,我们为可能的数据质量问题累计分数,然后移除高于 5 分切点的回答。
异常回答标记及相关分数列在下面。如果回答按某项数据质量标准被标为严重,它们会同时得到中等档与严重档的分数。
| 标记 | 中等 | 严重 | 每一档的分数 |
|---|---|---|---|
| 所有工作时间分配取值相同(且至少填写 3 项) | - | - | 2 |
| 所有 AI 强度评分相同(且至少填写 3 项) | - | - | 2 |
| agent 工具经验超过大语言模型工具经验 | - | - | 3 |
| 完全跳过 agent 权限问题 | - | - | 1 |
| 完全跳过复核做法问题 | - | - | 1 |
| 工作时间下界之和超过阈值 | >= 150% | >= 300% | 1 |
| 价值/加速度量在方向上不一致 | low=0.8, high=1.25 | low=0.6, high=1.67 | 3 |
| Q2(月数)与 Q3(副本数)发散 | >= 3x | >= 10x | 1 |
| Q2(月数)与 1/Q4 发散 | >= 2x | >= 4x | 1 |
| Q3(副本数)与 1/Q4 发散 | >= 3x | >= 10x | 1 |
| 价值估计从 2025 年到现在下降 | >= 1.1x | >= 2x | 1 |
| 价值估计从现在到 2027 年下降 | >= 1.1x | >= 2x | 1 |
| 价值估计从 2025 年到 2027 年下降 | >= 1.1x | >= 2x | 1 |
| 价值轨迹时间点未能解析 | 2 not parsed | 3 not parsed | 1 |
| 接受意愿远超工资 | >= 5x | >= 20x | 1 |
分数大于 5 的受访者随后被从清洁输出中滤掉。大约三分之一的受访者有 0 个异常数据标记。
逻辑上不可能的工作分配,是到目前为止最常见的坏数据标记。显著下降的提升是次常见的。尽管如此,在因为数据合理地看是坏的而被滤掉的条件下,潜在的数据质量问题相当多样。
我们的中心主张里,多数对过滤器所设的水平并不敏感。我们速度度量的中位数答案靠近边界,因此可能敏感。2027 年 3 月的价值乘数在非常紧的过滤器下会有所上升。
- 以往关于 AI 对工程师或研究人员生产率之定量影响的调查,对象与主要 AI 公司里的那些人相似,样本量通常更小。Claude Opus 4.5 与 4.6 的系统卡里,调查的 N<20;Mythos 系统卡报告的是一次 130 人的 Slack 投票结果;Huang et al. (2025) 做了一次 132 人的调查;Becker et al. (2025) 在实验完成后调查了全部 N=16 名开发者。
- 最相关的实验数据通常是在 2024 年或更早做的(例外是 METR 的随机对照试验,分别覆盖 2025 年初(https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)与 2025 年末(https://metr.org/blog/2026-02-24-uplift-update/)),而最相关的调查通常是在 2025 年或更晚做的,到那时自主 AI 能力已经显著前进(https://metr.org/time-horizons/)。就我们所知,只有一项研究在同一人群、同一指标上同时收集了调查与现场实验结果——Becker et al. (2025),它发现开发者把生产率增益高估了 40 个百分点以上。此外,以往文献所估计的量在研究之间差异很大,这增加了比较估计的困难。
- 例如,我们 2025 年初(https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)与 2025 年末(https://metr.org/blog/2026-02-24-uplift-update/)的开发者生产率随机对照试验,合理地看,涉及的任务是在 AI 之前与 AI 之后的「价格」之间被选出来的(用的是我们近期区分价值提升与速度提升的研究(https://metr.org/blog/2026-05-08-task-substitution-and-uplift/)里的语言),这给解释造成挑战。
- 事实上,随机对照试验可能会变得越来越贵,因为不使用 AI 来完成任务所需的额外努力随时间增加。
- 要考虑哪些任务,这一选择至少导致两种回答这个问题的方式:(i)做那些如果你没有使用 AI 的途径你本来会做的任务、但现在用上 AI,需要多少时间;(ii)做那些如果你确实有使用 AI 的途径你本来会做的任务,需要多少时间。我们猜测,Anthropic 调查的受访者可能是在(ii)之下解释生产率改进,这使他们在替代进入更高提升、更低价值的任务之后,高估生产率改进。
- 希望我们的调查也让人们更具体地思考自己的工作,并使用能更好地追踪我们所关心之物的度量,但我们为验证这一点所做的工作是有限的,而且在反馈里人们报告调查疲劳,这与这一点相抵。
- 此外,即便我们确实成功捕获了价值增益,这仍然只是对我们真正关心的那个问题的一个代理答案。我们真正关心的是:AI 能力是否在总体上造成额外的 AI 进展,而不只是对单个 AI 研究人员而言(例如计入组织结构的变化,以及自主的 AI 研究贡献)。
- 用现有调查材料,我们还可以做其他一致性分析,例如在给定按工作时间类别划分的工作时间分配和 AI 使用强度时,映射合理的提升范围。
- 尤其是,选择的是那些开始并完成调查的人,也许因为他们对所问话题想得很多,或对 AI 使用持有不寻常的看法。
- 注意,哪一种汇总统计最合适并不明显。对我们的数据用几何平均作为汇总统计,一种辩护可能是:参与者有乘性的回答误差,这看起来是合理的。更深的问题是,我们不知道如何把受访者层面的数据映射到我们关心的更大问题上——由于 AI 能力,AI 能力进展快了多少。
- 事实上,速度度量与价值度量之间的差距没有更大,这让我们惊讶。我们预期会有许多情形:人们替代进入非常不同的任务(例如学术界人士用 AI 的网页开发能力做小网站),这只会小幅增加价值,但会天真地暗示戏剧性的时间节省(例如该网站本来可能要花 30 倍时间,这意味着如果你后来把工作周的 4 小时花在这个网站上,你至少有 1×(工作周的 90%)+ 30×(工作周的 10%)= 3.9 倍的速度提升)。
- 2025 年 3 月 1.3 倍的中位数价值提升,看起来与我们先前那次以 2025 年 3 月为中心的实验里大约 32% 的感知时间提升大体一致。在那次实验里,价值增益更合理地与速度增益重合,因为人们似乎并没有因为有了 AI 而改变自己在做哪些任务。
- 如同 Anthropic 的 Claude Opus 4.6 系统卡(https://www-cdn.anthropic.com/14e4fb01875d2a69f646fa5e574dea2b1c0ff7b5.pdf)里所讨论的那次调查。
- 事后看来,我们也许该问受访者:他们的雇主多么看重他们使用 AI 工具的途径。我们也可以问受访者如何为互联网、他们的日历系统等等估价。
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.