Industry & PracticeResearch & Benchmarks
智能 体 能力 的 度量: 固定 支出、 时间 期限 与 支出 期限
Tom Cunningham 把智能体能力指标收成两条分数曲线:智能体的 s_A(x) 和人类的 s_H(x)。固定支出下的分数在测试时缩放很强时不够用;时间期限、支出期限和相对人类的成本各看曲线的不同位置。

In this piece
智能体能力的度量
Tom Cunningham
METR。2026 年 7 月 24 日。
这篇帖子回顾衡量智能体能力的其他指标。
这篇帖子对一种情形给出一套相当完整的能力指标分类:你观察到一条智能体的分数曲线和一条人类的分数曲线。
每一个指标都基于下面两个分数函数:
- $s_A(x)$ = 智能体分数,作为支出的函数
- $s_H(x)$ = 人类分数,作为支出的函数
支出可以理解为花掉的钱,或 token,或所需时间。
我不会做的事。
我一般不会推荐哪种情形下哪种指标最好。
我不会深入讨论如何测量分数曲线 $s_H$ 和 $s_A$。这里有许多实际困难。
我一般只处理单个任务上的分数;用到任务集合(基准分数)上会更复杂一些。
我大多不讨论指标的其他可欲性质,例如它是否好懂、是否可推广。
一些一般观察。
一些我认为相当自然的个人观察:
- 如果分数曲线非常凹(意思是分数不随支出变化),那么在某个合理的支出量下,只报告原始分数就够了。
- 如果分数曲线对支出的回报很高,我们就需要一个把测试时缩放算进去的指标。
- 对照人类能力做基准,帮助我们推广到全新的任务。
- 当模型变得非常好时,许多与人类相关的基准就不再有用。
设置与定义
每一个智能体和每一个人都由一个从支出到分数的函数 $s(x)$ 刻画,$s^{-1}(\bar{s})$ 表示达到分数 $\bar{s}$ 所需的支出。
一般而言,我把分数理解为单个任务上的表现,例如一个优化问题上的加速。我们也可以把分数理解为完成的二元任务份额,或完成单个任务的概率。1
支出一般会被当作钱,但也可以理解为时间或 token。
比较智能体支出与人类支出的、以人类为参照的指标,要求两种支出用同一单位测量,或换算成美元这样的共同单位。
我通常把智能体曲线($s_A(\cdot)$)画得比人类曲线($s_H(\cdot)$)更凹。2 我认为这准确代表了今天大多数任务上的现实(例如 Wijk 等人(2025)),但它可能改变。
AISI 最近关于「更多测试时计算,更多能力」的帖子,对多种不同基准上的测试时缩放曲线有很好的讨论和可视化:
只看智能体的能力指标
我们先讨论只依赖智能体分数、不对照人类做基准的指标。3
固定支出下的分数
这是我们报告大多数评测的典型方式:选一个固定支出 $\bar{x}$,报告每个智能体的分数 $s_A(\bar{x})$。如果 $s_A(\cdot)$ 在相当低的 $x$ 上就可靠地趋于渐近,那么对大多数目的,这就是一个充分统计量。
当智能体分数即使在高支出上仍继续上升时,这个指标就没那么有用;例如见 Noam Brown 和 Kapoor 等人(2025)的批评。4
固定支出的另一个理由是拉开分数:更高的支出会造成饱和,从而几乎无法区分模型能力(例如最近一篇 AISI 帖子)。5
实际平台处的分数
一种常见的实际做法,是报告函数进入平台、或斜率落到某个值以下的那个点上的分数(假定凹性)。例如,Kwa 与 West 等人(2025)说:「模型被给予足够高的 token 上限,以使成功率达到平台。」
这大致等价于在一个高支出水平上报告分数,代表最高的合理支出水平。如果分数函数从不进入平台,它就没有良好定义。
固定分数下的支出
我们也可以固定一个目标分数 $\bar{s}$,报告达到该分数所需支出的下确界:$x=s_{A}^{-1}(\bar{s})$。
只有当被评测的模型能够达到分数 $\bar{s}$ 时,这个指标才会给出一个有限的数。这是一个成本效率指标,常用于观察模型成本随时间下降(Gundlach 等人 2026;Cottier 等人 2025)。6
如果所有智能体的相对表现成本都相同,那么新一代模型会成倍地向左移动(在对数空间里则是加法式左移),这种「效率」指标就会是能力的充分统计量。然而有一些理由相信,新模型通常在高支出处有不成比例的影响,也就是说,它们使某些分数变得可得,而更早的模型在任何支出下都几乎不可能达到这些分数。7
支出的回报
如果支出的回报即使在相当大的支出水平上也不进入平台,那么固定支出下的分数就不是一个令人满意的指标。
相反,让一个指标表达支出的边际回报会有用。缩放的性质可以因领域而异,因此合适的指标常常按缩放的形状来选。两种常见模式:
- 对数线性缩放:许多测试时缩放结果声称大致是对数线性缩放。8
- 对数—对数缩放:如果支出的回报是幂律,那么弹性(对数变化之比)会是常数。这是表达人类努力回报的常用指标,例如 Jones(1995)的研发生产函数。
在每一种情形里,关系在坐标经过适当变换的图上都是线性的。但也有可能不存在一致的关系。
经支出调整的分数
如果我们愿意对支出与分数的相对价值表态,就可以用一个效用函数 $U(s,x)$ 表达这些权衡,从而得到一个价值指标。每个智能体都有不同的最优支出水平(由图上的切点表示)和不同的效用水平。
效用可以表示成经支出调整的分数:零支出处的那个分数,使你在「拿到这个分数」和「以最优支出使用该智能体」之间无差异:
\[\hat{s}_A:\quad U(\hat{s}_A,0)=\max_{x\geq 0} U(s_A(x),x).\]
效用也可以用货币单位表示,代表你从使用该智能体得到的总价值。视觉上,这是最优无差异曲线与 $x$ 轴的交点(图中未画出,它会落在 $x$ 轴的负半部分)。
\[\hat{x}_A:\quad U(0,-\hat{x}_A)=\max_{x\geq 0} U(s_A(x),x).\]
以人类为参照的指标
对照人类努力来校准。
现在我们讨论一组对照人类努力校准的指标。以人类为参照的指标有一个优点:可解释,可推广。如果一个智能体的人类等价时间期限在任务之间是稳定的,它就能让我们在尚未于某个新任务上测试该智能体之前,预测它在该任务上的表现。
人类支出的一个自然指标是花在问题上的时间,因此其中一些指标用人类等价时间作为智能体能力的指标。然而,如果我们在同一根轴上比较智能体支出和人类支出,那么钱是对 $x$ 更自然的解释。
二元时间期限
许多连续评分的任务用单个人类支出门槛给智能体评分。例如 Opus 5 的系统卡报告一系列 AI 研发任务,并对每一项给出人类在特定时间之后达到的分数(例如 8 小时或 40 小时)。然后可以把智能体判为通过,如果它们超过该基线。
METR 的「时间期限」指标(Kwa 与 West 等人(2025))把许多二元分数合成每个模型的一个人类等价时间,依据的是智能体有一半时间达到或超过人类分数的那个 $x$。9
形式上,对每个任务我们选择一个参考分数 \(\bar{s}\),并计算达到该分数所需的人类支出下确界 \(x_H^*=s_H^{-1}(\bar{s})\)。这里支出以时间测量,但也可以以钱测量。
然后我们计算智能体在某个固定支出 \(\bar{x}_A\) 上的分数,并按 \(s_A(\bar{x}_A)\) 高于还是低于 \(\bar{s}\) 给智能体一个二元分数。
图中人类和智能体的支出相等(\(\bar{x}_A=x_H^\))。固定的智能体支出 \(\bar{x}_A\) 不必等于人类支出 \(x_H^\),但对两边用相等支出,是为了可解释性的一个自然选择。
连续时间期限
我们可以扩展时间期限指标:保留智能体的连续分数,而不是把它收成一次二元比较。
我们在单一支出水平 $\bar{x}_A$ 上引出每个智能体,然后把得到的分数与整条人类曲线比较,而不是与一个二元门槛比较。
人类等价支出是 $s_H^{-1}(s_A(\bar{x}_A))$:人类会达到同一分数的那个支出。
这个方法在统计上比二元时间期限方法高效得多。使用二元评分的理由包括:(1)把整个 $s_H(\cdot)$ 函数画出来可能很难,但测量单个点更容易;(2)人类努力的回报可能看起来像阶跃函数,例如如果分数指标 $s$ 本身是二元的。
支出期限(与人类持平的支出)
与固定预算的指标不同,这个指标使用智能体的整条表现曲线,因此对那些我们预期有显著测试时缩放的任务有用。
我们把「支出期限」定义为智能体达到或打败人类的那些共同支出的上确界:$\sup\{x\geq 0:s_A(x)\geq s_H(x)\}$。
如果智能体在每一个支出水平上都不弱于人类,支出期限就不提供一个有限的交叉点。
如果 $s_H$ 和 $s_A$ 的斜率相近,支出期限也可能不稳定。
Cunningham 等人(2026)引入这个指标,部分基于摘苹果模型(Cunningham 与 Shetty 2026)。10
相对人类的支出节省
我们也可以直接测量,相对于在一个任务上使用人类,有效省下了多少成本。
为简单起见,我们把人类分数曲线画成线性。然后我们可以找出智能体与人类的支出边际回报相等的那个点(假定智能体上的支出回报是凹的)。如果你在智能体和人类之间分配预算,这就是你从在智能体上花钱转向在人类上花钱的那个点。
这个点也标出经济价值:红点与蓝点之间的水平距离代表因使用智能体而省下的支出:
\[\Delta x_{A_i}=\max_{x\geq 0}\\{s_H^{-1}(s_{A_i}(x))-x\\}.\]
这用的是上面讨论的效用框架,但现在我们的无差异曲线由人类劳动的回报(我们的外部选项)决定。
Cunningham 等人(2026)以及 Cunningham 与 Shetty(2026)对此有进一步讨论。
固定分数下相对人类的成本
另一个指标是简单地比较达到某个固定分数 $\bar{s}$ 的成本。图中,$x_{A_i}=s_{A_i}^{-1}(\bar{s})$,$x_H=s_H^{-1}(\bar{s})$:
\[\text{human-relative cost}_{A_i}(\bar{s})= \frac{s_H^{-1}(\bar{s})}{s_{A_i}^{-1}(\bar{s})} =\frac{x_H}{x_{A_i}}.\]
当人类与智能体的分数曲线只差一个乘法式的水平重缩放时,这个指标在不同的 $\bar{s}$ 上是一致的。
与本节其他指标不同,当智能体严格支配人类时(即红线完全在蓝线左边),这个指标仍然有用。
常见问题 / 注释
问:我们能否把「分数」理解为二元任务上的成功概率?
许多测试时缩放曲线在分数轴上使用 $\Pr(\text{success})$。例如,OpenAI 报告随着测试时计算变化,解出 Erdős 单位距离问题的概率(OpenAI 2026)。一个重要的限定是:在可靠性的边际价值递增的应用里,效用可能是成功概率的凸函数:从 95% 到 100% 的可靠性,可以比从 40% 到 45% 值钱得多。我们可以把 $p$ 变换成一个可靠性指标,如 $-\log_{10}(1-p)$,它测量错误按数量级的下降——「可靠性的九的个数」——并且在 $p$ 趋近于 1 时无界。11 如果智能体可以弃权,在已尝试的答案中的成功概率也是不够的:评测必须同时抓住正确性和覆盖。
问:当智能体支配人类时会发生什么?
如果智能体曲线帕累托支配人类曲线,也就是说,如果智能体在每一个支出水平上都能达到至少与人类一样高的分数,并且在某个水平上更高,那么一些以人类为参照的指标会变成未定义或没有信息。一个把智能体表现表达成人类支出倍数的指标可以仍然有用。
注:轨迹内部的缩放不同于轨迹之间的缩放。
我们可以沿着单次智能体运行测量 $s(x)$,也可以做多次运行,每一次取不同的 $x$。两种技术只有在每次运行只依赖过去、而不依赖对未来的预期(例如评分规则)时才可比较。理论上,最优引出应当给智能体关于未来的信息,而这可以影响它们的轨迹。
问:我们应该如何测量支出的回报?
测量曲线 $s(x)$ 有许多并发症。一些简短观察:
- 曲线本身可以依赖于支出预算和评分规则。例如,我会根据预期工作 1 天还是 1 周而采取不同策略。理想情况下,人类和智能体都应当被告知支出预算和评分规则。这个效应在实践中有多大并不清楚。
- 如果验证并不很便宜,在单条轨迹内部测量中间值会很难。例如,Cunningham 等人(2026)重新验证了智能体的 NanoGPT 优化轨迹。
- 引出智能体的方式很多,表现可以差很多。Best-of-n 聚合可以被想成一种引出 / 脚手架策略。每个任务一个固定预算,也定义了与「按任务难度或模型置信度自适应分配的平均预算」不同的生产函数。12
- 理想的 $x$ 应当包括全部成本,不只是智能体推理或人类时间的成本。例如,如果是在优化一个函数,它应当包括跑一次实验的成本。
问:我们应该如何给人类与智能体的协作(混合)打分?
在许多实际情形里,我们关心的是人类与智能体协作的表现,例如对 AI 研发。我们可以用同一套指标。然而,如果协作严格超过人类分数,许多以人类为参照的指标就不再有用。
两篇相关论文以不同方式把模型成本和人类成本放在一起(两者都与真正的混合有些不同:它们用基于规则的方式在智能体和人类之间分配任务):
- Erol 等人(2025)把一个模型在问题 $p$ 上的通过成本定义为 $v(m,p)=C_m(p)/R_m(p)$:一次尝试的成本除以它的成功概率,或等价地,在独立重试下得到一个正确答案的期望成本。他们的前沿通过成本对每个问题分别选择最便宜的可用模型或合格的人类专家:
\[V_p(\mathcal M\cup\mathcal M_0)=\min\left\lbrace\min_{m\in\mathcal M}v(m,p),\,v(\mathrm{expert},p)\right\rbrace.\]
因此,前沿可以在人类劳动更便宜的任务上使用人类,在推理更便宜的任务上使用模型;它对一个任务分布的平均,测量的是把每个任务分给更便宜的生产者的成本。13 这是通过逐任务路由来结合人类和模型,而不是任务内部的协作。
- Patwardhan 等人(2025)(GDPval)描述速度与成本指标,把模型胜率与模型生成、专家复核和人类返工的时间与成本合在一起。14
致谢
感谢 Beth Barnes、Manish Shetty、Nate Rush、Thomas Kwa、Parker Whitfill、Megan Kinniment、Alexander Barry 和 Kaivu Hariharan。他们提供了有帮助的讨论与反馈,作者据此整理了这篇笔记。
参考文献
Alomrani, Mohammad Ali、Yingxue Zhang、Derek Li 等,2025。《预算上的推理:LLM 中自适应且可控的测试时计算综述》。https://arxiv.org/pdf/2507.02076.pdf。
Bartz-Beielstein, Thomas、Carola Doerr、Daan van den Berg 等,2020。《优化中的基准评测:最佳实践与未决问题》。https://arxiv.org/pdf/2007.03488.pdf。
Brown, Bradley、Jordan Juravsky、Ryan Ehrlich 等,2024。《大语言猴子:用重复采样缩放推理计算》。https://arxiv.org/abs/2407.21787。
Cottier, Ben、Ben Snodin、David Owen 与 Tom Adamczewski,2025。《LLM 推理价格迅速下降,但在任务之间并不均等》。https://epoch.ai/data-insights/llm-inference-price-trends。
Cunningham, Tom 与 Manish Shetty,2026。「AI 研发的摘苹果模型」。3 月 13 日。https://tecunningham.github.io/posts/2026-03-13-apple-picking-ai.html。
Cunningham, Tom、Manish Shetty、Vincent Cheng 与 Nate Rush,2026。「支出期限:度量优化能力,并应用于 NanoGPT」。METR,7 月 21 日。https://metr.org/blog/2026-07-21-expenditure-horizon/#appendix-d。
Erol, Mehmet Hamza、Batu El、Mirac Suzgun、Mert Yuksekgonul 与 James Zou,2025。《通过成本:评测语言模型的一个经济框架》。https://arxiv.org/abs/2504.13359。
Fogelson, Alex、Zachary A. Brown、Hans Gundlach、Jayson Lynch 与 Neil Thompson,2026。《两个 AI 指标分道:这会不会造成全部差别?》。https://arxiv.org/pdf/2607.00913.pdf。
Folkerts, Linus、Will Payne、Simon Inman 等,2026。《测量 AI 智能体在多步网络攻击场景上的进展》。https://arxiv.org/abs/2603.11214。
Gundlach, Hans、Jayson Lynch、Matthias Mertens 与 Neil Thompson,2026。《进步的价格:价格表现与 AI 的未来》。https://arxiv.org/abs/2511.23455。
Jones, Charles I.,1995。「基于研发的经济增长模型」。Journal of Political Economy 103(4):759–784。https://doi.org/10.1086/262002。
Kapoor, Sayash、Benedikt Stroebl、Zachary S. Siegel、Nitya Nadgir 与 Arvind Narayanan,2025。「要紧的 AI 智能体」。Transactions on Machine Learning Research。https://arxiv.org/abs/2407.01502。
Kwa, Thomas、Ben West、Joel Becker 等,2025。「测量 AI 完成长任务的能力」。arXiv Preprint arXiv:2503.14499,提前印行。https://doi.org/10.48550/arXiv.2503.14499。
McFadyen, Jessica、Ole Jorgensen、Harry Coppock、Kevin Wei 与 Cozmin Ududec,2026。《推理计算如何塑造前沿 LLM 评测》。https://arxiv.org/abs/2606.17930。
OpenAI,2026。「一个 OpenAI 模型否证了离散几何中的一个中心猜想」。5 月 20 日。https://openai.com/index/model-disproves-discrete-geometry-conjecture/。
Patwardhan, Tejal、Rachel Dias、Elizabeth Proehl 等,2025。GDPval:在真实、有经济价值的任务上评测 AI 模型表现。https://arxiv.org/abs/2510.04374。
Wijk, Hjalmar、Tao Lin、Joel Becker 等,2025。RE-Bench:对照人类专家评测语言模型智能体的前沿 AI 研发能力。https://arxiv.org/abs/2411.15114。
- 这篇讨论的大部分时间里,我心里想的是一个带连续分数的单个任务,但我们也可以把分数理解为一个基准里通过的任务份额(Terminal-Bench、GPQA 等)。如果总体通过率是一个充分统计量,这大概没问题,但在没有更多思考之前,我不愿做强声称。它在下列情形可以是充分统计量:(A)每一个组成任务同样有价值,或(B)任务难度的排序对所有智能体都相同。↩
- 在 Cunningham 与 Shetty(2026)里,我们把这描述为「龟兔」模式:智能体在低支出处赢,人类在高支出处赢。↩
- 许多指标在优化基准评测里有类似物;例如,Bartz-Beielstein 等人(2020,第 5 节)讨论固定成本与固定目标指标。↩
- 在题为「把准确率最大化会导致无界成本」的一节里,Kapoor 等人写道:「反复调用语言模型并取多数票,可以在 GSM-8K、MATH、Chess 和 MMLU 等基准上带来并非微不足道的准确率提升。……当智能体环境有容易的信号来检查答案是否正确时,反复重试可以带来更引人注目的表现增益。……Li 等人表明,AlphaCode 的准确率从零样本接近 0% 升到 1,000 次重试时超过 15%,一百万次重试时超过 30%。……因此,能够提高准确率的推理计算量看起来没有上限」(Kapoor 等人 2025,第 2.1 节)。↩
- 「如果没有 250 万 token 上限,成功率会高到无法计算时间期限。」↩
- Gundlach 等人(2026)强调前沿成本与固定分数成本的区别:「虽然一个固定的能力水平随时间变得戏剧性地更便宜,达到前沿表现仍然要求更高的前沿支出」(结论)。Erol 等人(2025)定义一个类似的「通过成本」指标:$\mathrm{CoP}=\frac{\text{cost per attempt}}{\Pr(\text{success per attempt})}$。↩
- McFadyen 等人(2026)发现,「这些曲线上可见的跨代增益主要来自更大的任务触及和可靠性,而不是更高的效率。」Folkerts 等人(2026)说,「改进很可能在上面指出的两个维度上同时发生:更新的模型更省 token(可见于图 1 里更陡的早期斜率),并拥有更深的专门能力(可见于一个模型是进入平台还是继续前进)。」↩
- Brown 等人写道:「在多个任务和模型上,我们观察到覆盖——被任何一个生成样本解出的问题份额——随样本数跨越四个数量级缩放。有趣的是,覆盖与样本数的关系常常是对数线性的,并可以用一个取指数的幂律来建模,这暗示存在推理时缩放定律。」他们给这个结果加了限定:「在没有自动验证器的领域里,我们发现从样本集合里挑选的常用方法(多数投票和奖励模型)在几百个样本之后进入平台,不能随样本预算充分缩放」(Brown 等人 2024,摘要)。↩
- 他们把 50% 任务完成时间期限定义为「人类通常完成那些 AI 模型能以 50% 成功率完成的任务所需的时间」——Kwa 与 West 等人(2025,摘要)。↩
- 它把该指标定义为「目标指标上的改进等于一个拥有同样预算的人类所带来的改进时的美元价值」(Cunningham 等人 2026)。↩
- Fogelson 等人(2026)写道,「$\log(1/\epsilon)$ 可以被想成错误率的数量级,或『可靠性的九的个数』」,并强调合适的尺度取决于效用:「如果一个人的效用在错误率的数量级上,温顺模型与前沿模型就会分开。如果在一个固定基准上接近完美的准确率就够了,温顺模型确实会继承地球」[第 3.1.2 节]。↩
- Alomrani 等人(2025)区分「L1 可控性——在固定计算预算下运作的方法——和 L2 自适应性——按输入难度或模型置信度动态缩放推理的方法」[摘要]。↩
- 「这个前沿通过成本代表用最好的可用选项——无论是语言模型还是人类——为问题 $p$ 得到一个正确解的真正最小期望成本」(Erol 等人 2025,第 2.4 节)。↩
- 对他们的「试 1 次,然后修好它」指标,他们「取模型的采样时间,加上专家评估质量的复核时间 $R_T$,然后以概率 $(1-w_i)$ 加上任何所需修复的人类完成时间」;他们类似地计算成本(Patwardhan 等人 2025,附录 A.2.1)。↩
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.