智测 OpenQA

行业与实践研究与基准测试

少跑题也能排榜:智能体基准的中等难度过滤

智测团队 · OpenQA(openqa.cn)阅读约 27 分钟

智能体全量评测很贵,因为每一题都是带工具的多步交互。这篇在八个基准上看到:脚手架和时间偏移会让绝对分数预测变差,排名仍然比较稳。只评历史上通过率 30%–70% 的题,任务量减少 44%–70%,排名保真仍高。

本文目录

本文是 arXiv 论文 Efficient Benchmarking of AI Agents(arXiv:2603.23749,CC BY 4.0)正文第 1 节至第 7 节及附录 A 的中文译文,由智测团队翻译。参考文献未逐条展开。正文保留了论文各表中的基准规模、排名相关、费用和任务削减比例。

摘要

在完整基准上评测人工智能智能体很贵,因为每一次评测都是带工具、多步推理的交互式 rollout。本文研究:较小的任务子集能不能在大幅降成本的同时保住智能体排名。和静态语言模型基准不同,智能体评测会受到脚手架带来的分布偏移,因为成绩取决于包在模型外面的框架。在八个基准、33 种智能体脚手架、70 多种模型配置上,绝对分数的预测在这种偏移下变差,名次预测仍然稳定。利用这种不对称,作者提出一个不需要优化的简单协议:新智能体只评历史上通过率落在 30%–70% 的题。这个中等难度过滤来自项目反应理论。它把评测任务数减少 44%–70%,在脚手架偏移和时间偏移下仍保持较高的排名保真。它比随机抽样更稳,随机抽样在不同随机种子之间方差很大;在分布偏移下也优于贪心选题。这些结果说明,可靠的榜单排名不必跑完全部基准。

图 1 叫稳健性缺口。它比较不同评测机制下的 Spearman ρ(排名)和 R²(分数预测)。在时间偏移、脚手架偏移和随机偏移下,绝对分数预测很快变差,排名保真仍然稳健。

1 引言

智能体基准越来越多地用来评测需要推理、工具使用、以及与外部环境交互的复杂多步系统。跑这些基准很贵,局面类似机器学习研究里的算力鸿沟(Besiroglu 等,2024)。Holistic Agent Leaderboard(HAL,Kapoor 等,2026)是目前最完整的智能体标准化评测之一。它在九个基准上评智能体,大约花了 4 万美元,而且每个基准最多只考虑两种脚手架,每种脚手架–模型配置只跑一轮。这种费用把独立研究者和小实验室挡在外面,实践里也很难做统计上稳健的评测(Gonzalez 等,2025)。

已有的基准压缩工作表明,自然语言处理和语言模型评测常常可以压到小得多的题目子集,同时仍能预测模型分数(Vivek 等,2024;Polo 等,2024;Perlitz 等,2024;Subramani 等,2025)。智能体基准多了一种静态评测没有的偏移:成绩不只取决于底层模型,还取决于脚手架,也就是掌管工具使用、记忆、重试逻辑和执行流程的那层框架。因此,缩减后的智能体评测集必须能跨脚手架、跨时间泛化,而不能只跨模型。压缩也更苛刻:智能体基准通常只有几十到几百题,不是几千题;每一题都是完整的智能体循环,不是一次提示–回答。

本文研究:任务数能不能明显减少,同时保住智能体榜单真正在用的信号,也就是排名。贡献有三条。

第一,在脚手架偏移和时间偏移下,排名预测和分数预测之间有一种稳健的经验不对称。这种不对称使智能体场景下的基准压缩成为可能。

第二,提出中等难度过滤(Mid-Range Difficulty Filter,下文记为 MR)。这是一条确定的、不需要优化的选题规则:保留通过率在 30%–70% 的题。动机来自项目反应理论:通过率接近 50% 的题,对潜在能力的区分信息最强。

第三,在五种分布偏移逐步加重的协议下,用严格的嵌套交叉验证,把 MR 和贪心、随机、分层、极端难度等基线比较。在所研究的八个基准上,MR 的排名保真最好,而且跨评测机制稳定。随机和贪心的方差则很高。

合在一起,实际结论是:日常榜单可以默认用缩减后的任务集;全量基准留给初始化、漂移监测,以及能力发生重大跃迁的时候。

2 背景与相关工作

已有不少工作研究如何降低基准评测成本,同时不大改分数或排名。多数针对自然语言处理或语言模型,而不是智能体。Vivek 等(2024)的锚点选择,找出能可靠给模型排名、并能估计全量上逐例行为的小代表子集。Polo 等(2024)表明,MMLU、HELM 这类套件上的语言模型表现,可以用少得多、经过挑选的例子来估计,从而大幅降成本。Perlitz 等(2024)研究 HELM 上计算与可靠性的权衡,提出 Decision Impact on Reliability(DIoR),以及能在保住排名可靠性的同时明显降成本的评测算法。Subramani 等(2025)只从成绩矩阵做基准压缩,说明小代表子集可以保住模型排名,并预测 HELM、MMLU、BigBenchLite 上留出的表现。

另一条线用心理测量,尤其是项目反应理论(Baker,2001),判断哪些题目信息量最大(Gignac 与 Ilić,2025)。Rodriguez 等(2021)提出 DAD(难度与能力区分)榜单,用潜在题目难度和模型能力分析榜单可靠性,并找出有信息或有错误的评测项。把 DAD 用到 SQuAD 2.0 榜单上,基于项目反应理论的排名比只看平均准确率更稳;题目很少时,也能提高评测可靠性。这些工作强调:题目的难度和区分度不同,选哪些题会改变排名。近期工作把这个视角延伸到语言模型评测,例如用更丰富的项目反应理论模型诊断基准质量,并构造更对齐人类偏好的较小变体(Zhou 等,2026)。

本文精神相近,但场景和目标不同。先前的压缩主要是在自然语言处理或语言模型上评模型。智能体基准的核心额外偏移是:成绩不只看模型,还看脚手架。缩减后的评测必须跨模型、跨脚手架、跨时间泛化。压缩也更紧:语言模型常常是从几千例压到几百例;智能体基准一开始往往只有几十或几百题,而且每题贵得多。要真正省钱,缩减后的智能体基准必须从更少的题、以及相对较少的已完整评测智能体里,抽出强信号。

3 方法

3.1 问题设置

对每个基准,有一张逐题成绩矩阵 X,取值在 0 到 1,形状是 n 乘 m。n 是智能体数,m 是任务数。X 的第 i 行第 j 列表示智能体 i 是否解开任务 j。每个智能体每题只评一次时,元素是 0 或 1;多次试验时,元素是解开该题的试验比例。智能体 i 的全量基准分数是所有任务上的均值:

y_i = (1/m) × Σ_j X_ij

所有智能体的分数组成向量 y。基准压缩要找一个子集 S,大小 k 远小于 m,使得只在 S 上的表现就能预测 y。X_S 是只保留 S 中那些列的子矩阵。分数校准时,在选中的列上做岭回归,预测分数等于 X_S 乘以系数向量 β。全文正则化参数 α 取 1.0。若只做排名预测,选中任务上的不加权均值就够了。

两个预测目标对子集的要求不同。

分数预测。子集对每个智能体全量分数预测得有多准,用决定系数 R² 衡量。分子是预测误差平方和,分母是相对均值的总平方和。高 R² 要求子集抓住基准的绝对难度结构:不只是谁更好,还要好多少,也就是校准。子集表现和全量表现之间的关系一旦偏移,R² 就敏感。

排名预测。子集是否保住智能体的次序,用两个互补的秩相关。Spearman ρ 是在秩向量上算的 Pearson 相关。并列取中间秩。它捕捉总体单调关系,对大的名次错位敏感。

Kendall τ 数一致对和不一致对,并对并列做调整。全文用 τ_b,简写为 τ。一对智能体若预测次序和真实次序同向,算一致;反向算不一致。τ 有直接的概率解释:(τ + 1) / 2 是随机抽一对智能体、排序与全量基准一致的概率。例如 τ = 0.80 表示 90% 的两两比较与全量基准一致。τ 数的是成对错误,不是秩位移的平方,所以对排名保真比 ρ 更严;同一套一致性下,ρ 的数值往往更高。全文两个都报:ρ 便于和先前工作比,τ 便于解释。

这两个目标可以差得很远。子集可以分数校准很差(R² 远小于 1),同时仍然知道谁胜过谁(ρ 和 τ 接近 1)。第 4 节表明,这不是纯理论:脚手架引起的分布偏移下,R² 垮掉,两个排名指标仍然高。这种不对称是省钱评测智能体的关键,因为模型选择、脚手架选择、榜单排名,多数只要排名。

选题方法是一个函数:把全部任务(以及可选的历史成绩)映射到大小为 k 的子集。

3.2 数据

八个智能体基准:Terminal-Bench 2.0(Merrill 等,2026),在终端环境里评智能体,时间结构丰富;以及 HAL 里的七个基准,任务领域多样,但智能体人数较少。

Terminal-Bench 2.0 有 89 个任务,每个智能体每题尝试 5 次,单元格是分数形式的成功率。抓取时榜单有 101 个智能体,来自 23 种不同脚手架,包括 OpenHands、Codex CLI、Aider,以及各种自定义实现。它有自然的时间结构:2025 年 10 月发布时有 50 个智能体,随后 3.5 个月又增加 51 个,覆盖原来那批里没有的 17 种脚手架。因此它特别适合检验选题能否泛化到新的智能体架构。

HAL 覆盖九个基准:编码类有 SWE-bench Verified、CoreBench Hard、USACO、SciCode、ScienceAgentBench;网页导航有 Online Mind2Web;通用助理有 GAIA、AssistantBench;客服有 TAU-bench Airline。ScienceAgentBench 和 AssistantBench 被排除,因为它们没有选题和排名预测所需的、干净的逐题二值成功信号。TAU-bench 不是原生的逐题二值成功,而是用奖励阈值:奖励严格大于 0 算成功,总体准确率是各题奖励的平均。作者发现奖励阈值仍然提供可用的逐题信号,因此保留。表 1 是数据采集时各基准的主要统计。最后一列「平均任务 ρ」是各任务结果向量之间、跨智能体的平均成对 Spearman 相关。越高,说明智能体在不同任务上的表现越一致;越低,说明表现模式越散。

基准智能体任务脚手架平均任务 ρ
CoreBench Hard384520.10
GAIA3216520.15
Mind2Web2230020.03
SciCode246520.12
SWE-bench Verified285020.29
TAU-bench Airline265020.08
USACO1330720.17
Terminal-Bench 2.010189230.30

HAL 基准和 Terminal-Bench 有三点不同。多数情况下每题只记一轮,结果是二值的,格内没有方差估计,逐题信号更吵。每个 HAL 基准只有两种脚手架,智能体人群的多样性有限。样本量也不大(n 从 13 到 38),任何数据驱动的选题程序,可靠性都受限制。

费用结构。表 2 是 HAL 的单次运行费用。SWE-bench Verified 一次运行的中位费用是 163 美元,单题费用从 DeepSeek R1 的 0.08 美元到 Claude Opus 4.1 High 的 32.00 美元,相差 400 倍,由模型定价和脚手架设计驱动。在选出的八个 HAL 基准上评一个智能体,API 费用中位数大约 800 美元。全部 242 次智能体运行的总费用大约 4.6 万美元,与 HAL 报告的约 4 万美元一致;论文发表后到作者采集数据之间又加了一些运行。单次运行费用取决于基准、脚手架和模型。前沿模型在计入缓存收益之前,在 GAIA 上可以高到 2,829 美元。Terminal-Bench 2.0 没有 HAL 那种细到每次运行的费用。

表 2 的智能体列与表 1 并不处处相同。例如 SWE-bench Verified 在表 1 是 28 个智能体,在表 2 是 33 个。下文按各表原文照录。

基准任务智能体中位美元/次最高美元/次中位美元/题单题范围
SWE-bench Verified503316316003.260.08–32.00
CoreBench Hard4545665101.470.05–11.33
GAIA1653214028290.850.05–17.14
Mind2Web3002227616100.920.02–5.37
SciCode6533676251.030.00–9.62
TAU-bench Airline5026221800.440.01–3.61
USACO30713562760.180.00–0.90

3.3 选题策略

智能体基准压缩的难点,是找到一种选题策略:少跑题,仍能恢复排名和基准分数。主要比较三种:中等难度、贪心、随机。另外还有最难、最易和分层。

中等难度过滤(MR)。选出通过率落在区间 [0.30, 0.70] 的全部任务。区间来自项目反应理论。设 p 为智能体解开一题的概率。在带逻辑链接的伯努利响应模型下,关于潜在能力参数 θ 的 Fisher 信息是 I(θ) = p(1 − p)。它在 p = 0.5 处最大,在 p 约 0.146 和约 0.854 处降到最大值的一半。作者把大约 50% 的压缩当作实际效率要求。30%–70% 这条固定规则,比完整的高信息区(约 15%–85%)窄不少,但仍保留中等难度的题。

只对中等难度带足够密的基准使用这条协议。数据里 SciCode 在 30%–70% 通过率区间只有四题,协议不稳定。因此主结果排除 SciCode,只在分基准分解里保留,用来说明中等难度协议不适用的情形。

贪心前向选择(Greedy-k)。从空集开始,迭代加入能最大化岭回归、留一智能体交叉验证 R² 的那一题,用帽子矩阵捷径提高计算效率。为了和 MR 公平比较,k 等于该评测折里中等难度题的数量。每一折先在训练智能体上算 MR 带,得到该折的预算 k_i,再让贪心和其他基线都刚好用这个预算。完全嵌套、预算对齐,避免信息泄漏,也使方法之间可以直接比。

随机抽样(Random-k)。均匀随机抽 k 题,k 与该折的 MR 池大小对齐。用 100 个随机种子。元自助分析确认,这对所有基准都给出稳定估计(估计均值和标准差的方差低于 2×10⁻⁵)。报告种子间的均值加减标准差。这条基线用来看:被选中的是哪些题是否重要,还是任何一个足够大的随机子集都够。

其他基线。最难 k 题(通过率最低)、最易 k 题(通过率最高)、分层 k 题(按难度十分位均匀抽样)。预算都与 MR 的折内 k 相同。

3.4 评测协议

全部评测用严格的嵌套交叉验证:选题发生在交叉验证循环内部,测试智能体的数据从不参与选题。这避免了先在全量数据上选题、再划分所带来的乐观偏差。

五种协议按分布偏移从轻到重:

  1. 脚手架内留一智能体(Within-Scaffold LOAO)。只在同一脚手架的智能体里留一。Terminal-Bench 上评运行数不少于 10 的三种脚手架:Terminus 2 有 30 次,Mini-SWE-Agent 有 13 次,OpenHands 有 12 次。HAL 上每种脚手架通常有 10–20 次运行,不够的丢掉。
  1. 留一智能体(LOAO)。不管脚手架,在全部智能体上留一。每一折重新选题。
  1. 随机 80/20。智能体随机分成 80% 训练、20% 测试,100 个种子。
  1. 留一脚手架(LOSO)。在其他脚手架的全部智能体上训练,在留出的脚手架上测试。只在训练脚手架上选题。
  1. 时间扩展窗口。用时间 t 之前提交的全部智能体训练,预测在 t 提交的那个智能体。每一步都在当时的训练集上选题。这最接近真实榜单的运行方式。

报告 Spearman ρ、Kendall τ 和 R²。

4 结果

4.1 ρ 与 R² 的分化:分数预测垮了,排名还在

在 8 个基准、6 种选题策略上跑 5 种协议之后,经验上榜单排名比绝对分数保得更好。

跨协议的排名预测稳定(ρ 在 0.90 到 0.96),分数预测从 R² = 0.90 掉到随机划分下的 0.54、脚手架偏移下的 0.65。单个基准上分化更极端:Online Mind2Web 在 LOSO 下 R² 变成负数,ρ 仍高于 0.90。时间扩展窗口的 ρ 仍高(0.90),因为不断变大的训练集抵消了分布偏移。它也是最接近真实榜单操作的协议。

表 3 是核心发现:在严格嵌套交叉验证下,Spearman ρ 在所有协议上保持稳定,R² 明显变差。这意味着不必跑完全部基准,仍然可以比较智能体并给它们排名。最优选题策略里最差的 Kendall τ 是 0.80(出现在 LOSO),也就是 90% 的智能体对被排对:每 100 次两两比较里只有 10 次颠倒。「Best」是每个基准上表现最好的选题方法;「Avg」是各方法的平均。

协议最好 ρ平均 ρ最好 τ平均 τ最好 R²平均 R²基准数
LOAO0.950.910.850.790.900.748
脚手架内 LOAO0.960.860.870.740.890.658
时间窗口0.900.850.810.730.710.528
LOSO0.920.870.800.730.650.507
随机 20%0.900.860.840.790.540.468

智能体基准常被用来估计绝对能力。实践里,即便全量跑一遍,得到的也只是所测能力的有偏估计。偏差来自分布限制(基准题是方便样本,不是从全部相关挑战里的代表性抽取)、构念效度失败(Zhu 等,2025:十个广泛使用的智能体基准里有七个,要么任务效度失败,平凡智能体不必具备目标能力也能通过;要么结果效度失败,评分器给错误完成记分),以及脚手架混淆(成绩同时取决于模型和包住它的脚手架,绝对分数把能力和工程选择混在一起)。这些偏差是结构性的:它们影响分数的期望,不只是方差,多跑题或多跑智能体消不掉。因此,关注排名而不是重建分数,不只是省事,在认识上也站得住:绝对分数在做任何压缩之前就已经系统性地误导;排名继承的这种结构偏差更少,因为分数尺度上的仿射扭曲不改变次序。给智能体在一个基准上排名,比估计它们的绝对能力更站得住,因为它不需要假设这个基准可靠地测量了它打算测量的那种能力。

4.2 跨基准、跨协议,中等难度选题最好

中等难度选题保住排名的效果好于其他策略。多数策略在最有利条件下都能达到很高的峰值(ρ 约 0.99),但下界暴露出对分布变化的严重脆弱。随机和贪心的 Spearman ρ 可以分别低到 0.54 和 0.56。

MR 的均值最高(ρ = 0.94),同时有较稳的安全网(最差 ρ = 0.87),避免了贪心和随机那种灾难性下跌。图 2 给出各策略的均值、最好和最差 Spearman ρ。图 3 表明,基线在特定基准划分上方差大、下跌严重,MR 则不管评测机制如何,都保持收紧的高保真排名(平均 ρ 高于 0.85)。

跨全部协议,难度过滤给出清楚的次序。MR 的排名和分数预测最好(ρ = 0.910,R² = 0.670),最易 k 题紧随其后(ρ = 0.894,R² = 0.628)。分层 k 题(ρ = 0.875)居中:因为样本更均衡,好于随机(ρ = 0.816),但因为被迫纳入又难又吵的题,差于 MR。贪心(ρ = 0.842)系统性地过拟合,在时间和脚手架偏移下更不可靠。最难 k 题是灾难性的(ρ = 0.638,R² = −3.360):选中的题上智能体普遍失败时,就无法区分。

关键不是纳入了哪些题,而是排除了哪些题。MR 和最易 k 题之所以成功,是因为它们丢掉了最难的题,那些题贡献的是噪声而不是信号。MR 仍优于最易 k 题,有两个理由:它也排除了所有智能体都成功的天花板题,因此 R² 更好;并且有项目反应理论的原则性动机。分层抽样的中间表现印证了这一点:按原基准比例强制纳入难题,会主动损害排名预测。

跨全部协议,MR 在八个基准的五个上排名保持最好,其余上也是紧挨着的第二。随机选题平均看起来不错,但这个平均是 100 个种子上算的,并不反映真实榜单做法,本身就违背省钱的目的。方差大,不能当部署策略;作者只把它留作基线。

表 4 是各基准上、跨全部评测协议的平均 ρ。随机列是每个协议 100 个种子的均值加减标准差;最差/最好是全部协议上极端种子的结果。SciCode 的分层一格在原文中为空。

基准kMR贪心最易分层随机均值±标准差随机最差/最好
TerminalBench390.9800.9880.9700.9790.980±0.0030.962 / 0.991
GAIA770.9460.9270.9280.9300.938±0.0150.872 / 0.987
SWE-bench Mini200.9200.8810.9220.9020.903±0.0260.695 / 0.977
USACO810.9380.8860.8610.9140.924±0.0330.700 / 0.995
τ-bench Airline270.9440.8340.9200.8740.860±0.0380.708 / 0.957
CoreBench Hard140.9010.8690.8960.7410.780±0.0500.588 / 0.910
Online Mind2Web860.9210.6120.9130.7980.808±0.0620.543 / 0.962
SciCode40.7360.7530.736—0.364±0.147−0.189 / 0.734

最易 k 题为什么有竞争力:它选中的常常就是中等难度题。表 4 里最易 k 题的排名意外地接近,不是因为简单题本身信息量大。八个基准里有四个,最易 k 题和 MR 选中的题集相同或几乎相同。当难度分布左偏(难题多、简单题少)时,最容易的那 k 题本来就和中等难度带重叠更高。MR 与最易 k 题的表现差距,和两者题集重叠强相关(r = −0.71;正文 p = 0.05,图 4 图注写 p = 0.048)。重叠高时(CoreBench、SciCode、τ-bench)两者几乎分不开;重叠低时(USACO,重叠 14%),MR 高出 Δρ = 0.078。最易 k 题有竞争力,恰恰是因为它是 MR 的一个带噪声的近似。附录 A.4 画出了造成这种重叠的难度分布。

4.3 成本削减

表 5 是 MR 过滤带来的逐基准任务削减和费用节省。任务削减通常在 44% 到 70%,中位数 58%。节省按任务数线性缩放,用 HAL 榜单上的中位智能体费用;每个智能体、每个基准一次。TAU-bench Airline 每次大约省 5 到 22 美元,Online Mind2Web 大约省 149 到 253 美元。TerminalBench 没有 HAL 式费用。USACO 的 LOSO 不可用,因为除一个智能体外都用同一种脚手架。SciCode 因中等难度题不足(k = 4)被排除。表 4 的 k 是各折对齐后的预算,表 5 的 k 是全量上的中等难度题数,因此 GAIA 等行的 k 并不相同。

基准Nk削减LOAO 的 ρLOSO 的 ρ时间窗口 ρ中位节省节省范围
TerminalBench893956%0.9860.9840.975——
GAIA1658250%0.9560.9260.97470.3 美元40.1–237.7
SWE-bench Mini502158%0.9240.8960.96894.5 美元37.9–234.0
USACO3079370%0.940—0.95039.3 美元19.6–55.8
τ-bench Airline502844%0.9670.9560.9459.8 美元5.2–22.4
CoreBench Hard451567%0.9180.9120.90344.1 美元16.8–67.5
Online Mind2Web3009568%0.9390.9090.930188.7 美元149.2–253.2
合计/均值100637363%0.9470.9310.949446.7 美元268.8–870.6

5 讨论

5.1 给基准运营者的实用协议

要用 MR 做压缩,作者建议四阶段部署。

阶段 0,冷启动。用已有的历史智能体运行估计每题通过率。即便 5 到 10 次运行也能给出可用的初估,智能体变多后估计会持续变好。靠近带边界的题,在运行次数少时估计更不确定,但带本身有宽度,边界上分错的后果有限。

阶段 1,设置。选出通过率在 30%–70% 的全部题。若落入此带的题少于 10%,逐步放宽到 25%–75%,再到由 Fisher 信息准则导出的理论边界 15%–85%,即 I(θ) = p(1 − p) 不低于最大信息的一半。

阶段 2,日常。新智能体只跑选中的题。报告排名,不把缩减集上的原始分数当成绝对分数。如果必须报绝对分数,报岭回归预测的全量基准分数,而不是缩减集上的原始分,并附上置信区间,反映预测不确定性。

阶段 3,维护。任务集先固定,直到有证据表明该变。若需要分数预测,每 5 到 10 个智能体重拟合一次岭回归权重。在偶尔的全量校验上监测 ρ;只有 ρ 掉到 0.75 以下才触发重新选题。

以下情形不适合这条协议:预期只有很少几次智能体运行,冷启动成本收不回来;需要绝对能力声明;难度分布偏到中等带里的题少于 10%(SciCode 就是这样,65 题里中等难度不足 5 题)。

5.2 呼吁逐题透明

这项研究之所以能做,是因为 HAL 和 Terminal-Bench 公布了逐题、逐智能体的结果,也就是完整成绩矩阵,而不只是汇总分。多数基准不这样做。

即便名义上有逐题数据,也常常散在嵌套的 JSON 日志或多个 API 端点里,要花不少工程才能重组成可用格式。公开但不好取用,会限制复现和社区复用。

作者建议:榜单之外,再发一个扁平文件(CSV 或等价物),每个智能体–任务对一行,列包括智能体标识、任务标识、结果、脚手架、模型、提交日期。这不超出评测时已经算过的东西,但能让社区研究评测效率、发现基准饱和、找出冗余题、建造缩减评测集。摊销论证依赖于此:历史 rollout 只有被共享,而且共享成任何人一行代码就能载入的格式,才能变成共用的训练数据。

6 局限

MR 需要一条足够密的中等难度带。它在 SciCode 上失败,那里大约只有四题落入此带。更一般地,难度分布高度偏斜的基准不太适合。

冷启动成本不小:大约要有 5 到 10 个智能体在全量基准上评完,缩减才适合增量使用;若要让以后所有比较都稳定,更接近 15 个智能体。

HAL 基准的运行数相对少(n 为 13 到 38),脚手架多样性有限,也几乎无法估计运行之间的方差。作者用嵌套交叉验证,并在八个基准上重复,来缓解;更大、更多样的人群会让结论更强。

TerminalBench 的时间验证窗口大约 3.5 个月(105 天),期间智能体人数增加约 40%。选题质量会随人群演化而变差。尤其是能力大跳跃,表现为 MR 通过率突然上升,会比渐变漂移更快地让先前选中的题失效。这时需要一次全量运行来确认结果、收集更多数据,并可能重新选题,或宣布基准已经饱和。

本研究的基准都是逐题二值或接近二值的结果。评分方式掩盖了逐题结果与总分关系的基准,行为可能不同,这些结果不能直接覆盖。

最后,30%–70% 是一条由项目反应理论和降成本目标推动的实用启发式,不是理论上唯一或最优的选择。

7 结论

可靠的智能体榜单排名不需要全量评测。在八个基准和多种分布偏移下,排名比绝对分数预测稳定得多,因此即便校准变差,缩减评测仍然可行。

这导出一条简单规则:新智能体只评中等难度的题。MR 大幅降低评测成本,同时比随机或贪心更可靠地保住榜单保真。它的价值是操作性的,不是普适的:最适合那些中等难度带足够密、逐题结果透明、并且不断有新智能体到来、从而值得把最初的全量成本摊销掉的基准。

更广地说,论文主张改变智能体评测的框架方式。智能体基准常被当成测量绝对能力的仪器。考虑到构念效度失败和非代表性的任务分布,这是一个很难达到的理想。实践里它们主要用来比较和排名。一旦评测与这个用途对齐,选择性测量就是穷尽式基准的一种有原则、而且有效的替代。

因此,日常维护榜单应以缩减评测为默认;全量运行留给初始化、漂移检查、重大能力跳跃和饱和分析。

可复现性。代码、数据和预计算结在 https://github.com/fsndzomga/efficient-benchmarking-ai-agents 。仓库包含所用八个基准的逐题成绩矩阵、五种协议的评测脚本,以及支撑全文表格和图的 CSV。

附录 A

大模型在本文准备过程中用于文字编辑、校对、图表润色和编程协助。作者对全部文字和结果负责。

A.1 为什么排名比分数容易:一种理论

这一节为第 4 节的经验结果提供一种可能的理论根据:即便有脚手架偏移和时间偏移,用任务子集预测排名,为什么仍比预测分数更稳健。

缩减评测在「观察到的量」和「想恢复的量」之间引入两种变换。第一是子集限制:只观察任务子集 S 上的表现,而不是全量。第二是脚手架偏移:被评的智能体可能用了选题时历史数据里没有的脚手架。缩减集上的可靠排名,要求这两种变换的复合近似单调。一种简单的形式化是仿射扭曲。

设 y(m) 为智能体 m 的全量分数,x̄_S(m) 为它在子集 S 上的均分。即便没有脚手架偏移,子集限制也带来扭曲:全量分数约等于 α_sub 乘以子集均分,加上水平偏移 β_sub,再加残差。α_sub 大于 0 时,它捕捉子集难度与全量难度的尺度不匹配。当 α_sub 大于 0 且残差小,映射近似单调:子集能恢复排名,即使恢复不了校准后的分数。中等难度过滤就是为了把这个残差保持得小。通过率近 50% 的题,在项目反应理论模型下对潜在能力的 Fisher 信息最大,子集因此落在智能体最能被稳定区分的难度区域。极难题(多数失败)和极易题(多数成功)对排序信号贡献很小,排除它们对子集到全量映射的单调性影响有限。

再看第二种变换。新脚手架 S2 在选题时不存在。原脚手架下的子集分数,与新脚手架下的全量分数之间,还有一层扭曲:新脚手架下的全量分数约等于 α 乘以历史子集均分,加上 β 和残差。只要 α 大于 0、残差小到不颠倒成对次序,这个复合变换就保住排名。分数预测要求更高:要恢复正确的尺度(α 约等于 1)和截距(β 约等于 0),对参数的任何偏移都敏感。

这个框架可以解释第 4 节的 ρ–R² 分化。LOSO 直接测量这种复合扭曲:Spearman ρ 保持在 0.90 以上,同时 R² 掉到 0.65 以下。子集限制加上脚手架偏移,在实践中近似保序,但不保分数。

近似单调并不要求脚手架变化在强意义上与模型无关。有些脚手架与特定模型族共同优化(系统提示、工具模式或后训练),会引入真实的脚手架–模型交互。排名在总体上仍然稳定,可能有两个原因,而且数据区分不了它们。第一,脚手架工程有实际限度:很难设计一套框架,把较弱模型抬到在足够难的基准上超过明显更强的模型。共同优化可以缩小差距,但通常不足以逆转由底层能力差决定的次序,如果能力差足够大。第二,共同优化的脚手架可能是少数;若多数脚手架近似与模型无关,少数强交互在对全部智能体平均时会被稀释。经验结果确立的是:不论机制如何,在所研究的全部八个基准上观察到的人群层面,复合变换仍然近似单调。

时间偏移是新智能体随时间提交带来的分布变化,它在子集限制和脚手架偏移之上再加第三层扭曲。Terminal-Bench 的 3.5 个月窗口里,智能体人数翻倍,出现 17 种新脚手架和更新的基础模型。每个新脚手架相对选题所用的历史数据,各自引入近似单调的扭曲。近似单调函数的复合仍然近似单调,因此累积的时间偏移继承其组成部分的保序性质,只要没有任何一次偏移严重到颠倒次序。

时间偏移里的能力成分,也就是新的、更强的基础模型,原则上可以打破这个结构。足够大的能力跳跃是违反单调近似的非线性偏移:若一整类原先做不动的题变成常规题,用历史数据估计的中等难度带就不再对准区分区域。但时间扩展窗口协议达到 ρ = 0.921,只比 LOAO 基线低 0.01,说明观察期内的能力提升仍然是增量的,留在单调机制之内。这不能保证永远成立,所以第 5.1 节的部署协议要求:一旦出现漂移或不连续的证据,就做周期性的全量运行。

A.2 对中等难度带的事后核验

30%–70% 这个阈值是事先选定的,不是在基准数据上直接优化相关得到的。动机是项目反应理论(通过率近 0.5 的题,对接近的能力区分力最大),再平衡一种实际愿望:比理论上更宽的最优区间(例如 15%–85%)更激进地省计算。若在数据上直接优化过滤带以最大化相关,会引入循环论证,并夸大子集选择的可泛化性。

为核验这个事先选择是否合理,作者在七个基准上做了事后敏感性分析(因数据规模排除 SciCode)。看收紧百分位带如何同时影响排名保持(相对全量的 Spearman ρ)和任务削减。

图 5 显示排名保持和任务削减之间有清楚的经验权衡。更宽的带(例如 10%–90%)相关近乎完美(ρ 约 0.98),但任务只减少大约 30%。极窄的带(例如 45%–55%)能减掉 90% 的题,但相关下跌更陡,基准之间的方差也更大。阴影是跨基准的正负一个标准差。

事先选定的 30%–70% 落在这条帕累托前沿上一个有效的位置。跨所评基准平均,这条带保持 Spearman 相关 ρ = 0.95 ± 0.02,同时平均任务削减 60% ± 11%。事后分析确认:这个由理论推动、事先做出的选择,能给出稳健、高保真的排名,而不需要在数据上窥探式地优化。

A.3 分基准的选题表现

图 6 报告每种选题策略与每个基准组合的平均 Spearman ρ(跨协议平均),灰色为最差 ρ。星号标出每个基准上最好的策略。

MR 在八个基准的五个上取得最好或并列最好的平均 ρ:GAIA、USACO、τ-bench Airline、CoreBench Hard、Online Mind2Web。其余三个上与最好者的差距在 0.01 以内。更重要的是,最差情形不低于 0.56(SciCode,中等带只有很少几题);在协议定义良好的基准上,保持在 0.87 以上。

贪心在单个基准上可以最高(Terminal-Bench 上 0.99),但最差情形很差:SciCode 上掉到 0.48,Online Mind2Web 上掉到 0.56。这确认数据驱动的选题在智能体人群偏移时会过拟合。

最易策略在难度左偏的基准上有竞争力(CoreBench Hard、τ-bench Airline),因为最易题与中等带重叠很大。两套题真正分开的地方,最明显是 USACO,MR 领先。

随机的模式与正文一致:均值还过得去,最差可以到 SciCode 的 −0.19 和 Online Mind2Web 的 0.54。尽管平均可接受,也不能当部署规则。而且随机是 100 个种子的平均,实践中本身就违背省钱。

SciCode 在所有策略上都是异常点。难度分布严重偏斜,中等带里题很少。所有策略都变差,印证第 5 节的局限:MR 需要足够密的中等难度区域。

A.4 最易 k 题与中等难度的重叠

图 7 是每个基准的任务难度分布,标出最易 k 题和 MR 题集。竖直虚线是 30%–70% 的中等带。图按两种策略的题重叠从高到低排列。

当难度分布左偏、集中在难题、右尾较薄时,最容易的 k 题落在中等带内或附近,重叠高,排名保真几乎相同。CoreBench Hard 和 SciCode 的重叠达到 100%:最易 k 题选中的每一题也都是中等难度题。SWE-bench Mini 为 95%,τ-bench Airline 为 93%。

重叠下降后两者分开。TerminalBench 62%,GAIA 57%,Online Mind2Web 56%,属于中等分离:最易 k 题开始纳入多数智能体都能成功的天花板题,区分信号更少。USACO 是真正分开的最清楚例子,重叠只有 14%。它的难度分布右偏,最易题聚集在通过率 0.7 到 1.0,明显高于中等带。这正是分布偏移下 MR 最清楚地胜过最易 k 题的基准(Δρ = 0.078)。表现差距跟踪的是题集是否分开,而不是简单题有什么内在优势。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误