CodexQA

Industry & PracticeResearch & Benchmarks

Messier:把 30 个 Agent 基准对齐成可审计的逐任务记录

CodexQA 团队43 min read

Andromede 发布 CC BY 语料 Messier:957,253 条试验结局,覆盖 30 个基准。全通过评分会把部分完成打成零,开放数据拟合的能力排序与 Epoch ECI 的 Spearman 相关为 0.81。

In this piece

Messier:用于跨基准 Agent 评测的高分辨率语料库

Stefan Krsteski、Charlotte Meyer、Guillaume Allegre、Tony O’Halloran、Alexandre Sallinen。Andromede AI。通信作者:stefan@andromede.ai。许可证:CC BY 4.0。arXiv:2607.25891v1,2026 年 7 月 28 日。

在交互环境中评测 AI agent,受阻于任务、支架、验证器和评分规则彼此割裂。现有工作要么只覆盖很窄的设定,要么规模有限,要么必须付出高昂代价重跑,结果是大量实证记录无法互相比较。我们提出 Messier,一个统一语料库,包含 957,253 条记录,覆盖 30 个基准、714 个 agent、11,891 个任务和 74,205 个验证器。Messier 汇集公开基准分数,并用五个 agent 的运行补上六个代表性不足的职业与科学领域,其中包括一个近期的法律基准。每条记录都按模型、支架、环境、任务、验证器和聚合规则标准化,并带有用于职业与行业分析的 SOC/NAICS 分类。利用这一语料,我们发现前沿进展在不同基准类型上并不均匀:「函数调用」已经饱和,「编程」提升最快,「企业工作流」仍然最难。此外,反事实重新评分表明,多验证器任务上严格的全通过聚合会掩盖进展,并改变 agent 排名。从这些标准化记录中,我们导出能力标尺,与 Epoch 的 Evaluation Capability Index 排名的 Spearman 相关为 $\rho=0.81$,并且可以按领域、职业、动作空间或验证器类型专门化。Messier 为 agent 能力标度、基准审计,以及对评测失败的细粒度分析,提供一套可复用的基础设施工具。

资源是否为 Agent基准数环境数模型数支架数任务数
HELM Liang et al. (2022)✗42N/A30N/A30,000
METR Kwa et al. (2026)✓3313N/A170
Epoch ECI Ho et al. (2025)✓37N/A200N/AN/A
TOUCAN Xu et al. (2025)✓N/A495321.5M
HAL Kapoor et al. (2025)✓9N/A9$\sim$ 10$\sim$ 1,500
BRIDGE Liu et al. (2026)✓4N/A176$\sim$ 70752
Agent Psych. Ge et al. (2026)✓4N/A275$\sim$ 901,421
Messier✓305,36034520511,891

表 1:与相关 LLM 评测数据集合的比较。计数以各资源发布时自行报告的为准;$\sim$ 表示由论文推断的近似值。N/A 表示该信息未报告或不适用。

1 引言

Agent 基准如今是衡量语言模型如何在交互环境中行动的核心工具。它们检验这些系统能否在领域约束下完成被委派的职业工作,利用证据和工具产出可能影响科学主张 Bragg et al. (2025)、临床记录 Jiang et al. (2025)、法律事务 Grupen et al. (2026)、软件系统 Jimenez et al. (2024) 或财务决策 Bigeard et al. (2025); Zhang et al. (2026) 的输出。

这种增殖使整个领域的结果越来越难比较。基准在领域、agent 定义、环境、动作空间和成功条件上各不相同 Kapoor et al. (2025)。最终分数进一步把这些差异藏起来,把复杂行为压成一个数字。一道数学题可能只用一次二元检查来评,而一条多步业务工作流可能用一整套测试聚合成一个分数。虽然两者都给出介于 $0$ 与 $1$ 之间的分数,一种设定下的「通过」所反映的成功,与另一种设定下的「通过」并不是同一种成功 Burnell et al. (2023); Yang and Wang (2026); Sha and Zhao (2026)。

为了让异质结果更可比,近期框架追求统一测量。Epoch 的 Evaluation Capability Index(ECI)Ho et al. (2025) 使用项目反应理论(IRT)Rasch (1960),把多样的基准分数映射到模型能力与任务难度的共享标尺上。另一条互补的工作是 METR Kwa et al. (2026),它用任务时间跨度长度衡量 agent 能力,表明自 2019 年以来模型的执行上限大约每七个月翻一倍。

支撑这些标尺的数据仍然不完整。Epoch 发布的是基准级输入,而不是单条任务结果,并且主要关注编程和数学;METR 只为 170 个任务提供任务级粒度 Kwa et al. (2026)。因此,要扩展这些分析,研究者往往得先从零搭建评测语料,再重跑昂贵的 agent 评测;近期大规模扫描的花费大约为 40,000 美元 Kapoor et al. (2025)。现有的元集合部分填补了这一缺口,但要么只关注工具使用这类狭窄的 agent 设定,要么以静态、非 agent 基准为中心,要么规模仍然有限 Liang et al. (2022); Srivastava et al. (2023); Lù et al. (2025); Xu et al. (2025)。与此同时,奖励黑客 Thaman (2026); Atinafu and Cohen (2026); Gabor et al. (2025); Tan et al. (2025)、评测意识 Needham et al. (2025); Hua et al. (2025) 以及故意压低表现 Van Der Weij et al. (2025); Gasteiger et al. (2025) 等新出现的担忧,进一步说明需要开放、可检查的数据。

我们提出 Messier,一个约 96 万条试验结局的语料库。它汇集 24 份公开发布,并在六个基准上新增五个 agent 的运行,覆盖量子算法设计、法律审阅、临床工作流,以及其他评测不足的职业领域。借助 SOC/NAICS 任务分类和部分轨迹覆盖,Messier 支持对 agent 行为、验证器设计和评测失败模式的分析。我们的贡献是:

一个统一的 agent 评测语料,汇集 30 个基准(其中六个有新运行)、714 个 agent、11,891 个任务和 74,205 个验证器(§4),同时提供 agent 表现的宏观与微观视图。

聚合规则会改变所测能力的证据。这由支持反事实重新评分的验证器级记录实现。例如,全通过评分可以在 agent 平均已满足许多标准时,仍报告接近于零的任务成功率。

来自开放数据的能力指数,与 Epoch ECI 排名的 Spearman 相关为 $\rho=0.81$(§5.3),并支持按职业、动作空间或验证器设计切片。

通过让研究者在单一数据集中运行、共享并贡献评测,Messier 有望减少重复计算。

译注:原文脚注写明代码与样例数据位于 anon.4open.science/messier-d3。

2 相关工作

#### Agent 基准。

在交互环境中评测模型,把测试范式从静态文本对,转向顺序执行:agent 在多轮中观察状态、选择动作、修改文件或调用工具,然后由验证器给出结局。近期基准在若干环境族上实例化这一设定,包括软件工程 Jimenez et al. (2024); Shetty et al. (2026); Jain et al. (2025)、网页导航 Xue et al. (2025); Wei et al. (2025); He et al. (2024)、终端与操作系统任务 Merrill et al. (2026); Xie et al. (2024)、工具使用与函数调用环境 Patil et al. (2025); Barres et al. (2025); Wang et al. (2025b)、安全任务 Zhang et al. (2025)、经济工作 Patwardhan et al. (2025); Xu et al. (2026),以及科学、医学和法律等职业领域 Grupen et al. (2026); Bragg et al. (2025); Jiang et al. (2025)。然而,每个基准都规定自己的命名约定、支架接口和底层验证器架构。因此,跨基准比较需要大量手工,目前依赖繁琐的事后汇集,或昂贵的重跑。

#### 评测集合。

平行的工作越来越关注跨基准汇集,把异质的执行轨迹组装成统一格式。这些工作从非 agent 的文本集合,如 HELM Liang et al. (2022) 和 BIG-bench Srivastava et al. (2023),延伸到围绕交互环境构建的集合 Liu et al. (2024); Mialon et al. (2024); Ma et al. (2024)。然而,现有仓库仍受其特定操作范围或关注点限制。例如,AgentRewardBench Lù et al. (2025) 专注于评测轨迹评判器,而 TOUCAN Xu et al. (2025) 提供的是为 agent 训练优化的合成数据,而不是经验能力标引。与我们最接近的先例是 Holistic Agent Leaderboard(HAL)Kapoor et al. (2025)。它引入一个主动的、成本受控的评测支架,以及跨九个基准、超过 21,000 次 agent rollout 的语料。HAL 解决的是:在共享执行协议下产出可比的新评测。然而,agent 评测的大量实证记录已经存在于任何一个单一支架之外,分散在公开发布中,任务标识、agent 元数据、评分语义、验证器定义和轨迹格式互不兼容。结果是,已有结果很难在其最初发布的设定之外被比较、审计或复用。

#### 基准评测中的异质性。

越来越多的文献表明,汇总的基准分数经常掩盖只有在实例层才能看见的信息,也就是基准内的单个任务或验证器结局 Schaeffer et al. (2023); Madaan et al. (2024); Lourie et al. (2024)。BenchScope Sha and Zhao (2026) 表明,逐实例分析揭示的潜在维度大约是宏观分析的五倍,说明单一头条指标把多种不同能力混在一起。类似地,Yang and Wang (2026) 记录到:总准确率相同的语言模型,仍可能在 16% 到 66% 的单个条目上不一致,这给只从宏观总分得出的结论带来风险。这一风险延伸到自动评测层:CARE Zhao et al. (2026) 表明,在相关的评判误差下做聚合会扭曲排行榜名次;SkillsBench Li et al. (2026a) 和 ACE-Bench Chen et al. (2025a) 表明,最终分数对基准构成敏感,包括领域、技能和任务时间跨度的混合。如果总通过率把异质的任务结构和验证规则塌缩成单一指标,那么宏观比较就可能歪曲模型能力。我们用一个保留单个任务与验证器结局的跨基准语料来处理这一限制。

3 背景

在一次交互评测中,大语言模型(LLM)通过支架行动,从环境接收反馈,并产出由一个或多个验证器评分的试验。然而在不同基准之间,任务、环境和验证器的边界并不总是画得一致。因此我们介绍本文使用的框架,并指出跨基准变异出现在哪里。

#### Agent 与环境。

一个 agent 是一对 $(\textit{model},\textit{scaffold})$:模型产出文本,支架把文本解析成动作、执行它们,并返回观察。我们把支架当作 agent 的一部分,因为同一模型在不同支架下可以给出实质不同的基准结局 Brand and Denain (2025); Kapoor et al. (2025)。

环境是 agent 与之交互的系统。这种交互常被形式化为部分可观察马尔可夫决策过程(POMDP)Kaelbling et al. (1998);对我们而言,相关组成部分是状态空间 $\mathcal{S}$、动作空间 $\mathcal{A}$ 和观察空间 $\mathcal{O}$。它们定义环境可以处于什么状态、agent 可以做什么,以及 agent 可以看见什么。在 LLM 评测中,状态通常是外部系统,例如数据库或代码库;观察是该状态的文本或视觉呈现,例如命令输出或网页。

#### 任务与验证器。

一个任务 $T=(I,s_{0})$ 把一条指令 $I$ 与一个初始环境状态 $s_{0}\in\mathcal{S}$ 配成一对。一次试验 $\tau$(也称一次 rollout)是某个 agent 在某个任务上的一次执行。每个任务由 $N$ 个验证器 $\{v_{1},\ldots,v_{N}\}$ 评分,其中每个 $v_{i}:\tau\to\{0,1\}$ 通常是程序化检查、LLM 评判、精确匹配检查或人工评价。一次试验结局是单个验证器输出 $v_{i}(\tau)$(也称一条记录)。基准的差异既在于使用哪些验证器类型,也在于如何对待一个计分单元:有的把许多要求编进一个任务,有的则拆成单独的任务。

当一个任务有多个验证器时,基准必须决定如何把它们的结局塌缩成单一任务分数。形式上,聚合规则 $f:\{0,1\}^{N}\to\{0,1\}$ 把验证器结局映射为 $S=f(v_{1}(\tau),\ldots,v_{N}(\tau))$。最简单的情形只有一个验证器,于是 $S=v_{1}(\tau)$。在全通过评分下,每个验证器都必须通过:

$$S=\prod_{i=1}^{N}v_{i}(\tau).$$

在阈值评分下,当至少有基准定义的比例 $\theta\in(0,1]$ 的验证器通过时,任务才通过:

$$S=\mathbb{I}\!\left(\frac{1}{N}\sum_{i=1}^{N}v_{i}(\tau)\geq\theta\right).$$

#### 对齐问题。

在单个基准内部,这些选择通常直截了当。跨基准时,它们造成一个对齐问题:支架必须与模型名一起被规范化,分数必须通过其验证器与聚合结构来解释。映射 $f$ 是多对一的,因此单凭 $S$ 恢复不了产生它的验证器结局。这促使我们发布 $\{v_{i}(\tau)\}$ 而不是 $S$,并暴露出本文其余部分所利用的测量缺口。

基准基准组验证器类型聚合任务数验证器数结局数Agent 数
SWE-benchProgrammingscriptall-pass1,5001,50054 k92
SWE-bench VerifiedProgrammingscriptall-pass500500129 k192
SWE-bench ProProgrammingscriptall-pass73173112 k14
GSOProgrammingscriptall-pass1021021.5 k15
LiveCodeBenchProgrammingscriptall-pass1,0551,05530 k22
QCircuitBenchProgrammingscriptthreshold28280.1 k5
TerminalBenchProgrammingscriptall-pass898962 k146
CyBenchProgrammingexact matchsingle-verifier15150.1 k8
HCASTResearch & reasoningscriptthreshold15715715 k20
SWAAResearch & reasoningscriptsingle-verifier66668.3 k20
RE-BenchResearch & reasoningscriptthreshold550.5 k20
MLE-benchResearch & reasoningscriptthreshold821641.5 k13
ScienceAgentBenchResearch & reasoningscriptsingle-verifier1021020.5 k5
ReplicationBenchResearch & reasoningscriptsingle-verifier90900.4 k5
HLEResearch & reasoningjudgesingle-verifier1,3691,36912 k18
MathArenaResearch & reasoningjudgesingle-verifier35235251 k84
MathHayResearch & reasoningexact matchsingle-verifier75751.3 k5
TheAgentCompanyEnterprise workflowsscriptall-pass17548311 k18
HarveyAI-LabEnterprise workflowsjudgeall-pass1,00060,187221 k5
GDPvalEnterprise workflowsjudgethreshold2202203.5 k16
MedAgentBenchEnterprise workflowsscriptsingle-verifier3003001.5 k5
$\tau^{2}$-benchEnterprise workflowsexact matchall-pass3752,85260 k7
MCPBenchEnterprise workflowsjudgethreshold523126.3 k5
DABStepEnterprise workflowsexact matchsingle-verifier4504502.2 k5
OSWorldGUIscriptsingle-verifier36136131 k48
OnlineMind2WebGUIhumansingle-verifier3003003.0 k10
BrowseCompGUIjudgesingle-verifier1241241.8 k5
WebVoyagerGUIjudgesingle-verifier65651.3 k5
BFCL-LiveFunction callingexact matchsingle-verifier1,3511,351147 k108
BFCL-Multi-TurnFunction callingexact matchall-pass80080087 k108
Total5 groups4 types3 rules11,89174,205960 k714

表 2:Messier 的分基准摘要。行按基准组(§4)分组;验证器与聚合分类在 §3 定义。验证器数列出多验证器任务的逐条标准行数,否则计任务本身。结局数计每次试验的评分事件,多验证器任务按每条标准计一条。HarveyAI-Lab、MedAgentBench、DABStep、QCircuitBench、ReplicationBench 和 ScienceAgentBench 通过 Harbor,在统一的五 agent OpenHands 网格下收集。Agent 总数是跨基准的并集。

图 1:构成与前沿分析。各面板按 §3 定义的维度概括语料:(a)按基准组的任务,(b)动作空间,(c)环境状态,(d)聚合规则,(e)验证器类型。(b)–(e)的计数使用对数刻度。面板(f)按发布季度和基准组追踪前沿通过率,哑铃标记连接每组观察到的首个季度与最后季度。

4 Messier 数据集

为构建 Messier,我们把已有的公开发布与新评测结合起来,新评测针对的是逐任务数据稀缺或缺失的基准。来源包括此前的能力测量发布(METR Kwa et al. (2026)、BRIDGE Liu et al. (2026)、Agent Psychometrics Ge et al. (2026))、General AgentBench Li et al. (2026b)、各基准作者发布的公开数据转储,以及我们通过 Harbor 支架收集的统一五 agent 重跑。表 1 把所得语料与相关集合放在一起概括。源发布接下来说明。

METR Kwa et al. (2026) 用任务时间跨度长度衡量 agent 能力,定义为:在对照人类完成时间标定后,模型能够可靠完成的任务时长。他们为这一测量所使用的三个时间跨度基准(HCAST、SWAA、RE-Bench Wijk et al. (2024))发布了逐任务结局,我们直接纳入。

BRIDGE Liu et al. (2026) 用显式的 2PL 项目反应理论扩展 METR 的任务时间跨度框架,在 METR 带宽任务上联合拟合每个 agent 的能力和每个任务的难度。BRIDGE 发布贡献了在 MLE-Bench Chan et al. (2025)、GDPval Patwardhan et al. (2025) 和 CyBench Zhang et al. (2025) 上的新评测,以及我们用于 SWE-bench Verified Jimenez et al. (2024) 的人类时间标注。

Agent Psychometrics Ge et al. (2026) 是近期把心理测量形式化到语言模型 agent 上的工作,在一组聚焦的 agent 基准上拟合 IRT 式的能力与难度参数。我们使用他们的发布,取得 TerminalBench Merrill et al. (2026)、GSO Shetty et al. (2026)、SWE-bench Deng et al. (2025) 和 SWE-bench Pro Deng et al. (2025) 的逐任务结局。

#### General AgentBench

Li et al. (2026b) 发布了跨越搜索、编程、数学推理以及工具编排这几类基准的 agent 轨迹。我们使用这一公开发布,取得 MathHay Wang et al. (2024)、BrowseComp Wei et al. (2025)、WebVoyager He et al. (2024) 和 MCPBench Wang et al. (2025b) 上的逐任务结局。

#### 贡献的运行。

公开数据的可得性并不均匀,因为前沿模型规模的试验活动很贵,而且若干近期基准只发布汇总排行榜分数。为填补这些缺口,我们贡献六组新评测:HarveyAI-Lab Grupen et al. (2026)、MedAgentBench Jiang et al. (2025)、DABStep Egg et al. (2025)、QCircuitBench Yang et al. (2026)、ScienceAgentBench Chen et al. (2025b) 和 ReplicationBench Ye et al. (2025)。新评测在 OpenHands Wang et al. (2025a) 支架上,通过 Harbor 支架,对前沿模型使用统一的五 agent 网格,总成本约 10,000 美元。所有新运行都包含完整执行轨迹。

#### 公开基准发布。

对于大多数基准(HLE Phan et al. (2025)、LiveCodeBench、GDPval、MathArena Balunovic et al. (2026)、SWE-bench、BFCL、OSWorld、$\tau^{2}$-bench 等),我们从作者发布的产物中取得逐任务结局,或者是 Hugging Face 数据集,或者直接来自基准的 GitHub 仓库。当一份主发布对某些 agent–任务对省略了逐任务细节时,我们在规范化标识下交叉核对辅助来源,包括备用的 Hugging Face 镜像和排行榜 CSV。附录 A.2 按基准列出完整源 URL。

汇集之后,语料包含 30 个基准、11,891 个任务、74,205 个验证器,以及跨 345 个模型和 205 个支架(714 个不同 agent)的 957,253 条试验结局。数据概括于表 2。

#### 对齐流水线。

流水线分四步。第一,我们把每条进入的记录铸入由 §3 导出的统一数据模型:每个环境归组一个或多个任务;每个任务带有一个或多个带类型的验证器(Python 脚本、精确匹配检查、LLM 评判或人工标签)以及一条聚合规则;每个任务还带有关于自身、其动作空间和其环境状态的简短自由文本描述。第二,遵循 Epoch ECI 的命名约定 Ho et al. (2025),我们把模型标识、支架和发布日期映射到标准化类别。第三,我们沿两条线核验映射后的语料:确定性测试覆盖标识卫生、日期有效性(例如 agent 日期不能早于基准日期)、在(benchmark, task_id)上的精确匹配去重,以及文本质量(HTML 实体、控制字符)。自动检查之后是人工抽查,重点是新贡献的运行,以及从多个来源拼接的条目。最后,任务按照 GDPval Patwardhan et al. (2025) 的做法,获得美国劳工统计局 2018 年 SOC 职业代码 U.S. Bureau of Labor Statistics (2018) 和管理与预算办公室 2022 年 NAICS 行业代码 Office of Management and Budget (2022)。分类由三投票人 LLM 集成完成,SOC 多数一致为 88.3%,NAICS 为 86.8%,其余由更强的模型裁定(附录 A.3)。

对齐之后,每个分数都连到它的模型和支架、被测量的环境与任务,以及决定成功的验证器。流水线本身按来源组织成各自独立的构建器,现有的 30 个构建器就是可照做的例子。因此,用一个新基准扩展语料是局部贡献,不必触碰核心汇集逻辑,这让研究者和 agent 驱动的贡献门槛都保持较低。我们按 agent 所做工作的种类,把 30 个基准组织成五组:编程(软件工程任务)、研究与推理(科学和数学问题)、企业工作流(职业办公室工作)、GUI(网页和桌面导航),以及函数调用(工具选择与调用)。附录 A.1 详细描述每一组。

5 分析与应用

我们用 Messier 研究:一旦 agent 评测在任务级通过率之下被对齐,什么变得可测量。分析先描述各基准组的前沿进展,然后表明验证器聚合可以改变所测能力。我们展示语料的两个应用:从开放数据复现能力指数,以及在跑新评测之前预测任务难度。

5.1 不一致的前沿进展

图 1f 给出 Messier 所代表的五个基准组上前沿进展的描述性视图。在季度 $q$,若某 agent 的发布日期早于 $q$,则它有资格。对基准中的每个任务,我们取有资格 agent 中的最高分。基准前沿是这些逐任务最大值的平均,组前沿再对组内基准取平均。这一分析并不打算估计全领域的算法进展,因为基准、支架和评测来源在组间不同。前沿曲线要指出的是:汇总任务分数在哪里提示有进展,又在哪里可能藏住更细的执行改进。

观察到的前沿在 2024 年到 2026 年之间于所有被追踪领域上升,但进展不对称。函数调用基准接近饱和,当代前沿分数为 0.97。编程其次,为 0.82,并显示出最大的净增长,两年窗口内绝对提升 0.64。企业工作流仍是表现最低的领域,为 0.57。这高于历史上的企业基线,但绝对分数低,说明多步职业工作流对 agent 仍然困难。研究与推理(0.68)和 GUI 基准(0.71)处于中间表现带。

然而,任务级通过率低本身并不能告诉我们 agent 没做成什么。在多验证器任务中,全通过规则给「一条要求都没满足」和「几乎全部满足」的轨迹打上同一个零。因此任务级分数省略了标准级结局的分布。我们在 Messier 中记录了这类结局的基准子集上,考察这一信息损失的幅度。

图 2:来自 Messier 与 Epoch ECI 的能力排序。每个面板把 Messier 拟合的逐 agent 能力(logit 刻度)对匹配子集上 Epoch 已发布的 ECI 作图,并给出 Spearman 相关、1000 次重抽样的 95% 自助法置信区间、成对一致率,以及匹配 agent 数。General 面板使用 Epoch 的总体 ECI;Coding 使用 SWE-ECI;Math 使用 Math-ECI。仅在 Messier 上做的 1PL 拟合,不必发起新的评测活动,就与 Epoch 的排序对齐。

5.2 反事实聚合

Messier 中的验证器级记录让我们考察:当同一批标准结局以不同方式聚合时,报告的表现如何变化。我们纳入语料中使用全通过评分、且每个任务包含多条标准的全部三个基准:HarveyAI-Lab、$\tau^{2}$-bench 和 TheAgentCompany。我们用两种反事实聚合规则对同一些试验重新评分。第一种是软分数,计算为通过标准的平均比例。第二种是多数通过分数,当至少一半标准通过时,把该 rollout 标为成功(记为 $\geq 50\%$)。我们还报告近通过率,衡量试验在满足至少 80% 标准的情况下,仍因全通过评分而失败的频率。

基准全通过软平均$\geq 50\%$近通过$\rho$(软分数,全通过)
HarveyAI-Lab0.0020.2880.2980.0800.667
$\tau^{2}$-bench0.4790.7540.8090.1130.857
TheAgentCompany0.1530.3400.3580.0080.981

表 3:对带有逐标准结局的基准做反事实聚合。我们对同一些试验用三种备选规则重新评分:全通过(官方规则)、软分数(通过标准的平均比例),以及多数通过。近通过是未通过全通过、但至少通过一定比例标准的试验占比。最后一列报告各 agent 的平均全通过分与平均软分数之间的 Spearman 秩相关:若为 1,表示两种规则保持 agent 排序;较低的值表示规则会重排 agent。

表 3 表明聚合规则影响所测能力。在全部三个基准上,软分数和多数通过分数都实质高于官方全通过分数,说明许多任务级失败包含部分完成。效应在 HarveyAI-Lab 上最大:全通过评分给出的任务成功率只有 0.2%,而 agent 平均满足 28.8% 的标准。在多数通过评分下,测得的成功率升至 29.8%。

聚合也会改变 agent 排序,尽管幅度因基准而异。在 HarveyAI-Lab 上,逐 agent 的平均全通过分与平均软分数的 Spearman 相关为 $\rho=0.667$,而在 $\tau^{2}$-bench 上为 0.857,在 TheAgentCompany 上为 0.981。因此,虽然全通过与软分数之间出现一些分歧是预期之中的,仍需要在更广、更多样的基准上仔细验证,才能确定这种分歧有多经常改变比较结论。尽管如此,观察到的名次移动提示:评测者在可得时应同时报告标准级表现和任务级分数,使比较结论对聚合选择的敏感性可见。

5.3 基于开放数据的能力标尺

接下来我们评估:Messier 数据的质量是否足以追踪一个已建立的跨基准能力排序(Epoch ECI Ho et al. (2025)),而不必发起新的评测活动。为此,我们在汇集后的 agent–任务反应矩阵上拟合标准 Rasch(1PL IRT)模型 Rasch (1960)。为使估计与 ECI 可比,我们遵循他们的模型级聚合协议,在构造反应矩阵时,为每个唯一的(模型,基准)选择得分最高的支架配置。在该模型下,agent $a$ 成功完成任务 $t$ 的概率为

$$P(Y_{at}=1\mid\theta_{a},\beta_{t})=\frac{1}{1+e^{\beta_{t}-\theta_{a}}},$$

其中 $Y_{at}\in\{0,1\}$ 表示二元试验结局,$\theta_{a}$ 是潜在的 agent 能力,$\beta_{t}$ 是任务难度。完整的估计与优化细节见附录 B.2。

因为 Messier 关注交互环境,而不是静态文本或选择题基准,其构成与 Epoch 的原始数据池不同。因此我们通过 Spearman 秩相关($\rho$)把拟合能力与已发布的 ECI 排名比较 agent 的秩顺序,而不是比较绝对能力值。因为基准常常混合多种技能,我们用 Messier 的任务级分类按领域对齐比较。具体而言,我们把 1PL 模型限制在映射到相关 SOC 类别的任务上:编程用 SOC 15-1200,数学用 SOC 15-2000。

如图 2 所示,所得的 1PL 能力估计($\theta_{a}$)紧密跟踪已发布的 ECI 排名。在 75 个匹配 agent 上,我们发现一般能力的秩相关为 $\rho=0.81$,编程为 $\rho=0.77$,数学为 $\rho=0.84$。在同一数据上,2PL 拟合给出几乎相同的 agent 排序,相对 1PL 拟合的 Spearman $\rho=0.98$(附录 B.2)。除了与 ECI 的这一对应,Messier 的规模和结构还支持跨数据集族、职业、动作空间和验证器设计的定制能力标尺。

5.4 试验前的任务难度预测

作为最后一个应用,我们检验 Messier 元数据在试验运行之前是否含有关于任务难度的信号。使用第 5.3 节拟合的 IRT 任务参数,我们预测两个目标:原始难度 $\beta$,以及基准内 $z$ 分数化的 $\beta$,方法遵循 Agent Psychometrics Ge et al. (2026)。我们在 bge-base-en 句向量 Xiao et al. (2024) 上拟合 RidgeCV 回归器,使用随机 $k$ 折交叉验证,比较两种输入:原始指令文本(task),以及任务、环境、动作描述和金标准答案的拼接(称为 all)。

表 4 表明,额外元数据在两个目标上都带来适度但一致的改进。对于原始 $\beta$,模型只略优于基准均值基线,说明基准身份解释了大部分信号。对于 $z$ 分数化的 $\beta$,它去掉了基准级偏移,模型更清楚地优于基线,说明任务描述含有基准内相对难度的信号。

目标输入模型基线
$\beta$(原始)task$0.484\pm 0.008$$0.465$
all$\mathbf{0.508\pm 0.009}$$0.465$
$\beta$($z$ 分数)task$0.263\pm 0.015$$-0.081$
all$\mathbf{0.298\pm 0.011}$$-0.081$

表 4:两个目标、两种输入配置下的难度预测。目标:原始 IRT 难度,以及基准内 $z$ 分数化难度。输入:task = 原始指令文本;all = 任务、环境和动作描述再加上金标准答案的拼接。基线预测训练折的基准均值。条目报告 5 折交叉验证下的 Spearman,为各折的均值与标准差。

6 结论

我们提出了 Messier,一个统一的 agent 评测语料,汇集 30 个基准、714 个 agent、11,891 个任务和 74,205 个验证器(§4),其中包括六个基准上新的五 agent 运行。通过把 agent、任务、环境、验证器和聚合规则对齐到共享模式,Messier 使异质的 agent 评测在宏观和微观层面都可比。

我们的分析表明,这种增加的粒度改变了可以测量的东西。前沿进展在基准组之间不均匀,企业工作流的解决程度仍然实质低于编程和函数调用。在带有逐标准结局的基准上,反事实重新评分表明,全通过的任务分数会抹掉大量部分进展,有时还会改变 agent 排名。同一批对齐记录也支持开放的心理测量标定,与 Epoch 的 ECI 排序在 Spearman $\rho=0.81$ 上对齐,并为基准内难度预测提供有用信号。

向前看,Messier 的验证器级记录和执行轨迹可以支持对聚合、评判器设计、奖励黑客、评测意识和故意压低表现的研究,粒度就在这些现象发生的地方。它的任务分类和难度估计也可以帮助按职业、领域、动作空间和任务难度构造有针对性的评测。通过降低复用和扩展既有评测的成本,Messier 旨在让未来的 agent 评测更容易比较、审计和在其上继续建造。

局限性

仍有若干局限。第一,语料反映的是当前评测版图:集中在技术、职业和知识工作领域,主要以英语进行,并且大体建立在西方软件惯例上。因此,发现未必能推广到其他语言、文化设定或非技术形态的工作。扩大覆盖既需要代表性不足领域中的新基准,也需要使这类评测可供汇集的开放逐任务发布。

第二,我们的收集依赖上游基准,其构造和质量控制不在我们权限之内。这个领域正在积极推动长程任务的前沿,并改进评测可靠性,近期若干「-verified」基准变体的出现就是证据。然而,这种验证仍然是进行中的社区努力。目前,我们大体假定这些底层数据集有效,并依靠更广的社区确立其可信度。随着这些努力增长,我们可以系统追踪各基准中已知有缺陷的任务,这最终也许允许我们建模并预判这些失败。

第三,在执行之前预测任务难度仍然是重大挑战。为此使用嵌入,假定难度部分由语义相似性和向量检索捕获,尽管嵌入主要编码的是语义上下文,而不是固有复杂度。我们有意做出这一方法选择,以便与该领域近期的基础工作对齐(例如 Agent Psychometrics Ge et al. (2026))。尽管如此,我们认为先验难度预测是未来研究中令人兴奋的方向,尤其是利用模型信息论熵、而不是依赖语义嵌入的方法。

伦理考量

随着任务时间跨度变长 Kwa et al. (2026),评测活动的财务与环境成本大幅增长 Strubell et al. (2019),资源充足与资源不足的研究组之间的不对称进一步拉大。虽然 Messier 旨在通过尽量减少重复评测运行来减轻这一负担,底层计算需求仍然是结构性的公平问题。为部分弥合这一差距,我们投入约 10,000 美元计算资源来贡献这一数据集。通过把这些试验标准化并公开分发,我们希望降低那些缺乏资本、无法从零跑大规模 agent 活动的研究者的进入门槛。

此外,agent 基准经常把有偿人类劳动抽象化。孤立地阅读定量分数,有掩盖其任务正被自动化的劳动者之社会经济含义的风险。因此,评测发布必须清楚记帐:被测量的是谁的劳动,这一测量最终服务谁。

最后,我们指出,我们的汇集严格遵守上游基准创建者确立的原始许可证、版权约束和使用条款。

参考文献

  • Atinafu and Cohen (2026) Y. Atinafu 与 R. Cohen。RewardHackingAgents:为 LLM 机器学习工程 agent 评测评测完整性。arXiv:2603.11337。引用:§1。
  • Balunovic et al. (2026) M. Balunovic、J. Dekoninck、I. Petrov、N. Jovanović 与 M. Vechev。MathArena:在未受污染的数学竞赛上评测 LLM。Advances in Neural Information Processing Systems 38。引用:§4。
  • Barres et al. (2025) V. Barres、H. Dong、S. Ray、X. Si 与 K. Narasimhan。$\tau^{2}$-bench:在双控制环境中评测对话 agent。arXiv:2506.07982。引用:§2。
  • Bigeard et al. (2025) A. Bigeard、L. Nashold、R. Krishnan 与 S. Wu。Finance Agent Benchmark:在真实世界金融研究任务上给 LLM 做基准。arXiv:2508.00828。引用:§1。
  • Bragg et al. (2025) J. Bragg、M. D’Arcy、N. Balepur、D. Bareket、B. Dalvi、S. Feldman、D. Haddad、J. D. Hwang、P. Jansen、V. Kishore 等。AstaBench:用科学研究套件严格评测 AI agent。arXiv:2510.21652。引用:§1、§2。
  • Brand and Denain (2025) F. Brand 与 J. Denain。为什么做基准很难。访问日期:2026-05-25。引用:§3。
  • Burnell et al. (2023) R. Burnell、W. Schellaert、J. Burden、T. D. Ullman、F. Martinez-Plumed、J. B. Tenenbaum、D. Rutar、L. G. Cheke、J. Sohl-Dickstein、M. Mitchell 等。重新思考 AI 评测结果的报告方式。Science 380 (6641),第 136–138 页。引用:§1。
  • Chan et al. (2025) J. S. Chan、N. Chowdhury、O. Jaffe、J. Aung、D. Sherburn、E. Mays、G. Starace、K. Liu、L. Maksin、T. Patwardhan 等。MLE-bench:在机器学习工程上评测机器学习 agent。International Conference on Learning Representations,2025,第 50466–50494 页。引用:§4。
  • Chen et al. (2025a) C. Chen、X. Hao、W. Liu、X. Huang、X. Zeng、S. Yu、D. Li、S. Wang、W. Gan、Y. Huang 等。ACEBench:谁在工具使用上拿下赛点?arXiv:2501.12851。引用:§2。
  • Chen et al. (2025b) Z. Chen、S. Chen、Y. Ning、Q. Zhang、B. Wang、B. Yu、Y. Li、Z. Liao、C. Wei、Z. Lu 等。ScienceAgentBench:面向数据驱动科学发现的语言 agent 严格评估。International Conference on Learning Representations,2025,第 96934–96990 页。引用:§4。
  • Deng et al. (2025) X. Deng、J. Da、E. Pan、Y. Y. He、C. Ide、K. Garg、N. Lauffer、A. Park、N. Pasari、C. Rane 等。SWE-bench Pro:AI agent 能否解决长程软件工程任务?arXiv:2509.16941。引用:§4。
  • Egg et al. (2025) A. Egg、M. I. Goyanes、F. Kingma、A. Mora、L. von Werra 与 T. Wolf。DABStep:面向多步推理的数据 agent 基准。arXiv:2506.23719。引用:§4。
  • Gabor et al. (2025) J. Gabor、J. Lynch 与 J. Rosenfeld。EvilGenie:一个奖励黑客基准。arXiv:2511.21654。引用:§1。
  • Gasteiger et al. (2025) J. Gasteiger、A. Khan、S. Bowman、M. Wagner、V. Mikulik、E. Perez 与 F. Roger。自动化研究者可以隐蔽地故意压低表现。Anthropic Alignment Blog。引用:§1。
  • Ge et al. (2026) C. Ge、D. Kryvosheieva、D. Fried、U. Girit 与 K. Hariharan。Agent Psychometrics:agent 编程基准中的任务级表现预测。arXiv:2604.00594。引用:表 1、§4、§5.4、局限性。
  • Grupen et al. (2026) N. Grupen、G. Pereyra 与 J. Pereyra。开源 Harvey 的长程法律 agent 基准。Harvey AI Blog。引用:§1、§2、§4。
  • He et al. (2024) H. He、W. Yao、K. Ma、W. Yu、Y. Dai、H. Zhang、Z. Lan 与 D. Yu。WebVoyager:用大型多模态模型构建端到端网页 agent。ACL 2024 长文,第 6864–6890 页。引用:§2、§4。
  • Ho et al. (2025) A. Ho、J. Denain、D. Atanasov、S. Albanie 与 R. Shah。AI 基准的罗塞塔石碑。arXiv:2512.00193。引用:表 1、§1、§4、§5.3。
  • Hua et al. (2025) T. T. Hua、A. Qin、S. Marks 与 N. Nanda。把有评测意识的语言模型引导得像已部署那样行动。arXiv:2510.20487。引用:§1。
  • Jain et al. (2025) N. Jain、A. Gu、W. Li、F. Yan、T. Zhang、S. Wang、A. Solar-Lezama、K. Sen 与 I. Stoica。LiveCodeBench:对代码大语言模型的整体且无污染评测。ICLR 2025,第 58791–58831 页。引用:§2。
  • Jiang et al. (2025) Y. Jiang、K. C. Black、G. Geng、D. Park、J. Zou、A. Y. Ng 与 J. H. Chen。MedAgentBench:用于给医学 LLM agent 做基准的虚拟电子病历环境。NEJM AI 2 (9),AIdbp2500144。引用:§1、§2、§4。
  • Jimenez et al. (2024) C. E. Jimenez、J. Yang、A. Wettig、S. Yao、K. Pei、O. Press 与 K. Narasimhan。SWE-bench:语言模型能否解决真实世界的 GitHub issue?ICLR 2024,第 54107–54157 页。引用:§1、§2、§4。
  • Kaelbling et al. (1998) L. P. Kaelbling、M. L. Littman 与 A. R. Cassandra。在部分可观察随机域中的规划与行动。Artificial Intelligence 101 (1-2),第 99–134 页。引用:§3。
  • Kapoor et al. (2025) S. Kapoor、B. Stroebl、P. Kirgis、N. Nadgir、Z. S. Siegel、B. Wei、T. Xue、Z. Chen、F. Chen、S. Utpala 等。Holistic Agent Leaderboard:AI agent 评测所缺的基础设施。arXiv:2510.11977。引用:表 1、§1、§2、§3。
  • Kwa et al. (2026) T. Kwa、B. West、J. Becker、A. Deng、K. Garcia、M. Hasin、S. Jawhar、M. Kinniment、N. Rush、S. Von Arx 等。测量 AI 完成长软件任务的能力。NeurIPS 38,第 92213–92266 页。引用:表 1、§1、§4、伦理考量。
  • Li et al. (2026a) X. Li、W. Chen、Y. Liu、S. Zheng、X. Chen、Y. He、Y. Li、B. You、H. Shen、J. Sun 等。SkillsBench:评测 agent 技能在多样任务上的效果。arXiv:2602.12670。引用:§2。
  • Li et al. (2026b) X. Li、R. Ming、P. Setlur、A. Paladugu、A. Tang、H. Kang、S. Shao、R. Jin 与 C. Xiong。通用 LLM agent 的测试时扩展基准。arXiv:2602.18998。引用:§4。
  • Liang et al. (2022) P. Liang、R. Bommasani、T. Lee、D. Tsipras、D. Soylu、M. Yasunaga、Y. Zhang、D. Narayanan、Y. Wu、A. Kumar 等。语言模型的整体评测。arXiv:2211.09110。引用:表 1、§1、§2。
  • Liu et al. (2026) F. Liu、J. Gala、D. Bahdanau、S. Reddy、H. Larochelle 等。BRIDGE:由模型表现预测人类任务完成时间。arXiv:2602.07267。引用:表 1、§4。
  • Liu et al. (2024) X. Liu、H. Yu、H. Zhang、Y. Xu、X. Lei、H. Lai、Y. Gu、H. Ding、K. Men、K. Yang 等。AgentBench:把 LLM 当作 agent 来评测。ICLR 2024,第 52989–53046 页。引用:§2。
  • Lourie et al. (2024) N. Lourie、K. Cho 与 H. He。用置信度展示你的工作:调参曲线的置信带。NAACL 2024 长文,第 3455–3472 页。引用:§2。
  • Lù et al. (2025) X. H. Lù、A. Kazemnejad、N. Meade、A. Patel、D. Shin、A. Zambrano、K. Stańczak、P. Shaw、C. J. Pal 与 S. Reddy。AgentRewardBench:评测对网页 agent 轨迹的自动评价。arXiv:2504.08942。引用:§1、§2。
  • Ma et al. (2024) C. Ma、J. Zhang、Z. Zhu、C. Yang、Y. Yang、Y. Jin、Z. Lan、L. Kong 与 J. He。AgentBoard:多轮 LLM agent 的分析性评测板。NeurIPS 37,第 74325–74362 页。引用:§2。
  • Madaan et al. (2024) L. Madaan、A. K. Singh、R. Schaeffer、A. Poulton、S. Koyejo、P. Stenetorp、S. Narang 与 D. Hupkes。量化评测基准中的方差。arXiv:2406.10229。引用:§2。
  • Merrill et al. (2026) M. A. Merrill、A. G. Shaw、N. Carlini、B. Li、H. Raj、I. Bercovich、L. Shi、J. Y. Shin、T. Walshe、E. K. Buchanan 等。Terminal-Bench:在命令行界面的困难、真实任务上给 agent 做基准。arXiv:2601.11868。引用:§2、§4。
  • Mialon et al. (2024) G. Mialon、C. Fourrier、T. Wolf、Y. LeCun 与 T. Scialom。GAIA:通用 AI 助手基准。ICLR 2024,第 9025–9049 页。引用:§2。
  • Needham et al. (2025) J. Needham、G. Edkins、G. Pimpale、H. Bartsch 与 M. Hobbhahn。大语言模型常常知道自己正在被评测。arXiv:2505.23836。引用:§1。
  • Office of Management and Budget (2022) 美国管理与预算办公室。北美行业分类系统:美国,2022。总统行政办公室,管理与预算办公室。引用:§4。
  • Patil et al. (2025) S. G. Patil、H. Mao、F. Yan、C. C. Ji、V. Suresh、I. Stoica 与 J. E. Gonzalez。Berkeley Function Calling Leaderboard(BFCL):从工具使用到大语言模型的 agent 评测。第 42 届 ICML。引用:§2。
  • Patwardhan et al. (2025) T. Patwardhan、R. Dias、E. Proehl、G. Kim、M. Wang、O. Watkins、S. P. Fishman、M. Aljubeh、P. Thacker、L. Fauconnet 等。GDPval:在真实世界、具有经济价值的任务上评测 AI 模型表现。arXiv:2510.04374。引用:§2、§4。
  • Phan et al. (2025) L. Phan、A. Gatti、Z. Han、N. Li、J. Hu、H. Zhang、C. B. C. Zhang、M. Shaaban、J. Ling、S. Shi 等。Humanity’s Last Exam。arXiv:2501.14249。引用:§4。
  • Rasch (1960) G. Rasch。某些智力与学业测验的概率模型。Danmarks Pædagogiske Institut,哥本哈根。引用:§1、§5.3。
  • Schaeffer et al. (2023) R. Schaeffer、B. Miranda 与 S. Koyejo。大语言模型的涌现能力是海市蜃楼吗?NeurIPS 36,第 55565–55581 页。引用:§2。
  • Sha and Zhao (2026) T. Sha 与 S. Zhao。BenchScope:你的基准提供多少独立信号?arXiv:2603.29357。引用:§1、§2。
  • Shetty et al. (2026) M. Shetty、N. Jain、J. Liu、V. Kethanaboyina、K. Sen 与 I. Stoica。GSO:用于评测 SWE agent 的困难软件优化任务。NeurIPS 38。引用:§2、§4。
  • Srivastava et al. (2023) A. Srivastava、A. Rastogi、A. Rao、A. A. M. Shoeb、A. Abid、A. Fisch、A. R. Brown、A. Santoro、A. Gupta、A. Garriga-Alonso 等。超越模仿游戏:量化并外推语言模型的能力。Transactions on Machine Learning Research。引用:§1、§2。
  • Strubell et al. (2019) E. Strubell、A. Ganesh 与 A. McCallum。深度学习在 NLP 中的能源与政策考量。ACL 2019,第 3645–3650 页。引用:伦理考量。
  • Tan et al. (2025) R. Tan、B. Peng、Z. Yang、H. Cheng、O. Mees、T. Zhao、A. Tupini、I. Meijier、Q. Wu、Y. Yang 等。带 agent 验证器的多模态强化学习,用于 AI agent。arXiv:2512.03438。引用:§1。
  • Thaman (2026) K. Thaman。奖励黑客基准:测量带工具使用的 LLM agent 中的利用行为。arXiv:2605.02964。引用:§1。
  • U.S. Bureau of Labor Statistics (2018) 美国劳工统计局。2018 年标准职业分类手册。美国劳工统计局。引用:§4。
  • Van Der Weij et al. (2025) T. Van Der Weij、F. Hofstätter、O. Jaffe、S. Brown 与 F. Ward。AI sandbagging:语言模型可以策略性地在评测中表现不佳。ICLR 2025,第 73152–73189 页。引用:§1。
  • Wang et al. (2024) L. Wang、S. Dong、Y. Xu、H. Dong、Y. Wang、A. Saha、E. Lim、C. Xiong 与 D. Sahoo。MathHay:LLM 长上下文数学推理的自动基准。arXiv:2410.04698。引用:§4。
  • Wang et al. (2025a) X. Wang、B. Li、Y. Song、F. F. Xu、X. Tang、M. Zhuge、J. Pan、Y. Song、B. Li、J. Singh、H. H. Tran、F. Li、R. Ma、M. Zheng、B. Qian、Y. Shao、N. Muennighoff、Y. Zhang、B. Hui、J. Lin、R. Brennan、H. Peng、H. Ji 与 G. Neubig。OpenHands:面向作为通才 agent 的 AI 软件开发者的开放平台。ICLR。arXiv:2407.16741。引用:§4。
  • Wang et al. (2025b) Z. Wang、Q. Chang、H. Patel、S. Biju、C. Wu、Q. Liu、A. Ding、A. Rezazadeh、A. Shah、Y. Bao 等。MCP-Bench:经由 MCP 服务器,用复杂真实世界任务给使用工具的 LLM agent 做基准。arXiv:2508.20453。引用:§2、§4。
  • Wei et al. (2025) J. Wei、Z. Sun、S. Papay、S. McKinney、J. Han、I. Fulford、H. W. Chung、A. T. Passos、W. Fedus 与 A. Glaese。BrowseComp:一个简单但困难的浏览 agent 基准。arXiv:2504.12516。引用:§2、§4。
  • Wijk et al. (2024) H. Wijk、T. Lin、J. Becker、S. Jawhar、N. Parikh、T. Broadley、L. Chan、M. Chen、J. Clymer、J. Dhyani 等。RE-Bench:对照人类专家,评测前沿 AI 的研发能力。arXiv:2411.15114。引用:§4。
  • Xiao et al. (2024) S. Xiao、Z. Liu、P. Zhang、N. Muennighoff、D. Lian 与 J. Nie。C-Pack:面向通用中文嵌入的打包资源。第 47 届 ACM SIGIR,第 641–649 页。引用:§5.4。
  • Xie et al. (2024) T. Xie、D. Zhang、J. Chen、X. Li、S. Zhao、R. Cao、T. J. Hua、Z. Cheng、D. Shin、F. Lei 等。OSWorld:在真实计算机环境的开放任务上给多模态 agent 做基准。NeurIPS 37,第 52040–52094 页。引用:§2。
  • Xu et al. (2026) F. F. Xu、Y. Song、B. Li、Y. Tang、K. Jain、M. Bao、Z. Wang、X. Zhou、Z. Guo、M. Cao 等。TheAgentCompany:在有后果的真实世界任务上给 LLM agent 做基准。NeurIPS 38。引用:§2。
  • Xu et al. (2025) Z. Xu、A. M. Soria、S. Tan、A. Roy、A. S. Agrawal、R. Poovendran 与 R. Panda。TOUCAN:从真实世界 MCP 环境合成 150 万条工具 agent 数据。arXiv:2510.01179。引用:表 1、§1、§2。
  • Xue et al. (2025) T. Xue、W. Qi、T. Shi、C. H. Song、B. Gou、D. Song、H. Sun 与 Y. Su。进步的幻觉?评估网页 agent 的当前状态。arXiv:2504.01382。引用:§2。
  • Yang and Wang (2026) E. Yang 与 D. Wang。基准幻觉:LLM 之间的分歧及其科学后果。arXiv:2602.11898。引用:§1、§2。
  • Yang et al. (2026) R. Yang、Z. Wang、Y. Gu、Y. Liang 与 T. Li。QCircuitBench:用于量子算法设计基准的大规模数据集。NeurIPS 38。引用:§4。
  • Ye et al. (2025) C. Ye、S. Yuan、S. Cooray、S. Dillmann、I. L. Roque、D. Baron、P. Frank、S. Martin-Alvarez、N. Koblischke、F. J. Qu 等。ReplicationBench:AI agent 能否复现天体物理论文?arXiv:2510.24591。引用:§4。
  • Zhang et al. (2025) A. K. Zhang、N. Perry、R. Dulepet、J. Ji、C. Menders、J. Lin、E. Jones、G. Hussein、S. Liu、D. Jasper 等。CyBench:评测语言模型网络安全能力与风险的框架。ICLR 2025,第 25094–25243 页。引用:§2、§4。
  • Zhang et al. (2026) C. Zhang、Z. Gan、L. Zhu、Y. Pang、Q. Zhang 与 R. Zhang。FinMTM:面向金融推理与 agent 评测的多轮多模态基准。arXiv:2602.03130。引用:§1。
  • Zhao et al. (2026) J. Zhao、C. Shin、T. Huang、S. S. S. N. GNVV 与 F. Sala。CARE:面向可靠 LLM 评测的混杂因素感知聚合。arXiv:2603.00039。引用:§2。

附录 A 补充材料

A.1 基准分组

#### 编程。

编程基准把 agent 放进软件工程环境,通常是源代码仓库或终端会话,并评测所得代码或命令输出是否满足可执行检查。该组包括 SWE-bench、SWE-bench Verified 和 SWE-bench Pro,以及针对测试套件做代码生成的 LiveCodeBench 和 GSO、面向 shell 级工程与夺旗任务的 TerminalBench 和 CyBench,以及面向量子算法设计的 QCircuitBench。虽然 SWE-bench Verified 在上游是一个经过策展的子集,我们把它视为与 SWE-bench 不相交,以避免重复计数。在这一组内,评分大多是确定性的:多数基准是对单元测试做全通过聚合的脚本执行,QCircuitBench 是基于阈值的评分,CyBench 是精确匹配的旗标比较。这些基准中,QCircuitBench 由我们手工收集,其余从公开发布汇集。

#### 研究与推理。

研究与推理基准要求 agent 解决科学、数学或研究工程问题,并产出正确答案或成功的实验产物。该组分为两类:结局是产物或分析解的研究基准(HCAST、SWAA、RE-Bench、MLE-Bench、ScienceAgentBench、ReplicationBench),以及结局是数学或一般知识难题之答案的推理基准(HLE、MathArena、MathHay)。其中 ScienceAgentBench 和 ReplicationBench 由我们收集;MLE-Bench 从 BRIDGE 发布汇集。三个研究基准(HCAST、SWAA、RE-Bench)另外带有逐任务的人类完成时间带,组内验证器覆盖确定性评分函数和 LLM 评判。

#### 企业工作流。

企业工作流基准把 agent 放进被委派的职业或办公室工作,包括法律审阅、临床工作流、客户支持、财务分析和一般知识工作任务。该组涵盖用量表评判输出的工作流模拟(HarveyAI-Lab、GDPval、MCPBench)和确定性检查(TheAgentCompany、MedAgentBench、DABStep、$\tau^{2}$-bench)。这些基准中,HarveyAI-Lab、MedAgentBench 和 DABStep 是我们为之收集了新运行的公开基准;其余四个(GDPval、$\tau^{2}$-bench、TheAgentCompany、MCPBench)从公开发布汇集。该组若干基准把任务分解成多条标准,因此即使最终任务结局是二元的,也可以研究部分完成。

#### GUI 导航。

GUI 基准评测 agent 通过点击、按键和页面导航在图形或网页环境中操作的能力,成功由环境的最终状态衡量。该组包括面向桌面应用的 OSWorld、面向实时网页导航的 OnlineMind2Web、面向网页研究的 BrowseComp,以及面向浏览任务的 WebVoyager。四个都从公开发布汇集。验证器方法在组内分开:OSWorld 依赖确定性的环境状态检查,BrowseComp 和 WebVoyager 对最终回答使用 LLM 评判,OnlineMind2Web 由人工评分。

#### 函数调用。

函数调用基准评测 agent 能否选择并调用合适的工具,工具集常常很大,函数名重叠,并带有必需输入以及用户角色或权限等上下文约束。该组由 BFCL-Live 和 BFCL-Multi-Turn 组成。前者用相对规范调用的结构化 AST 匹配来评测单轮函数调用;后者在有状态的内存类注册表上评测多轮对话,逐轮把 agent 的每轮方法调用轨迹与参考轨迹匹配。在我们的分类中,两个基准的评分都视为精确匹配,两种配置都从公开的 BFCL 发布汇集。

A.2 来源

表 5 列出 Messier 30 个基准各自的规范上游来源。HF 表示 Hugging Face 数据集路径;GitHub 表示公开仓库(固定的提交和数据集修订记录在配套代码发布中)。对于从次级发布(BRIDGE、Agent Psychometrics、General AgentBench)汇集的基准,我们把汇集者与上游所有者一并记录。Harbor 收集的条目是我们自己在 OpenHands 支架下评测的(§4)。

基准来源上游许可证 / 访问状态
SWE-benchGitHub: princeton-nlp/SWE-benchMIT
SWE-bench VerifiedHF: princeton-nlp/SWE-bench_Verified aux. GitHub: dariakryvosheieva/agent-psychometrics aux. GitHub: McGill-NLP/BRIDGE (human-time)MIT via SWE-bench repo; HF tag not stated
SWE-bench ProHF: ScaleAI/SWE-bench_Pro aux. GitHub: dariakryvosheieva/agent-psychometricsno explicit standard license identified
GSOHF: gso-bench/gso aux. GitHub: dariakryvosheieva/agent-psychometricsMIT
LiveCodeBenchHF: livecodebench/code_generation_liteCC (HF tag; variant unspecified)
QCircuitBenchHarbor (this work)MIT
TerminalBenchGitHub: laude-institute/terminal-bench via GitHub: dariakryvosheieva/agent-psychometricsApache-2.0
CyBenchGitHub: andyzorigin/cyber-bench via GitHub: McGill-NLP/BRIDGE (results + human-time)Apache-2.0
HCASTGitHub: METR/hcast-public runs via GitHub: METR/eval-analysis-publicMIT†
SWAAruns via GitHub: METR/eval-analysis-publicno explicit standard license identified
RE-BenchGitHub: METR/RE-Bench runs via GitHub: METR/eval-analysis-publicMIT†
MLE-BenchKaggle competitions via GitHub: McGill-NLP/BRIDGEMIT for code; competition data subject to Kaggle terms
ScienceAgentBenchHarbor (this work)MIT
ReplicationBenchHarbor (this work)MIT
HLEHF: cais/hle aux. GitHub: supaihq/hle (judged-pro labels)MIT; gated; outcomes only‡
MathArenaHF: MathArena/{slug}_outputsCC-BY-NC-SA-4.0
MathHayHF: cx-cmu/agent_trajectoriesgated; no explicit HF license identified§
TheAgentCompanyGitHub: TheAgentCompany/TheAgentCompany GitHub: TheAgentCompany/experimentsMIT for benchmark repo; no explicit license identified for experiments repo
HarveyAI-LabHarbor (this work)no explicit standard license identified
GDPvalHF: openai/gdpval aux. GitHub: McGill-NLP/BRIDGEno explicit standard license identified
MedAgentBenchHarbor (this work)MIT
$\tau^{2}$-benchGitHub: sierra-research/tau2-bench submissions: Sierra S3MIT
MCPBenchHF: cx-cmu/agent_trajectoriesgated; no explicit HF license identified§
DABStepHarbor (this work)CC-BY-4.0
OSWorldGitHub: xlang-ai/OSWorld HF: xlangai/ubuntu_osworld_verified_trajsApache-2.0 for code; MIT for HF trajectories
OnlineMind2WebHF: osunlp/Online-Mind2Web labels: osunlp/Online_Mind2Web_Leaderboard (HF Spaces)CC-BY-4.0; gated
BrowseCompHF: cx-cmu/agent_trajectoriesgated; no explicit HF license identified§
WebVoyagerHF: cx-cmu/agent_trajectoriesgated; no explicit HF license identified§
BFCL-LiveGitHub: ShishirPatil/gorilla (berkeley-function-call-leaderboard)Apache-2.0
BFCL-Multi-TurnGitHub: ShishirPatil/gorilla (berkeley-function-call-leaderboard)Apache-2.0

表 5:分基准来源与上游许可证/访问状态。分组顺序遵循表 2。aux. 标记用于在规范化标识下交叉核对或填补逐任务缺口的次级发布。许可证/状态列报告的是所引上游来源在识别时的条款;它不定义 Messier 整体的许可证。我们原创的 Messier 代码、模式、映射和派生记录以 MIT 发布,并不覆盖上游许可证或访问条件。†MIT,但作者要求不要发布未加保护的解答,也不要把任务纳入 LLM 训练数据。‡HLE 在 Hugging Face 上标记为 MIT,但设有门禁,并要求用户不要公开分享、重新上传或分发数据集;因此我们只再分发派生的通过/失败结局。§所引 Hugging Face 轨迹发布设有门禁,且未识别到明确的 HF 许可证标签;底层基准项目可能另有许可证,但我们不把那些许可证视为对轨迹发布的再许可。

A.3 SOC 与 NAICS 分类

任务通过三层流水线获得 SOC 职业代码和 NAICS 行业代码。第一,三个投票模型(Anthropic Claude Haiku、Anthropic Claude Sonnet 和 OpenAI GPT-5-mini)对照完整的 BLS 2018 SOC 结构和 Census 2022 NAICS 部门列表,各自独立分类每个任务,提示中包含任务描述和每个代码的简短释义。第二,三个投票人之间的分歧由 Anthropic Claude Opus 在有争议的子集上裁定。第三,内容关键词覆盖抓住一小部分边缘情形的残余。其任务确定性地映射到单一职业的基准(例如 SWE-bench 家族映射到计算机职业)绕过投票流水线,直接做交叉对照。在全部三个投票人都评分的 4,311 个条目上,SOC 标签有 88.3%、NAICS 标签有 86.8% 存在 2/3 多数;其余 11.7% 和 13.2% 由 Opus 作为裁定者解决。分类器输出模式、投票人提示和各阶段缓存与语料一并发布。

图 3:Messier 的实体关系视图。一个 agent 是模型与支架的组合。一个任务指定一个或多个验证器。一次试验是某个 agent 在某个任务上的一次执行;每个验证器产出一个结局,聚合规则把这些结局合成试验分数。

A.4 数据模型

图 3 概括 Messier 的实体关系结构,遵循 §3 引入的框架。

A.5 贡献运行的配置

六个贡献基准(HarveyAI-Lab、MedAgentBench、DABStep、QCircuitBench、ScienceAgentBench 和 ReplicationBench)通过 Harbor 支架、针对托管模型 API,在单一固定配置下收集;没有进行本地 GPU 训练。agent 网格由五个在全部六个基准上保持不变的前沿模型组成:openai/gpt-5、openai/gpt-5-nano、openai/gpt-4o、anthropic/claude-haiku-4-5 和 anthropic/claude-sonnet-4-5。每个(agent,任务)对只跑一次;我们不为每个格子收集多次试验。支架是 openhands-sdk v1.22.0,在 Modal 沙箱镜像内执行。采样参数保持提供商默认值。对 HarveyAI-Lab 的量表评分,验证器是一个 LLM 评判(anthropic/claude-sonnet-4-6),对附在任务上的 33–65 条标准各自给出独立的二元判断,父任务成功由跨标准的全通过聚合得到。API 总花费约 10,000 美元。

A.6 许可

Messier 是一个混合许可的集合,由许可证和访问条件各异的第三方基准组装而成。我们并不声称第三方基准材料被再许可到单一的总括许可证之下。每个上游组件仍受其原始条款约束,表 5 列出公开发布来源,以及我们在发布时识别到的相应许可证或访问状态。

我们在本工作中的原创贡献,包括规范化代码、模式定义、基准映射,以及摘要统计或结局表等已发布的派生记录,以 MIT 许可证授权。该许可证只适用于我们的原创贡献,并不覆盖或取代任何上游许可证。

当上游来源设有门禁、缺少清晰的公开许可证,或再分发条款含糊时,我们不分发底层任务内容。在允许的情况下,我们只发布最小的派生产物,例如规范化标识和/或通过/失败结局,并引导用户向上游提供者获取原始数据。

附录 B 方法

B.1 人类时间标定

在 BRIDGE 的精确方法下(METR 带宽任务、2PL IRT),Messier 流水线与他们的对数线性斜率在自助法置信区间内对齐:斜率 $=0.80$,95% 置信区间 $[0.71,0.90]$,$n=158$。对应的、每单位潜在能力的翻倍因子为 2.23,与 BRIDGE 发表的 2.26 和 METR 的 2.36 相符。我们把这作为实现检查来报告,确认流水线在重叠数据上是一致的。

B.2 项目反应理论估计

我们通过 Pyro 中的随机变分推断拟合 1PL Rasch 模型 $P(Y_{at}=1)=\sigma(\theta_{a}-\beta_{t})$,对 $\theta_{a}$ 和 $\beta_{t}$ 使用正态先验(均值 $0$,标准差 $1$),以及均值场正态引导分布。优化使用 ClippedAdam,学习率 $0.01$,共 1000–2000 个 epoch(种子 $42$);对与 BRIDGE 对齐的复现(附录 B.1),我们另外拟合 2PL 变体 $P(Y_{at}=1)=\sigma(\alpha_{t}(\theta_{a}-\beta_{t}))$,对 $\alpha_{t}$ 使用对数正态的区分度先验。在全语料上,1PL 与 2PL 的 agent 排序在 Spearman $\rho=0.98$ 上一致($n=344$ 个 agent),因此我们通篇报告 1PL。在所有 agent 上结局恒定的条目(一律通过或一律失败)在拟合前丢弃,因为它们对能力估计不携带信息。领域受限的能力估计(例如 SOC 15-1200 编程任务)通过把 $\beta_{t}$ 固定在全语料后验均值、只在领域子集上重新拟合 $\theta_{a}$ 得到,这保持能力标尺的跨领域可比性。

B.3 拟合后的 IRT 参数分布

图 4:全 Messier 语料上,拟合得到的 IRT 1PL agent 能力与任务难度的分布。

B.4 ECI 对齐指标

我们通过 Spearman 秩相关,测量 Messier 拟合的 IRT 能力与 Epoch 已发布 ECI 之间的一致程度:

$$\rho=1-\frac{6\sum_{i}d_{i}^{2}}{n(n^{2}-1)},$$

其中 $d_{i}$ 是 agent $i$ 在两个标尺上的秩差。我们通过对匹配的 $(\theta,\mathrm{ECI})$ 对做 1000 次百分位自助法重抽样,报告 95% 置信区间。

我们也报告成对一致率:对每一对不同的匹配模型 $(i,j)$,若 $\theta_{i}\neq\theta_{j}$ 且 $\mathrm{ECI}_{i}\neq\mathrm{ECI}_{j}$,一致率是 Messier 与 Epoch 在排序上达成一致的配对比例。一致率对标尺和并列稳健。

做跨来源匹配时,模型标识先用 Epoch ECI 所用的同一别名表规范化,再计算 Spearman 或一致率。

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction