CodexQA

行业与实践研究与基准测试

Agent 的毕业考:ALE 用 1490 个真实行业任务度量经济价值工作

CodexQA 团队阅读约 28 分钟

UC Berkeley 联合 250 多位行业专家推出 Agents' Last Exam(ALE):55 个子领域、13 个行业集群、1490 个来自专家真实交付项目的任务实例,全部用确定性脚本自动验证。最强配置 Codex+GPT-5.5 总体通过率仅 24%,最难的末考层大面积挂零——基准成功与 GDP 相关影响之间的鸿沟,第一次被完整量化。本卷为正文,参考文献与附录见下两卷。

本文目录

Agents' Last Exam

摘要

近期的 AI 系统在广泛的基准上取得了强劲结果,但这些进步并未在许多专业领域转化为有经济意义的部署。我们认为这一鸿沟在很大程度上是一个评测问题:被广泛使用的基准缺乏对真实且有经济价值的工作流上的持续性能测量。本文提出 Agents' Last Exam(ALE),一个旨在评测 AI agent 在长程、有经济价值、结果可验证的真实世界任务上的基准。ALE 与 250 多位行业专家合作开发,覆盖参照 O*NET / SOC 2018(美国联邦职业分类法)界定的非体力产业。它围绕一个任务分类法组织:55 个子领域被归入 13 个行业集群,覆盖 1K+ 任务。当前结果显示最难的层级远未饱和:在主流 harness 与骨干模型配置下,平均完全通过率低于 1%。ALE 被设计为一个活的基准:随着新工作流与新行业的接入,其任务池持续增长。更广泛地说,ALE 的意义不只是又一个排行榜,而是一个缩小基准成功与 GDP 相关影响之间鸿沟的工具。

网站 GitHub HuggingFace 排行榜

组织与执行团队

Yiyou Sun、Xinyang Han、Weichen Zhang、Yuanbo Pang、Tianyu Wang、Yuhan Cao、Yixiao Huang、Chris Duroiu、Haoyun Zhang、Jeffrey Lin、Weishu Zhang、Tyler Zeng、Ying Yan、Bo Liu、Hanson Wen、Mingyang Xu、Xiaoyuan Liu、Zimeng Chen、Weiyan Shi、Amanda Dsouza、Vincent Sunn Chen、Dawn Song

\* 核心贡献者。

顾问委员会

Patrick Bryant、Carl Boettiger、Yamini Rangan、Bradley Rothenberg、Kyle Steinfeld、Arvind Rao、Tapio Schneider、Georgios Yannakakis、Laure Zanna、Kaan Ozbay、Ida Sim、Tarek Zohdi、George Em Karniadakis、Jack Gallant、Teresa Head-Gordon

数据贡献者

Yushan Li、Wenxi Deng、Tao Sun、Huiqi Wang、Zhun Wang、Justin Xu、Chris Yuhao Liu、Yafei Cheng、Rongwang Hu、Aras Bacho、Shengcao Cao、Zengyi Qin、Yixiong Chen、Hengduan Fan、Hao Liu、Lin Zeng、Shashank Muralidhar Bharadwaj、Litian Gong、Yingxuan Yang、Maojia Song、Ruheng Wang、Zongzheng Zhang、Honglin Bao、Shuo Lu、Jianhong Tu、Zhonghua Wang、Zheng Zhang、Zijiao Chen、Yanqiong Jiang、Zhendong Li、Bohan Lyu、Chang Ma、Peiran Xu、Benran Zhang、Shangding Gu、Haoyue Hua、Haoyang Li、Wanzhe Liao、Chengzhi Liu、Junbo Peng、Haoran Sun、Zechen Xu、Bo Chen、Jiayi Cheng、Yi Jiang、Keying Kuang、Yuan Li、Youbang Pan、Ziyan Rao、Alexander Schubert、Yifan Shen、Vincent Siu、Xiatao Sun、Kangqi Zhang、Xiaopan Zhang、Yuchen Zhu、Ishaan Singh Chandok、Lei Ding、Jingxuan Fan、Andrew Glover、Jiaming Hu、Yiran Hu、Wenbo Huang、Zixin Jiang、Haoran Jin、Lukas Kim、Ming Liu、Yang Liu、Alireza Rafiei、Xuhuan Shen、Kunyang Sun、Sophia Sun、Ting Sun、Eric Wang、Yixin Wang、Hanwen Xing、Sihan Xu、Yuzheng Xu、Zhongxing Xu、Zhiling Yan、Boqin Yuan、Ruiqi Zhang、Yifan Zhang、Zibo Zhao、Liana、Santanu Bosu Antu、Haoyue Bai、Carlo Bosio、Joseph Cavanagh、Patricia Cavazos-Rehg、Tianxing Chen、Xuewen Chen、Yipu Chen、Chenyu Zhu、Chen Dai、Stefano De Castro、Yunfu Deng、Kaustubh Dhole、Jiayuan Ding、Chenchen Du、Zhehang Du、Hao Fan、Run-Ze Fan、Hengyu Fu、Shi Gu、Yifan Gu、Charlie Guo、Baihe Huang、Baixiang Huang、Rimika Jaiswal、Zhihan Jiang、Ran Jin、Erin Kasson、Xin Lan、Joseph Lee、Deren Lei、Chenyu Li、Daofeng Li、Haitao Li、Hongwei Li、Jingyan Li、Xiao Li、Yi Li、Yinsheng Li、Yuangang Li、Zhixu Li、Wenyu Liang、Longtai Liao、Kevin Qinghong Lin、Andy Zeyi Liu、Che Liu、Jiaming Liu、Kaiyuan Liu、Xuan Liu、Pan Lu、Wenbo Lv、Yicheng Lyu、Qiuyang Mang、Kyle Montgomery、Yuzhou Nie、Ruoxi Ning、Jorin Overwiening、Xu Pan、Layna Paraboschi、Core Francisco Park、Justin Purnumo、Swati Rajwal、Scott Rankin、Bixuan Ren、Yiren Rong、HaoYang Shang、Ventus Shaw、Fiona Shen、Jiawei Shen、Minqi Shi、Shi Qiu、Huaxiu Yao、Tianneng Shi、Jonah So、Vladislav Susoy、Hannah Szlyk、Haocheng Wang、Jialu Wang、Wei Wang、Xinyu Wang、Zehao Wang、Dowling Wong、Angela Wu、Dehao Wu、Fangyu Wu、Mengyuan "Millie" Wu、Yu Wu、Yuchen Wu、Yuhao Wu、Qingpo Wuwu、Weihang Xiao、Yongyi Xiong、Fan Xu、Ruiling Xu、Mingxuan Yan、Benjamin Yang、Jirong Yang、Sen Yang、Xiaoli Yang、Yushi Yang、Haoran Ye、Xiaohu Yu、Zhengming Yu、Chenlong Zhang、Chi Zhang、Hanning Zhang、Hanwen Zhang、Junge Zhang、Kunpeng Zhang、Song Zhang、Wenjin Zhang、Wenshuo Zhang、Ying Zhang、Yizhi Zhang、Brian Zhao、Qijian Zhao、Yimin Zhao、Yuhaohua Zheng、Liwei Zhou、Tianyue Zhou、Sichen Zhu、Siqi Zhu、Yan Zhu、Yishu Zhu、Jierui Zuo、Chonghao Cai、Helena Casademunt、Wenjia Chen、Cheng Cheng、Nawen Deng、Rao Fu、Tianfu Fu、Yifan Han、He Ren、Zhenyu He、Qiao Jin、Langlang Li、Yuetai Li、Sylvia Liu、Lu Lu、Luqing Zhou、Subhabrata Mukherjee、Yunqi Ouyang、Yin Ren、Dawei Shi、Haoran Wu、Zhiyue Wu、Hannah Yao、Zhuoran Yi、Jenny Yu、Rhea Zhan、Hang Zhou、Blake Zhu、Junfan Zhu、Alan Yuille、Yang Liu、Russell Alan Poldrack、Jiachen Li、Zhenglu Li、Molei Tao、Jing Huang、Wenqi Shi、Costas Spanos、Lichao Sun、Chenguang Wang、Orson Xu、Zhen Dong、Hector Gomez、Aylin Caliskan、Ali Emami、Haimin Hu、Zhi Li、Lihui Liu、Murphy Niu、Yi Shao、Jianxin Sun、Mikko Tolonen、Ting Wang、Sanjiv Das、Yanjun Gao、Wenbo Guo、Erika J Schneider、Zhiyong Lu、Yian Ma、Mark Mueller、Radha Poovendran、Somayeh Sojoudi、Yinglun Zhu

主导机构:University of California, Berkeley。通讯邮箱:{sunyiyou,dawnsong}@berkeley.edu。

完整单位信息见附录 A。

Agents' Last Exam 任务全景

图 1:Agents' Last Exam 覆盖一个宽广的专业任务与真实工作流分类体系。

任务分布总览

图 2:1,490 个任务实例在 ALE 分类法上的分布。每一行是 55 个子领域之一,归入 13 个顶级领域(括号内数字为领域合计)。堆叠条把每个子领域分解为已完全实现的实例(领域色)与等待质量控制(QC)流程的专家提交(橙色)。全部 55 个子领域都获得非零覆盖。当前可运行的任务实例以 Linux 或 Windows 虚拟机为目标。

1 引言

过去几年,AI 系统接连攻克了一个个著名基准:世界冠军级游戏 [43]、奥赛数学 [18]、竞技编程 [16]。然而,以最终真正重要的指标——经济产出——来衡量,其更广泛的影响却出人意料地微弱;基准胜利的累积速度,快于核心产业中可测量的转变。我们认为这一鸿沟是 AI 的效用问题,它表明这个领域现在需要的评测不仅要测量抽象能力,还要测量在真实专业环境中执行长程、有经济价值工作的能力。

这一鸿沟之所以重要,是因为 AI 的进展在很大程度上被这个领域选择优化的基准所塑造。基准不只是记录能力;它们聚焦研究注意力、定义工程目标,还常常决定哪些领域变得可以被快速改进。AI 的近史让这一模式清晰可见:一旦某个领域被一个可验证且被广泛使用的评测所覆盖,该领域的进展往往会加速,部署也常常随之而来——ImageNet [13] 在计算机视觉中就扮演了这一角色。然而,对金融、法律、电气工程、制造等经济核心部门,可比的评测仍然欠缺发展。如果这类基准能够被建立起来并最终被攻克,那一结果的意义将不止于通过一场考试:它将表明 AI 系统已经能够以足以支撑真实产业采用的水平执行底层专业工作流。

建立这类评测在结构上是困难的。第一,长程真实工作流的采集成本高昂,因为它们必须来源于真实的软件与组织环境。先前工作往往采用更易采集的任务单元,无论是更短的计算机使用任务 [51]、合成环境构建 [1],还是纯问答设置 [53]。第二,覆盖广泛行业、且有真实经济价值的工作流同样困难。它需要跨领域专家的持续参与,以及对产业格局的深入洞察。现有基准往往只在有限的领域集合上评测 [3]。第三,对真实工作流而言,验证在本质上是困难的,因为其输出空间是异质的。正确的交付物可能是文件、电子表格、媒体产物、报告、设计或模型。因此,测量有经济价值工作的基准常常依赖人类判断,如 GDPval [37] 与 Remote Labor Index [23]。这些约束有助于解释为什么现有基准常常在真实性、广度或可验证性三者中牺牲其一。它们共同催生了 Agents' Last Exam(ALE)。

为什么叫「Last Exam(最后的考试)」?这个名字承载着双重期许。_作为能力门槛的 Last_:通过这类行业考试的 agent,证明了自己准备好在该职业中执行持续的、有经济价值的工作,而不仅仅是回答关于它的问题。_作为难度前沿的 Last_:通过把评测锚定在需要专业判断的真实长程工作流上,ALE 位于当前系统能够可靠完成的事情的边界上。

图 3:基准定位图。先前基准通过把它们已发布的领域映射到 ALE 领域分类法上来定位。

ALE 是一个包含 1K+ 任务实例的基准,横跨 55 个子领域与 13 个行业集群,与 250 多位领域专家合作开发。为确保广泛且有代表性的行业覆盖,专家顾问委员会梳理每个领域的工作流版图,识别有经济意义的工作流族,并锚定在 O*NET / SOC 2018 职业分类法上 [38, 46]。其任务工作流来源于真实专业实践:专家不是发明合成场景,而是贡献他们已经完成过的项目,这些项目随后经过多轮质量控制——初审、工程师试运行、专家委员会的最终同行评审——之后才被接收。大多数任务要求的计算机使用是 GUI 交互(桌面应用、浏览器、领域专用软件)与 CLI 操作(shell 脚本、代码执行、文件操作)的交织,要求现有基准各自孤立测试的能力的并集。为了在不使用人类评审的情况下让异质的真实世界输出可验证,ALE 把评测标准化为围绕结构化交付物或里程碑的检查,对照专家提供的参考答案与评分细则。

ALE 的目标评测对象是_通用计算机使用 agent_(Generalist Computer-Use Agent,GCUA),例如 Claude Code [4] 或 Codex [33],它们在单一动作循环中结合视觉感知、代码执行、工具使用与长程规划。ALE 的任务面在构造上是 GUI-only 基准(如 OSWorld [51])与 CLI-only 基准(如 Terminal-Bench [24])的超集。为做覆盖比较,我们把 55 个 ALE 子领域当作共同坐标系,把每个先前基准已发布的科目、应用、代码仓库或职业映射到这一分类法上(图 3)。当前结果确认 ALE 远未饱和:最强配置(搭载 GPT-5.5 的 Codex)——它在 Terminal-Bench 上已达到 82%——在 ALE 最简单层级上得分也低于 50%,在最难层级上低于 10%;包括 Claude Code 在内的大多数主流 agent 在该难度下记录的通过率接近零。

更广泛地说,ALE 的意义不只是又一个排行榜,而是一个缩小基准成功与 GDP 相关影响之间鸿沟的工具:如果前沿 AI agent 能通过这最后的考试,那么基准上的进展才可能开始体现为真实的经济转型。

2 基准设计与数据集构建

2.1 基准设计原则:我们在找什么样的任务?

基准由三项高层要求定义。它们决定哪些工作流被接收进数据集、哪些在公开提交门户中被拒绝:

• 代表性。工作流应匹配真实专业实践,并使用领域专家实际会用的软件。例如,建筑专家通常用 SolidWorks 或 Rhino 而非 AutoCAD 把 2D 蓝图转换为 3D 模型。

• 复杂度。任务应当是一个端到端交付物,需要专家投入大量时间,而不只是几次 UI 操作。关键区分在于工作流与单个动作。

不希望的例子。「在 DaVinci 中应用一个颜色滤镜」太窄,因为它只是一个局部编辑。

更好的例子。「把一只奔跑的猎豹移入另一段赛跑视频」是合适的,因为它需要在一个耦合的工作流中完成跟踪、转描、合成与调色匹配。

• 可验证性。输出应支持确定性检查,或支持一个与可观察产物绑定的无歧义评分细则。最强的情形是可以直接与参考输出比较的确定性交付物。当精确匹配不可能时,判断仍应能归约为一个可测量的产物。

不希望的例子。「设计一个有怪物的 RPG 游戏」没有可客观检查的目标。

更好的例子。「用 RPGMaker XP 复刻游戏 mota.exe」是可验证的,因为最终地图几何、角色属性与事件状态可以在相同用户操作轨迹下与参考版本自动比较。

2.2 基准范围与分类法:我们覆盖哪些领域?

我们没有临时挑选行业或按经济排名选择,而是把 ALE 分类法锚定在 SOC 2018 [46] 与 O*NET [38] 上:我们把具有相似软件中介工作流的职业聚类为 ALE 行业,排除核心工作并非有意义数字化的部门,并把结果归为 13 个领域、55 个子领域(图 1;完整推导见附录 B.1)。为支持公平的跨基准比较,我们通过一个 LLM 辅助分类器,把每个先前基准已发布的类别(科目、应用、代码仓库或职业)映射到同一个 55 子领域分类法上。结果暴露出一个没有任何现有基准能填补的覆盖缺口:即便是 16 个主要先前基准的并集,仍有 55 个子领域中的 13 个完全未被覆盖(表 2)。

2.3 任务构建流水线:任务是如何产生的?

任务构建流水线

图 4:任务构建流水线。任务从专家征集出发,经过提交、初审、工程实现与最终质量控制。图 5:来源与评审产出。1,490 个任务实例分为 960 个外部提交(上,按初审结论)与 530 个委托任务(下)。每条柱按发布状态分段:150 公开、1,017 私有、323 未验证待 QC。

ALE 中的任务无法从普通众包工人那里征集;它们必须产生于领域专业人员的实际日常,并经过严格筛选以保证真实性、复杂度与技术可执行性。因此我们采用一个分阶段的构建协议(图 4),设有五道关卡。专家征集通过一个由行业从业者组成的顾问委员会招募领域专家,确保覆盖整个分类法。任务提交通过专用 web 门户(https://agents-last-exam.org/submit/new/form)路由提案,专家在其中上传曾耗费他们数天数周专业工作的过往项目,AI 辅助工具帮助打磨每份提案,直到五个核心组件被完整指定:自然语言描述、输入文件、目标软件、预期交付物与评测规格。初审以会议式决定筛选提交(大修/小修、边缘接收、接收、强接收);需要修订的会循环回专家。任务实现把接收的规格转换为可运行资产、预配的软件容器与代码化的评测逻辑,由工程师试运行,发现缺口时自动路由回专家。最终 QC 是专家委员会的同行评审,在任务被接收前验证参考输出的正确性、评测边界的校准(既不过窄到不可能、也不过松到虚假宽容)以及上下文的充分性。更多细节见附录 B.2。

公开/私有发布策略。基准污染——无论是通过预训练数据重叠还是任务特定的优化——是任何公开评测长期有效性的核心威胁。ALE 的应对方式是只公开发布 1,490 个任务实例中的 150 个(约 10%),其余保留在私有池中(图 5)。ALE 还进一步为_滚动评测_而设计:私有任务实例将定期轮换进入公开集,同时退役的公开任务被替换,从而在连续的模型代际间维持一个未被污染的评测面。附录 D.1 实证验证了公开子集对完整池具有代表性。

3 评测流水线

上一节描述了专家提交如何被收集并转换为经过验证的基准实例。本节说明任务存在之后发生什么:它如何被执行、agent 如何与环境交互、结果如何评分。流水线围绕三个组件的解耦组织(_任务规格_、_agent_ 与 _环境_),使它们都可以被轻松替换。

术语。全文中我们用 _task workflow(任务工作流)_ 指一个端到端的专业流程,用 _task instance(任务实例)_ 指任务工作流的一个可运行案例(一个具体的 (input, output) 对,共享同一个 evaluate(),但输入与输出数据不同)。少数情况下单独出现的「task(任务)」指可运行实例层级。

3.1 流水线架构

图 6:评测流水线架构。每个基准实例由一个任务规格(main.py)定义,它在远程虚拟机环境上编排三阶段生命周期(load()、start()、evaluate())。agent(harness + 模型)只接收任务描述与元数据,通过动作循环与环境交互,产出输出产物,由规格对照参考答案或评分细则打分。

图 6 展示了端到端评测流水线。一个基准实例通过三个解耦组件实现,它们经由定义良好的接口交互。任务规格是一个可执行的 main.py,编码构建期间提供的五个要素(描述、输入资产、目标软件、参考资产、评测标准),并暴露三个生命周期函数:load() 声明任务与算力需求,start() 把虚拟机预配到确定性初始状态,evaluate() 在 $[0,1]$ 上为 agent 的输出打分。agent(编排一个基础模型的 harness)只接收任务描述与元数据,然后在截图、shell 输出、鼠标键盘、文件编辑与 API 调用上运行动作循环,直至终止。环境是一台远程虚拟机,具有规范的四目录布局:input/(只读资产)、software/(预装应用)、output/(agent 唯一可写的目标)与 reference/(对 agent 隐藏、仅用于评分的真值产物)。这种解耦让任何符合动作接口的 agent 都能在任何任务上被评测,也让同一个规格无需修改即可部署到云虚拟机或本地容器。各组件接口与目录契约详见附录 C.1,生命周期协议见附录 C.2。

3.2 Agent 架构:从 CLI/GUI-agent 到通用 CUA

ALE 中的任务要求 agent 能读取 GUI 屏幕、在对话框中输入、执行 shell 命令、编写并调试代码、调用 API、管理长会话——往往在同一个任务工作流之内。没有任何单一现有 agent 家族原生覆盖这一任务面,因此基准针对一个更宽的 agent 类别;我们在此把它明确化,并说明主流 harness 架构如何被扩展以达到它。

Agent能力分类

图 7:Agent 能力分类法。五个功能层定义了 agent 的操作面。通用 CUA-agent(GCUA)在全部层上拥有完整能力;CLI-agent 缺少视觉感知(Eyes);GUI-agent 的编排、工具使用与运行时访问受限(Body、Hands、Feet)。

图 8:典型 GCUA harness 架构。主 agent 循环(左)在上下文构建、LLM 推理、动作决策、工具执行与溢出管理之间循环。系统提示构建器、工具系统(含经 MCP 的 GUI harness)、子 agent 与上下文压缩管理器在主流 harness 实现间是共享的。

我们把 agent 的操作能力分解为五个功能层(图 8):Brain(LLM 推理与规划)、Eyes(经截图的 GUI 感知)、Body(编排与控制流)、Hands(结构化工具调用)、Feet(动作生效的运行时基底)。这一分解暴露出现有家族之间一条清晰的界线。传统 CLI-agent,如 SWE-agent [52] 与 ForgeCode [45],拥有完整的 Brain、Body、Hands 与 Feet,但在构造上缺少 Eyes;框架式 agent 如 OpenClaw 并非严格 CLI-only,但它们出厂时没有原生 GUI 模块。建立在视觉-语言-动作模型上的 GUI-agent 覆盖 Brain 与 Eyes,但只暴露浅层 Body、窄的 Hands(多为鼠标键盘)与受限的 Feet,使它们无法写代码、管理文件或维持长工作流。ALE 的任务工作流要求两种操作面的并集,因此基准评测的 agent 类别是通用 CUA-agent(GCUA):在全部五个功能层上拥有完整能力的 agent。我们刻意采用「Generalist(通用)」限定词,因为业界常把 CUA-agent 与 GUI-agent 等同;这种混同是不完整的。

中介模型与环境的 harness 层已经收敛到一个足以支撑 GCUA 的结构。早期 agent 围绕 ReAct 风格 [54] 的轻量推理循环(Think 与 Action 步骤交替);当代 harness,如 Claude Code [4]、Codex [33] 与 OpenClaw,共享一个更丰富的宏架构,我们把它视为现代 agent-harness 层的代表(图 8):一个主 agent 循环、一个模块化系统提示构建器、一个统一工具系统、子 agent 调度,以及一个用于长程运行的上下文压缩管理器。由于这些 harness 是 CLI 原生的,把它们提升到 GCUA 就归结为添加 GUI 能力。我们使用两种模式:GUI-as-Tool 把 GUI 操作作为主循环中的普通工具暴露,而 GUI-as-SubAgent 把 GUI 交互委托给一个专门的视觉-语言子 agent。我们目前把 GUI-as-SubAgent 保留给没有原生视觉输入的模型,如 DeepSeek V4 [12]。我们的主基准评测使用 GUI-as-Tool,以测量在整个任务上集成的视觉推理与行动。组件级 harness 内部细节见附录 C.4。

3.3 评测模式

evaluate() 必须打分的交付物高度异质(CAM 刀路、财务工作簿、3D 网格、游戏世界状态、渲染截图、结构化申报文件、自由文本报告)。ALE 不强加单一评分指标,而是沿两条正交轴组合每个任务的评测。(i) 比较形式:任务作者从一小组产物模式中选择:精确/哈希值、带清单驱动容差的结构化数值或表格字段、几何曲面或点云距离、视觉外观(视觉 LLM 评审)、固定输入轨迹下的行为世界状态,以及自由文本评分细则。(ii) 组合方式:各产物信号通过 _gate-and-score(门槛-评分)_ 模式组合,或对二元检查表或逐文件分数取平均。gate-and-score 是最常见的模式:一个二元前置条件(如「刀路无碰撞」「文件解析无错误」)必须通过,然后才评估连续质量指标(曲面偏差、尺寸精度等);门槛失败会强制任务分数为 $0$,无论其他标准上有无部分进展。完整的模式分类法、逐任务工作流分配、辅助 API 与实例演练见附录 C.3。

ALE 刻意避免在存在确定性替代方案的地方使用 LLM-as-judge;如果一个任务工作流唯一提出的评分路径是「问模型结果看起来对不对」,它会在 QC 中被拒绝,并被重新工程化以暴露一个可检查的产物。真正需要 LLM 评审的少数任务工作流(视频片段、游戏截图、渲染场景等),不是用通用的整体式提示打分,而是用狭窄的、证据锚定的是/否探针打分,其答案由代码聚合进分数。每个任务工作流暴露一个任务实例列表(例如 manufacturing/gcode 中的 18 个工件实例),它们共享单个 evaluate(),但输入与参考不同。

表 1:ALE 上的主要结果。每个难度级别报告完全通过率(Pass, %)、平均分(Score, %)、总 API 成本($)、总挂钟时间(h)与总 token 用量(Tok.)。最后的 Overall Pass Rate 列报告三个难度级别所有不同任务的完全通过率。「–」表示成本数据不可得。上标 ± 值表示从同一任务实例的三次独立运行估计的分数标准差;由于算力预算限制,只有部分配置包含重复运行。† 模型使用额外的视觉子 agent 进行视觉感知。下方面板报告 ALE-CLI,即 Linux-only 子集,将 CLI agent 与 GCUA 参照(∗)并列比较。

近期层(67 任务)全谱层(55 任务)末考层(38 任务)总体
Pass (%)Score$时间Tok.Pass (%)Score$时间Tok.Pass (%)Score$时间Tok.通过率
主流 Agent Harness(配对 LLM + GUI-as-Tool)
Codex [33] (GPT-5.5 [35])38.164.7±2$243154h550M22.736.0±3$157125h389M0.011.2±2$170111h754M24.0
ALE-Claw (GPT-5.5 [35])32.867.4$14820h168M23.641.1$7114h56M2.612.8$10718h127M23.0
Claude Code [4] (Fable 5 [5])34.363.4$95376h348M20.934.1±1$60967h333M0.05.2$84070h236M22.0
Cursor [10] (GPT-5.5 [35])32.160.8±1$6949h58M20.032.7$5021h37M2.610.7$6121h64M20.7
Cursor [10] (Composer 2.5 [11])34.361.1$23158h95M18.230.8$3040h131M0.08.8$3462h152M20.4
Cursor [10] (Opus 4.7 [7])29.961.2$55838h112M20.037.6$86619h225M2.611.4$58821h122M20.4
Droid [14] (GPT-5.5 [35])29.958.2$10632h99M16.433.4$7122h60M2.611.3$7438h92M19.1
ALE-Claw (Opus 4.7 [7])28.460.5$31226h361M18.236.6$25819h302M0.07.9$59446h710M18.4
Gemini CLI [15] (Gemini 3.1 Pro [17])26.953.5$342113h240M12.726.4$96294h483M0.00.9$73374h498M15.8
Claude Code [4] (Opus 4.8 [8])26.960.2$806289h192M10.927.5$48679h119M0.05.2$60299h158M15.8
Claude Code [4] (Opus 4.7 [7])20.954.3$49620h121M12.729.1$74715h204M0.010.0$68520h171M13.2
Droid [14] (Opus 4.7 [7])27.660.2±1$73721h182M3.610.9$1675h40M0.08.0$49613h147M12.8
ALE-Claw (GPT-5.4 [34])20.944.3$6622h179M9.122.9$17926h597M0.08.1$10021h322M11.8
Codex [33] (GPT-5.4 [34])13.422.8$5628h87M3.67.7$4210h67M0.00.0$4614h69M7.2
Grok CLI [50] (Grok 4.3 [50])9.030.4±1$12628h104M7.317.0$9721h78M0.02.3$7318h60M6.6
LLM 模型对比(固定 OpenClaw [36] + GUI-as-Tool)
GPT-5.5 [35]35.865.7$21848h224M18.232.1$10427h102M0.010.9$15527h179M21.1
GPT-5.4 [34]33.657.8±1$7054h104M19.434.3±1$13073h285M0.07.3±1$11047h218M20.5
Claude Opus 4.7 [7]26.956.5$49357h218M10.927.5$39337h175M0.04.3$84255h454M15.1
Gemini 3.1 Pro [17]26.148.3±1$57061h626M10.923.6$138774h1854M0.03.1$117652h1417M14.1
Claude Opus 4.6 [6]22.451.2±1$24258h238M13.628.5±1$11567h95M0.05.6±1$16052h119M14.1
DeepSeek V4 Pro† [12]19.943.8±2$131106h356M10.923.8±2$7366h201M0.02.5±1$13173h384M12.4
Qwen3.7 Max [41]17.946.9$268112h509M10.927.2$30843h592M0.06.4$19644h382M11.8
GLM 5.1† [55]20.145.6±2$112124h329M9.121.8±1$237116h580M0.06.2±1$188100h575M11.5
Claude Sonnet 4.6 [9]16.440.6$12036h154M7.319.6$6718h101M0.01.3$4813h79M9.9
Kimi K2.6 [28]15.735.1±2$47119h208M6.418.2±1$40111h140M0.01.6$3685h121M9.2
MIMO v2.5 [26]11.935.1±2$1579h206M9.120.8±1$2366h321M0.03.4±1$1362h221M8.6
Qwen3.6 Plus [2]12.735.8±2$100117h466M8.222.9±1$12089h480M0.05.0±1$8967h376M8.6
MiniMax M2.7† [27]10.424.5±1$985h131M3.68.4±1$1064h146M0.01.3$1056h105M5.9
Grok 4.3 [50]6.724.4±1$3878h143M3.612.9±2$2856h97M0.02.3±1$2551h84M4.3
Agent Harness 对比(固定 GPT-5.5 [35] + GUI-as-Tool)
Codex [33]38.164.7±2$243154h550M22.736.0±3$157125h389M0.011.2±2$170111h754M24.0
ALE-Claw32.867.4$14820h168M23.641.1$7114h56M2.612.8$10718h127M23.0
OpenClaw [36]35.865.7$21848h224M18.232.1$10427h102M0.010.9$15527h179M21.1
Cursor [10]32.160.8±1$6949h58M20.032.7$5021h37M2.610.7$6121h64M20.7
Droid [14]29.958.2$10632h99M16.433.4$7122h60M2.611.3$7438h92M19.1
Agent Harness 对比(固定 Claude Opus 4.7 [7] + GUI-as-Tool)
Cursor [10]29.961.2$55838h112M20.037.6$86619h225M2.611.4$58821h122M20.4
ALE-Claw28.460.5$31226h361M18.236.6$25819h302M0.07.9$59446h710M18.4
Claude Code [4]20.954.3$49620h121M12.729.1$74715h204M0.010.0$68520h171M13.2

ALE-CLI(Linux-only 子集,105 任务)。

近期层(47 任务)全谱层(42 任务)末考层(20 任务)总体
Pass (%)Score$时间Tok.Pass (%)Score$时间Tok.Pass (%)Score$时间Tok.通过率
ALE-CLI:CLI Agent + GUI-as-Tool
Codex [33] (GPT-5.5 [35])∗37.268.3±3$14286h258M19.032.2±2$10793h213M0.013.1±3$10162h394M23.3
Claude Code [4] (Sonnet 4.6 [9])∗24.554.2±2$3823h84M14.328.3±1$5426h112M0.08.9±2$6338h118M16.7
ForgeCode [45] (Sonnet 4.6 [9])22.048.1±3$4441h170M8.717.6±2$3932h112M0.02.8$2052h83M13.3
Hermes [32] (Sonnet 4.6 [9])21.652.4±3$21931h216M8.722.5±1$13223h121M0.04.1±2$12324h192M13.2
Terminus [24] (Sonnet 4.6 [9])19.150.0±2$7542h208M8.322.7$5532h513M0.04.1$14853h630M11.9
OpenHands [49] (Sonnet 4.6 [9])13.831.9±5$7436h213M7.113.6±3$2126h191M0.03.7±2$8149h288M9.0

4 实验

ALE 的任务实例取自专家在真实计算机环境中执行的真实专业工作流,在单个任务中例行地交织 shell 命令、GUI 应用、文件操作与网络调研。如第 3.2 节所论证,这一操作面要求在全部五个功能层(Brain、Eyes、Body、Hands、Feet)上拥有完整能力的通用 CUA-agent(GCUA)。因此我们以 GCUA 配置评测所有 agent 系统。

4.1 主要结果

为把每个 agent 带入 GCUA 配置,每个系统都被扩展了 GUI-as-Tool 模式:一个统一的 CUA MCP 桥把 14 个桌面动作工具(表 5)作为标准条目暴露进 agent 的工具系统,使单个基础模型能在一个动作循环内同时对 shell 输出与视觉反馈进行推理。表 1 报告了 agent 系统与基础模型的平均分、通过率、成本与挂钟时间。具体而言,mean score 是细粒度任务分的平均值,full pass rate 是获得满分的任务占比。每次运行以五小时为上限;总体超时率为 3.8%,从轻量 harness 的约 1% 到 OpenClaw 的 5.7% 不等(见附录 D.2)。行被分为五个块:(a) 主流 harness–骨干配置;(b) harness 固定为 OpenClaw+GUI-as-Tool 的模型扫描;(c) 骨干固定为 GPT-5.5 的 harness 扫描;(d) 骨干固定为 Claude Opus 4.7 的 harness 扫描;(e) ALE-CLI,即 105 个 Linux-only 任务实例,CLI-only agent(ForgeCode、Hermes、Terminus)无需 GUI 桌面访问即可尝试,报告于表 1 下方面板,并以 Codex 与 Claude Code 作为 GCUA 参照。

ALE-CLI:一个更难的、以 CLI 为中心的子基准。ALE-CLI 是与 Terminal-Bench [24] 的天然比较点,后者包含约 100 个规模相近的以终端为中心的任务。然而,ALE-CLI 任务要难得多,且要求更长的 agent 会话:搭载 GPT-5.5 [35] 的 Codex [33]——在 Terminal-Bench 上达到 82% 的最强配置——在 ALE-CLI 上的总体通过率只有 23.3%(近期层 37.2%、全谱层 19.0%、末考层 0.0%)。

三个难度层级。前沿 agent 在一个 ALE 任务上单次运行平均花费 $3–10,耗时数十分钟到数小时。因此评测完整的 152 任务公开集是昂贵的,ALE 把任务组织为三个难度层级,让社区可以选择与其评测预算和目标匹配的子集。近期层(Near-Term,67 任务)包含当前前沿 agent 能部分完成的工作流,最高通过率接近 40%;这些任务是短期排行榜竞争与快速迭代最具成本效益的目标。全谱层(Full-Spectrum,55 任务)按设计覆盖 ALE 全部 55 个子领域,每个至少一个任务实例,确保全面评测的广泛领域覆盖。末考层(Last-Exam,38 任务)由最难的工作流组成,大多数 agent 在其上通过率为 0%;这些任务锚定基准的长期上限空间,最适合留给里程碑式评测而非日常测试。

ALE-Claw:一个自实现的 GCUA 参照。我们实现 ALE-Claw 以检验第 3.2 节中的基本 GCUA 组件——单一动作循环、模块化工具、GUI-as-Tool 与上下文压缩——是否足以取得与前沿 harness 可比的性能。ALE-Claw 是一个派生自 OpenClaw [36] 的简化实现,范围限定于隔离的基准运行。它省略了长期记忆管理与用户偏好定制等产品特性,这些特性对交互式 agent(如 Claude Code [4])有用,但单次任务评测并不需要。在固定基础模型的情况下,ALE-Claw 在 ALE 上的表现与默认 OpenClaw 相当。附录 C.4 记录了实现差异。

领域雷达图

(a)

工具使用构成-harness

(b)

工具使用构成-模型

(c)

(d)

Bash File GUI Planning Web Other

图 9:实验分析总览。(a) Claude Fable 5 与 GPT-5.5 的领域级平均分,各自在有完成运行的 harness 上取平均(选定的公开任务集);稀疏的 transportation 领域被省略。(b) 每个 harness 可用的最佳表格支持配置的工具调用构成。(c) 固定 OpenClaw harness 下骨干模型的工具调用构成。(d) Claude Code + Opus 4.7 公开任务失败运行的失败根因分类。

4.2 分析

领域级表现。图 9(a) 显示 Claude Fable 5 与 GPT-5.5 按领域划分的平均分,各自在 harness 上取平均。两个前沿模型表现出相似的领域画像:计算数学与农业/环境得分最高(约 55–85%),其次是商业与法律(约 50–55%),而教育垫底(低于 25%)。这一共同排序很可能同时反映了模型内在能力在领域间的不平衡,以及训练期间对工具使用任务暴露的不均匀——与代码邻近的领域获得的覆盖远多于专业领域工作流。

工具使用。用附录 C.4.1 的分类法归一化后的工具轨迹揭示,harness 与模型都塑造工具调用构成(图 9(b,c))。GUI 使用仍低于任务需求:34% 的公开任务实例指定图形软件为主要工具,但大多数配置中 GUI 占比仍很小,因为 agent 用 Bash/CLI 替代物执行 GUI 任务。

失败分类法。我们把 Claude Code + Opus 4.7 的失败任务归类为一个两级分类法(图 9(d);细节见附录 D.3)。理解与方法类失败合计约占四分之三,表明主要瓶颈是领域知识而非执行能力。由于缺乏专业知识,agent 默认使用临时脚本而非目标领域软件,强化了上述 GUI 利用不足的模式。

补充分析。附录 D.4 进一步把性能差异分解为模型效应与 harness 效应,发现在工程化良好的系统中,基础模型选择带来的差异幅度约为 agent harness 选择的 3 倍。附录 D.5 考察每个配置的成本、时间与 token 效率(图 13),显示更高的资源消耗并不能可靠地转化为更好的性能。附录 D.6 提供逐任务实例的分数热力图(图 14–16),可视化三个层级上的每个任务-agent 组合。

5 相关工作

表 2:ALE 与代表性基准的定位。行业计数使用附录 B.1 中的映射;「–」表示该基准未声明领域分类法、不可直接比较。

基准任务形式规模广度领域锚定任务来源时程验证
知识与考试式问答
MMLU [20]知识问答~16K26 / 55学术科目挖掘(考试)秒级自动(精确匹配)
GPQA [42]知识问答~5008 / 55硬核科学领域专家分钟级自动(精确匹配)
HLE [39]知识问答~2.5K20 / 55学术科目领域专家分钟级自动(精确 / LLM 评审)
Agentic 与计算机使用基准
GAIA [25]工具使用问答~500–通用助手策展人分钟级自动(精确匹配)
SWE-bench [21]代码补丁~2K5 / 55开源 Python 仓库挖掘(GitHub)分钟–小时自动(单元测试)
OSWorld [51]GUI 操作~4005 / 55桌面应用策展人分钟级自动(状态检查)
WebArena [56]GUI 操作~8004 / 55Web 应用(6 站点)策展人分钟级自动(状态检查)
Terminal-Bench 2 [24]CLI 操作~1006 / 55终端工作流策展人分钟–小时自动(状态检查)
PinchBench [22]助手任务~503 / 55生产力 + 编码策展人分钟级自动(测试 / LLM 评审)
经济锚定 / 项目式基准
GDPval [37]项目交付物~20016 / 55GDP 头部职业行业专家小时–天人工(专家)
RLI [23]项目交付物~25014 / 55Upwork 类目挖掘(Upwork)小时–天人工(专家)
ALE(本文)项目交付物~1.5K55 / 55SOC 2018 + O*NET行业专家小时–周自动(确定性脚本)

表 2 把 ALE 与知名基准放在一起定位;「广度」列通过把每个基准已发布的类别映射到我们的 55 行业分类法上来报告行业覆盖。MMLU [20]、GPQA [42]、HLE [39] 等知识与考试式基准主题宽广,但测的是模型_知道_什么,而非它_能做什么_。SWE-bench [21]、OSWorld [51]、WebArena [56]、GAIA [25] 等 agentic 基准加入了多步交互与工具使用,但只覆盖少数以软件为中心的领域,且通常依赖策展人编写的任务而非真实专业工作流。最接近的同期工作 GDPval [37] 与 RLI [23] 瞄准经济锚定的项目级评测,但仍留下大片劳动力市场未被测试(分别为 55 个行业中的 16 与 14 个),并依赖昂贵的人工评分。ALE 填补了这些缺口:它是第一个覆盖全部 55 个 SOC/O*NET 行业的基准,每个任务都来自 300 多位从业者之一已完成过的真实项目,并用确定性的、基于评分细则的自动验证取代人工评测。

6 结论

我们提出了 ALE,一个由 960 个专家编写的任务工作流(1,490 个任务实例)构成的基准,横跨 55 个数字化行业,来源于专家已交付的真实工作,锚定于 SOC/O*NET 分类法,并通过确定性检查与结构化评分细则打分,而非开放式的 LLM 评审。前沿 agent 今天只能通过其中一小部分;我们发布 ALE,作为缩小基准成功与 GDP 相关影响之间鸿沟的工具——当它被攻克时,将意味着 agent 能够承担专业实践真正要求的长程、工具密集型工作。

致谢与资助披露

我们衷心感谢 Tianqiao & Chrissy Institute(TCCI)、Snorkel AI 与 UniPat AI 提供的资金与算力额度支持。


译注:本文为正文卷(摘要至结论与致谢)。参考文献与附录 A–B(作者与单位、基准构建细节)见《附录卷(上)》:https://openqa.cn/articles/agents-last-exam-appendix-1-zh ;附录 C–D(评测流水线细节、扩展实验结果与分析)见《附录卷(下)》:https://openqa.cn/articles/agents-last-exam-appendix-2-zh

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误