Agents ' Last Exam: 面向 职业 工作 流 的 智能 体 基准
ALE 用 1490 个来自真实职业项目的任务实例,覆盖 55 个子领域。最强的 Codex 加 GPT-5.5 在 Terminal-Bench 上有 82%,在 ALE 最难一档的完全通过率低于 10%,多数主流配置在该档接近零。

本文目录
本文是 arXiv 论文 Agents' Last Exam(arXiv:2606.05405,CC BY 4.0)正文第 1 节至第 6 节的中文译文,由智测团队翻译。参考文献列表、附录 A 的作者名录、附录 B 与附录 C 的构建和接口细则未逐条译出。附录 D 里已经写进第 4 节的结论保留在正文中。
1 引言
过去几年,人工智能系统接连通过一批被广泛关注的基准:世界冠军级的游戏、奥赛数学,以及竞赛编程。若以最终要紧的指标、也就是经济产出来衡量,更广泛的影响却出人意料地有限。基准上的胜利积累得比核心产业里可测量的变化更快。作者把这个缺口看成人工智能的效用问题,并认为这个领域现在需要的评测,不只测量抽象能力,还要测量系统在真实职业环境里完成长时程、有经济价值的工作的能力。
这个缺口之所以重要,是因为人工智能的进展在很大程度上被这个领域选择去优化的基准塑造。基准不只记录能力。它们把研究注意力集中起来,规定工程目标,并且常常决定哪些领域会变得容易快速改进。人工智能近年的历史把这个模式说得很清楚:一个领域一旦被可核验、又被广泛使用的评测抓住,这个领域的进展就会加快,部署也往往跟着到来。ImageNet 在计算机视觉里就起过这个作用。可是对金融、法律、电气工程、制造这类经济上处于中心的部门,可比的评测仍然不发达。如果这样的基准能够建出来并最终被做满,那个结果就不止是一次考试成功。它将表明人工智能系统已经能够以足以被真实产业采用的水平,执行底层的职业工作流。
建造这样的评测,难在结构上。第一,长时程的真实工作流收集成本高,因为它们必须来自真实软件和组织情境。先前工作往往采用更容易收集的任务单位,无论是更短的计算机使用任务、合成环境,还是纯粹的问答设置。第二,用真实、有经济价值的工作流覆盖宽广的行业也很难。这需要持续接触各领域专家,并对产业格局有深入了解。现有基准常常只在有限的一组领域上评测。第三,真实工作流的核验本质上就难,因为输出空间是异构的。一份正确的交付物可以是文件、电子表格、媒体成品、报告、设计或模型。因此,测量有经济价值的工作的基准,往往依赖人工判断,例如 GDPval 和 Remote Labor Index。这些约束说明,现有基准常常在真实性、广度、可核验性三者里放弃其中一个。它们合在一起,构成了 Agents' Last Exam(ALE)的动机。
为什么叫「最后一场考试」?这个名字有两层意思。作为能力门槛的「最后」:通过这些行业考试的智能体,表明它准备好在该职业里承担持续的、有经济价值的工作,而不只是回答关于这个职业的问题。作为难度前沿的「最后」:评测建立在需要专业判断的真实长时程工作流上,ALE 处在当前系统能够可靠完成的边界上。
ALE 是一个包含 1000 个以上任务实例的基准,覆盖 55 个子领域和 13 个行业簇,与 250 名以上领域专家合作开发。为了保证行业覆盖既广又有代表性,专家顾问委员会绘制每个领域的工作流版图,并识别在经济上有意义的工作流族,锚定在 O*NET / SOC 2018 职业分类上。任务工作流来自真实职业实践:专家贡献的是他们已经完成的项目,而不是发明合成情景。这些项目在入库前经过多轮质量控制,包括初审、工程师试跑,以及专家委员会的最终同行评审。大多数任务要求的计算机使用,把图形界面交互(桌面应用、浏览器、领域软件)和命令行操作(shell 脚本、代码执行、文件操作)交织在一起,要求的是现有基准各自单独测试的能力的并集。为了让异构的真实输出不必依赖人工裁判也能核验,ALE 把评测标准化为:对照专家提供的参考和量规,做基于交付物或基于里程碑的结构化检查。
ALE 的目标评测对象是通用计算机使用智能体(Generalist Computer-Use Agent,GCUA),例如 Claude Code 或 Codex。它在同一个行动循环里结合视觉感知、代码执行、工具使用和长时程规划。ALE 的任务表面按构造是仅图形界面基准(如 OSWorld)和仅命令行基准(如 Terminal-Bench)的超集。为了比较覆盖,作者把 55 个 ALE 子领域当作共同坐标系,把先前基准已发表的学科、应用、仓库或职业映射到这个分类上。当前结果确认 ALE 远未饱和:最强配置是 Codex 加 GPT-5.5,它在 Terminal-Bench 上已经达到 82%,在 ALE 最容易的一档仍低于 50%,在最难的一档低于 10%。包括 Claude Code 在内的大多数主流智能体,在该难度上的通过率接近零。
更广义地说,ALE 不只是又一块排行榜。它是用来缩小「基准成功」和「与 GDP 相关的影响」之间缺口的工具。如果前沿人工智能智能体能够通过这最后一场考试,基准上的进展才可能开始表现为真实的经济变化。
2 基准设计与数据集构建
2.1 设计原则:要找什么样的任务
基准由三条高层要求定义。它们决定哪些工作流进入数据集,哪些在公开投稿入口被拒绝。
代表性。工作流应当符合真实职业实践,并使用该领域专家实际会用的软件。例如,建筑专家把二维蓝图转成三维模型时,通常用 SolidWorks 或 Rhino,而不是 AutoCAD。
复杂性。任务应当是一份端到端交付物,会占用专家相当长的时间,而不是只有几次界面操作。关键区别是工作流和动作。不合适的例子是「在 DaVinci 里加一个颜色滤镜」,这只是一次局部编辑。更合适的例子是「把一只奔跑的猎豹移到另一段比赛视频里」,因为它在同一条耦合的工作流里要求跟踪、抠像、合成和颜色匹配。
可核验性。输出应当允许确定性检查,或者有一份绑在可观察成品上的、没有歧义的量规。最强的情形是确定性交付物,可以直接和参考输出比较。精确匹配不可能时,判断仍然应当收成一个可测量的成品。不合适的例子是「设计一个有怪物的角色扮演游戏」,没有可客观检查的目标。更合适的例子是「用 RPGMaker XP 复现游戏 mota.exe」,因为在相同的用户操作轨迹下,地图几何、角色属性和事件状态可以自动与参考版本比较。
2.2 范围与分类:覆盖哪些领域
作者没有按临时想法或经济排名挑选行业,而是把 ALE 的分类锚定在 SOC 2018 和 O*NET 上。他们把软件中介的工作流相似的职业聚成 ALE 的行业,排除核心工作并非有意义地数字化的部门,再收成 13 个领域、55 个子领域。完整推导在附录 B.1。为了公平地跨基准比较,他们用一个有大模型辅助的分类器,把每个先前基准已发表的类别映射到同一套 55 个子领域上。结果露出一个现有基准都没有补上的覆盖缺口:即便把 16 个主要的先前基准并在一起,55 个子领域里仍有 13 个完全没有被覆盖。
2.3 任务构建流水线
ALE 里的任务不能由外行众包。它们必须来自领域专业人员的实际例行工作,并经过严格筛选,以保证真实性、复杂性和技术上可执行。因此采用分阶段协议,有五道门。
专家征集通过由产业从业者组成的顾问委员会招募领域专家,保证分类被覆盖到。任务提交走专门的网页入口。专家上传曾经花费他们数天或数周专业工作的过往项目。人工智能辅助工具帮助把每份提案细化到五个核心成分都写全:自然语言描述、输入文件、目标软件、预期交付物、评测规格。初审用会议式决定筛选投稿,决定包括大修、小修、边界接收、接收、强接收。需要修改的退回专家。任务实现把接受的规格变成可运行资产、备好的软件容器和写成代码的评测逻辑。工程师试跑若发现缺口,会自动退回专家。最终质量控制是专家委员会的同行评审,核对参考输出是否正确、评测界限是否校准(既不是窄到不可能,也不是宽到虚假地放行),以及上下文是否充分,然后任务才入库。更多细节在附录 B.2。
公开与私有的发布策略。基准污染,无论来自预训练数据重叠还是针对题目的优化,都是任何公开评测长期有效性的核心威胁。ALE 在 1490 个任务实例里只公开 150 个,大约 10%,其余留在私有池。图 5 把 1490 个实例分成 960 份外部投稿和 530 份委托任务。发布状态是 150 个公开、1017 个私有、323 个尚未通过质量控制。ALE 还设计成滚动评测:私有实例会定期轮换进公开集,退役的公开任务被替换,从而在 successive 的模型代际上维持一块未被污染的评测表面。附录 D.1 用实验核对公开子集对全池是有代表性的。
3 评测流水线
上一节说明专家投稿如何被收集并变成核验过的基准实例。这一节规定任务存在之后发生什么:如何执行,智能体如何与环境交互,结果如何打分。流水线围绕三个部件的解耦来组织,这三个部件是任务规格、智能体和环境,以便它们都可以方便地替换。
术语。全文用任务工作流指一条端到端的职业流程,用任务实例指一个工作流的一次可运行情形,也就是一对具体的输入和输出。它们共享同一个 evaluate(),但输入和输出数据不同。偶尔出现的单个「任务」指可运行的实例这一层。
3.1 流水线架构
每个基准实例由一份任务规格定义。它是一个可执行的 main.py,在远程虚拟机环境上编排三段生命周期:load()、start()、evaluate()。智能体由脚手架和模型组成,只收到任务描述和元数据,通过行动循环与环境交互,产出由规格对照参考或量规打分的输出成品。
任务规格把构建时提供的五个要素编码进来:描述、输入资产、目标软件、参考资产、评测标准。它暴露三个生命周期函数。load() 声明任务和计算需求。start() 把虚拟机准备到一个确定的起始状态。evaluate() 把智能体的输出打成分数,范围是 0 到 1。智能体只收到任务描述和元数据,然后在截图、shell 输出、鼠标和键盘、文件编辑和 API 调用上跑行动循环,直到终止。环境是一台远程虚拟机,目录布局固定为四个:input/ 是只读资产,software/ 是预装应用,output/ 是智能体唯一可写的目标,reference/ 是对智能体隐藏、只用于打分的地面真值成品。这种解耦让任何符合行动接口的智能体都能在任何任务上被评测,也让同一份规格不用修改就能部署到云虚拟机或本地容器。部件接口和目录约定的细节在附录 C.1,生命周期协议在附录 C.2。
3.2 智能体架构:从命令行或图形界面智能体到通用计算机使用智能体
ALE 的任务要求智能体能够读图形界面、在对话框里打字、执行 shell 命令、编写和调试代码、调用 API,并管理长时间会话,而且常常在同一条任务工作流里。没有一个现有的智能体家族原生覆盖这个表面。基准因此对准一个更宽的智能体类别,并说明主流脚手架要怎样扩展才能到达它。
作者把智能体的操作能力拆成五层。大脑是大模型的推理和规划。眼睛是通过截图做的图形界面感知。身体是编排和控制流。手是结构化的工具调用。脚是动作在其上生效的运行时基底。这个分解把现有家族分开。传统命令行智能体,例如 SWE-agent 和 ForgeCode,有完整的大脑、身体、手和脚,但按构造没有眼睛。OpenClaw 这类框架式智能体并不严格只是命令行,但发布时没有原生图形界面模块。建立在视觉语言动作模型上的图形界面智能体覆盖大脑和眼睛,但身体浅、手窄(主要是鼠标和键盘)、脚受限,因此不能写代码、管理文件或维持长工作流。ALE 的任务工作流要求两个表面的并集,所以基准评测的智能体类别是通用计算机使用智能体:五层能力都完整。作者故意用「通用」这个限定,因为业界常常把计算机使用智能体等同于图形界面智能体,这个等同是不完整的。
介于模型和环境之间的脚手架层,已经收敛到一种足以支持通用计算机使用智能体的结构。早期智能体围绕 ReAct 式的薄推理循环,把思考和行动交错。当代脚手架,例如 Claude Code、Codex 和 OpenClaw,共享一种更丰富的宏观架构,作者把它当作现代智能体脚手架层的代表:主智能体循环、模块化的系统提示构建器、统一的工具系统、子智能体分发,以及面向长时程运行的上下文压缩管理器。因为这些脚手架原生是命令行的,把它们提升到通用计算机使用智能体,归结为补上图形界面能力。作者用两种模式。图形界面作为工具,把图形界面操作暴露成主循环里的普通工具。图形界面作为子智能体,把图形界面交互委托给一个专门的视觉语言子智能体。后一种目前留给没有原生视觉输入的模型,例如 DeepSeek V4。主评测使用图形界面作为工具,以便在整个任务上测量整合在一起的视觉推理和行动。部件级的脚手架内部细节放在附录 C.4。
3.3 评测模式
evaluate() 必须打分的交付物高度异构:计算机辅助制造的刀路、财务工作簿、三维网格、游戏世界状态、渲染截图、结构化申报、自由文本报告。ALE 不强加单一指标,而是沿两条正交的轴组合每个任务的评测。
比较形式。任务作者从一小套成品模式里选择:精确值或哈希值;带清单驱动容差的结构化数值或表格字段;几何表面或点云距离;视觉外观,由视觉大模型裁判;在固定输入轨迹下的行为世界状态;自由文本的量规评分。
组合方式。每个成品上的信号,或者用门控加评分,或者对二元清单或逐文件分数取平均。门控加评分是最常见的模式。一个二元前提必须先通过,例如刀路没有碰撞、文件能够无错误解析,然后才评估连续的质量指标,例如表面偏差、尺寸精度。门控失败会把任务分数强制为 0,不管其他标准上有多少部分进展。
ALE 有意在存在确定性替代方案时避免用大模型当裁判。如果一个任务工作流唯一提出的评分路径是「问一个模型结果看起来是否正确」,它会在质量控制时被拒绝,并被重新设计成暴露一个可检查的成品。少数确实需要大模型裁判的工作流,例如视频片段、游戏截图、渲染场景,也不是用通用的整体提示来打分,而是用狭窄的、锚定证据的是否问句,再由代码把答案聚成分数。每个任务工作流暴露一列任务实例,例如制造与 G-code 里的 18 个工件实例。它们共享一个 evaluate(),但输入和参考不同。
4 实验
ALE 的任务实例来自专家在真实计算机环境上执行的职业工作流,常规地在同一个任务里交织 shell 命令、图形界面应用、文件操作和网页检索。如第 3.2 节所论证,这个操作表面要求五层能力都完整的通用计算机使用智能体。因此所有智能体系统都在该配置下评测。
4.1 主要结果
为了把每个智能体带入该配置,每个系统都用图形界面作为工具的模式扩展。一座统一的计算机使用 MCP 桥把 14 个桌面动作工具暴露成智能体工具系统里的标准条目,使同一个基础模型在一个行动循环里同时对 shell 输出和视觉反馈推理。每次运行上限五小时。总体超时率是 3.8%,轻量脚手架大约 1%,OpenClaw 为 5.7%。单次前沿智能体跑一道 ALE 任务,平均花费 3 到 10 美元,耗时从数十分钟到数小时。因此评完全部 152 个公开任务很贵。ALE 把任务组织成三个难度档,让社区按预算和目标选子集。
近期档有 67 个任务,是当前前沿智能体能够部分完成的工作流,最高通过率接近 40%。它们是短期榜单竞争和快速迭代里最划算的目标。全谱档有 55 个任务,按设计覆盖 ALE 的 55 个子领域,每个子领域至少一个任务实例。最后考试档有 38 个任务,是最难的工作流,大多数智能体的通过率为 0%。这些任务锚定基准的长期空间,适合里程碑评测,不适合日常测试。
表中每一档报告完全通过率(得到满分的任务比例)和平均分(细粒度任务分数的平均),以及 API 费用、墙钟时间和词元用量。总通过率是三个难度档上所有不同任务的完全通过率。由于计算预算,只有一部分配置做了三次独立重复,表中的上下偏差是这些重复的分数标准差。带剑号的模型额外使用一个视觉子智能体做视觉感知。
主流脚手架配图形界面作为工具,完全通过率(近期 / 全谱 / 最后考试)和总通过率如下。Codex 加 GPT-5.5 为 38.1%、22.7%、0.0%,总通过率 24.0%,三档平均分 64.7、36.0、11.2。ALE-Claw 加 GPT-5.5 为 32.8%、23.6%、2.6%,总通过率 23.0%。Claude Code 加 Fable 5 为 34.3%、20.9%、0.0%,总通过率 22.0%。Cursor 加 GPT-5.5 为 32.1%、20.0%、2.6%,总通过率 20.7%。Cursor 加 Composer 2.5 为 34.3%、18.2%、0.0%,总通过率 20.4%。Cursor 加 Opus 4.7 为 29.9%、20.0%、2.6%,总通过率 20.4%。Droid 加 GPT-5.5 为 29.9%、16.4%、2.6%,总通过率 19.1%。ALE-Claw 加 Opus 4.7 为 28.4%、18.2%、0.0%,总通过率 18.4%。Gemini CLI 加 Gemini 3.1 Pro 为 26.9%、12.7%、0.0%,总通过率 15.8%。Claude Code 加 Opus 4.8 为 26.9%、10.9%、0.0%,总通过率 15.8%。Claude Code 加 Opus 4.7 为 20.9%、12.7%、0.0%,总通过率 13.2%。Droid 加 Opus 4.7 在表中对应行为 27.6%、3.6%、0.0%,总通过率 12.8%。ALE-Claw 加 GPT-5.4 为 20.9%、9.1%、0.0%,总通过率 11.8%。Codex 加 GPT-5.4 为 13.4%、3.6%、0.0%,总通过率 7.2%。Grok CLI 加 Grok 4.3 为 9.0%、7.3%、0.0%,总通过率 6.6%。
固定 OpenClaw 加图形界面作为工具、只换模型时,GPT-5.5 的三档完全通过率是 35.8%、18.2%、0.0%,总通过率 21.1%。GPT-5.4 是 33.6%、19.4%、0.0%,总通过率 20.5%。Claude Opus 4.7 是 26.9%、10.9%、0.0%,总通过率 15.1%。Gemini 3.1 Pro 是 26.1%、10.9%、0.0%,总通过率 14.1%。Claude Opus 4.6 是 22.4%、13.6%、0.0%,总通过率 14.1%。DeepSeek V4 Pro 是 19.9%、10.9%、0.0%,总通过率 12.4%。Qwen3.7 Max 是 17.9%、10.9%、0.0%,总通过率 11.8%。GLM 5.1 是 20.1%、9.1%、0.0%,总通过率 11.5%。Claude Sonnet 4.6 是 16.4%、7.3%、0.0%,总通过率 9.9%。Kimi K2.6 是 15.7%、6.4%、0.0%,总通过率 9.2%。MIMO v2.5 是 11.9%、9.1%、0.0%,总通过率 8.6%。Qwen3.6 Plus 是 12.7%、8.2%、0.0%,总通过率 8.6%。MiniMax M2.7 是 10.4%、3.6%、0.0%,总通过率 5.9%。Grok 4.3 是 6.7%、3.6%、0.0%,总通过率 4.3%。
固定 GPT-5.5 比较脚手架,Codex、ALE-Claw、OpenClaw、Cursor、Droid 的总通过率分别是 24.0%、23.0%、21.1%、20.7%、19.1%。固定 Claude Opus 4.7 比较脚手架,Cursor、ALE-Claw、Claude Code 的总通过率分别是 20.4%、18.4%、13.2%。最后考试档上,绝大多数配置的完全通过率是 0.0% 或 2.6%。
ALE-CLI 是只含 Linux、共 105 个任务实例的子集,命令行智能体不必访问图形桌面也能尝试。它是 Terminal-Bench 的自然对照。Terminal-Bench 大约有 100 个以终端为中心的任务,规模相近。但 ALE-CLI 更难,会话也更长。在 Terminal-Bench 上达到 82% 的最强配置 Codex 加 GPT-5.5,在 ALE-CLI 上的总通过率只有 23.3%:近期档 37.2%,全谱档 19.0%,最后考试档 0.0%。同一子集上,Claude Code 加 Sonnet 4.6 的总通过率是 16.7%,ForgeCode 加 Sonnet 4.6 是 13.3%,Hermes 加 Sonnet 4.6 是 13.2%,Terminus 加 Sonnet 4.6 是 11.9%,OpenHands 加 Sonnet 4.6 是 9.0%。
ALE-Claw 是作者自己实现的通用计算机使用参考。它用来检验第 3.2 节的基本部件,也就是单一行动循环、模块化工具、图形界面作为工具、上下文压缩,是否足以达到与前沿脚手架相当的表现。ALE-Claw 从 OpenClaw 简化而来,范围限于隔离的基准运行。它省略长期记忆管理和用户偏好定制。这些功能对 Claude Code 这类交互式智能体有用,但单任务评测不需要。基础模型固定时,ALE-Claw 在 ALE 上与默认 OpenClaw 表现相当。实现差异写在附录 C.4。
4.2 分析
领域表现。Claude Fable 5 和 GPT-5.5 在各领域上的平均分轮廓相似。计算数学以及农业与环境最高,大约 55% 到 85%。商业和法律大约 50% 到 55%。教育最低,低于 25%。稀疏的交通运输领域在图里被省略。作者认为这个共同排序既反映模型内在能力在领域间不平衡,也反映训练中工具使用任务的暴露不均:靠近代码的领域覆盖远多于专门的职业工作流。
工具使用。用附录 C.4.1 的分类把工具轨迹归一之后,脚手架和模型都会改变工具调用的混合。图形界面的使用低于任务需求。34% 的公开任务实例把图形软件指定为主要工具,但大多数配置里图形界面所占比例仍然很小,因为智能体用 Bash 或命令行替代去执行图形界面任务。
失败分类。作者把 Claude Code 加 Opus 4.7 在公开任务上的失败分成两级分类。理解和做法两类失败合计大约占四分之三,说明主要瓶颈是领域知识,而不是执行能力。缺少专门知识时,智能体默认写临时脚本,而不是使用预定的领域软件。这加强了上面图形界面利用不足的模式。
进一步分析。附录 D.4 把表现差异分解成模型效应和脚手架效应,发现在工程做得较好的系统里,基础模型的选择造成的分散大约是智能体脚手架选择的 3 倍。附录 D.5 考察每种配置的费用、时间和词元效率,表明更高的资源消耗并不能可靠地转化成更好的表现。附录 D.6 给出逐任务实例的分数热力图。
5 相关工作
表 2 用映射到 55 个行业分类之后的覆盖广度给 ALE 定位。知识和考试式基准,例如 MMLU(约 1.6 万题,26/55)、GPQA(约 500 题,8/55)和 HLE(约 2500 题,20/55),题目面宽,但测的是模型知道什么,不是它能做什么。智能体基准,包括 SWE-bench(约 2000,5/55)、OSWorld(约 400,5/55)、WebArena(约 800,4/55)和 GAIA(约 500,未按该分类申报),加上了多步交互和工具使用,但只覆盖少数以软件为中心的领域,而且通常依赖策展人编写的任务,而不是真实职业工作流。Terminal-Bench 2 大约 100 个任务,覆盖 6/55。PinchBench 大约 50 个任务,覆盖 3/55。
最接近的同时代工作是 GDPval 和 Remote Labor Index。它们以有经济依据的、项目规模的评测为目标,但仍留下劳动力市场的大片未测:分别是 55 个行业里的 16 个和 14 个,并且依赖昂贵的人工评分。GDPval 大约 200 个项目交付物,时程从小时到天。Remote Labor Index 大约 250 个,来自 Upwork 类别。ALE 大约 1500 个项目交付物,覆盖 55/55,来源是行业专家已经完成的工作,时程从小时到周,核验是确定性脚本,而不是人工专家。
论文的原话是:ALE 补上这些缺口。它是第一个覆盖全部 55 个 SOC/O*NET 行业的基准,每条任务都来自 300 名以上从业者之一已经完成的真实项目,并用确定性的、基于量规的自动核验代替人工评测。引言里的专家规模写作 250 名以上,相关工作写作 300 名以上,译文保留这两处原文数字,不把它们收成一个。
6 结论
作者介绍了 ALE。它是 960 条专家撰写的任务工作流、1490 个任务实例,跨 55 个数字行业。任务来自专家已经交付的工作,锚定在 SOC/O*NET 分类上,用确定性检查和结构化量规打分,而不是开放式的大模型评判。前沿智能体今天只能通过一小部分。作者把 ALE 作为缩小基准成功与 GDP 相关影响之间缺口的工具发布。饱和将意味着智能体能够维持职业实践实际要求的那种长时程、工具密集的工作。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。