CodexQA

Industry & PracticeResearch & Benchmarks

Terminal-Bench 2.1:89 道终端任务上的一次核对修订

CodexQA 团队2 min read

Artificial Analysis 介绍的 Terminal-Bench 2.1 仍是 89 道硬任务,但修了环境和指令,让分数反映 Agent 能力而不是环境缺口。评测用 Terminus 2,每题三次取 pass@1。

来源:Artificial Analysis 的 Terminal-Bench 2.1 榜单说明,以及论文《Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces》(arXiv:2601.11868)。基准由 Laude Institute、斯坦福研究者和 Terminal-Bench 开源社区维护。

2.1 改了什么

Terminal-Bench 2.1 是 2.0 的核对修订,任务仍是那 89 道,覆盖软件工程、系统管理、数据处理、模型训练和安全。和 Terminal-Bench Hard 一样,每道题用程序化验证:Agent 必须在真实终端环境里满足随题附带的验证套件。

2.1 修的是环境和指令,而不是另出一套更难题。例如补上 Dockerfile 里缺失的依赖(页面举的例子是补上 procps,让后台进程相关工具能用),并修正大约十来道题上指令和测试不一致的地方。目的写得很明确:分数应反映 Agent 能力,而不是环境缺口。

Artificial Analysis 的跑法是:Terminus 2 支架,e2b 沙箱,每题重复三次,报告平均 pass@1。评测由他们独立完成,方法写在其智能评测方法页的 Terminal-Bench 2.1 一节。

论文里的问题设定

论文摘要的出发点是:Agent 也许很快就能在多种领域里自主完成有价值的长程任务。当时的基准要么不测真实任务,要么不够难,测不出前沿模型的差别。Terminal-Bench 2.0 因此做成一套仔细筛选的硬基准,89 道题都在命令行环境里,灵感来自真实工作流。每道题有独立环境、人类撰写的解法,以及程序化检查。

2.1 没有更换这 89 道题的能力范围,而是承认:环境或指令本身有洞时,失败不能算在模型头上,通过也不能算成能力。这和 OpenAI 对 SWE-bench 的审计是同一类卫生工作,只是发生在终端基准上,而且修订已经进了被引用的版本号。

读榜或写进模型卡时,应标明是 2.0 还是 2.1,以及支架是不是 Terminus 2、重复了几次。不同支架上的终端分不能直接横比。页面没有在这段说明里给出可以脱离榜单引用的单一冠军分数,引用时应以榜单当时的数字为准。

榜单:https://artificialanalysis.ai/evaluations/terminalbench-2-1 论文:https://arxiv.org/abs/2601.11868

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction