CodexQA

Industry & PracticeResearch & Benchmarks

满分档平均只有 3.2%:腾讯混元参与的长程终端基准用子任务给部分分

CodexQA 团队8 min read

46 题、17 个模型。0.95 阈值上 Grok 4.5 为 28.3%(13/46),模型平均 6.4%;满分阈值平均 3.2%。782 次运行里 491 次有部分分。未解原因的分母却写成 660。

In this piece

满分档平均只有 3.2%:腾讯混元参与的长程终端基准用子任务给部分分

腾讯混元大模型前沿(Tencent HY LLM Frontier)与马里兰大学等机构的预印本 Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading。arXiv 为 2607.08964v2。页面记录首次提交是 2026 年 7 月 9 日,v2 修订于 2026 年 7 月 13 日。许可证是 CC BY 4.0。作者以 Zongxia Li 起,邮箱同时写了 zli12321@umd.edu、zongxiali@global.tencent.com 和 zhongzhili@global.tencent.com。Long-Horizon-Terminal-Bench(下称 LHTB,把终端里的长任务拆成可检查的子任务再给部分分的基准)评的是 Agent 沿一条长命令序列能走多远,不只看最后过没过。

46 道题,平均 239 回合

LHTB 沿用 Terminal-Bench(把任务放进容器,只给自然语言指令和命令行环境的终端基准)的外形:每题是一条 Harbor 任务(用指令、Docker 镜像、配置和评分用的参考实现把终端任务装起来的格式)。Agent 只能在终端里读文件、改代码、跑脚本、看中间结果。和 Terminal-Bench 的过或不过不同,LHTB 把每题拆成少量有语义的子任务,用完成率给部分分。

论文写的规模是 46 题,跨实验复现、软件工程、多模态分析、交互游戏和科学计算等方向。引言和结论说是九类;第 2.4 节又写这 46 题跨 21 个高层类别,图 2 的说明仍是九个领域。最大的两组是交互游戏和多模态审计,没有单一类别占满整套题。任务例子包括材料相图审计、机器人 SLAM 流水线修复、气候 NetCDF 极端事件检测、音视频事件对齐、科学图数据重建、卫星洪水变化检测、显微细胞计数质检、扫描件表格重建。一部分专业流程题改编或受 APEX-Agents(另一套长程职业任务基准)启发,其余是新写的。

单次运行的均值:17 个模型合计,每题 9.8M token、239 个回合、88.9 分钟、约 10.8 美元。引言把超时写成 90 分钟。这些数被用来和 Terminal-Bench 2、SWE-Bench(用真实仓库 issue 看能不能改对的软件工程基准)对比,说明 LHTB 更长。论文没有把对照基准的回合数和分钟数列在同一张表里。

分数是加权子任务,过线默认 0.95

评分器在回合结束后于容器内运行,不把轨迹中途的每一步都打分。子任务 \(s_k\) 各有归一化分 \(r_k\in[0,1]\)。任务奖励是

\[R=\frac{\sum_k w_k r_k}{\sum_k w_k}\]

权重非负,默认相等,需要时给最终目标更高权重。证据只来自最终容器状态:文件、输出、测试结果或模拟器返回。三类子任务:

  1. 二元。单元测试是否全过、服务是否在预期端口响应、实验脚本是否无错退出。\(r_k\) 只取 0 或 1。
  2. 连续或阈值。复现指标在容差内给 1.0,误差变大则线性降到 0;或按与参考实现一致的留出样本比例给分。
  3. 跨回合汇总。游戏或重复审计里,成功旗标被触发的回合比例,或模拟器报告的平均归一化奖励。看的是多次里稳不稳,不是碰巧成一次。

报告用的 pass@1(单次尝试达到阈值的任务比例)默认是 \(R\ge 0.95\)。全文同时报 \(R\ge 0.9\)、\(R\ge 0.95\)、\(R\ge 1.0\) 和全部任务上的平均 \(R\)。\(R\ge 1.0\) 才算完全做完。

每题是一个故意写坏的、只能用终端修的项目。公开检查只验命令行行为、文件格式和少量简单例子,权重较低。大部分奖励在隐藏加压用例上:嵌套清单、gzip 加 base64、改字段名、缺值、注入噪声、旋转或裁切图像、异常帧、另一套坐标或时间维约定。官方金解必须在整套隐藏评分上拿到 1.0。靠写死输出或只补公开用例拿不了高分。

难度用 Deepseek-V4-Pro 在 1.5 小时预算下反复跑来标定,调到“难但原则上可解”。候选 120 题经过质量过滤后留下 46 题,全部是 Harbor 格式,共用一套 Agent 外壳。用来标定的 Deepseek-V4-Pro 后来也出现在被测名单里,论文没有单列这会不会把题校得对它更熟。

17 个模型,外壳并不完全相同

评测用 Harbor 框架配 Terminus-2(在一次长终端会话里发命令的 Agent 外壳)。例外是 GPT-5.3,改用 Codex(OpenAI 的编码 Agent 外壳)。结论里写的“共用 terminus-2”没有把这个例外再写一遍。

被测模型:GPT-5.6-sol、GPT-5.5、GPT-5.4、GPT-5.3 Codex、DeepSeek V4 Pro、Gemini 3.1 Pro、GLM 5.1、GLM 5.2、Kimi K2.6、Kimi K2.7 Code、MiniMax M3、Qwen3.7 Max、Qwen3.6 Plus、Doubao Seed 2.1 Pro(字节的豆包 Seed 编程模型)、Hy3(腾讯混元的模型)、Grok 4.20、Grok 4.5。共 17 个。指标是 pass@1、平均归一化奖励、回合数、耗时、按公开标价估的美元成本和每题 token。

0.95 档最高 28.3%,满分档会把多数模型打成 0

图 3 按 \(R\ge 0.95\) 的 pass@1 排序。Grok 4.5 最高,28.3%,即 13/46,平均奖励 \(R=0.51\)。GPT-5.6-sol 和 GPT-5.5 各 15.2%(7/46),GPT-5.6-sol 的平均奖励略高。MiniMax M3、Kimi K2.7 Code、DeepSeek V4 Pro 各 6.5%(3/46)。4.3% 这一档是 Qwen3.7 Max、Doubao Seed 2.1 Pro、Gemini 3.1 Pro、GLM 5.1、GPT-5.3 Codex。GLM 5.2、Qwen3.6 Plus、GPT-5.4、Hy3 各只做完 1 题。Kimi K2.6 和 Grok 4.20 在 \(R\ge 0.95\) 上是 0 题;Grok 4.20 的平均奖励 \(R=0.10\),是文中报出的最低。

摘要把 17 个模型的平均通过率写成:0.95 阈值 6.4%,1.0 阈值 3.2%。把阈值收到 \(R\ge 1.0\),17 个里有 10 个是 0 题。论文用这个落差说明:只看满分会把部分进度抹掉。

全部运行是 \(17\times 46\)。图 4 在这些运行上分桶:50 次达到 \(R\ge 0.95\),占 6.4%;241 次 \(R<0.05\),占 30.8%,算没有实质进度;剩下 491 次、62.8% 有部分分,二元评分会把它们和零进度记成同一种失败。其中 223 次(28.5%)达到 \(R\ge 0.5\)。区间 \([0.85,0.95)\) 有 68 次,仍多于满分通过的次数。近失(\(0.75\le R<0.95\))90 次,通过 50 次,近失几乎是通过的两倍。

同在“0.95 档只做完 1 题”的模型里,平均奖励从 GPT-5.4 的 0.27 到 GLM 5.2 的 0.32。通过率和平均奖励的 Spearman \(\rho=0.74\),正相关但不强,名次可以不一样:通过率看做完,平均奖励看没做完时走了多远。

Kimi K2.6 在 0.95 档是 0 题,但有 5 次近失,平均奖励 0.25。最接近的一次是 grammar-fuzz-coverage-hunt 上的 \(R=0.94\),另外 spot-scheduler-traces 0.90、poc-exploit-craft 0.89、nbody-accel-iterative 0.89。二元评分里它会和完全没进展的模型分不开。

贵不等于更接近做完

表 1 用每题 token 和 2026 年 6 月的公开标价估算成本,输入和输出都计入,提示缓存折扣不算,因为各家不保证。均值 9.79M token、239 回合、88.9 分钟、10.79 美元。

模型每题 token(M)每题回合每题分钟每题美元
Grok 4.58.9119774.910.95
GPT-5.6-sol4.3221471.321.14
GPT-5.54.1620872.921.00
MiniMax M320.2031490.06.13
Kimi K2.7 Code8.5418385.48.67
DeepSeek V4 Pro14.4532183.66.19
Qwen3.7 Max6.1321883.57.78
Doubao Seed 2.1 Pro5.8018391.75.16
Gemini 3.1 Pro3.5514885.07.44
GLM 5.15.8412092.65.46
GPT-5.3 Codex4.9930584.68.16
GLM 5.28.4319589.311.93
Qwen3.6 Plus8.6719488.64.47
Hy325.33435176.13.62
GPT-5.410.9030279.325.77
Kimi K2.610.2718892.59.94
Grok 4.2015.9533169.519.64
平均9.7923988.910.79

单题成本大约从 3.6 美元到 26 美元。Grok 4.5 通过率最高,大约 11 美元,不在最贵的一档。GPT-5.6-sol 和 GPT-5.5 大约 21 美元,通过率同为 15.2%。GPT-5.4 最贵,约 26 美元,通过率更低:它比 GPT-5.5 弱,但每题 302 回合,GPT-5.5 是 208 回合,单价接近,所以更贵且更低分。

帕累托前沿(在花费和通过率上没有另一点同时更便宜且更高分的那些模型)的低成本端是 Hy3,约 3.6 美元。Doubao Seed 2.1 Pro 约 5 美元、4.3%;MiniMax M3 约 6 美元、6.5%。Grok 4.5 把前沿拉到 28.3%、约 11 美元。DeepSeek V4 Pro 和 MiniMax M3 同为 6.5%,成本接近,论文把它放在前沿外侧。Kimi K2.7 Code、GPT-5.3 Codex、GLM 5.1、Gemini 3.1 Pro、Qwen3.7 Max、GLM 5.2、Kimi K2.6、Grok 4.20 是中低档:花费中等或偏高,做完率低。多花钱本身抬不高 0.95 档。

没做完的主因是时间到了,不是外壳报错

未解(\(R<0.95\))按结束原因拆开。超时:90 分钟到时 Agent 还在做。提前退出:Agent 自己停,外壳没有报错。外壳错误:API 或评分器一侧的非超时异常。

全部模型里,未解运行的 79%(518/660)是超时。这些超时的平均奖励只有 0.10 到 0.35,不是差一步。提前退出占未解的 19%,往往是还没满足隐藏评分器就停了。外壳错误 3%。论文把主瓶颈写成视野内做不完,而不是单步命令写错。Terminal-Bench 2.0 上多数试验不到 20 分钟,失败更多是没按规格做、重复步骤、漏了终止条件。LHTB 上更常见的是一串局部动作能接上,但在时限内交不出成品。因此名次里混着“单位时间能攒多少奖励”。少做重复探索、少在验证上打转,收益可能大于同等幅度的单步推理提升。论文没有做这个对照实验,只把它写成推论。

自己停下来的有 124 次。其中假完成定义为提前退出且 \(R\ge 0.75\):大部分做完了,自己判结束,时间还有剩。这样的运行有 14 次。例子:Kimi K2.7 Code 在 duckdb-optimizer-closure 上停在 0.92;GLM 5.2 在 apex-ib244-matter 上停在 0.90;七个不同模型在 apex-law433-matter 上停在 0.80 到 0.87,大约还剩 20 分钟。提前退出的平均奖励:Kimi K2.7 Code 0.51,MiniMax M3 0.42,其他模型约 0.22 到 0.39,Kimi K2.6 只有 0.11。前一组停得晚,后一组大部分工作还没做就放弃。

这些数不能被读成什么

28.3% 和 6.4% 是 \(R\ge 0.95\) 的任务比例或运行比例,不是 \(R\ge 1.0\) 的完全做完率。摘要里的 3.2% 才是满分阈值上的模型平均。50 次通过、241 次近零、491 次部分分,分母是 \(17\times 46=782\)。未解原因却写成 518/660。782 减 50 是 732,不是 660,中间 72 次运行没有进入这张拆分,论文没有解释。

表 1 里 Hy3 的每题 176.1 分钟、GLM 5.1 的 92.6、Doubao 的 91.7、Kimi K2.6 的 92.5,都高于正文写的 90 分钟超时。标定用的是 1.5 小时,评测写的是 90 分钟。两套时钟并在一起,超时占比不能脱离这个缺口来读。

GPT-5.3 用的是 Codex,不是 Terminus-2。它的 4.3% 和其他 16 个模型不是同一外壳。成本按 2026 年 6 月标价、不计提示缓存,换价目表名次里的美元会变,通过率不变。金解被要求隐藏分 1.0,但正文没有给出每题子任务个数和权重表。类别数在九和二十一之间前后不一致。稿面日期印着 2026 年 8 月 24 日,arXiv 页面的提交记录是 7 月 9 日、v2 为 7 月 13 日,本文用提交日。许可证是 CC BY 4.0。这篇只复述评测协议和文中数字。

出处:腾讯混元,Zongxia Li 等,Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading,2026-07-09,https://arxiv.org/abs/2607.08964

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction