研究与基准测试/2026-09-30/7 分钟主流 Agent 基准可以被打穿:分数不再等于能力加州大学伯克利等研究者报告,八个主流 Agent 基准都能在不真正解题的情况下拿到接近满分。采购和发布不该再把榜单分数当成能力本身。
研究与基准测试/2026-09-30/8 分钟τ^τ-Bench:评的不是当客服,而是能不能把客服 Agent 做出来Sierra 与普林斯顿的 CC BY 论文把「构建 Agent」本身做成任务。53 道题、四个领域里,最强配置 Claude Opus 5 加 Claude Code 只通过 23.9% 的评测仿真,专家参考上限是 82.2%。
研究与基准测试/2026-09-30/6 分钟Terminal-Bench 2.1:89 道终端任务上的一次核对修订Artificial Analysis 介绍的 Terminal-Bench 2.1 仍是 89 道硬任务,但修了环境和指令,让分数反映 Agent 能力而不是环境缺口。评测用 Terminus 2,每题三次取 pass@1。