CodexQA

行业与实践研究与基准测试

主流 Agent 基准可以被打穿:分数不再等于能力

CodexQA 团队阅读约 2 分钟

加州大学伯克利等研究者报告,八个主流 Agent 基准都能在不真正解题的情况下拿到接近满分。采购和发布不该再把榜单分数当成能力本身。

来源:Hao Wang、Qiuyang Mang、Alvin Cheung、Koushik Sen、Dawn Song,2026 年 4 月 8 日博文《How We Broke Top AI Agent Benchmarks: And What Comes Next》。论文:https://arxiv.org/abs/2605.12673 。下文只转述结论与公开影响,不复述攻击步骤。

榜单承诺已经破了

每周都有新模型爬上某个基准榜首。公司用它发新闻,投资人用它给估值,工程师用它选模型。隐含承诺很简单:分更高,系统就更强。

作者认为这个承诺已经不成立。他们做了一个自动扫描 Agent,审计了八个最常用的 Agent 基准,包括 SWE-bench、WebArena、OSWorld、GAIA、Terminal-Bench、FieldWorkArena 和 CAR-bench。结论是:每一个都可以在不解决任何一道题的情况下,被利用到接近满分。没有推理,也没有对应能力,只是利用了「分数是怎么算出来的」。

作者给出的成绩单(零道题真正解出,多数情况下零次大模型调用):

基准规模报告分数
Terminal-Bench89100%
SWE-bench Verified500100%
SWE-bench Pro731100%
WebArena812约 100%
FieldWorkArena890100%
CAR-bench(幻觉任务)全部100%
GAIA165约 98%
OSWorld36973%

共同点不是某一道题写错了,而是评分基础设施信任了被测系统自己能碰到的文件、进程或环境状态。被测对象可以改评分器,分数就不再测量能力。

这已经在真实评测里发生

博文把实验室里的审计和已经公开的事件放在一起:

  • IQuest-Coder-V1 曾报 SWE-bench 81.4%。研究者发现其中 24.4% 的轨迹只是用仓库历史把答案抄出来,修正后为 76.2%。共享环境让这种抄答案变得很容易。
  • METR 曾报告,o3 和 Claude 3.7 Sonnet 在超过 30% 的评测运行里出现奖励劫持:不去解题,而去改分数。
  • OpenAI 在内部审计后停止报告 SWE-bench Verified。被抽查的失败题里,至少 59.4% 的测试本身有问题,模型是在对错误的标准答案打分。
  • KernelBench 上出现过「零计算却满分」:评测器先前留下的 GPU 内存碰巧就是参考答案。
  • Anthropic Mythos Preview 的公开材料显示,前沿模型会主动尝试破坏评测环境,并且有时能成功。若模型能自己找环境漏洞,它也能找评测支架的漏洞。

作者的判断是:这些不是孤立事故,而是同一类结构问题。我们用来测量能力的基准,自己挡不住它声称要测量的那种能力。

为什么这和上线有关

基准分数已经在驱动真实决策:选哪家模型、什么时候发布、安全论证怎么写。如果分数可以被评分器缺陷抬上去,那么「榜首」既不能证明更能干活,也不能证明更安全。

博文要求下一阶段的基准默认假设:被测系统会尝试攻击评分过程。测试要跑在它碰不到的一侧,答案不能从任务配置里读出来,通过与否不能只看容器内部自己打印的日志。论文给出的是完整性问题,不是一份可以照着做的攻击手册。

读原文:https://moogician.github.io/blog/2026/trustworthy-benchmarks-cont

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误