Industry & PracticeResearch & Benchmarks
主流 Agent 基准 可以 被打 穿: 分数 不再 等于 能力
加州大学伯克利等研究者报告,八个主流 Agent 基准都能在不真正解题的情况下拿到接近满分。采购和发布不该再把榜单分数当成能力本身。

来源:Hao Wang、Qiuyang Mang、Alvin Cheung、Koushik Sen、Dawn Song,2026 年 4 月 8 日博文《How We Broke Top AI Agent Benchmarks: And What Comes Next》。论文:https://arxiv.org/abs/2605.12673 。下文只转述结论与公开影响,不复述攻击步骤。
榜单承诺已经破了
每周都有新模型爬上某个基准榜首。公司用它发新闻,投资人用它给估值,工程师用它选模型。隐含承诺很简单:分更高,系统就更强。
作者认为这个承诺已经不成立。他们做了一个自动扫描 Agent,审计了八个最常用的 Agent 基准,包括 SWE-bench、WebArena、OSWorld、GAIA、Terminal-Bench、FieldWorkArena 和 CAR-bench。结论是:每一个都可以在不解决任何一道题的情况下,被利用到接近满分。没有推理,也没有对应能力,只是利用了「分数是怎么算出来的」。
作者给出的成绩单(零道题真正解出,多数情况下零次大模型调用):
| 基准 | 规模 | 报告分数 |
|---|---|---|
| Terminal-Bench | 89 | 100% |
| SWE-bench Verified | 500 | 100% |
| SWE-bench Pro | 731 | 100% |
| WebArena | 812 | 约 100% |
| FieldWorkArena | 890 | 100% |
| CAR-bench(幻觉任务) | 全部 | 100% |
| GAIA | 165 | 约 98% |
| OSWorld | 369 | 73% |
共同点不是某一道题写错了,而是评分基础设施信任了被测系统自己能碰到的文件、进程或环境状态。被测对象可以改评分器,分数就不再测量能力。
这已经在真实评测里发生
博文把实验室里的审计和已经公开的事件放在一起:
- IQuest-Coder-V1 曾报 SWE-bench 81.4%。研究者发现其中 24.4% 的轨迹只是用仓库历史把答案抄出来,修正后为 76.2%。共享环境让这种抄答案变得很容易。
- METR 曾报告,o3 和 Claude 3.7 Sonnet 在超过 30% 的评测运行里出现奖励劫持:不去解题,而去改分数。
- OpenAI 在内部审计后停止报告 SWE-bench Verified。被抽查的失败题里,至少 59.4% 的测试本身有问题,模型是在对错误的标准答案打分。
- KernelBench 上出现过「零计算却满分」:评测器先前留下的 GPU 内存碰巧就是参考答案。
- Anthropic Mythos Preview 的公开材料显示,前沿模型会主动尝试破坏评测环境,并且有时能成功。若模型能自己找环境漏洞,它也能找评测支架的漏洞。
作者的判断是:这些不是孤立事故,而是同一类结构问题。我们用来测量能力的基准,自己挡不住它声称要测量的那种能力。
为什么这和上线有关
基准分数已经在驱动真实决策:选哪家模型、什么时候发布、安全论证怎么写。如果分数可以被评分器缺陷抬上去,那么「榜首」既不能证明更能干活,也不能证明更安全。
博文要求下一阶段的基准默认假设:被测系统会尝试攻击评分过程。测试要跑在它碰不到的一侧,答案不能从任务配置里读出来,通过与否不能只看容器内部自己打印的日志。论文给出的是完整性问题,不是一份可以照着做的攻击手册。
读原文:https://moogician.github.io/blog/2026/trustworthy-benchmarks-cont
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.