OpenAI 审计 SWE - Bench Pro: 大约 三成 任务 是 坏 的
2026 年 7 月,OpenAI 用自动管线加五名工程师复审,估计 SWE-Bench Pro 约 30% 的任务有问题。公开子集上八个月内从 23.3% 升到 80.3%,并不能直接当成能力跃升。

来源:OpenAI,2026 年 7 月 8 日《Separating signal from noise in coding evaluations》。
准确测量能力,关系到部署和安全决策,包括 Preparedness Framework 下的决策。每次发布都会报告一批外部和内部基准。评测若有影响结果的缺陷,就会给能力一种虚假的理解,歪曲安全论证,也扭曲研究优先级。
在此之前,OpenAI 已经说明 SWE-bench Verified 因设计和污染问题不再提供有意义的软件开发信号,并建议社区改用 SWE-Bench Pro。Pro 的设计意图是用更长程、更真实的编码任务改进 Verified:题目仍从一批公开和私有仓库的功能变更历史里程序化抽取,模型要实现能通过新测试的解法,同时不破坏既有功能。731 题的公开子集上,前沿模型的通过率在八个月内从 23.3% 升到 80.3%。
审计怎么做
作者用一条数据点分析管线复审数据集。管线查看模型的作答尝试、题目元数据和失败轨迹,标出可能的评测缺陷。每道被标出的题再经过多轮调查 Agent,并由五名有经验的软件工程师独立复审,分歧升级后再查。
管线标出 200 道坏题,占 27.4%。人工标注活动认定 249 道,占 34.1%。综合之后,作者估计大约 30% 的 SWE-Bench Pro 任务是坏的。
问题主要落在四类:
- 测试过严:强制提示里没写的实现细节,从而判掉许多功能正确的提交。
- 提示不足:漏掉隐藏测试所要求、且无法合理推断出来的需求。
- 测试覆盖过低:要求的功能查得不够,不完整的修复也能通过。
- 提示误导:把模型指向错误行为,或与测试要求互相矛盾。
怎么用这个结论
作者认为,这说明做出「难、但公平」的基准很难,也说明 Agent 已经能用来做可扩展的数据质量检查。八个月内从两成出头升到八成,不能全部记成模型变强。其中有一部分是题目在奖励或惩罚与提示不一致的行为。
和 2 月停用 Verified 的文章放在一起,OpenAI 的编码评测立场是:先审计题目是否在测它声称要测的行为,再解释模型分差。分差很大时,尤其要先怀疑测试和提示,而不是先写进能力曲线。
原文:https://openai.com/index/separating-signal-from-noise-coding-evaluations/
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。