CodexQA

行业与实践研究与基准测试

OpenAI:SWE-bench Verified 已经测不出前沿编程能力

CodexQA 团队阅读约 2 分钟

2026 年 2 月,OpenAI 停止报告 SWE-bench Verified。抽查常失败题目后,至少 59.4% 的测试会拒绝功能正确的补丁,而且前沿模型能复述金标准补丁。

来源:OpenAI,2026 年 2 月 23 日《Why SWE-bench Verified no longer measures frontier coding capabilities》。

SWE-bench Verified 自 2024 年 8 月发布后,被广泛用来衡量模型在自主软件工程上的进展,也写进多次前沿模型发布。OpenAI 的 Preparedness Framework 同样依赖对这类能力的跟踪。Verified 当初是为了修原始 SWE-bench 里一批无法完成的题。

最初的跃升过去之后,前沿成绩慢了下来:最近六个月只从 74.9% 升到 80.9%。剩下的失败,到底是模型不行,还是数据集本身的问题?

两个使它不再适合前沿发布的问题

第一,测试会拒绝正确解法。作者审计了数据集中模型经常解不出的 27.6% 子集,发现其中至少 59.4% 的题有缺陷测试:功能上正确的提交会被判失败。这是在当初已经尽量清洗之后仍然存在的问题。

第二,训练见过题和答案。前沿模型会从训练数据里记住信息,因此不能在评测题及其解法上训练。这和考前把题目和答案发给学生类似:不一定背下来,但见过的人会更好。SWE-bench 的题来自开源仓库,而很多模型方用这些仓库做训练。分析发现,所有被测前沿模型都能复现一部分题的人类金标准补丁,或逐字复现问题陈述中的细节,说明它们至少见过其中一些题和解法。

作者还看到:训练时见过这些题的模型更容易成功,因为它们多掌握了通过那些「写得不够明确的测试」所需的信息。

因此,Verified 上的提升不再反映真实软件开发能力的提升,而越来越反映模型在训练时接触这个基准的程度。OpenAI 已停止报告该分数,并建议其他模型方也停止。在新的未污染评测做好之前,他们建议改报 SWE-bench Pro。

这个基准原来怎么打分

原始 SWE-bench 于 2023 年发布。每道题来自 12 个开源 Python 仓库之一里已解决的 GitHub issue,并配上对应的拉取请求。判定对错靠两组测试:一组在未修改的代码上失败、正确修复后通过;另一组是回归测试,修复前后都应通过,用来保证无关功能还在。模型看不到测试,只能根据 issue 原文和修复前的仓库状态提交代码变更。

Verified 是为了去掉「题本身做不成」而做的人工筛选子集。OpenAI 现在的结论是:筛选没有挡住错误测试,也没有挡住训练污染。分数靠近天花板时,这两种噪声会盖过能力信号。

原文:https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误