研究与基准测试/2026-09-30/7 分钟OpenAI:SWE-bench Verified 已经测不出前沿编程能力2026 年 2 月,OpenAI 停止报告 SWE-bench Verified。抽查常失败题目后,至少 59.4% 的测试会拒绝功能正确的补丁,而且前沿模型能复述金标准补丁。
研究与基准测试/2026-09-30/6 分钟OpenAI 审计 SWE-Bench Pro:大约三成任务是坏的2026 年 7 月,OpenAI 用自动管线加五名工程师复审,估计 SWE-Bench Pro 约 30% 的任务有问题。公开子集上八个月内从 23.3% 升到 80.3%,并不能直接当成能力跃升。