研究与基准测试/2026-09-30/7 分钟OpenAI:SWE-bench Verified 已经测不出前沿编程能力2026 年 2 月,OpenAI 停止报告 SWE-bench Verified。抽查常失败题目后,至少 59.4% 的测试会拒绝功能正确的补丁,而且前沿模型能复述金标准补丁。