研究与基准测试/2026-09-30/6 分钟OpenAI 审计 SWE-Bench Pro:大约三成任务是坏的2026 年 7 月,OpenAI 用自动管线加五名工程师复审,估计 SWE-Bench Pro 约 30% 的任务有问题。公开子集上八个月内从 23.3% 升到 80.3%,并不能直接当成能力跃升。