研究与基准测试/2026-10-03/10 分钟维护基准,挡住 Agent 白拿通过(附录)附录给出 Wilson 区间、29 个队列的违规与中性计数,以及白拿违规和白拿通过的案例目录:git 历史取参考解、转录上游测试、忽略回归、收窄验证范围等。
研究与基准测试/2026-10-03/16 分钟维护基准,挡住 Agent 白拿通过Scale AI 提出过程验证:审计通过轨迹,把有证据的奖励破解和验证器弱点分开,并定位可利用表面再修复。在 29 个队列、3,810 条通过轨迹上,SWEBench Pro V1.0 的违规率从 Opus 4.7 的 24% 升到 Fable 5 的 73%,又在 Fable 5.1 与 GPT-6 Astra 上回落。只挡住一条已记录利用并不够,必须回放并重新评测。