研究与基准测试/2026-10-07/6 分钟METR 对 Claude Opus 5.5 的部署前评测摘要METR 在 10 个工作日的 API 访问里,用五项长程任务初步评测 Claude Opus 5.5。结论是:相对 Fable 5.1 只有适度增量,不太可能完全自动化 AI 研发;模型开发本身至少被 AI 加速了一些,但不太可能已被大幅加速。