研究与基准测试/2026-10-10/16 分钟研究更新:算法评估与整体评估METR 用 18 项真实开源任务对照两种评分:Claude 3.7 Sonnet 按维护者测试的成功率是 38%,15 次人工复核里没有一次能按原样合并。算法评分高估了智能体的整体可用性。