研究与基准测试/2026-08-05/10 分钟说得清楚不等于查得对:腾讯 RepoProbe 用清单给仓库问答打分500 道 GitHub Discussions 改写题,10 分清单。GPT-5.2 总分 62.7%,完美求解率最高的 Claude Opus 4.6 也只有 27.5%。清晰分一律高于知识分。
研究与基准测试/2026-07-26/9 分钟三次都改对才算稳:腾讯 E-Bench 用数据库差异评多步工具323 道合成任务,三次尝试,没有部分分。Kimi-K3 的 Avg@3 是 73.79%,但三次都成功只有 58.82%。加上代码执行后 Opus-4.8 升到第一,最好的三次全过仍是 68.66%。