研究与基准测试/2026-08-11/8 分钟同一模型 SEM-F1 从 11.57% 到 25.10%:阿里把代码评审的自由探索收成三道门阿里 OpenCodeReview 在 AACR-Bench 的 200 个 PR、1505 条专家评论上,六个底座的 SEM-F1 是 17.90% 到 25.10%。同一 Claude-4.6-Opus 在 Claude Code 上只有 11.57%。召回多数行更低。相对 Claude Code 的 Token 大约少 5 到 15 倍,相对 Codex 只有约 1.24 倍。