CodexQA

Industry & PracticeResearch & Benchmarks

同一模型 SEM-F1 从 11.57% 到 25.10%:阿里把代码评审的自由探索收成三道门

CodexQA 团队4 min read

阿里 OpenCodeReview 在 AACR-Bench 的 200 个 PR、1505 条专家评论上,六个底座的 SEM-F1 是 17.90% 到 25.10%。同一 Claude-4.6-Opus 在 Claude Code 上只有 11.57%。召回多数行更低。相对 Claude Code 的 Token 大约少 5 到 15 倍,相对 Codex 只有约 1.24 倍。

In this piece

同一模型 SEM-F1 从 11.57% 到 25.10%:阿里把代码评审的自由探索收成三道门

阿里云与南京大学、北京大学的 OpenCodeReview(把代码评审 Agent 的选文件、查上下文和过滤评论收成三道确定性步骤),arXiv v2 日期 2026-08-11(2608.09290)。通讯作者 Zhengfeng Li(lizhengfeng.lzf@alibaba-inc.com,阿里巴巴集团)。代码在 https://github.com/alibaba/open-code-review 。许可证是 CC BY 4.0。

SEM-F1 是和专家评论做语义匹配后的 F1,不是「评论写得像不像人」。AACR-Bench(多语言真实 PR 评审集)有 200 个真实 PR、10 种语言、50 个仓库、1505 条专家核过的评论。标注经过 80 多名资深工程师三轮交叉核对。语义裁判每个配置跑 5 次,报平均。

对照是带评审能力的 Claude Code 和 Codex,不是另写一个小脚本。六个底座:Claude-4.6-Opus、Qwen3.7-Max、GPT-5.5、Claude-4.8-Opus、Deepseek-V4-Pro、GLM-5.1。GPT-5.5 的对照是 Codex,其余五行的对照是 Claude Code。

三道门

Rule-Guided Dispatch:用多层规则决定看哪些文件、用什么标准,不让模型自己挑文件。单文件超过上下文窗口 80% 的会被滤掉。利用率到 60% 时后台异步压缩,到 80% 时同步强制摘要。

Grounded File Review:不用自由 shell。工具收成 file_read、file_find、code_search、file_read_diff、code_comment、task_done,输出有上限,走 ReAct。多文件用文件级并行 SubAgent,跨文件依赖按需补。

Independent Reflection:反思器只看 diff,看不到审查 Agent 用工具查出的材料。它只做证伪、只删不写。设计意图是抬精确率、保住召回。表 3 里召回大多没保住,见下节。

AACR-Bench 主表

分母:精确率的分母是系统吐出的评论数,召回的分母是 1505 条专家评论。

底座系统SEM-F1精确率命中/输出召回命中/1505Token时间
Claude-4.6-OpusOpenCodeReview25.10%33.90%301/88920.00%301/1505385K1 分 23 秒
Claude-4.6-OpusClaude Code11.57%7.23%435/598028.90%435/15055,664K13 分 06 秒
Qwen3.7-MaxOpenCodeReview21.20%25.20%276/109618.30%276/1505625K4 分 41 秒
Qwen3.7-MaxClaude Code12.17%8.23%351/426023.37%351/15055,153K8 分 06 秒
GPT-5.5OpenCodeReview21.00%32.10%234/72815.50%234/1505422K2 分 51 秒
GPT-5.5Codex8.36%27.82%74/2664.92%74/1505525K2 分 58 秒
Claude-4.8-OpusOpenCodeReview17.90%37.80%176/46511.70%176/1505352K1 分 06 秒
Claude-4.8-OpusClaude Code14.13%15.93%191/120012.70%191/15052,062K5 分 38 秒
Deepseek-V4-ProOpenCodeReview17.90%30.60%191/62412.70%191/1505394K6 分 28 秒
Deepseek-V4-ProClaude Code10.93%8.27%243/294516.13%243/15055,450K14 分 24 秒
GLM-5.1OpenCodeReview20.40%28.90%237/82015.70%237/1505743K4 分 11 秒
GLM-5.1Claude Code11.93%8.37%313/374220.80%313/15054,038K14 分 10 秒

OpenCodeReview 的 SEM-F1 从 17.90% 到 25.10%。Claude Code 从 10.93% 到 14.13%。Codex 只有一行,8.36%。最高是 Claude-4.6-Opus 上的 25.10% 对同一模型 Claude Code 的 11.57%,25.10/11.57=2.17 倍。这个模型在 Claude Code 里接近该对照的底部,不是顶部。

精确率:OpenCodeReview 25.20% 到 37.80%。Claude Code 7.23% 到 15.93%。Codex 27.82%,高于好几行 OpenCodeReview 的精确率,但召回只有 4.92%。Claude Code 最高召回是 Claude-4.6-Opus 的 28.90%,靠 5980 条评论里只对上 435 条,精确率掉到 7.23%。

召回并没有普遍保住。相对各自对照,OpenCodeReview 的召回:Claude-4.6-Opus 20.00% 低于 28.90%,Qwen3.7-Max 18.30% 低于 23.37%,Claude-4.8-Opus 11.70% 低于 12.70%,Deepseek-V4-Pro 12.70% 低于 16.13%,GLM-5.1 15.70% 低于 20.80%。只有 GPT-5.5 对 Codex 是 15.50% 高于 4.92%。「只过滤、保住召回」是设计说法,主表多数行召回更低、精确率更高。

Token:相对 Claude Code,Claude-4.6-Opus 是 5,664K 对 385K(约 14.7 倍),Qwen 约 8.2 倍,Claude-4.8-Opus 约 5.9 倍,Deepseek 约 13.8 倍,GLM 约 5.4 倍。摘要写的 5–15 倍对得上这五行。对 Codex 不是:422K 对 525K,大约 1.24 倍,时间 2 分 51 秒对 2 分 58 秒,几乎一样。不能把 5–15 倍说成对所有对照都成立。

最低的两行 OpenCodeReview 都是 17.90%(Claude-4.8-Opus 和 Deepseek-V4-Pro),都高于 Claude Code 最高的 14.13%。论文据此说系统设计比换模型更顶事。六个底座仍然差 7.2 个百分点(25.10 对 17.90),模型不是没差别。

限制

论文自己的效度节写了三件事。内部:Agent 仍然非确定,他们用同一套采样参数,语义裁判跑 5 次取平均,只能保证相对比较用的是同一个匹配器。外部:AACR-Bench 盖不住领域专用语言和结构异常的仓库;对照只有 Claude Code 和 Codex 两套。构念:SEM-F1 不算可执行性、清楚程度和严重级别;一条真有用但没对上标准评论的话,会被算成假阳性。没有消融表把三道门拆开。45.2% 合并率是文中引用的别人部署数据,不是这张主表。没有线上拦截率或合并率。

阿里巴巴集团、南京大学、北京大学,Zhengfeng Li、Lei Zhang、Xianwei Wu、Zhengqi Zhuang、Yingjie Xu、Boge Wang、Shaofei Zhu、Chuan Wang、Peng Zhao、Xinyu Zheng、Guoping Rong,OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review,2026-08-11,https://arxiv.org/abs/2608.09290

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction