Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “代码评审”
Techniques & Tutorials//3 min
改动不大不等于影响不大:一处公共方法、一个新参数、一条只在超时重试时才走到的分支,都不在 diff 里。本文讲为什么只看 git diff 撑不起 AI 代码的评审,以及证据化评审先收什么证据、怎么下结论,附 2 分钟视频。
Research & Benchmarks//14 min
MSR 2026 用 AIDev 看 33,596 条智能体拉取请求。总体合并 71.5%,但 Codex 82.6%,Copilot 只有 43.0%。至少有一次评审与合并相关最强;变更更大和强制推送则更难合并。多改几版或补测试,在控制协作信号后没有显著作用。
Research & Benchmarks//36 min
2026 年 9 月这篇综合没有新实验。4,867 人的随机试验里完成任务增加 26.08%,但 10 万多名 GitHub 开发者的遥测里,自主智能体把提交抬高 180%,发布只剩 30%。作者把评审、测试和返工写成验证税,并警告三个生产率数字不能横比。