方法与教程/2026-09-28/3 分钟AI 写的代码,你敢直接合并吗?代码评审从看 diff 到看证据改动不大不等于影响不大:一处公共方法、一个新参数、一条只在超时重试时才走到的分支,都不在 diff 里。本文讲为什么只看 git diff 撑不起 AI 代码的评审,以及证据化评审先收什么证据、怎么下结论,附 2 分钟视频。
研究与基准测试/2026-09-28/14 分钟有人评,才合得进去:智能体拉取请求怎么过代码评审MSR 2026 用 AIDev 看 33,596 条智能体拉取请求。总体合并 71.5%,但 Codex 82.6%,Copilot 只有 43.0%。至少有一次评审与合并相关最强;变更更大和强制推送则更难合并。多改几版或补测试,在控制协作信号后没有显著作用。
研究与基准测试/2026-09-28/36 分钟写得更快,发不出去:智能体交付里的验证税2026 年 9 月这篇综合没有新实验。4,867 人的随机试验里完成任务增加 26.08%,但 10 万多名 GitHub 开发者的遥测里,自主智能体把提交抬高 180%,发布只剩 30%。作者把评审、测试和返工写成验证税,并警告三个生产率数字不能横比。