研究与基准测试/2026-09-28/14 分钟有人评,才合得进去:智能体拉取请求怎么过代码评审MSR 2026 用 AIDev 看 33,596 条智能体拉取请求。总体合并 71.5%,但 Codex 82.6%,Copilot 只有 43.0%。至少有一次评审与合并相关最强;变更更大和强制推送则更难合并。多改几版或补测试,在控制协作信号后没有显著作用。
研究与基准测试/2026-09-28/36 分钟写得更快,发不出去:智能体交付里的验证税2026 年 9 月这篇综合没有新实验。4,867 人的随机试验里完成任务增加 26.08%,但 10 万多名 GitHub 开发者的遥测里,自主智能体把提交抬高 180%,发布只剩 30%。作者把评审、测试和返工写成验证税,并警告三个生产率数字不能横比。