OpenQA

Industry & PracticeResearch & Benchmarks

从补全到委派:智能体进入软件生命周期

智测团队 · OpenQA(openqa.cn)12 min read

这是一篇综述,不是新实验。它把 SWE-bench Verified 从 2023 年 10 月的 1.96% 汇编到 2026 年春 Claude Opus 4.7 的 78.4%,并认为增益主要来自脚手架而不是模型变大。传统生命周期对照成智能体生命周期之后,人的位置改到意图、评审和批准。

In this piece

本文是论文 Agentic AI in the Software Development Lifecycle: Architecture, Empirical Evidence, and the Reshaping of Software Engineering(arXiv:2604.26275)的中文译文,由智测团队翻译。作者是东北大学的 Happy Bhati。参考文献未逐条展开。这是综述,不是新实验。文中的 SWE-bench 分数、生产率和经济数字都是汇编已发表报告,多处标明为大约值。

引言

2021 年 GitHub Copilot 发布,是多数软件工程师第一次在日常工作流里碰到生成式人工智能。Copilot 以及后来的 Tabnine、Codeium、Amazon CodeWhisperer,都是编辑器里的补全:人写,模型建议,人接受或拒绝。认知契约清楚:人仍是工程师,模型是带判断的自动补全。

五年后,这份契约被大幅改写。Anthropic 的 Claude Code、OpenAI 的 Codex CLI、Google 的 Jules、Cognition 的 Devin,以及开源的 OpenHands 和 SWE-agent,与其说是在补全代码,不如说是在做工程:读仓库、跨多个文件订计划、执行外壳命令、跑测试、看失败、改做法,然后交出一次已提交的变更。Anthropic 报告,其内部现在写出的多数代码由 Claude Code 产生。在普林斯顿的 SWE-bench Verified 上,前沿系统从 2023 年 10 月的 1.96%,到 2026 年春大约 78%。

这不只是数量变化。它改变工程师一天在做什么、软件生命周期产出什么制品、哪些技能有工资溢价。它也提出治理问题:确定性、可审计性、安全和知识产权。这个学科还没有完全消化。

贡献有四条。第 2 节综合工业实验室和学术团体在智能体编码上的主要工作。第 3 节提出六层参考架构。第 4 节对照传统软件开发生命周期和智能体软件开发生命周期(A-SDLC)。第 5、6 节汇总性能和劳动力市场证据。第 7 节指出五项近期研究议程上的开放问题。

背景与相关工作

从代码补全到能动性

最早基于大模型的编码工具,在大量公开源码上训练,用 HumanEval 和 MBPP 评测。这两个基准测的是根据文档字符串合成单个函数。它们很快饱和:到 2024 年,前沿模型在 HumanEval 上的 pass@1 超过 90%。单函数评测饱和之后,普林斯顿的 Jimenez 等人在 2023 年 10 月提出 SWE-bench:2,294 个 GitHub Issue,来自十二个成熟的 Python 仓库。系统必须在真实代码库里导航、找到相关文件、写出解决该 Issue 的补丁,并通过项目的隐藏测试套件。原始报告发现,无论有没有检索增强,没有任何系统能解决超过大约 2% 的 Issue。

性能天花板被打破,不是因为模型变大,而是因为外面的脚手架变了。同一组在 NeurIPS 2024 提出 SWE-agent:一套定制的智能体–计算机接口,用结构化命令做导航、编辑和测试。即使用同一个底层模型,解决率也升到 12.5%。自此,这个领域的组织原则是:给智能体设计的接口,和模型能力一样重要。

图 1 画出 2023 年 10 月到 2026 年 4 月,SWE-bench Verified 上的 Issue 解决率。智能体系统(实线)复合式上升;非智能体、基于检索增强的大模型(虚线)在大约 20% 附近平台化。

工业前沿系统

Anthropic。Claude Code 在 2025 年初与 Claude 3.7 Sonnet 一起作为研究预览发布。它在项目粒度上工作:读整个代码库、跨文件计划变更、执行外壳命令、跑测试、再迭代。Anthropic 报告 Claude Opus 4.7 在 SWE-bench Verified 上领先,为 78.4%。产品把自己定位成委派接口:工程师定目标、审结果,而不是逐步引导。

OpenAI。贡献呈括号形。2021 年最初的 Codex 论文提出 HumanEval。2024 年 OpenAI 与 SWE-bench 作者合作发布 SWE-bench Verified,489 个任务的子集,按可解性和清晰度过滤。到 2026 年,GPT-5.4-Codex 驱动的 Codex CLI 与 Claude Code 直接竞争,在 Terminal-Bench 2.0 和 SWE-bench Pro 上取得高分。

Google DeepMind。2025 年 5 月公布的 AlphaEvolve 是另一种智能体编码。它不解决 GitHub Issue,而用进化循环:Gemini Flash 和 Pro 组成的集合提出程序变体,自动评估器打分,最好的进入下一代。AlphaEvolve 发现了一种新的 4×4 复矩阵乘法,用 48 次标量乘法,改进了 Strassen 1969 年的结果;在五十个开放数学问题里推进了 20%;在 Google 数据中心收回 0.7% 的算力;把训练 Gemini 自身的 FlashAttention 内核加速 23%。

Cognition / Devin。2024 年 3 月演示的 Devin,是第一个把「人工智能软件工程师」这个说法做成商业产品并普及的系统。它在带浏览器、终端和编辑器的沙箱云虚拟机里运行,任务从 Slack、Jira 或网页界面派发。Devin 当初的 SWE-bench 头条数字已被前沿模型智能体超过,但它确立了后来商业和开源竞争者都跟随的模式。

Microsoft / GitHub。微软研究院做了最早一批关于 Copilot 的严格生产率研究。对照实验里,用 Copilot 的开发者完成一个 JavaScript HTTP 服务器任务,比对照组快 55.8%。对 934,533 名 Copilot 用户的后续分析发现,建议接受率大约 30%,并投影到 2030 年累计 1.5 万亿美元的 GDP 影响。微软基于 Azure 的智能体软件开发生命周期参考架构,把分阶段的专门智能体由一个核心编排器协调。

学术与开源

学术文献扩张很快。MetaGPT 和 ChatDev 都把软件开发编码成多智能体过程。MetaGPT 实例化产品经理、架构师、工程师和质量保障角色,按标准作业程序运转。ChatDev 把虚拟软件公司建模成智能体通过聊天链沟通。AgileCoder 用冲刺和动态代码依赖图扩展这些想法。OpenHands(原名 OpenDevin)是主要的开源通用平台,提供 Docker 沙箱执行环境,支持多种大模型后端。AutoCodeRover 和 HyperAgent 专做仓库级程序修复。近期综述沿规划、记忆、工具增强和自我反思来组织这些工作。

智能体软件工程的参考架构

跨不同系统,作者观察到反复出现的分层,组织成六层,见图 3。依赖向上,反馈向下。

L0,基础模型。提供推理和代码生成能力。当时锚定前沿的是 Claude Opus 4.7、GPT-5.4 和 Gemini 3.1 Pro。开源权重模型(Llama、DeepSeek、Qwen-Coder)用于自托管。

L1,推理、记忆、自我反思。认知脚手架:思维链和 ReAct 式规划,短期和长期记忆(包括 Claude Opus 4 原生产出的「记忆文件」),以及自我批评循环。自我反思在很大程度上解释了零样本模型准确率与智能体解决率之间的差距。

L2,智能体–计算机接口。把大模型的文本词元输出翻译成对真实计算机的具体操作。普林斯顿小组的核心发现是:接口设计质量在经验上和模型规模一样重要。

L3,工具与环境。文件系统和编辑器操作、外壳与进程管理、网页浏览、测试运行器和编译器,以及与版本控制和持续集成的集成。

L4,编排。两种主导模式并存。单智能体循环(SWE-agent、Claude Code)维持一个认知中心。多智能体系统(MetaGPT、ChatDev、AgileCoder、AgentMesh)把工作分解给按角色专门化的智能体。

L5,治理与安全。权限边界、沙箱、审计日志,以及对敏感操作的策略。作者在第 7 节认为,L5 目前最不成熟,并正在成为企业部署的瓶颈。

图 2 对照传统软件开发生命周期和智能体软件开发生命周期。在后者里,编排器协调专门子智能体,人在意图、评审和批准关口上监督。

从传统生命周期到智能体生命周期

经典生命周期,无论瀑布、迭代还是敏捷,都预设行为在构建时被完全规定,并在发布前验证。智能体系统以两种方式打破这个假设。第一,系统本身是随机的:提示漂移、上下文截断和模型更新,会在名义上相同的输入下产生非确定行为。第二,开发过程也变成随机的:同一任务,智能体在不同次运行里可能走不同路径。

作者沿近期行业框架,把智能体软件开发生命周期,和仅仅被人工智能助手加速的增强型生命周期区分开。表 1 是分阶段对照。

阶段传统智能体生命周期
需求分析师写规格,干系人评审意图规格;智能体起草规格
设计架构师产出图和架构决策记录智能体提议并互评;人来选择
实现工程师逐文件写代码编码智能体执行计划;人来评审
测试质量保障编写并运行测试测试智能体生成套件;在沙箱里跑
部署手工或流水线提升持续集成智能体设门;人批准生产
维护值班、工单、热修复监控智能体分诊;修复智能体打补丁
关键指标周期时间、缺陷率接受率、升级质量

三个结构差别值得强调。第一,工作单元变小:不再估两周冲刺,而是把工作划成智能体能在几分钟到几小时内完成的任务,人在边界上评审。第二,开发者的角色从生产转到编排、评审和指导,更接近高级工程师或技术负责人,而不是个人贡献者。第三,行为指标——智能体接受率、升级质量、监督负担——挤占但并不完全取代周期时间和缺陷率这类过程指标。

经验证据

能力

图 1 画出 2023 年 10 月到 2026 年 4 月,每个时点上占主导的智能体系统在 SWE-bench Verified 上的解决率。轨迹近似逻辑斯蒂:1.96%(检索增强基线),12.5%(SWE-agent),33.2%(围绕 Sonnet 3.5 的第一套 Anthropic 脚手架),49%(新的 Claude 3.5 Sonnet),62.3%(Claude 3.7 Sonnet 加 Claude Code),72.7%(Claude Sonnet 4),78.4%(Claude Opus 4.7)。非智能体的前沿系统在大约 20% 附近平台化,说明增益主要由脚手架主导,而不是原始模型能力。

图 5 把主要系统放在能力–自主性平面上。前沿目前由实验室的智能体栈锚定:Claude Code、GPT-5.4 加 Codex CLI、Gemini 3.1 Pro 加 Jules。AlphaEvolve 不在 SWE-bench 前沿上,因为它对准的是算法发现。

生产率

证据分三档。对照实验报告的效应最大:Peng 等人发现,在 JavaScript HTTP 服务器任务上,完成时间减少 55.8%。Brandebusemeyer 等人发现,适度使用 Copilot 提高效率,过度使用会侵蚀好处。现场实验:Cui 等人观察到,微软每周拉取请求多 12.92% 到 21.83%,埃森哲多 7.51% 到 8.69%。纵向团队研究发现,即便提交指标持平,团队表现和感知到的效率仍上升。

这些数字要和两条警示一起读。第一,近期工作认为,人工智能辅助的代码可能增加长期技术债。第二,生产率收益分布不均:有经验的 Claude 用户比新手成功得多,说明学习曲线会放大已有的技能分布。

采用与劳动力市场信号

Anthropic 的季度经济指数是最系统的公开使用数据。截至 2026 年 2 月,计算机和数学任务约占 Claude.ai 对话的 35%,并占接口流量的近一半。样本中 49% 的工作里,Claude 被用于至少四分之一的任务,高于 2025 年 1 月的 36%。但若按有效覆盖加权,软件开发者受到的影响相对小于朴素的任务覆盖所暗示的。这个反直觉的发现,来自开发者实际委派出去的任务很难。

劳动力市场分析发现,截至 2026 年初,高暴露职业里没有清楚的失业信号,但 22 到 25 岁工人进入暴露最高岗位的招聘,相对反事实放慢了大约 14%。另一项调查有 8.1 万名受访者,暴露于人工智能的工作中大约五分之一的工人表达了对经济替代的担心;软件工程师在最担心的人群之中。

前沿项目的比较

表 2 概括各主要项目大约在 2026 年 4 月的姿态。SWE-bench Verified 数字是大约值。

项目旗舰侧重点SWE-bench Verified
AnthropicClaude Code(Opus 4.7)委派、记忆、安全约 78%
OpenAICodex CLI(GPT-5.4)通用智能体能力约 73%
DeepMindAlphaEvolve 加 Jules进化式发现约 70%
微软 / GitHubCopilot、Azure企业覆盖面约 50%
CognitionDevin沙箱里的人工智能软件工程师约 14%
普林斯顿SWE-agent / SWE-bench基准与接口12.5%
学术界MetaGPT、ChatDev多智能体标准作业程序不适用

三个模式值得注意。Anthropic 把主要重点放在委派:长程智能体编码,带明确的人批准关口。OpenAI 收敛到类似的产品表面(Codex CLI),并在基准上紧追。DeepMind 用 AlphaEvolve 走了一条不同的进化路径。微软 / GitHub 占据最广的用户基础。普林斯顿和斯坦福在 SWE-agent 与 SWE-bench 上的开源工作,支撑着评测基础设施。

策略不同,收敛可见。所有主要项目现在都提供:(i)驻留在命令行或集成开发环境里的智能体,能访问外壳、文件和测试运行器;(ii)高影响动作上的人在回路批准;(iii)某种长期记忆;(iv)对非平凡任务的并行或多智能体执行;(v)一套关于安全和审计的说法。

开放问题与研究议程

作者认为未来两到三年会由五个开放问题主导。

评测超出 SWE-bench。SWE-bench 是不可缺少的迫使函数,但有限制:以 Python 为主,聚焦修缺陷,并提供真实任务所没有的地面真值测试。SWE-bench Multimodal、SWE-bench Pro、Terminal-Bench 和 SWE-Compass 正在把覆盖扩到 JavaScript、多语言、多模态和更对齐生产的任务。还需要能抓住长程委派、与人类评审者协作、对所述意图的忠实,以及没有「奖励黑客」行为的基准。

治理、安全与审计。2025 年的人工智能智能体索引记录了已部署智能体系统的增殖,以及治理文档的明显不足。ADLC 框架提出人–智能体责任映射:明确分配权限级别和批准关口,作为不可选的设计步骤。把它做成审计人员能够核验的东西,仍是开放问题。

技术债假说。Bauer 等人认为,人工智能辅助编程可能通过膨胀维护负担,降低有经验开发者的生产率。智能体偏向产出更多代码,因为生产便宜;也偏向局部修复,因为全局重设计在词元上很贵。迫切需要在持续的智能体贡献下,对仓库健康做长期研究。

技能再分配。Anthropic 的数据提示一个正在出现的双轨市场:有经验的工程师获得复合收益;新手用智能体做事,表现更差。教育研究需要明确训练编排技能:分解、提示、评审,以及判断何时不该委派,才能让人才管道保持开放。

注意力的经济学。如果智能体每小时能产出十个看似合理的补丁,限速资源就是人的评审。高吞吐评审的工具——自动 diff 摘要、行为测试生成、对智能体轨迹的有原则抽样——是 2023 到 2026 年智能体项目之后自然的下一项研究。

结论

软件工程正处于一次间断之中。2021 年的问题是语言模型能否像样地补全一个函数。到 2026 年,前沿智能体系统能解决成熟仓库里大约五分之四的真实 GitHub Issue,主要人工智能实验室里已有不可忽略的一部分代码由这类系统写出。五分之四对应上文汇编的约 78.4%,不是新测出来的比例。

作者的读法是谨慎乐观。智能体系统是真实的生产率工具,不是玩具。节省的时间和被委派的任务,经验证据是充实的,但不均匀。但「代码生成」是错误的框架。正确的框架是在人的监督下的委派执行。长期的赢家将是那些最早投资于委派所要求的过程、治理和技能的人。勾勒出的研究议程,归根结底是:让机器去打字,同时把人牢牢留在回路里。

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction