编码 智能 体 的 强化 学习 跨 基准 迁移 (续): 四 种 失败 模式
成对轨迹显示,基座模型的失败多是差一点:需求丢失、测试过窄、无声回归、地面真值太弱。训练后的模型把规格说明当成必须完整兑现的契约。

本文目录
译注:本篇接《编码智能体上的强化学习,能否跨基准迁移》,从原文第 7 节起,含参考文献与附录。
7 变了什么:成对轨迹分析
我们把基座模型和训练后模型在同一批任务上的轨迹配成对,读它们的推理、shell 命令、测试和输出,重点放在 DeepSWE、Terminal-Bench 3 和 SWE-Marathon 里基座失败、训练后通过的任务。因此下面的案例来自训练后模型新解出的任务;§7.1 的「差一点」统计覆盖每一次失败的内部 DeepSWE 基座运行。
7.1 基座模型在 DeepSWE 上的失败大多是差一点
83 次失败的内部 DeepSWE 基座运行里,59% 是差一点:至少通过了 80% 的目标测试(所请求行为的测试);失败运行的通过率中位数是 86%,84% 的失败运行保住了每一条 pass-to-pass 测试(图 2a)。在我们读过的配对里,典型的失败是功能大体做完,缺一两条需求。测试通过的比例并不等于需求完成的比例:下面第一个案例里,漏掉一条需求,137 条测试里就有 16 条失败。
7.2 四种失败模式,以及 RL 之后的行为
基座模型的失误反复落在四种模式里;每一种里,训练后模型在同一任务上的轨迹都表现出不同的行为(表 3)。这四种跟着一条标准的工程回路(理解需求、测试它、维护已经能用的东西、对照可靠的假设做验证),并与 §3.2 的四条任务性质对齐。
表 3:成对轨迹里基座模型的失败模式、训练后模型在同一任务上的行为,以及偏向这一变化的任务性质(§3.2)。
| 阶段 | RL 之前的失败模式 | RL 之后的行为 | 性质 |
|---|---|---|---|
| 理解 | 需求丢失。功能大体做出来了,却丢掉一条必需的约束,常常是一条很细的。 | 实现整份规格说明。把每一条写明的需求带过实现和最后的复查。 | (P1)可打分的需求 |
| 测试 | 测试过窄。测的是自己那份不完整实现所围绕的情形。 | 测试需求,而不是测试实现。从规格说明导出正例、反例和另一种形式的情形。 | (P2)隐藏的评分器 |
| 维护 | 无声回归。满足了新需求,同时弄坏了必须保持完好的行为。 | 保护已有行为。在改代码之前先分清什么必须改、什么必须继续能用。 | (P3)受保护的行为 |
| 验证 | 地面真值太弱。拿一个错误假设或一个弱代理去验收。 | 重建地面真值。造一个独立的参考、一个模拟器,或自己的测试输入。 | (P4)没有神谕 |
#### 7.2.1 需求丢失 $\rightarrow$ 实现整份规格说明
##### 之前。
一道 FastAPI 任务列出 20 条需求。第 18 条要求一个跟踪中间件,暴露 get_stats() 和 reset_stats() 方法。基座模型几乎把整个功能做出来了,架构对,代码能跑,但把这两个函数定义在模块级,而不是中间件对象上的方法。它通过了 137 条目标测试里的 121 条;剩下 16 条在规格说明所说的位置调用这些方法,16 条全部失败。
##### 之后。
训练后的模型把它们做成实例方法,并通过了全部 137 条测试。基座模型对这个功能的理解并没有错:一条接口需求在读完规格说明和做完实现之间丢掉了,训练后的模型把它带了过去。
##### 与训练的联系(P1)。
每一条需求都对应检查,所以丢掉一条的 rollout 就失去这条需求在奖励里的份额(在一道像这个案例这样打分的任务上,是 137 项检查里的 16 项)。当一组里没有任何一次 rollout 做完时,部分得分仍把这种压力保持着:两次都保住已有行为的 rollout 里,通过更多检查的那一次得到更高的优势;若是通过/失败奖励,整组都不会有信号(§4.1)。
#### 7.2.2 测试过窄 $\rightarrow$ 测试需求,而不是测试实现
##### 之前。
两个模型都经常测试;差别在于它们选择测什么。有一道任务要求默认参数值对匿名函数定义和具名函数定义都生效。基座模型选了一种能处理匿名形式 func(a = 1) 的实现,而它写的每一个测试都用这种形式。规格说明还要求具名形式 func f(a = 1);实现不能处理 func 和括号之间的标识符,两套隐藏测试都失败了。基座模型是围绕自己的实现已经支持的那条路径来设计测试的。
##### 之后。
训练后的模型从规格说明自己给出的具名例子开始,然后试匿名函数、多行参数列表、展开调用、立即调用的函数,以及其他变体。它在找能证明自己对需求的读法是错的情形,而不是找证据确认自己已经支持的情形能用。
##### 与训练的联系(P2)。
评分器是隐藏的,因此一次 rollout 针对写明需求所做的测试,就是它关于「决定奖励的那些检查」的最好证据。去测被问到的东西、而不只测已经做出来的东西的 rollout,能抓住更多自己的错误,并在组内得到更高的分数;优势把测试和修复一起记上。
#### 7.2.3 无声回归 $\rightarrow$ 保护已有行为
##### 之前。
一道任务要求消除一个站点各页面上的布局偏移,同时保留可见元素、样式和分析副作用。基座模型在每一页上都把布局偏移做到了零,部分做法是删掉两个组件。它自己的最终复查判定这次删除无害,因为其中一些组件的样式已经内联到别处。
##### 之后。
在改代码之前,训练后的模型先记下规格说明要求保留的东西,然后在改变这些视觉效果的施加方式时把那些组件留住。它按两份清单工作:什么必须改,什么不允许动。
##### 与训练的联系(P3)。
在仓库任务上,一次 rollout 只要有任何一条 pass-to-pass 测试失败,奖励就是零,不管它满足了多少条新需求。于是它在组里并列垫底,并且只要另一次 rollout 拿到了分数,它就会得到负的优势。
#### 7.2.4 地面真值太弱 $\rightarrow$ 重建地面真值
##### 之前。
有些任务没有可以对照的参考实现或检查。这时基座模型有时会采纳一个假设,再做一个继承了该假设的测试。在一道二维谱求解器任务上,容器里没有参考函数。基座模型认定问题实际上是一维的,做了一个一维求解器,并用在同一假设下构造的参考数据去验收。这个测试没有办法把假设暴露出来。
##### 之后。
训练后的模型使用人造解方法:它选一个解析的二维解,导出使该解精确成立的输入,并把这一对当作独立检查,从而在提交前暴露了一次不稳定。在一道 Verilog 控制台任务上,它用差分方式测试硬件实现,对照它自己写的 Python 模拟器,逐条指令来比。在一道 SWE-Marathon 任务上,环境里没有参考的 zstd 二进制,却要求一个 Zstandard 解压器。它先写了一个压缩器,这样就能在本来没有测试输入的地方生成测试输入,并做往返检查,确认解压器恢复了原文。
##### 与训练的联系(P4)。
训练集里没有偏微分方程求解器、硬件模拟器或压缩器的任务,但每一道任务都把模型放在同一个位置上:一份精确的规格说明、一个隐藏的评分器、没有神谕。自己产出「结果是对的」的证据的 rollout,更稳定地拿到奖励,而这些轨迹显示的就是这种行为。SWE-Marathon 的作者报告,前沿智能体的失败常常来自糟糕的自我验证 [Desai et al., 2026]。
7.3 一条共同的线
在全部四种模式里,基座模型都停在「还没确认整件事做完」的地方:它宣布完成,却没有检查每一条需求;它测的是已经做出来的东西,而不是被问到的东西;它改了本该保留的东西;或者它对照自己的假设做验证。训练后的模型把规格说明当成一份必须完整兑现的契约,把自己的工作当成一个有待检验的假设。它加上了这种验证,同时在 DeepSWE 和 Terminal-Bench 3 上仍然用更少的智能体步数(§6.3)。这些是工程习惯,不是任何一个基准的惯例,这与增益能跨基准、跨 harness 成立是一致的。
8 结论
在 1,700 道专家编写的编码任务上做一轮 RL,用 GSPO 和一个秩为 32 的 LoRA 适配器,使 Kimi K2.7 Code 在我们评测的全部六个外部基准上都有提升,幅度 4.7 到 20.0 个百分点。这包括四个在数据采集之后才发布的基准、两种训练里没有的 harness,以及训练里没有对应物的数小时构建(20 道里从 1 道变成 5 道)。在我们读过的新解出任务上,训练后的模型实现整份规格说明、测试需求、保护已有行为,并自己建立地面真值;每一种都是训练任务和奖励所偏向的行为。按这份证据,迁移过去的不是领域知识——基座模型大体已经有了——而是一种把工作做完的方式。
参考文献
译注:下列各条保留原文作者姓名、题名、模型名、基准名和网址;中文是对该条出处与内容的直译说明。
- Anthropic [2025] Anthropic. Claude Code, 2025. URL https://github.com/anthropics/claude-code. Agentic coding tool; first released February 24, 2025. Documentation: https://code.claude.com/docs/en/overview. Accessed September 2026. 智能体编码工具,2025 年 2 月 24 日首次发布。文档于 2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Artificial Analysis [2026a] Artificial Analysis. Terminal-Bench 2.1 benchmark leaderboard, 2026a. URL https://artificialanalysis.ai/evaluations/terminalbench-2-1. Independent evaluation using the Terminus 2 harness; pass@1 averaged over three runs per task. Accessed September 2026. 独立评测,使用 Terminus 2 harness,pass@1 为每道任务三次运行的平均。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Artificial Analysis [2026b] Artificial Analysis. Terminal-Bench 4.0 benchmark leaderboard, 2026b. URL https://artificialanalysis.ai/evaluations/terminalbench-4-0. Independent evaluation of all 66 tasks with the mini-swe-agent harness; pass@1 averaged over three runs per task. Accessed September 2026. 对全部 66 道任务的独立评测,使用 mini-swe-agent harness,pass@1 为每道任务三次运行的平均。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Boschloo [1970] R. D. Boschloo. Raised conditional level of significance for the $2\times 2$-table when testing the equality of two probabilities. Statistica Neerlandica, 24(1):1–9, 1970. 检验两个概率是否相等时,把 2×2 表的条件显著性水平提高。载于《Statistica Neerlandica》第 24 卷第 1 期,第 1–9 页,1970 年。作者姓名、模型名、基准名和网址保持原文。
- Cao et al. [2025] Shiyi Cao, Sumanth Hegde, Dacheng Li, Tyler Griggs, Shu Liu, Eric Tang, Jiayi Pan, Xingyao Wang, Akshay Malik, Graham Neubig, et al. SkyRL-v0: Train real-world long-horizon agents via reinforcement learning, 2025. URL https://novasky-ai.notion.site/skyrl-v0. NovaSky (UC Berkeley Sky Computing Lab) blog post, May 7, 2025. Code: https://github.com/NovaSky-AI/SkyRL. Accessed September 2026. 用强化学习训练真实世界里的长程智能体。加州大学伯克利天空计算实验室 NovaSky 的博客,2025 年 5 月 7 日。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Chowdhury et al. [2024] Neil Chowdhury, James Aung, Chan Jun Shern, Oliver Jaffe, Dane Sherburn, Giulio Starace, Evan Mays, Rachel Dias, Marwan Aljubeh, Mia Glaese, et al. Introducing SWE-bench Verified, 2024. URL https://openai.com/index/introducing-swe-bench-verified/. OpenAI blog post, August 13, 2024. Accessed September 2026. 介绍 SWE-bench Verified。OpenAI 博客,2024 年 8 月 13 日。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Chu et al. [2025] Tianzhe Chu, Yuexiang Zhai, Jihan Yang, Shengbang Tong, Saining Xie, Dale Schuurmans, Quoc V. Le, Sergey Levine, and Yi Ma. SFT memorizes, RL generalizes: A comparative study of foundation model post-training. In International Conference on Machine Learning (ICML), 2025. URL https://arxiv.org/abs/2501.17161. 监督微调记住,强化学习泛化:基础模型后训练的比较研究。发表于国际机器学习会议,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Dao et al. [2022] Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra, and Christopher Ré. FlashAttention: Fast and memory-efficient exact attention with IO-awareness. In Advances in Neural Information Processing Systems (NeurIPS), 2022. URL https://arxiv.org/abs/2205.14135. FlashAttention:具有输入输出意识的、快速且省内存的精确注意力。发表于神经信息处理系统进展,2022 年。作者姓名、模型名、基准名和网址保持原文。
- DeepSeek-AI et al. [2025] DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, et al. DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning. arXiv preprint arXiv:2501.12948, 2025. URL https://arxiv.org/abs/2501.12948. Also published in Nature, 645(8081):633–638, 2025. 用强化学习激励大语言模型的推理能力。预印本,2025 年;亦发表于《Nature》第 645 卷,第 633–638 页。作者姓名、模型名、基准名和网址保持原文。
- Deng et al. [2026] Xiang Deng, Jeff Da, Edwin Pan, Yannis Yiming He, Charles Ide, Kanak Garg, Niklas Lauffer, Andrew Park, Chetan Rane, Karmini Sampath, et al. SWE-Bench Pro: Can AI agents solve long-horizon software engineering tasks? In International Conference on Machine Learning (ICML), 2026. URL https://arxiv.org/abs/2509.16941. Public leaderboard: https://labs.scale.com/leaderboard/swe_bench_pro. 人工智能智能体能解决长程软件工程任务吗?发表于国际机器学习会议,2026 年。另有公开排行榜。作者姓名、模型名、基准名和网址保持原文。
- Desai et al. [2026] Rishi Desai, Jesse Hu, Joan Cabezas, Neel Harsola, Pratyush Shukla, Roey Ben Chaim, Adnan El Assadi, Omkaar Mukund Kamath, Fenil Faldu, Prannay Hebbar, et al. SWE-Marathon: Can agents autonomously complete ultra-long-horizon software work? arXiv preprint arXiv:2606.07682, 2026. URL https://arxiv.org/abs/2606.07682. Benchmark website (v1.1, July 2026): https://www.swe-marathon.org/. 智能体能自主完成超长程的软件工作吗?预印本,2026 年。基准网站为 2026 年 7 月的 v1.1。作者姓名、模型名、基准名和网址保持原文。
- Deshpande et al. [2025] Kaustubh Deshpande, Ved Sirdeshmukh, Johannes Baptist Mols, Lifeng Jin, Ed-Yeremai Hernandez-Cardona, Dean Lee, Jeremy Kritz, Willow E. Primack, Summer Yue, and Chen Xing. MultiChallenge: A realistic multi-turn conversation evaluation benchmark challenging to frontier LLMs. In Findings of the Association for Computational Linguistics: ACL 2025, pages 18632–18702, 2025. URL https://aclanthology.org/2025.findings-acl.958/. 一个对前沿大语言模型构成挑战的、贴近真实的多轮对话评测基准。计算语言学协会 2025 年发现集,第 18632–18702 页。作者姓名、模型名、基准名和网址保持原文。
- Greenland and Robins [1985] Sander Greenland and James M. Robins. Estimation of a common effect parameter from sparse follow-up data. Biometrics, 41(1):55–68, 1985. 从稀疏随访数据估计共同效应参数。载于《Biometrics》第 41 卷第 1 期,第 55–68 页,1985 年。作者姓名、模型名、基准名和网址保持原文。
- Gunjal et al. [2026] Anisha Gunjal, Anthony Wang, Elaine Lau, Vaskar Nath, Yunzhong He, Bing Liu, and Sean Hendryx. Rubrics as rewards: Reinforcement learning beyond verifiable domains. In International Conference on Learning Representations (ICLR), 2026. URL https://arxiv.org/abs/2507.17746. 把量规当作奖励:可验证领域之外的强化学习。发表于国际学习表征会议,2026 年。作者姓名、模型名、基准名和网址保持原文。
- Harbor Framework Team [2026] Harbor Framework Team. Harbor: A framework for evaluating and optimizing agents and models in container environments, 2026. URL https://github.com/harbor-framework/harbor. First released November 7, 2025. Concept DOI 10.5281/zenodo.20953922. Documentation: https://www.harborframework.com. Accessed September 2026. 在容器环境中评测并优化智能体与模型的框架。2025 年 11 月 7 日首次发布。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- He et al. [2026] Yun He, Wenzhe Li, Hejia Zhang, Songlin Li, Karishma Mandyam, Sopan Khosla, Yuanhao Xiong, Nanshu Wang, Xiaoliang Peng, Beibin Li, et al. AdvancedIF: Rubric-based benchmarking and reinforcement learning for advancing LLM instruction following. In Annual Meeting of the Association for Computational Linguistics (ACL), pages 18003–18022, 2026. URL https://aclanthology.org/2026.acl-long.820/. 基于量规的基准评测与强化学习,用以推进大语言模型的指令遵循。计算语言学协会年会,2026 年,第 18003–18022 页。作者姓名、模型名、基准名和网址保持原文。
- Hu et al. [2022] Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen. LoRA: Low-rank adaptation of large language models. In International Conference on Learning Representations (ICLR), 2022. URL https://arxiv.org/abs/2106.09685. 大语言模型的低秩适配。发表于国际学习表征会议,2022 年。作者姓名、模型名、基准名和网址保持原文。
- Huan et al. [2026] Maggie Ziyu Huan, Yuetai Li, Tuney Zheng, Xiaoyu Xu, Seungone Kim, Minxin Du, Radha Poovendran, Graham Neubig, and Xiang Yue. Does math reasoning improve general LLM capabilities? Understanding transferability of LLM reasoning. In International Conference on Machine Learning (ICML), 2026. URL https://arxiv.org/abs/2507.00432. 数学推理会提高大语言模型的一般能力吗?理解大语言模型推理的可迁移性。发表于国际机器学习会议,2026 年。作者姓名、模型名、基准名和网址保持原文。
- Huang et al. [2026] Wenqi Huang, Charley Lee, Leonard Tng, and Serena Ge. DeepSWE: Measuring frontier coding agents on original, long-horizon engineering tasks, 2026. URL https://deepswe.datacurve.ai/. Datacurve, May 26, 2026; v1.1 released June 2026. Also arXiv:2607.07946. Code: https://github.com/datacurve-ai/deep-swe. Accessed September 2026. 在原创的长程工程任务上测量前沿编码智能体。Datacurve,2026 年 5 月 26 日;v1.1 于 2026 年 6 月发布。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Jain et al. [2025] Naman Jain, Jaskirat Singh, Manish Shetty, Tianjun Zhang, Liang Zheng, Koushik Sen, and Ion Stoica. R2E-Gym: Procedural environment generation and hybrid verifiers for scaling open-weights SWE agents. In Conference on Language Modeling (COLM), 2025. URL https://arxiv.org/abs/2504.07164. 程序化生成环境,并用混合验证器扩展开源权重的软件工程智能体。发表于语言建模会议,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Jimenez et al. [2024] Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan. SWE-bench: Can language models resolve real-world GitHub issues? In International Conference on Learning Representations (ICLR), 2024. URL https://arxiv.org/abs/2310.06770. 语言模型能解决真实世界的 GitHub issue 吗?发表于国际学习表征会议,2024 年。作者姓名、模型名、基准名和网址保持原文。
- Kimi Team et al. [2025] Kimi Team, Yifan Bai, Yiping Bao, Y. Charles, Cheng Chen, Guanduo Chen, Haiting Chen, Huarong Chen, Jiahao Chen, Ningxin Chen, et al. Kimi K2: Open agentic intelligence. arXiv preprint arXiv:2507.20534, 2025. URL https://arxiv.org/abs/2507.20534. 开放的智能体智能。预印本,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Kingma and Ba [2015] Diederik P. Kingma and Jimmy Ba. Adam: A method for stochastic optimization. In International Conference on Learning Representations (ICLR), 2015. URL https://arxiv.org/abs/1412.6980. 一种随机优化方法。发表于国际学习表征会议,2015 年。作者姓名、模型名、基准名和网址保持原文。
- Lambert et al. [2025] Nathan Lambert, Jacob Morrison, Valentina Pyatkin, Shengyi Huang, Hamish Ivison, Faeze Brahman, Lester James V. Miranda, Alisa Liu, Nouha Dziri, Xinxi Lyu, et al. Tülu 3: Pushing frontiers in open language model post-training. In Conference on Language Modeling (COLM), 2025. URL https://openreview.net/forum?id=i1uGbfHHpH. 推动开放语言模型后训练的前沿。发表于语言建模会议,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Lieret and Jimenez [2025] Kilian Lieret and Carlos E. Jimenez. mini-SWE-agent: The minimal AI software engineering agent, 2025. URL https://github.com/SWE-agent/mini-swe-agent. GitHub repository; first PyPI release July 2025. Accessed September 2026. 最小的人工智能软件工程智能体。GitHub 仓库,2025 年 7 月首次在 PyPI 发布。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Liu et al. [2023] Jiate Liu, Yiqin Zhu, Kaiwen Xiao, Qiang Fu, Xiao Han, Wei Yang, and Deheng Ye. RLTF: Reinforcement learning from unit test feedback. Transactions on Machine Learning Research (TMLR), 2023. URL https://arxiv.org/abs/2307.04349. 从单元测试反馈做强化学习。载于《机器学习研究汇刊》,2023 年。作者姓名、模型名、基准名和网址保持原文。
- Loshchilov and Hutter [2019] Ilya Loshchilov and Frank Hutter. Decoupled weight decay regularization. In International Conference on Learning Representations (ICLR), 2019. URL https://arxiv.org/abs/1711.05101. 解耦的权重衰减正则。发表于国际学习表征会议,2019 年。作者姓名、模型名、基准名和网址保持原文。
- Luo et al. [2025] Michael Luo, Naman Jain, Jaskirat Singh, Sijun Tan, Ameen Patel, Qingyang Wu, Alpay Ariyak, Colin Cai, Tarun Venkat, Shang Zhu, et al. DeepSWE: Training a fully open-sourced, state-of-the-art coding agent by scaling RL, 2025. URL https://www.together.ai/blog/deepswe. Agentica and Together AI blog post, July 2, 2025. Accessed September 2026. 用扩展强化学习,训练一个完全开源、达到当时最高水平的编码智能体。Agentica 与 Together AI 博客,2025 年 7 月 2 日。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Mantel and Haenszel [1959] Nathan Mantel and William Haenszel. Statistical aspects of the analysis of data from retrospective studies of disease. Journal of the National Cancer Institute, 22(4):719–748, 1959. 回顾性流行病学研究数据分析的统计问题。载于《美国国立癌症研究所杂志》第 22 卷第 4 期,第 719–748 页,1959 年。作者姓名、模型名、基准名和网址保持原文。
- Marten [2026] Ryan Marten. Terminal-Bench 4.0, 2026. URL https://www.tbench.ai/news/terminal-bench-4-0. Blog post, August 28, 2026. Removes 8 tasks from Terminal-Bench 3.0 and fixes 19. Accessed September 2026. 博客,2026 年 8 月 28 日。从 Terminal-Bench 3.0 去掉 8 道任务,并修好 19 道。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Marten et al. [2026] Ryan Marten, Alex Shaw, and Andy Konwinski. Terminal-Bench 3.0, 2026. URL https://www.tbench.ai/news/terminal-bench-3-0. Blog post, July 30, 2026. Dataset: https://github.com/harbor-framework/terminal-bench. Accessed September 2026. 博客,2026 年 7 月 30 日。附数据集。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Mehta et al. [2026a] Sushant Mehta, Liudas Panavas, Suhaas Garre, and Edwin Chen. ComplexConstraints and beyond: Expert rubrics for RLVR. arXiv preprint arXiv:2606.09118, 2026a. URL https://arxiv.org/abs/2606.09118. Also in the GEM Workshop at ACL 2026. 面向带可验证奖励的强化学习的专家量规。预印本,2026 年。亦收入计算语言学协会 2026 年 GEM 研讨会。作者姓名、模型名、基准名和网址保持原文。
- Mehta et al. [2026b] Sushant Mehta, Logan Ritchie, Suhaas Garre, Ian Niebres, Nick Heiner, and Edwin Chen. EnterpriseBench Corecraft: Training generalizable agents on high-fidelity RL environments. arXiv preprint arXiv:2602.16179, 2026b. URL https://arxiv.org/abs/2602.16179. 在高保真强化学习环境上训练可泛化的智能体。预印本,2026 年。作者姓名、模型名、基准名和网址保持原文。
- Mehta et al. [2026c] Sushant Mehta, Logan Ritchie, Liudas Panavas, and Edwin Chen. Cross-benchmark generalization in long-horizon agents. arXiv preprint arXiv:2608.00181, 2026c. URL https://arxiv.org/abs/2608.00181. To appear in the Workshop on Agent Behavior at COLM 2026. 长程智能体中的跨基准泛化。预印本,2026 年。将收入语言建模会议 2026 年智能体行为研讨会。作者姓名、模型名、基准名和网址保持原文。
- Merrill et al. [2026] Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, et al. Terminal-Bench: Benchmarking agents on hard, realistic tasks in command line interfaces. In International Conference on Learning Representations (ICLR), 2026. URL https://arxiv.org/abs/2601.11868. 在命令行界面里,用困难而贴近真实的任务给智能体做基准。发表于国际学习表征会议,2026 年。作者姓名、模型名、基准名和网址保持原文。
- Miles Team [2026] Miles Team. Miles: Enterprise-grade reinforcement learning for large-scale model post-training, 2026. URL https://github.com/radixark/miles. Forked from slime; announced November 19, 2025 (https://www.lmsys.org/blog/2025-11-19-miles/). Accessed September 2026. 面向大规模模型后训练的企业级强化学习。从 slime 分叉,2025 年 11 月 19 日宣布。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Moonshot AI [2026] Moonshot AI. Kimi K2.7 Code, 2026. URL https://huggingface.co/moonshotai/Kimi-K2.7-Code. Hugging Face model card. Accessed September 2026. Hugging Face 上的模型卡。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Newcombe [1998] Robert G. Newcombe. Interval estimation for the difference between independent proportions: Comparison of eleven methods. Statistics in Medicine, 17(8):873–890, 1998. 独立比例之差的区间估计:十一种方法的比较。载于《Statistics in Medicine》第 17 卷第 8 期,第 873–890 页,1998 年。作者姓名、模型名、基准名和网址保持原文。
- NVIDIA [2025] NVIDIA. NeMo Megatron Bridge, 2025. URL https://github.com/NVIDIA-NeMo/Megatron-Bridge. GitHub repository; first PyPI release August 2025. Accessed September 2026. GitHub 仓库,2025 年 8 月首次在 PyPI 发布。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Pan et al. [2025] Jiayi Pan, Xingyao Wang, Graham Neubig, Navdeep Jaitly, Heng Ji, Alane Suhr, and Yizhe Zhang. Training software engineering agents and verifiers with SWE-Gym. In International Conference on Machine Learning (ICML), 2025. URL https://arxiv.org/abs/2412.21139. 用 SWE-Gym 训练软件工程智能体和验证器。发表于国际机器学习会议,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Ritchie et al. [2026] Logan Ritchie, Sushant Mehta, Liudas Panavas, and Edwin Chen. Post-training on office work improves software engineering: A behavioral account of cross-domain transfer. arXiv preprint arXiv:2608.01604, 2026. URL https://arxiv.org/abs/2608.01604. 在办公室工作上做后训练会提高软件工程:跨领域迁移的行为解释。预印本,2026 年。作者姓名、模型名、基准名和网址保持原文。
- Schulman and Thinking Machines Lab [2025] John Schulman and Thinking Machines Lab. LoRA without regret, 2025. URL https://thinkingmachines.ai/blog/lora/. Thinking Machines Lab: Connectionism, September 29, 2025. DOI 10.64434/tml.20250929. Accessed September 2026. 没有遗憾的低秩适配。Thinking Machines Lab 的 Connectionism,2025 年 9 月 29 日。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Shao et al. [2024] Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, Y. K. Li, Y. Wu, and Daya Guo. DeepSeekMath: Pushing the limits of mathematical reasoning in open language models. arXiv preprint arXiv:2402.03300, 2024. URL https://arxiv.org/abs/2402.03300. 把开放语言模型的数学推理推到极限。预印本,2024 年。作者姓名、模型名、基准名和网址保持原文。
- Shoeybi et al. [2019] Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, and Bryan Catanzaro. Megatron-LM: Training multi-billion parameter language models using model parallelism. arXiv preprint arXiv:1909.08053, 2019. URL https://arxiv.org/abs/1909.08053. 用模型并行训练数十亿参数的语言模型。预印本,2019 年。作者姓名、模型名、基准名和网址保持原文。
- Skalse et al. [2022] Joar Skalse, Nikolaus Howe, Dmitrii Krasheninnikov, and David Krueger. Defining and characterizing reward gaming. In Advances in Neural Information Processing Systems (NeurIPS), 2022. URL https://arxiv.org/abs/2209.13085. 定义并刻画奖励博弈。发表于神经信息处理系统进展,2022 年。作者姓名、模型名、基准名和网址保持原文。
- Terminal-Bench Team [2026] Terminal-Bench Team. Terminal-Bench 2.1: A revision of Terminal-Bench 2.0 that fixes 28 tasks, 2026. URL https://www.tbench.ai/news/terminal-bench-2-1. Blog post, May 6, 2026. Accessed September 2026. 对 Terminal-Bench 2.0 的修订,修好 28 道任务。博客,2026 年 5 月 6 日。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Vals AI [2026] Vals AI. Terminal-Bench 2.1 benchmark, 2026. URL https://www.vals.ai/benchmarks/terminal-bench-2-1. Terminus 2 harness; pass@1. Kimi K2.7 Code: https://www.vals.ai/models/kimi_kimi-k2.7-code. Accessed September 2026. 使用 Terminus 2 harness 的 pass@1。含 Kimi K2.7 Code 的条目。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Wang et al. [2025] Xingyao Wang, Boxuan Li, Yufan Song, Frank F. Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, et al. OpenHands: An open platform for AI software developers as generalist agents. In International Conference on Learning Representations (ICLR), 2025. URL https://arxiv.org/abs/2407.16741. 把人工智能软件开发者做成通用智能体的开放平台。发表于国际学习表征会议,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Wei et al. [2025] Yuxiang Wei, Olivier Duchenne, Jade Copet, Quentin Carbonneaux, Lingming Zhang, Daniel Fried, Gabriel Synnaeve, Rishabh Singh, and Sida I. Wang. SWE-RL: Advancing LLM reasoning via reinforcement learning on open software evolution. In Advances in Neural Information Processing Systems (NeurIPS), 2025. URL https://arxiv.org/abs/2502.18449. 在开放的软件演化上用强化学习推进大语言模型的推理。发表于神经信息处理系统进展,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Yang et al. [2024] John Yang, Carlos E. Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, and Ofir Press. SWE-agent: Agent-computer interfaces enable automated software engineering. In Advances in Neural Information Processing Systems (NeurIPS), 2024. URL https://arxiv.org/abs/2405.15793. 智能体与计算机的接口使自动化软件工程成为可能。发表于神经信息处理系统进展,2024 年。作者姓名、模型名、基准名和网址保持原文。
- Yang et al. [2025] John Yang, Kilian Lieret, Carlos E. Jimenez, Alexander Wettig, Kabir Khandpur, Yanzhe Zhang, Binyuan Hui, Ofir Press, Ludwig Schmidt, and Diyi Yang. SWE-smith: Scaling data for software engineering agents. In Advances in Neural Information Processing Systems (NeurIPS), Datasets and Benchmarks Track, 2025. URL https://arxiv.org/abs/2504.21798. 为软件工程智能体扩展数据规模。发表于神经信息处理系统进展的数据集与基准轨道,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Yao et al. [2025] Feng Yao, Liyuan Liu, Dinghuai Zhang, Chengyu Dong, Jingbo Shang, and Jianfeng Gao. Your efficient RL framework secretly brings you off-policy RL training, 2025. URL https://fengyao.notion.site/off-policy-rl. Blog post, August 2025. Accessed September 2026. 你那套高效的强化学习框架,其实在悄悄做离策略的强化学习训练。博客,2025 年 8 月。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
- Yu et al. [2025] Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue, Weinan Dai, Tiantian Fan, Gaohong Liu, Juncai Liu, et al. DAPO: An open-source LLM reinforcement learning system at scale. In Advances in Neural Information Processing Systems (NeurIPS), 2025. URL https://arxiv.org/abs/2503.14476. 一个大规模的、开源的大语言模型强化学习系统。发表于神经信息处理系统进展,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Yue et al. [2025] Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, and Gao Huang. Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model? In Advances in Neural Information Processing Systems (NeurIPS), 2025. URL https://arxiv.org/abs/2504.13837. 强化学习真的能在基座模型之外激励出推理能力吗?发表于神经信息处理系统进展,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Zheng et al. [2025] Chujie Zheng, Shixuan Liu, Mingze Li, Xiong-Hui Chen, Bowen Yu, Chang Gao, Kai Dang, Yuqiong Liu, Rui Men, An Yang, Jingren Zhou, and Junyang Lin. Group sequence policy optimization. arXiv preprint arXiv:2507.18071, 2025. URL https://arxiv.org/abs/2507.18071. 组序列策略优化。预印本,2025 年。作者姓名、模型名、基准名和网址保持原文。
- Zheng et al. [2024] Lianmin Zheng, Liangsheng Yin, Zhiqiang Xie, Chuyue Sun, Jeff Huang, Cody Hao Yu, Shiyi Cao, Christos Kozyrakis, Ion Stoica, Joseph E. Gonzalez, Clark Barrett, and Ying Sheng. SGLang: Efficient execution of structured language model programs. In Advances in Neural Information Processing Systems (NeurIPS), 2024. URL https://arxiv.org/abs/2312.07104. 结构化语言模型程序的高效执行。发表于神经信息处理系统进展,2024 年。作者姓名、模型名、基准名和网址保持原文。
- Zhu et al. [2025] Zilin Zhu, Chengxing Xie, Xin Lv, and slime Contributors. slime: An LLM post-training framework for RL scaling, 2025. URL https://github.com/THUDM/slime. GitHub repository. Accessed September 2026. 一个为强化学习扩展而做的大语言模型后训练框架。GitHub 仓库。2026 年 9 月访问。作者姓名、模型名、基准名和网址保持原文。
附录 A 评测细节与统计
A.1 评分
全部内部结果都是单次运行。在 Terminal-Bench 3 上,因 harness 原因失败的运行不计分;对训练后的模型,这排除了 74 次运行里的 8 次,其余 66 次里有 8 次通过。若把这 8 次运行改计为失败,则是 10.8%(74 次里的 8 次),增益 9.4 个百分点($p=0.016$)。基座模型通过 1 道任务;基座的分母从 69 到 74 的任何取值都给出 1.4%,并且 $p\leq 0.013$(若把那 8 次运行计为失败,则 $p\leq 0.021$)。在 SWE-Marathon 上,有一道任务需要我们没有的 A100 GPU,对两个模型都计为失败。
A.2 统计
表 4 给出通过计数、每项增益的 95% 置信区间(独立比例之差的混合得分区间;Newcombe, 1998),以及 Boschloo 精确检验的双侧 $p$ 值 [Boschloo, 1970]。公开基线按最接近的计数、当作一次运行进入(DeepSWE 为 35/113;Terminal-Bench 2.1 为 60/89,这是三次运行的均值),对多次运行的均值来说这是保守的。合并检验是 Cochran–Mantel–Haenszel 检验 [Mantel and Haenszel, 1959],不做连续性校正,按基准分层;它们使用公开的 DeepSWE 基线,并且 Terminal-Bench 3/4 家族只计一次,经由 Terminal-Bench 4,这是更保守的选择(改用 Terminal-Bench 3 会给出 $p=5\times 10^{-4}$)。在五个相互独立的任务集上,$p=7\times 10^{-4}$(精确条件版本为 $8\times 10^{-4}$),Mantel–Haenszel 风险差是 7.0 个百分点(95% 置信区间 [3.0, 11.0];Greenland and Robins, 1985)。在训练数据采集之后才发布的三个任务集上(DeepSWE、Terminal-Bench 4、SWE-Marathon),$p=0.004$(精确条件版本为 0.005)。改用内部的 DeepSWE 运行,五个集合上的 $p=3\times 10^{-4}$;去掉两个带公开基线的基准,则 $p=0.02$。这些区间和检验把两次运行当作独立样本,当两个检查点在同一任务上的结果正相关时,这样做是保守的。公开基线按最接近的整数计数折成一次运行,再与训练后的单次运行比较。表里每一行都给出基座通过数、训练后通过数、增益区间和精确检验的 p 值。
表 4:表 2 的通过计数与不确定性:每项增益的 95% 置信区间,以及 Boschloo 精确检验的双侧 $p$ 值。
| 基准 | 基座 | +RL | 增益的 95% 置信区间(百分点) | $p$ |
|---|---|---|---|---|
| SWE-Bench Pro | 439/731 | 474/731 | [$-$0.2, 9.7] | 0.059 |
| DeepSWE,公开基线 | 35/113 | 49/113 | [$-$0.2, 24.4] | 0.055 |
| DeepSWE,内部基线 | 30/113 | 49/113 | [4.4, 28.5] | 0.008 |
| Terminal-Bench 2.1 | 60/89 | 73/89 | [1.8, 26.8] | 0.028 |
| Terminal-Bench 3 | 1/74 | 8/66 | [2.5, 20.8] | 0.010 |
| Terminal-Bench 4 | 0/66 | 5/66 | [0.6, 16.5] | 0.029 |
| SWE-Marathon | 1/20 | 5/20 | [$-$3.2, 42.3] | 0.089 |
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。