留存 升了 3.85 %, 工具 错误 降了 61.5 %: Qwen - Coder - Qoder 的 线上 数 就 这些
Qwen-Coder-Qoder 在自建 Qoder Bench 上超过 Cursor Composer-1,Windows 终端命令准确率最多提高 50%。线上几周代码留存升 3.85%,工具错误降 61.5%,Token 降 14.5%。没有绝对分和样本量。

留存升了 3.85%,工具错误降了 61.5%:Qwen-Coder-Qoder 的线上数就这些
阿里云社区在 2026 年 7 月 17 日介绍了 Qwen-Coder-Qoder。它在 Qwen-Coder 上做大规模强化学习,对齐 Qoder 的场景、工具和 Agent 结构。Qoder 是阿里的 AI 编码与 Agent 桌面产品。这篇同时给了基准对比和几周线上变化,但没有给出样本量、绝对分和对照窗口。
Qoder Bench 上赢了任务解决,Windows 终端最多提高 50%
Qoder Bench 是他们自己的真实软件工程任务基准。文中只写:Qwen-Coder-Qoder 在任务解决上超过 Cursor Composer-1。Windows 上的终端命令准确率最多提高 50%。原文没有给出两边的绝对分、任务条数、Windows 的分母,也没有说明这 50% 是相对 Composer-1 还是相对上一版自己。
线上另有三项,时间范围是过去几周:代码留存上升 3.85%,工具错误率下降 61.5%,Token 消耗下降 14.5%。原文说这些指标让 Qoder 站到世界第一档模型旁边,但没有列出对照模型和绝对错误率。每天有数千用户在用产品,这是流量规模,不是评测分。
奖励看的是能不能做完,不是补丁能不能过
他们把模型、Agent、产品收成一个环:模型提供执行能力,产品侧一切围绕 Agent,每天的真实使用被抽成软件工程实践,再变成强化学习的奖励。训练环境是 Qoder 自己的知识、记忆、工具和 MCP、上下文,用来做真实编码任务。为了放大规模,他们自动搭了数万个真实软件环境,用高速容器化随时拉起和拆掉沙箱。
正确性不只有单元测试。还用 CLI 检查和自定义清单,确认 Agent 真的做完了,而不是只交一个能过的 diff。代码怎么写也有硬规则,要求过程和资深工程师的标准一致。
奖励黑客被单独写出来。如果为了速度去奖励并行调用工具,模型可能去扫大量无关文件来刷分。并行指标很好看,对最终正确率没有贡献。他们的对策是 Rewarder-Attacker:训练开始前,用一个 LLM 当审查员,不断攻击奖励系统、找漏洞。原文说这明显加快了奖励设计的迭代,也提高了稳健性,但没有给出找出多少漏洞、攻击前后奖励分差。
rollout 占掉七成以上时间,吞吐提高约 10 倍
训练框架是 ROLL,用来在数千张 GPU 上训练数千亿参数的 MoE。典型强化学习循环里,rollout 经常占掉总时间的 70% 以上。他们从两头改:
- rollout 本身:异步调度减少空等,前缀和 KV 缓存复用去掉重复计算,冗余的环境执行去压长尾延迟。
- rollout 和训练一起设计:放宽 on-policy 约束,允许跨版本采样,训练和 rollout 并行,并在训练等待时把 GPU 让给 rollout。
这些系统改动把吞吐提高了约 10 倍,训练周期被压短。原文没有给出改动前的绝对吞吐。
这是飞轮的第一站,不是一张完整成绩单
文中把今天发布的模型写成「模型—Agent—产品」飞轮的第一座里程碑,后面按周迭代。读的时候只保留原文给得出的边界:Qoder Bench 只有「超过 Composer-1」和 Windows 终端最多 50%,没有绝对分;3.85%、61.5%、14.5% 是过去几周的相对变化,没有基线绝对值和样本量;数万环境和约 10 倍吞吐是训练系统规模,不是用户任务准确率;奖励攻击没有公开漏洞数。
出处:阿里云,Alibaba Cloud Community,Qwen-Coder-Qoder: Customizing a Fast-Evolving Frontier Model for Real Software,2026-07-17,https://www.alibabacloud.com/blog/qwen-coder-qoder-customizing-a-fast-evolving-frontier-model-for-real-software_603370
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。