Qwen3.8 - Max: 从 编码 到 协作, Agent 走向 长 程 交付
Qwen 官方发布 Qwen3.8-Max,展示模型在多日自主编码、论文复现改进和真实竞赛中的长程交付能力,并强调模型、环境与 Harness 的协同扩展。

Qwen3.8-Max:从编码到协作,Agent 走向长程交付
阿里云 Qwen 团队于 2026 年 8 月 3 日发布 Qwen3.8-Max。官方介绍将重点放在长程任务交付:模型不仅回答问题,还要在数小时乃至数天内持续规划、执行、验证和迭代,最终产出可靠结果。
从单轮生成到持续交付
Qwen3.8-Max 基于 Qwen3.5 架构,规模达到 2.4 万亿参数、95B 激活参数。官方称其在编码、工作、研究和长程任务上全面提升,并计划开放 Qwen Max 级模型权重。
官方展示了三类编码任务。第一类是超过 10 天的自主编码:模型从零构建 oh-my-cli 项目,围绕 Issue、调度、监控、测试、预览和日志形成持续演进的 Harness。第二类是复现并改进研究论文:模型从论文和 GPU 资源出发,重建数据处理、训练和评测流程,再通过多轮假设—实验—分析循环改进方法。第三类是在 24 小时竞赛任务中,通过文本与图像模型组合、交叉验证和多轮提交优化结果。
工作流能力的工程基础
官方将能力提升归因于任务、工作区和 Harness 的共同扩展,以及统一奖励系统和在线数据均衡器。对 Agent 评测而言,这意味着不能只把模型当作孤立变量,还要记录工具链、工作区、权限、验证器、反馈机制和运行时间。
可靠的长程 Agent 至少需要:
- 将目标拆成可恢复的任务状态和阶段性交付物;
- 把构建、单元测试、端到端测试和人工验收纳入反馈回路;
- 保存运行轨迹,让失败能够回到具体 Issue 或实验轮次;
- 对成本、权限和运行时长设置边界,避免把无限试错误认为能力。
边界与观察口径
官方文章展示的是团队选定的案例和评测结果,不等同于所有企业工作流中的上线承诺。多日自主运行还会受到模型版本、Harness、数据分布、工具权限和验证器设计影响。复用这些结果时,应保留原始任务条件和评测配置。
来源:Qwen 官方博客《Qwen3.8-Max: A New Bar for Coding and Cowork》,2026-08-03。
官方页面:https://qwen.ai/blog?id=qwen3.8
出处:阿里云,Qwen 团队,《Qwen3.8-Max: A New Bar for Coding and Cowork》,2026-08-03,https://qwen.ai/blog?id=qwen3.8。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。