最高 分 要写 明 用 的 哪 套 Harness:Qwen3.8 - Flash - Next 把 评 测 口径 放进 脚注
Qwen 团队 2026-08-26 发布 Qwen3.8-Flash-Next 时,把 DeepSWE、SWE-bench、OSWorld 的 Harness、温度、上下文和裁判模型写进脚注。同一行分数不能当成同场裸分。

本文目录
最高分要写明用的哪套 Harness:Qwen3.8-Flash-Next 把评测口径放进脚注
阿里云 Qwen 团队在 2026 年 8 月 26 日放出 Qwen3.8-Flash-Next 的权重说明。主模型 125B 参数,另有 51B 的 N-gram Embedding,每个 token 激活 6B。官方把它和 Qwen3.7-Plus 对比时说,训练开销大约只有后者的九分之一,编码和办公任务上的能力更好。上下文原生 262,144 token,用 YaRN 可以扩到 1,000,000 token。线上的 Qwen3.8-Flash 标价是每百万输入 token 0.15 美元、每百万输出 token 0.47 美元。这些是规模和成本口径,不是任务成功率。
对评测有用的部分在成绩表下面的脚注:同一行里的模型,并不都是同一套运行条件。
语言和 Agent 任务:先写清 Harness,再读最高分
对照模型是 Qwen3.8-27B、Qwen3.7-Plus(397B,激活 17B)、DeepSeek-V4-Flash-0731(284B,激活 13B)和 Claude-Opus-4.6(Max)。Claude 的参数量留空。Qwen3.8-Flash-Next 在表里的分数如下,空位表示官方当时没有数,或该项不适用。
编码四项:
- DeepSWE 1.1:58.7,对照依次是 42.2、16.5、54.4,Claude 为空。
- SWE-bench Pro:62.5,对照 61.7、55.8、56.0、53.4。
- SWE-bench Multilingual:81.0,对照 73.8、75.8,DeepSeek 为空,Claude 77.5。
- NL2Repo-Bench:48.1,低于 DeepSeek-V4-Flash-0731 的 54.2;其余对照是 42.3、41.1、47.6。
Agent 四项:
- CoWorkBench(Qwen 内部的长程办公与生产力任务,覆盖计算机、金融、法律、医疗等):73.9,对照 70.7、65.1、45.1、68.2。
- JobBench:55.7,对照 33.4、27.6、41.3、36.6。
- Agents' Last Exam:本模型 Pass@1 为 24.3、Score 为 51.2。Qwen3.8-27B 是 20.4 / 42.9,Qwen3.7-Plus 是 13.2 / 33.6。DeepSeek 的 Pass@1 是 25.2,Score 为空,所以「谁最高」取决于看哪一列。Claude 整格为空。
- Toolathlon Verified 的 Pass@1:73.5,对照 67.1、50.6、70.3,Claude 为空。
通用四项:
- IFBench:81.3,对照 79.5、79.1、79.2、62.5。
- GPQA Diamond:91.7,对照 89.2、90.3、90.8、91.3。
- HLE:35.9,低于 Claude-Opus-4.6(Max)的 40.0;其余是 30.8、34.7、33.8。HLE 由 GPT-4o 做裁判。
- LiveCodeBench v6:91.9,对照 90.3、89.6、90.6、88.8。
脚注把采样写死了,不能把这些数字当成「模型裸分」:
- DeepSWE 1.1 同时用 Claude Code 和 mini-SWE-agent 两套 Harness,温度 1.0,top_p 0.95,上下文 256K。表上取两套里的较高分。官方特别写明,Qwen3.8-Flash-Next 的最好成绩来自 mini-SWE-agent,不是两套都到了 58.7。
- SWE-bench Pro 里,除 Claude-Opus-4.6(Max)使用官方已公布分数外,其余模型都用 Claude Code,温度、top_p 和上下文与上一条相同。有问题的任务被改过,基线模型在修订后的基准上重新跑过。因此这列 Claude 的 53.4 和其他模型不是同一次复测。
- SWE-bench Multilingual 用的是 mini-SWE-agent,温度和上下文同上。
- NL2Repo-Bench 用 Claude Code。为了挡住奖励投机,禁用了会直接碰到目标仓库的 Bash,例如 pip download、pip install 和 git clone。
- 每一行的加粗只表示该行当时的最高值。空单元格不是 0 分。
DeepSWE 1.1 是软件工程评测集;SWE-bench Pro 和 SWE-bench Multilingual 是仓库级软件工程基准的不同子集;NL2Repo-Bench 是从自然语言生成整个仓库的基准;Toolathlon Verified 看的是真实工具使用的一次通过率。这些名字第一次出现时,分数只能在对应脚注的 Harness 里比较。
视觉和电脑使用:通过率和平均分不是同一个数
视觉表只保留四列:本模型、Qwen3.8-27B、Qwen3.7-Plus、Claude-Opus-4.6(Max)。DeepSeek 没有进入这张表。
智能体多模态:
- ClawEval-MM 报两组数,Pass@3 和三次试验的平均分。本模型是 64.4 / 60.4。Qwen3.8-27B 是 57.4 / 56.9。Qwen3.7-Plus 是 57.4 / 60.1,平均分和本模型的 60.4 几乎贴在一起,Pass@3 仍低一截。Claude 是 52.5 / 54.7。Pass@3 指三次里至少一次通过的比例,不能和平均分混读。
- RecreationBench:49.9,对照 47.1、30.2,Claude 为空。这是内部的长程应用复现基准,覆盖桌面(Ubuntu、macOS、Windows)、Android 和 Web 五个平台。
- AndroidWorld:84.5,对照 81.9、81.0、62.0。
- OSWorld 2.0 分成 binary 和 partial。binary 是拿到满分奖励的任务比例,partial 是把部分奖励加总。本模型是 19.4 / 52.3。Qwen3.8-27B 的 binary 同样是 19.4,partial 是 48.0。Qwen3.7-Plus 是 2.8 / 21.5。Claude 为空。满分通过率不到两成,不能用 partial 的 52.3 代替「做完了」。
- Vision2Web:64.0,对照 62.9、42.1,Claude 为空。分数是 frontend、webpage、website 三类的平均,Harness 是 Claude Code,裁判模型是 gpt-5.4-2026-03-05。
通用多模态:
- ERQA:72.3,对照 65.5、69.8、40.8。
- LVBench:76.6,对照 72.4、76.2、63.0。和 Qwen3.7-Plus 只差 0.4。
- RealWorldQA:88.5,对照 85.9、86.9、73.9。
- MathVision 分「不用代码解释器 / 用代码解释器」:本模型 90.6 / 95.7,Qwen3.8-27B 是 90.0 / 94.6,Qwen3.7-Plus 是 90.3 / 88.7。注意 Qwen3.7-Plus 用上代码解释器后分数下降。Claude 只给了不用代码解释器的 65.5。
- CharXiv 的推理题同样分两种:本模型 84.6 / 90.6,Qwen3.8-27B 是 83.7 / 90.2。不用代码解释器时,Qwen3.7-Plus 的 85.8 高于本模型的 84.6;用上之后是 85.9,低于本模型的 90.6。Claude 不用代码解释器为 66.0。
MathVision 有少量错误标准答案,人工核对后改过。本模型用固定提示作答,要求逐步推理并把最终答案放进 \boxed{}。其他模型取「加这段格式」和「不加」两次里的较高分。所以本模型是单提示,对照是两次里的较好一次。
速度数字不要写进任务成功率
文中还有一组架构数字:在 100 万 token 上,QSA 的 Attention Kernel 在 Prefill 和 Decode 上最多到 7.6 倍和 4.9 倍。在线服务实验里,前缀缓存命中率按 90% 设置时,100 万 token 上下文的 Prefill 吞吐是 Qwen3.7-Plus 的 8.6 倍。这是算子和吞吐,不是 DeepSWE 或 OSWorld 的任务分。GDN、QSA、Gated Residual、Muon 这些结构说明,原文放在成绩表之后,用来解释为什么长上下文更便宜,不构成另一套 Agent 评测集。
这些表不能被读成什么
空单元格不是失败,也不是并列第一。SWE-bench Pro 上的 Claude 用的是官方已公布分,其余模型是修订任务后的复测,两边不能写成同场排名。DeepSWE 取的是两套 Harness 的较高分,文章没有给出另一套的分数。NL2Repo 禁掉了能直接拿到仓库的命令,这个分数不能和「允许 git clone」的跑法比较。CoWorkBench 和 RecreationBench 是内部集,外界不能按同题复现。HLE 的裁判是 GPT-4o,Vision2Web 的裁判是 gpt-5.4-2026-03-05,换裁判会换分。Agents' Last Exam 上 DeepSeek 的 Pass@1 更高,但 Score 缺失。OSWorld 的 binary 只有 19.4,和同为 19.4 的 Qwen3.8-27B 在满分通过率上没有拉开。训练成本「约九分之一」没有给出算力、token 和步数的对照表。
出处:阿里云,Qwen 团队,Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency,2026-08-26,https://qwen.ai/blog?id=qwen3.8-flash-next
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。