慢 思考 BFCL v3 到 78.3, τ - Bench 仍 低于 o1: 腾 讯 混 元 把 快慢 两 种 思考 分开 测
慢思考 BFCL v3 为 78.3,τ-Bench 为 54.7,低于 o1 的 60.4。快思考 BFCL v3 掉到 65.9。表 2 相对上一代低了 3 项,不是正文写的 2 项。

本文目录
慢思考 BFCL v3 到 78.3,τ-Bench 仍低于 o1:腾讯混元把快慢两种思考分开测
腾讯混元团队的技术报告 Hunyuan-A13B Technical Report。页面版本是 arXiv 2609.27284v1,水印日期 2026 年 9 月 23 日。许可证是 CC BY 4.0。作者栏写的是 Tencent Hunyuan Team。
Hunyuan-A13B 是混元的混合专家模型。混合专家指总参数里每次推理只激活一部分。这里总参数 80B,激活 13B。评测分成基座、后训练的快思考和慢思考、长上下文、吞吐四段。快思考和慢思考是同一套双模式思维链的两档:快思考少走推理步,慢思考把多步推理展开。对照里的 Qwen3-A22B 是通义的混合专家模型,总参数 235B,激活 22B。BFCL v3 是函数调用榜的第三版,看工具名和参数对不对。τ-Bench 是多轮工具使用基准,要在模拟环境里把任务做完。
基座写了 shot 数,14 项里有 3 项低于上一代
第 4.1 节给基座定了协议。通用:MMLU、MMLU-Pro、MMLU-Redux、SuperGPQA 都是 5-shot,BBH 是 3-shot,SuperGPQA 带思维链。编程:EvalPlus 和 MultiPL-E 是 0-shot,MBPP 是 3-shot,CRUXEval 是 1-shot。MultiPL-E 覆盖 Python、C++、Java、PHP、TypeScript、C#、Bash、JavaScript。数学:MATH 和 GSM8K 是 4-shot 加思维链,GPQA 是 5-shot 加思维链。CMATH 写在数学组里,这节没有单独标 shot。
表 2 四列:Hunyuan-Large(激活 52B,总 389B,上下文 256K)、Qwen2.5-72B(稠密 72B,128K)、Qwen3-A22B(激活 22B,总 235B,128K)、Hunyuan-A13B(激活 13B,总 80B,256K)。
正文写:相对 2024 年的 Hunyuan-Large,只用约四分之一激活参数、约五分之一总参数,14 项里有 12 项更好。把表 2 的 14 行逐项对一下,低于 Large 的是三项,不是两项:MMLU 88.17 对 88.40,CMATH 91.17 对 91.30,GSM8k 91.83 对 92.80。其余 11 项更高,包括 MMLU-Pro 67.23 对 60.20,EvalPlus 78.64 对 75.69,GPQA 49.12 对 25.18。12/14 和表不一致。
相对 Qwen2.5-72B,表里 14 项全部更高。相对 Qwen3-A22B,CRUX-I 和 CMATH 是空的,能比的是 12 项。更高的 7 项是 MMLU 88.17、MMLU-Redux 87.67、EvalPlus 78.64、MultiPL-E 69.33、MBPP 83.86、MATH 72.35、GPQA 49.12。更低的 5 项是 MMLU-Pro 67.23 对 68.18,BBH 87.56 对 88.87,SuperGPQA 41.32 对 44.06,CRUX-O 77.00 对 79.00,GSM8k 91.83 对 94.39。这一句和正文的「12 项里赢 7 项」一致。
慢思考的工具调用不是四项都领先
第 4.2 节把后训练拆成慢思考(表 3)和快思考(表 4)。表 3 的对照是 OpenAI-o1-1217、Deepseek-R1-0120、Qwen3-A22B。名字里的日期是模型快照,不是这篇论文的日期。后训练这节没有再写 shot、温度和采样次数。
工具四项,慢思考的 Hunyuan-A13B:BFCL v3 为 78.3,高于 Qwen3-A22B 的 70.8 和 o1 的 67.8。ComplexFuncBench 为 61.2,高于 o1 的 47.6。C³-Bench 为 63.5,高于 o1 的 58.8。C³-Bench 测的是任务组合会变的工具调用。τ-Bench 是 54.7,低于 o1 的 60.4,高于 Qwen3-A22B 的 44.6 和 R1 的 43.8。正文写这四项都领先。表 3 里 τ-Bench 不是最高。
同一张慢思考表里,AIME 2024 是 87.3,四列里最高;AIME 2025 是 76.8,低于 Qwen3-A22B 的 81.5,也低于 o1 的 79.2。MATH 94.3,低于 o1 的 96.4 和 R1 的 94.9。LiveCodeBench 63.9,和 o1 相同,低于 Qwen3-A22B 的 70.7 和 R1 的 65.9。BBH 89.1、ZebraLogic 84.7 是四列里最高。DROP 用 F1,91.1,低于 R1 的 92.2。IF-Eval 84.7,低于 o1 的 91.8。
快思考(表 4)没有 o1 和 R1。工具四项:BFCL v3 为 65.9,低于 Qwen3-A22B 的 68.0,也低于 Hunyuan-Large 的 66.1。τ-Bench 42.6,四列里最高,只比 Qwen2.5-72B-Instruct 的 41.8 高 0.8。ComplexFuncBench 74.0,对照三列是 25.2、40.1、38.1。C³-Bench 65.4,高于 Qwen2.5 的 52.1。快思考的 AIME 2024 只有 30.6,低于 Qwen3-A22B 的 40.1。LiveCodeBench 27.4,低于 Qwen3-A22B 的 35.3。两张表的列不完全一样:慢思考有 ArtifactsBench、没有 McEval;快思考有 McEval、没有 ArtifactsBench。ArtifactsBench 是他们新做的前端代码生成集,正文写即将公开,这篇里还没有公开入口。
LengthCtrl、InsCtrl、ComplexNLU、Word-Task 是内部集。LengthCtrl 看输出长度约束,InsCtrl 看复杂文字指令,ComplexNLU 是长尾理解,Word-Task 是词一级语义。慢思考上这四项都低于 o1 或 R1:LengthCtrl 55.4 对 o1 的 60.1,Word-Task 62.9 对 R1 的 76.3。
长上下文里,检索增强这项没有超过对照
第 4.3 节四套长文。PenguinScrolls 是混元自己的人工标注集,四类任务:信息抽取、定位、定性分析、数值推理,材料包括书、财报、法律和论文。LongBench-v2 是公开的长上下文多任务集,含单文档问答、多文档问答、长上下文学习、长对话、代码仓库和结构化数据。FRAMES 把检索、事实和推理放在同一条多跳问题上,测的是检索增强生成,不是单看检索分数。RULER 用合成样本把长度拉开,这里只取问答子任务。
表 5:PenguinScrolls 上 Hunyuan-A13B 87.7,Gemini 2.5 Pro 88.3,DeepSeek R1 87.5,Qwen3-A22B 87.1。LongBench-v2 是 55.0,低于 Gemini 的 60.9,高于 R1 的 53.8 和 Qwen3-A22B 的 48.4。FRAMES 是 81.1,高于 Gemini 的 80.1,低于 R1 的 85.7 和 Qwen3-A22B 的 84.0。正文自己写了 RAG 这项还有差距。
表 6 是 RULER 问答,按长度分桶。Hunyuan-A13B 平均 76.7;0–8K 为 78.7,8K–32K 为 75.3,32K–64K 为 78.0,64K–128K 为 73.9。Gemini 2.5 Pro 平均 81.7,64K–128K 仍是 80.2。对照 R1 和 Qwen3-A22B 在 64K–128K 掉到 65.6 和 66.6。从 0–8K 到 64K–128K,混元掉 4.8,Gemini 掉 3.0,R1 掉 9.8。32K–64K 的 78.0 高于 8K–32K 的 75.3,不是单调变差。
吞吐表没有写在什么卡上
第 4.4 节说模型接到 vLLM、SGLang、TensorRT-LLM,精度写的是 W16A16,另支持 Weight Only INT8、W8A8 和 KV Cache FP8。表 7 的精度栏是 A16W16C16,只给 batch、输入长度、输出长度和吞吐,没有卡型、没有张量并行度。batch 1、输入 2048、输出 14336 时,190.84 token/s。batch 16 升到 1246.54,batch 32 升到 1981.99。同样 batch 32,输出加长到 22528,掉到 1725.95。输出长度都在一万 token 以上,不能直接当成短问答的首 token 延迟。
这些数不能被读成什么
78.3 只是慢思考表里的 BFCL v3。同一张表的 τ-Bench 是 54.7,低于 o1 的 60.4。快思考的 BFCL v3 是 65.9,低于 Qwen3-A22B,也低于自己上一代 Large。不能把「工具调用领先」同时套到四项、也套到快思考。
12/14 是正文相对 Hunyuan-Large 的说法。表 2 的 14 行里,更低的是 MMLU、CMATH、GSM8k 三行。相对 Qwen3-A22B 的 7/12 和表一致,但缺了 CRUX-I 和 CMATH。
AIME 2024 的 87.3 是慢思考。快思考同一项是 30.6。两张表的对照模型不一样,不能把 87.3 和 30.6 当成同一批题目上只改了一个开关的消融。后训练没有公布 shot 和采样次数。
PenguinScrolls、LengthCtrl、InsCtrl、ComplexNLU、Word-Task 是内部或自建集。ArtifactsBench 写的是即将公开。FRAMES 的 81.1 低于 R1 和 Qwen3-A22B。表 7 的 1981.99 token/s 没有硬件,换卡不能外推。全文没有线上任务成功率和时延分位。
出处:腾讯,Tencent Hunyuan Team,Hunyuan-A13B Technical Report,2026-09-23,https://arxiv.org/abs/2609.27284v1
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。