MobilePA 总 分 77.05, 技能 项 仍 低于 93.25: 阿里 把 手机 规划 的 模型 和 Harness 拆开 测
27B 加 Harness 后 MobilePA 总分 77.05,技能项 86.25,低于表内 93.25。35B-A3B 的总分只有 69.91。每千条 2.41 美元不含输入和 Harness。

本文目录
MobilePA 总分 77.05,技能项仍低于 93.25:阿里把手机规划的模型和 Harness 拆开测
阿里 MAI 团队、Alibaba Token Hub 的技术报告 Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents。页面版本是 arXiv 2609.29892v1,水印日期 2026 年 9 月 24 日。许可证是 CC BY 4.0。
Qwen-Planner-Agent 是一套手机规划系统。规划在这里指:给定手机上的任务,模型决定调哪些工具、按什么顺序做完。Qwen-Planner-Model 是训好的规划模型,部署时不带他们的 Harness。Harness 指权重之外的运行层,这里包括上下文、持久记忆、Skill 和执行反馈。Qwen-Planner-Agent 是同一检查点加上这层。两个尺寸:35B-A3B 是总参数 35B、推理时激活约 3B 的混合专家;27B 是另一个骨干,表里没有再标激活参数。
1700 多条任务上,总分第一不是五项都第一
第 3.1 节用 MobilePA-Bench。这是一套可执行的手机规划基准:1700 条以上任务,200 个以上手机工具,13 个问句领域。任务从受控的初始状态出发。完成与否看三件事里的命中:工具调用、终态有没有变、Agent 行为。正文写终评和开发环分开,开发环在第 2.1 节,不拿来当这张表的分数。
表 1 的 27B Agent:Overall 77.05,Tool Use 77.79,Memory 74.76,Skills 86.25,Sub-agent 59.55。Overall 高于表里的 GPT 6 Astra 76.84 和 Claude Opus 5 的 75.71。Tool Use 77.79 也是表里最高,Opus 5 是 77.60。
另外三项不是最高。Memory 74.76,低于 Claude Fable 5 的 76.33。Skills 86.25,低于 GPT 6 Astra 的 93.25。Sub-agent 59.55,和 Opus 5 相同,低于 Fable 5 的 68.54,也低于 Gemini 3.1 Pro 的 61.80。Sub-agent 指把子任务交给别的代理去跑。
两个尺寸相对各自基线都升。27B 从基线 67.22 到只训规划器的 71.90,再到 Agent 77.05。35B-A3B 从 54.90 到 64.79,再到 69.91。35B-A3B 的 Agent 总分低于表里多数闭源模型,也低于未训练的 27B 基线 67.22。35B-A3B 加上 Harness 之后,Sub-agent 仍是 52.81,没有变。
同一节的成本是估计值:每 1000 条任务的输出费用 2.41 美元,其他被评模型在 3.06 到 67.76 美元。算法是平均输出 token 乘输出单价,思考 token 算在输出里。不含输入 token、外部工具费、真机执行和 Harness 本身的处理。
固定检查点能分开的,只有 Harness 那一层
第 3.2.1 节在 27B 基线上比三种训练:普通强化学习、完整 CARE、以及拿掉 advantage calibration 的 CARE。CARE 是按能力阶段调奖励和优势的训练法。四个训练环境,曲线做了平滑。完整 CARE 的训练准确率和普通强化学习差不多,最后那个对齐的步上,输出 token 少 32.5%。拿掉校准之后输出更短,但准确率在画出的区间里明显更低。正文没有给出这三条曲线的准确率数字。
第 3.2.2 节把检查点固定,只加 Harness。27B:Overall 71.90 到 77.05,Tool Use 72.79 到 77.79,Memory 70.74 到 74.76,Skills 79.25 到 86.25,Sub-agent 55.06 到 59.55。35B-A3B:Overall 64.79 到 69.91,Sub-agent 不动。这是部署层的合计效果,没有把记忆、Skill、反馈再拆开。
第 3.2.3 节的共进化用的是另一份 27B 检查点,不是表 1 那份。MobilePA-Internal 是内部集,三类:工具使用、长上下文、个性化规划。MCPMark 是跨五个领域的通用工具使用基准。每一轮在固定 Harness 上训练固定步数,然后在留出的 evolve 集上看反馈、改 Harness。evolve 集被写成开发集,不是独立终测,轨迹也不直接拿去训练。
表 2:MobilePA-Internal 的 Overall,只模型 82.67,加 Harness 84.23,共进化四轮后 88.50。工具使用 83.36、85.52、89.76。长上下文前两行都是 75.46,四轮后才到 82.42。个性化规划 75.46、75.46、82.42。MCPMark 三轮:38.00、42.26、46.98。内部集上的 88.50 不能和表 1 的 77.05 比,题目池不一样,检查点也不一样。
历史一长,直接塞进上下文的分数掉到 25 上下
第 3.3 节看持久记忆有没有用。没有 Harness 时,问题和交互历史直接放进上下文,按 1M 或 256K 的预算分组,超了就从最早的历史截掉。有 Harness 时,记忆模块先看完整历史,再取和当前任务有关的证据。同一对 Qwen 用同一个规划检查点,只换历史怎么读。输入 token 和处理成本两边不一样。
LoCoMo 和 LongMemEval 用二分的 LLM 裁判,对或错。BEAM 用量表均分,再写成百分数。Mem0 的官方数是外部参照,不是用这套 Harness 测的。
直接塞上下文时,短历史仍然高。1M 预算组里 Claude Opus 5 的 BEAM-500K 是 73.63,BEAM-1M 是 54.84。BEAM-10M 上,直接上下文没有一列超过 25.64,这一格是 35B-A3B 基线。256K 组里 27B 规划器:LoCoMo 94.35,LongMemEval 95.00,BEAM-10M 21.99。
加上 Harness 之后,长历史才拉开。27B Agent:BEAM-500K 72.20,BEAM-1M 73.71,BEAM-10M 67.24。BEAM-1M 的最高格不是这个 Agent,而是 27B 基线加 Harness 的 73.97。四对匹配模型的均值,论文算的是:BEAM-500K 从 42.18 到 68.29,BEAM-1M 从 40.41 到 70.27,BEAM-10M 从 23.42 到 61.66。短历史的均值几乎不动:LoCoMo 93.90 到 94.12,LongMemEval 91.65 到 92.24,BEAM-100K 71.12 到 72.05。单对里有下降。35B-A3B 规划器的 LongMemEval 从 87.80 到 86.55。
Mem0 官方在 BEAM-1M、BEAM-10M 上是 64.10 和 48.60,平均 74.90 只覆盖它报出的四格,中间两格是空的。不能和八列齐全的模型平均直接比。
离开手机之后,七项里不是项项都升
第 3.4 节把规划器单独拿去和对应基线比,不带 Harness。七项智能体:Claw-Eval、BFCL-v4、MCP-Atlas、Tau-3、Toolathlon、SWE-Multilingual、SWE-Pro。BFCL-v4 是函数调用榜的第四版。Tau-3 是多轮工具任务。SWE 两项是改代码仓库。通用三项是 MMLU-Redux、C-Eval、IFEval。
35B-A3B 七项里六项上升,平均 57.74 到 62.31。上升的是 Claw-Eval 72.83 到 74.51,BFCL-v4 60.63 到 66.99,MCP-Atlas 59.40 到 68.69,Toolathlon 29.30 到 37.15,SWE-Multilingual 65.67 到 71.67,SWE-Pro 48.43 到 50.07。下降的是 Tau-3,67.94 到 67.06。通用平均 90.35 到 89.92。IFEval 从 90.94 到 89.83,MMLU-Redux 89.67 到 89.53,C-Eval 90.45 到 90.39。
27B 七项里五项上升,平均 67.91 到 69.29。下降两项:Claw-Eval 82.48 到 79.58,SWE-Multilingual 76.65 到 74.89。BFCL-v4 67.06 到 73.60,Tau-3 74.27 到 74.95,Toolathlon 39.70 到 44.02,SWE-Pro 61.70 到 64.71,MCP-Atlas 71.05 到 73.25。通用平均 90.05 到 89.70,三项都略降:88.73 到 88.67,89.74 到 89.30,91.68 到 91.13。
第 3.5 节是六条执行轨迹的定性说明,没有另给分数。其中一条是换算工具失败后改用计算器。这不能当成失败率。
这些数不能被读成什么
77.05 是 27B 加上 Harness 之后,在 MobilePA-Bench 上的 Overall。技能项 86.25 仍低于 GPT 6 Astra 的 93.25,子代理 59.55 不是最高。35B-A3B 的 Agent 只有 69.91。完成判定包含「Agent 行为」,这节没有给出三种判定各占多少,也没有人评一致率。
2.41 美元只覆盖输出 token。输入、工具、真机和 Harness 都不在账单里。
32.5% 来自平滑后的训练曲线,不是 MobilePA 终测上的 token。准确率只写了「相当」,没有数。
88.50 是内部集、另一份检查点、四轮共进化之后的开发向结果。evolve 集不是终测。长上下文在只加 Harness 时停在 75.46,没有涨。
表 3 的 1M 组和 256K 组预算不同,不能把 Opus 5 的 54.84 和 256K 组的 21.99 写成同条件。Mem0 不是这套 Harness。短历史上有单对变差。
表 4 的平均上升,盖不住 27B 的 Claw-Eval 和 SWE-Multilingual,也盖不住 35B-A3B 的 Tau-3。通用三项是略降,不是持平。全文没有线上手机任务的成功率,也没有真机时延。
出处:阿里,MAI Team, Alibaba Token Hub,Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents,2026-09-24,https://arxiv.org/abs/2609.29892v1
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。