Industry & PracticeResearch & Benchmarks
平均 只比 老师 高 0.4: 蚂蚁 MAGA 用 动作 结构 蒸馏 评 跨 端 GUI
8B 平均成功率 51.2,比三个域老师的平均 50.9 高 0.4,TNS 99.9。MobileWorld 仍低 3.4。2B 的 TNS 只有 77.1。WebVoyager 只用 140 题。

In this piece
平均只比老师高 0.4:蚂蚁 MAGA 用动作结构蒸馏评跨端 GUI
蚂蚁集团参与的预印本 MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation,arXiv 戳记 2026 年 7 月 31 日(2607.29320)。Hang Yan 注明实习于 Ant Group,通讯作者 Zhangxuan Gu 的邮箱是 guzhangxuan.gzx@antgroup.com。单位还有西安交通大学、上海交通大学。MAGA 要做的事是把手机、桌面、网页三个域的专用老师收成一个学生。评测只看任务成功率,另外用老师归一化分数看学生留下了多少老师的能力。
三个榜,分母是 117、369、140
主指标是任务级成功率 SR。百分数之差都是百分点,不是相对变化。三个域的分母固定:MobileWorld 的 GUI 任务 117 道,OSWorld 全量 369 道,WebVoyager 固定子集 140 道。140 道是 14 个网站各 10 道,任务编号写在附录 A.1,不是 WebVoyager 全量。SR 由整数成功计数换算,正文没有把每一格的成功条数再列出来。
老师归一化分数 TNS:每个域用该方法的 SR 除以该域专用老师的 SR,再对域平均,乘 100。100 表示平均下来和学生所对的老师打平。域内还报 ΔT,就是该方法 SR 减去该域老师 SR。
学生和老师的来历要分开。每个规模先用三域混合数据对 Qwen3-VL 做 mid-train,得到通用学生。主表、消融和分析里所有可训练学生都从这个检查点出发。再把同一检查点分别做三域 SFT,得到三个冻结的域老师。主实验一次收三个老师。对照是域老师、SFT、GRPO、Weight Soup、TIES、UI-MOPD。去掉 MAGA 的学生侧和老师侧,就回到按样本路由的普通 OPD。
训练集 343000 条,网页 200000、手机 93000、桌面 50000。这些数据受隐私和保密协议约束,论文写明不公开,采集规模、域构成和生产条件也和公开集不同。GRPO、UI-MOPD、MAGA 用的是同一套 SFT 数据,标签取最后一步动作。32 张 H20,训 1 个 epoch。AdamW,全局 batch 128,权重衰减 0,最长 16384 token,学习率先线性升 3% 步,然后停在 1e-5。每个提示采 4 条学生轨迹。视觉塔在老师之间逐位相同,全程冻结。推理用 vLLM。放大系数 β 全部实验取 1,选中的动作 token 权重加倍,不按域再调。每条训练样本只有一个输出动作,输入里可以有交互历史。
8B 平均 51.2,2B 平均只有 25.3
表 1。同一规模里,统一方法的最好结果加粗,第二名下划线。老师行不是统一方法。
8B:
| 方法 | MobileWorld | OSWorld | WebVoyager | 平均 SR | TNS |
|---|---|---|---|---|---|
| 域老师 | 37.6 | 42.8 | 72.1 | 50.9 | 100.0 |
| 通用学生 | 12.8(ΔT -24.8) | 20.9(-22.0) | 37.1(-35.0) | 23.6 | 44.8 |
| SFT | 33.3(-4.3) | 43.1(+0.3) | 68.6(-3.6) | 48.3 | 94.8 |
| GRPO | 17.9(-19.7) | 25.5(-17.3) | 60.0(-12.1) | 34.5 | 63.5 |
| Weight Soup | 29.1(-8.5) | 42.3(-0.5) | 72.9(+0.7) | 48.1 | 92.3 |
| TIES | 31.6(-6.0) | 41.5(-1.4) | 70.0(-2.1) | 47.7 | 92.7 |
| UI-MOPD | 30.8(-6.8) | 44.7(+1.9) | 72.1(0.0) | 49.2 | 95.4 |
| MAGA | 34.2(-3.4) | 45.3(+2.4) | 74.3(+2.1) | 51.2 | 99.9 |
8B 上 MAGA 三个域都高于 UI-MOPD。平均 SR 比最强对照高 2.0,TNS 高 4.4。相对老师,MobileWorld 低 3.4,OSWorld 高 2.4,WebVoyager 高 2.1。平均 SR 51.2,比老师平均 50.9 高 0.4。TNS 99.9,不是三个域都超过老师。
Weight Soup 在 WebVoyager 上比老师高 0.7,在 MobileWorld 上低 8.5。MAGA 把这两格收成 +2.1 和 -3.4。论文把这叫做权重合并的不平衡被缩小,不是消掉。
2B:
| 方法 | MobileWorld | OSWorld | WebVoyager | 平均 SR | TNS |
|---|---|---|---|---|---|
| 域老师 | 24.8 | 25.2 | 47.9 | 32.6 | 100.0 |
| Weight Soup | 12.0(-12.8) | 21.7(-3.5) | 40.0(-7.9) | 24.5 | 72.6 |
| MAGA | 14.5(-10.3) | 23.6(-1.6) | 37.9(-10.0) | 25.3 | 77.1 |
2B 的 WebVoyager 上 Weight Soup 是 40.0,高于 MAGA 的 37.9,差 2.1。MAGA 的平均 SR 和 TNS 仍是表内统一方法最高。三个域全部低于老师,TNS 只有 77.1。摘要里「和老师几乎打平」只对应 8B 的平均,不能套到 2B。
消融和单步诊断
表 2 只在 Qwen3-VL-8B 上做,报三个域的 SR。
| 变体 | MobileWorld | OSWorld | WebVoyager |
|---|---|---|---|
| MAGA | 34.2 | 45.3 | 74.3 |
| 去掉学生侧 | 30.8 | 41.5 | 72.9 |
| 去掉规则 1 | 31.6 | 45.0 | 70.7 |
| 去掉规则 2 | 32.7 | 43.4 | 74.3 |
| 去掉规则 3 | 33.3 | 43.9 | 72.1 |
| 去掉老师侧 | 31.6 | 45.3 | 73.6 |
| 两侧都去掉 | 29.1 | 44.4 | 70.0 |
去掉学生侧,三域下降 3.4、3.8、1.4。去掉老师侧提示,MobileWorld 降 2.6,WebVoyager 降 0.7,OSWorld 仍是 45.3。两侧都去掉就是普通路由 OPD,MobileWorld 掉到 29.1。
表 3 不是任务成功率。它在每域 300 道留出题上看单步动作:类型和所需参数都对,才算 Correct。8B 训练前总体 42.2% 全对、30.9% 类型错、26.9% 类型对但参数错。训练后是 63.2、14.6、22.2,变化 +21.0、-16.3、-4.7。分域的全对提升是 MobileWorld +22.3、OSWorld +23.0、WebVoyager +17.7。这 900 题和训练集不相交。
同一批 900 道离线单步题上,训练后学生的动作有 61.5% 和对应域老师一致,14.8% 只和别的域老师一致。20.6% 和任何老师都不一致而且是错的,另有 3.0% 不一致但是对的。论文把这 3.0% 写成学生能写出老师没写出的正确动作,分母仍是这 900 道单步,不是三个榜的任务成功率。
另从 900 道里取出动作类型错误的 136 条。只把类型换成参考类型,让冻结的学生按原上下文和推理重写参数,不给参考参数。68.4% 因此变对。需要坐标参数的 87 条里,57 条被救回。这是诊断实验,不是评测协议的一部分。
高分歧案例是另一套筛选。900 道随机样本里,三个域老师对空间动作分歧大的有 66 道,都在 MobileWorld:29 道 Click、37 道 Swipe。条件是三位老师都给出合法坐标,且两两最大距离大于 0.07。图 1(a) 说,在这类高分歧样本上,权重合并后的动作成功率比单个模型低 10% 到 24%。表 4 只比 Weight Soup 和 MAGA:Click 从 16/29(55.2%)到 21/29(72.4%),Swipe 从 31/37(83.8%)到 35/37(94.6%)。Soup 错 19 道,MAGA 改对其中 10 道,并新错 1 道 Click。合计从 47/66(71.2%)到 56/66(84.8%),高 13.6 个百分点。66 道不能代表 117 道 MobileWorld。
动作是否算对,附录给了规则。Click、LongPress、Hover、DoubleClick:点距离不超过较短屏幕边的 0.07 倍。Drag 的两端都不超过 0.14 倍。带方向的 Scroll,方向必须一致,端点不超过 0.07。文本、应用名、URL:精确匹配,或 token F1 高于 0.5。热键去掉首尾空白后精确匹配。空参数的动作只看类型。
学生为什么没有稳定超过老师
表 5 看 8B 学生的回复构成和交互步数。动作 token 只占回复的 3.9% 到 7.1%:MobileWorld 4.1,OSWorld 7.1,WebVoyager 3.9,其余是推理。失败轨迹平均比成功轨迹更长。步数差(失败减成功)是 MobileWorld 10.2(29.4 对 19.2)、OSWorld 43.4(56.9 对 13.5)、WebVoyager 23.4(39.2 对 15.8)。论文的解释是两条:动作 token 太短,监督被推理稀释;训练只有单步标签,评测却是多步执行。
这些数不能被读成什么
8B 的 TNS 99.9 是三域比值的平均,MobileWorld 仍比老师低 3.4。2B 的 TNS 是 77.1,WebVoyager 还不如 Weight Soup。WebVoyager 只用了 140 道、14 个网站,不能当成全量榜。OSWorld 用的是他们称为全量的 369 道,MobileWorld 只用 GUI 任务 117 道。训练集不公开,换一套数据不能从这张表外推。单步 900 题、类型替换 136 条、高分歧 66 道,都不是三个榜的 SR。坐标阈值 0.07 和 0.14 是这篇的动作判定,不是各榜官方的任务成功定义。β 固定为 1,没有做域内搜索。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测协议和表内数字。
出处:蚂蚁集团,Hang Yan、Zhangxuan Gu、Beitong Zhou、Jiaxuan Chen、Runze Li、Yusong Hu、Shuheng Shen、Changhua Meng,MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation,2026-07-31,https://arxiv.org/abs/2607.29320
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.