进度 76.86, 整 题 只有 41.00: 腾 讯 UI - Mate 用 检查 点 评 办公 GUI
OSWorkerBench 100 题、上限 200 步。27B 进度 76.86,整题成功 41.00,只比 Kimi-K2.6 的 40.67 高 0.33。OSWorld-Verified 77.0,低于 GPT-5.5 的 78.7。自演示的 30 题是按「没演示就失败」挑的。

本文目录
进度 76.86,整题只有 41.00:腾讯 UI-Mate 用检查点评办公 GUI
腾讯 Hy Frontier Team 的技术报告 UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations。arXiv 提交戳记 2026 年 8 月 16 日(2608.15930),正文页眉另印 August 24, 2026。许可证是 CC BY 4.0。作者以 Zihan Ding 起共 29 人。UI-Mate 有 9B 和 27B。评测分两套:只给指令,以及另外给一条演示。成功由可执行的终态检查器决定,不看轨迹像不像。
100 道办公题,检查点均值 4.86 个
OSWorkerBench 是这篇新做的办公流程基准:100 道长程任务,归一化后 41 个应用、10 个职位族。销售、客户成功和支持最多,27 道。人力资源与人才、财务与采购各 17 道。工程、IT 与可靠性,市场与增长,各 11 道。剩下 17 道摊在行政、数据、文档、项目、创意和法律。
两个标签按任务要求打,不按模型失败打,而且互相重叠。Long-Memory 67 道:动态值要跨过一段操作或切应用之后再用,或者要维持多项约束和未完成步骤。只是轨迹长、绕路、重复点击,不算。Multi-App 49 道:至少三个逻辑应用,而且至少两件动态事实、一组多字段记录或一段实质文本,要从一个应用忠实地转到另一个。只打开多个应用、只传一个标识、或者指令里已经写死的常数,不算。同一产品的多个窗口只计一次。
评价器看功能终态,不看是否模仿参考轨迹。检查点 1 到 13 个,均值 4.86,中位 5。记录级检查缺项、错项和多项;门控检查前置条件;权重把主要业务结果放在跨应用输出和辅助确认前面。部署前,原样初始状态必须得 0,黄金完成必须得 1,部分状态和负例的期望分在运行前就写死。人工再核说明、初始状态、可行性和权重。Kimi-2.6 等代表模型会先跑一遍,分数和终态对不上就改题或改评价器,再重跑受影响的检查。
只给指令时,所有模型只看目标说明。报告严格二元成功,以及基于检查点的进度分,分母都是 100。二元成功另报两个重叠子集。步数上限 200。演示引导是另一套:33 道自演示用更强 Agent 在同一题上的成功轨迹;45 道变体演示是人录的相关但不同的任务。45 道的汇总结果这篇没有给,留作以后。33 和 45 不是把 100 道切开。
对照分通用模型和专用计算机使用 Agent。论文写明架构、训练数据和脚手架都不同,比的是端到端系统,不是规模或专项训练的孤立效果。除非另说,同一初始环境、同一指令、同一交互预算、同一可执行评价器。演示对照里,每套系统按自己的输入格式吃同一条演示。
决策回合的定义:一次观测加一次模型回复算一回合。一条回复里可以有多个界面动作,中间没有新观测,仍算一回合。终止回复和重复日志不算。OSWorkerBench 的回合分析用截图、PyAutoGUI、1920×1080、名义 200 回合,每题一条轨迹。
OSWorld-Verified:27B 是 77.0,不是第一
表 1 是 OSWorld-Verified 的官方评价器给出的平均分。走官方代码、官方 Docker 或 AWS。并行只影响吞吐,不改题目和评分。星号是按官方仓库重跑。
| 模型 | 规模 | 平均分 |
|---|---|---|
| Kimi-K2.6 | 1T-A32B | 73.1 |
| Qwen3.7-Plus | 闭源 | 73.3 |
| Qwen3.6-27B | 27B | 52.5* |
| GPT-5.5 | 闭源 | 78.7 |
| Claude Sonnet 5 | 闭源 | 81.2 |
| Claude Opus 4.8 | 闭源 | 83.4 |
| EvoCUA | 32B | 56.7 |
| UI-TARS-1.5 | 7B | 25.4 |
| ScaleCUA-Qwen3.5 | 9B | 68.7 |
| UI-Mate-9B | 9B | 66.2 |
| UI-Mate-27B | 27B | 77.0 |
27B 的 77.0 高于 Kimi-K2.6 的 73.1 和 Qwen3.7-Plus 的 73.3,低于 GPT-5.5 的 78.7,差 1.7。也低于两档 Claude。专用模型里高于 ScaleCUA 的 68.7、EvoCUA 的 56.7 和 UI-TARS-1.5 的 25.4。9B 是 66.2,低于同规模 ScaleCUA 的 68.7,高于 EvoCUA-32B 共 9.5。
正文还拆了类目,没有放进表 1。9B 和 27B 的 OS 分都是 91.7。27B 相对 9B 的总提升 10.8,主要来自 Office +11.9、Daily +12.7、Professional +6.1、Workflow +13.0。相对 Kimi-K2.6,27B 的 OS 是 91.7 对 79.2,Office 是 85.4 对 80.0,Workflow 是 63.7 对 55.0,Daily 是 76.8 对 77.1,Professional 是 75.5 对 81.6。专业软件这列不是强项。
WindowsAgentArena:开源权重组里 27B 最高
表 3。协议跟随 OS-SYMPHONY 的 WAA 设置,并用对应的 OSWorld 配置作模型侧参考。环境可以是 WAA 原版 Docker,也可以是他们的内部沙箱。分数是任务评价器的端到端成功率。
| 模型 | 规模或访问 | 总分 |
|---|---|---|
| Kimi-K2.6 | 开放,1T-A32B | 63.3 |
| Qwen3.6-27B | 开放,27B | 47.1 |
| Qwen3.5-9B | 开放,9B | 37.5 |
| GPT-5.5 | 闭源 | 70.4 |
| Claude Sonnet 5 | 闭源 | 68.8 |
| Claude Opus 4.8 | 闭源 | 69.3 |
| EvoCUA-8B | 开放,8B | 37.4 |
| EvoCUA-32B | 开放,32B | 56.5 |
| UI-TARS-1.5-7B | 开放,7B | 42.1 |
| UI-TARS-2 | 闭源,230B-A23B | 50.6 |
| ScaleCUA-Qwen3.5-9B | 开放,9B | 38.1 |
| UI-Mate-9B | 9B | 61.7 |
| UI-Mate-27B | 27B | 66.2 |
27B 的 66.2 高于表内开源权重模型,包括 Kimi-K2.6 的 63.3,高 2.9。低于 Claude Sonnet 5 的 68.8、Claude Opus 4.8 的 69.3、GPT-5.5 的 70.4,差距 2.6、3.1、4.2。9B 的 61.7 比基座 Qwen3.5-9B 的 37.5 高 24.2,比同规模 ScaleCUA 的 38.1 高 23.6,比 EvoCUA-32B 的 56.5 高 5.2,距 Kimi-K2.6 还差 1.6。27B 比同规模 Qwen3.6-27B 的 47.1 高 19.1。
OSWorkerBench:整题 41.00,进度 76.86
表 2 是只给指令、100 题。进度是检查点分的平均。二元成功是整题。加粗规则是每一列基线里的最好,表注如此;下面只保留对照和本文模型。
| 模型 | 进度(100) | Multi-App 成功(49) | Long-Memory 成功(67) | 整题成功(100) |
|---|---|---|---|---|
| GPT-5.6-Sol | 87.67 | 65.31 | 67.16 | 71.00 |
| Claude Opus 4.8 | 81.54 | 53.06 | 55.22 | 62.00 |
| Claude Sonnet 5 | 81.46 | 42.86 | 50.75 | 55.00 |
| Qwen3.5-9B | 18.11 | 2.04 | 1.49 | 5.05 |
| Qwen3.6-27B | 52.35 | 7.48 | 12.94 | 23.33 |
| Kimi-K2.6 | 72.42 | 18.37 | 25.37 | 40.67 |
| UI-Mate-9B | 66.55 | 16.33 | 25.37 | 34.00 |
| UI-Mate-27B | 76.86 | 28.57 | 32.84 | 41.00 |
27B 整题 41.00,比基座 Qwen3.6-27B 的 23.33 高 17.67,进度 76.86 比 52.35 高 24.51。比 Kimi-K2.6 的整题 40.67、进度 72.42 略高。Multi-App 28.57 对 Kimi 的 18.37,Long-Memory 32.84 对 25.37。闭源三行仍明显更高,GPT-5.6-Sol 整题是 71.00。进度比整题高 35.86 个百分点,题做了一截但终态没齐。两个子集重叠,不能当成某个训练部件的因果消融。
9B 整题从基座 5.05 到 34.00,进度从 18.11 到 66.55。同基座的 ScaleCUA-Qwen3.5-9B 整题 16.33、进度 38.27。
同一 100 题上,决策回合中位数是 Kimi-K2.6 的 68、UI-Mate-27B 的 71。至少 100 回合的 UI-Mate 轨迹有 40 条。若干 Kimi 和 UI-Mate 轨迹顶到回合上限或因技术故障停下,观察到的长度是下界。GPT 的回合更短,但动作日志里平均每回合 3.83 条动作记录,近一半回合含多个非等待界面动作。短回合主要是把动作捆在一次回复里,不是任务变短。
自演示把「自己做不出」的题挑出来再测
定量的有演示结果都是自演示:每道目标配一条同一题的成功轨迹,来自更强的 GUI Agent。变体演示的 45 对不进汇总表。无演示和有演示使用同一指令、同一初始状态、同一预算、同一评价器。这里的预算放到每集 1000 步,和前面只给指令的 200 步不是同一设置。
OSWorld 子集 30 道的选法写明了:UI-Mate-27B 在没有演示时失败,但更强的参考 Agent 能做完,不可行题排除。每题 5 次平均。进度从 40.27 到 65.75,配对差 +25.48。这列没有报二元成功。引言把这两个数四舍五入成 40.3 和 65.8。
OSWorker 子集 33 道,每题跨 3 到 5 个应用,每题 3 次平均。进度 67.85 到 81.14,差 +13.29。整题成功 17.17 到 35.35,差 +18.18。引言写成 67.9、81.1、17.2、35.4。自演示度量的是能不能沿一条已经走通的同一题路径做完,论文写明这本身不是变体之间的流程迁移。
GameDev 是另 10 道人工题,人完成平均超过 200 个动作,其中 8 道是从零做 Godot 二维游戏。演示是人录的,并附相关在线教程。UI-Mate-27B 五次平均从 76.76 到 81.15,只高 4.39。已经满分的三道没有变化。
上下文也不相同。Kimi K2.6 窗口 96K,生成预留 32K,保留最近 8 步原文,估计用量到输入预算 85% 就折叠。UI-Mate-27B 窗口 128K,生成预留 64K,保留最近 40 步文本和 5 张截图,60% 就折叠。折叠摘要温度 0.2,上限 2048 token。每张截图按 1800 token 估计占用。
这些数不能被读成什么
OSWorld-Verified 的 77.0 低于 GPT-5.5 和两档 Claude。WAA 的 66.2 低于三个闭源模型。OSWorkerBench 整题 41.00 只比 Kimi-K2.6 高 0.33,远低于 GPT-5.6-Sol 的 71.00。进度 76.86 不是整题成功。每题一条轨迹,没有重复运行的区间。200 步的指令协议和 1000 步的演示协议不能横比。30 道 OSWorld 子集是按「27B 失败且别人能做」挑的,+25.48 不能当成全榜上加一条演示的平均效果。33 道自演示用的是同一题的成功轨迹,会把做法暴露给模型。45 道更接近迁移的人录演示没有汇总分。Long-Memory 和 Multi-App 重叠。类目里的 Professional 仍低于 Kimi。预印本许可证是 CC BY 4.0,这篇只复述评测协议和表内数字。
出处:腾讯 Hy Frontier Team,Zihan Ding 等,UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations,2026-08-16,https://arxiv.org/abs/2608.15930
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。