CodexQA

Industry & PracticeResearch & Benchmarks

进度 76.86,整题只有 41.00:腾讯 UI-Mate 用检查点评办公 GUI

CodexQA 团队7 min read

OSWorkerBench 100 题、上限 200 步。27B 进度 76.86,整题成功 41.00,只比 Kimi-K2.6 的 40.67 高 0.33。OSWorld-Verified 77.0,低于 GPT-5.5 的 78.7。自演示的 30 题是按「没演示就失败」挑的。

In this piece

进度 76.86,整题只有 41.00:腾讯 UI-Mate 用检查点评办公 GUI

腾讯 Hy Frontier Team 的技术报告 UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations。arXiv 提交戳记 2026 年 8 月 16 日(2608.15930),正文页眉另印 August 24, 2026。许可证是 CC BY 4.0。作者以 Zihan Ding 起共 29 人。UI-Mate 有 9B 和 27B。评测分两套:只给指令,以及另外给一条演示。成功由可执行的终态检查器决定,不看轨迹像不像。

100 道办公题,检查点均值 4.86 个

OSWorkerBench 是这篇新做的办公流程基准:100 道长程任务,归一化后 41 个应用、10 个职位族。销售、客户成功和支持最多,27 道。人力资源与人才、财务与采购各 17 道。工程、IT 与可靠性,市场与增长,各 11 道。剩下 17 道摊在行政、数据、文档、项目、创意和法律。

两个标签按任务要求打,不按模型失败打,而且互相重叠。Long-Memory 67 道:动态值要跨过一段操作或切应用之后再用,或者要维持多项约束和未完成步骤。只是轨迹长、绕路、重复点击,不算。Multi-App 49 道:至少三个逻辑应用,而且至少两件动态事实、一组多字段记录或一段实质文本,要从一个应用忠实地转到另一个。只打开多个应用、只传一个标识、或者指令里已经写死的常数,不算。同一产品的多个窗口只计一次。

评价器看功能终态,不看是否模仿参考轨迹。检查点 1 到 13 个,均值 4.86,中位 5。记录级检查缺项、错项和多项;门控检查前置条件;权重把主要业务结果放在跨应用输出和辅助确认前面。部署前,原样初始状态必须得 0,黄金完成必须得 1,部分状态和负例的期望分在运行前就写死。人工再核说明、初始状态、可行性和权重。Kimi-2.6 等代表模型会先跑一遍,分数和终态对不上就改题或改评价器,再重跑受影响的检查。

只给指令时,所有模型只看目标说明。报告严格二元成功,以及基于检查点的进度分,分母都是 100。二元成功另报两个重叠子集。步数上限 200。演示引导是另一套:33 道自演示用更强 Agent 在同一题上的成功轨迹;45 道变体演示是人录的相关但不同的任务。45 道的汇总结果这篇没有给,留作以后。33 和 45 不是把 100 道切开。

对照分通用模型和专用计算机使用 Agent。论文写明架构、训练数据和脚手架都不同,比的是端到端系统,不是规模或专项训练的孤立效果。除非另说,同一初始环境、同一指令、同一交互预算、同一可执行评价器。演示对照里,每套系统按自己的输入格式吃同一条演示。

决策回合的定义:一次观测加一次模型回复算一回合。一条回复里可以有多个界面动作,中间没有新观测,仍算一回合。终止回复和重复日志不算。OSWorkerBench 的回合分析用截图、PyAutoGUI、1920×1080、名义 200 回合,每题一条轨迹。

OSWorld-Verified:27B 是 77.0,不是第一

表 1 是 OSWorld-Verified 的官方评价器给出的平均分。走官方代码、官方 Docker 或 AWS。并行只影响吞吐,不改题目和评分。星号是按官方仓库重跑。

模型规模平均分
Kimi-K2.61T-A32B73.1
Qwen3.7-Plus闭源73.3
Qwen3.6-27B27B52.5*
GPT-5.5闭源78.7
Claude Sonnet 5闭源81.2
Claude Opus 4.8闭源83.4
EvoCUA32B56.7
UI-TARS-1.57B25.4
ScaleCUA-Qwen3.59B68.7
UI-Mate-9B9B66.2
UI-Mate-27B27B77.0

27B 的 77.0 高于 Kimi-K2.6 的 73.1 和 Qwen3.7-Plus 的 73.3,低于 GPT-5.5 的 78.7,差 1.7。也低于两档 Claude。专用模型里高于 ScaleCUA 的 68.7、EvoCUA 的 56.7 和 UI-TARS-1.5 的 25.4。9B 是 66.2,低于同规模 ScaleCUA 的 68.7,高于 EvoCUA-32B 共 9.5。

正文还拆了类目,没有放进表 1。9B 和 27B 的 OS 分都是 91.7。27B 相对 9B 的总提升 10.8,主要来自 Office +11.9、Daily +12.7、Professional +6.1、Workflow +13.0。相对 Kimi-K2.6,27B 的 OS 是 91.7 对 79.2,Office 是 85.4 对 80.0,Workflow 是 63.7 对 55.0,Daily 是 76.8 对 77.1,Professional 是 75.5 对 81.6。专业软件这列不是强项。

WindowsAgentArena:开源权重组里 27B 最高

表 3。协议跟随 OS-SYMPHONY 的 WAA 设置,并用对应的 OSWorld 配置作模型侧参考。环境可以是 WAA 原版 Docker,也可以是他们的内部沙箱。分数是任务评价器的端到端成功率。

模型规模或访问总分
Kimi-K2.6开放,1T-A32B63.3
Qwen3.6-27B开放,27B47.1
Qwen3.5-9B开放,9B37.5
GPT-5.5闭源70.4
Claude Sonnet 5闭源68.8
Claude Opus 4.8闭源69.3
EvoCUA-8B开放,8B37.4
EvoCUA-32B开放,32B56.5
UI-TARS-1.5-7B开放,7B42.1
UI-TARS-2闭源,230B-A23B50.6
ScaleCUA-Qwen3.5-9B开放,9B38.1
UI-Mate-9B9B61.7
UI-Mate-27B27B66.2

27B 的 66.2 高于表内开源权重模型,包括 Kimi-K2.6 的 63.3,高 2.9。低于 Claude Sonnet 5 的 68.8、Claude Opus 4.8 的 69.3、GPT-5.5 的 70.4,差距 2.6、3.1、4.2。9B 的 61.7 比基座 Qwen3.5-9B 的 37.5 高 24.2,比同规模 ScaleCUA 的 38.1 高 23.6,比 EvoCUA-32B 的 56.5 高 5.2,距 Kimi-K2.6 还差 1.6。27B 比同规模 Qwen3.6-27B 的 47.1 高 19.1。

OSWorkerBench:整题 41.00,进度 76.86

表 2 是只给指令、100 题。进度是检查点分的平均。二元成功是整题。加粗规则是每一列基线里的最好,表注如此;下面只保留对照和本文模型。

模型进度(100)Multi-App 成功(49)Long-Memory 成功(67)整题成功(100)
GPT-5.6-Sol87.6765.3167.1671.00
Claude Opus 4.881.5453.0655.2262.00
Claude Sonnet 581.4642.8650.7555.00
Qwen3.5-9B18.112.041.495.05
Qwen3.6-27B52.357.4812.9423.33
Kimi-K2.672.4218.3725.3740.67
UI-Mate-9B66.5516.3325.3734.00
UI-Mate-27B76.8628.5732.8441.00

27B 整题 41.00,比基座 Qwen3.6-27B 的 23.33 高 17.67,进度 76.86 比 52.35 高 24.51。比 Kimi-K2.6 的整题 40.67、进度 72.42 略高。Multi-App 28.57 对 Kimi 的 18.37,Long-Memory 32.84 对 25.37。闭源三行仍明显更高,GPT-5.6-Sol 整题是 71.00。进度比整题高 35.86 个百分点,题做了一截但终态没齐。两个子集重叠,不能当成某个训练部件的因果消融。

9B 整题从基座 5.05 到 34.00,进度从 18.11 到 66.55。同基座的 ScaleCUA-Qwen3.5-9B 整题 16.33、进度 38.27。

同一 100 题上,决策回合中位数是 Kimi-K2.6 的 68、UI-Mate-27B 的 71。至少 100 回合的 UI-Mate 轨迹有 40 条。若干 Kimi 和 UI-Mate 轨迹顶到回合上限或因技术故障停下,观察到的长度是下界。GPT 的回合更短,但动作日志里平均每回合 3.83 条动作记录,近一半回合含多个非等待界面动作。短回合主要是把动作捆在一次回复里,不是任务变短。

自演示把「自己做不出」的题挑出来再测

定量的有演示结果都是自演示:每道目标配一条同一题的成功轨迹,来自更强的 GUI Agent。变体演示的 45 对不进汇总表。无演示和有演示使用同一指令、同一初始状态、同一预算、同一评价器。这里的预算放到每集 1000 步,和前面只给指令的 200 步不是同一设置。

OSWorld 子集 30 道的选法写明了:UI-Mate-27B 在没有演示时失败,但更强的参考 Agent 能做完,不可行题排除。每题 5 次平均。进度从 40.27 到 65.75,配对差 +25.48。这列没有报二元成功。引言把这两个数四舍五入成 40.3 和 65.8。

OSWorker 子集 33 道,每题跨 3 到 5 个应用,每题 3 次平均。进度 67.85 到 81.14,差 +13.29。整题成功 17.17 到 35.35,差 +18.18。引言写成 67.9、81.1、17.2、35.4。自演示度量的是能不能沿一条已经走通的同一题路径做完,论文写明这本身不是变体之间的流程迁移。

GameDev 是另 10 道人工题,人完成平均超过 200 个动作,其中 8 道是从零做 Godot 二维游戏。演示是人录的,并附相关在线教程。UI-Mate-27B 五次平均从 76.76 到 81.15,只高 4.39。已经满分的三道没有变化。

上下文也不相同。Kimi K2.6 窗口 96K,生成预留 32K,保留最近 8 步原文,估计用量到输入预算 85% 就折叠。UI-Mate-27B 窗口 128K,生成预留 64K,保留最近 40 步文本和 5 张截图,60% 就折叠。折叠摘要温度 0.2,上限 2048 token。每张截图按 1800 token 估计占用。

这些数不能被读成什么

OSWorld-Verified 的 77.0 低于 GPT-5.5 和两档 Claude。WAA 的 66.2 低于三个闭源模型。OSWorkerBench 整题 41.00 只比 Kimi-K2.6 高 0.33,远低于 GPT-5.6-Sol 的 71.00。进度 76.86 不是整题成功。每题一条轨迹,没有重复运行的区间。200 步的指令协议和 1000 步的演示协议不能横比。30 道 OSWorld 子集是按「27B 失败且别人能做」挑的,+25.48 不能当成全榜上加一条演示的平均效果。33 道自演示用的是同一题的成功轨迹,会把做法暴露给模型。45 道更接近迁移的人录演示没有汇总分。Long-Memory 和 Multi-App 重叠。类目里的 Professional 仍低于 Kimi。预印本许可证是 CC BY 4.0,这篇只复述评测协议和表内数字。

出处:腾讯 Hy Frontier Team,Zihan Ding 等,UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations,2026-08-16,https://arxiv.org/abs/2608.15930

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction