整 题 只有 2.8 %: 蚂蚁 UI - Venus - 2 用 关键 点 把 GUI 轨迹 和 单 步 分开 评
27B 在 OSWorld 2.0 的 108 题、150 步上整题只有 2.8%,部分分 13.2。MobileWorld 50 步 76.1,低于 Qwen-UI-Agent 的 82.1。WebVoyager 刷新子集 93.4。OSBlind 的攻击成功率仍是 47.9。

本文目录
整题只有 2.8%:蚂蚁 UI-Venus-2 用关键点把 GUI 轨迹和单步分开评
蚂蚁集团 Venus Team 的技术报告 UI-Venus-2 Technical Report,arXiv 戳记 2026 年 8 月 27 日(2609.00028)。通讯作者是 Shuheng Shen、Changhua Meng。UI-Venus-2 是一套跨手机、网页和桌面的 GUI Agent,有 9B 和 27B 两档,分别从 Qwen3.5-9B、Qwen3.6-27B 初始化。报告把评测和训练信号拆开:榜单看任务是否做成,训练用的轨迹检查看关键点,单步对错在动作执行前就判定。
协议:温度、步数和星号先定死
推理时,通用任务温度 1.0,视觉分辨率用 Qwen3.5 的默认配置,默认开推理,并把完整推理历史喂回上下文。GUI grounding 关掉推理,温度设为 0。表里每一列,最好的加粗,第二名下划线。星号是作者重跑或复现,不是原榜原样抄来的。
图 1 把口径写在注里。MobileWorld 只用 GUI 成功率,117 题、50 步。WebVoyager 用刷新后的 595 题。Odysseys 是 200 题的 rubric 均分。VenusBench-CAPTCHA 是全部 219 例的 micro Pass@1。VenusBench-GD 是英文指令的 micro-average,点落在框内算对。图注还写了:优先选独立端到端系统、任务子集和步数预算最接近的结果,来源报告里的动作脚手架仍可能不同。
环境不是单应用。可执行移动应用 170 个以上,中文 100 个以上、英文 70 个以上,另有原生桌面系统。网页池来自公开浏览器 Agent 基准加 Tranco 排名,再做可达性检查,并用 Kimi 2.6 给动态性、可交互性、内容丰富度和画面质量打分,得到 4000 个以上域名、19 类。能力目录另外种入 InSTA-150k-v3 的 45000 条任务。网页执行用真实 Chrome,接口是 15 个动作的 Playwright。桌面任务写成 TaskSpec:受控桌面快照、安装步骤、所需文件和服务、出处、结果评价器。长任务切成子目标,上一段验收过的退出状态用来接着采下一段。
轨迹关键点和单步判定不是榜单分数
轨迹验证有两层。报告写明,Semantic Guided Verification(SGV)的结论用来给数据分层,不是直接的训练标签,也不是基准分数。
轨迹层不看模型自己有没有宣称成功。失败、超时、升级给用户的轨迹同样送去检查。流程五步:从任务目标抽出可核验关键点;轨迹切成固定窗口,点击位置在截图上画红点;各窗口并行判断哪些关键点已经满足;证据清楚的走硬规则,含糊的交给多模态终判,终判看结束信号、行为统计、窗口解释和最后一张截图;输出结论、理由、每个关键点的状态和证据截图。四类结果是 completed、partial、infeasible、failed。例子是往指定群发指定内容,关键点是进对群、写对标题和正文、确认发出。前两步做完但步数用尽,算 partial,不算 failed。completed 进高质量候选;partial 去截断或续写;infeasible 用来改任务可行性规则;failed 用来分开是任务设计、环境不稳还是模型不行。
单步层是事前判断。只看执行前能看到的东西:当前截图、声明的动作类型和目标、模型推理、任务目标。后面页面怎么跳,不拿来给这一步记分,避免把环境抖动算进动作质量。先看推理和动作是否一致,再看是否对准任务。四类:Correct,动作推进任务且模型知道自己做对了;Exploratory,明确不确定,但在试一条说得通的路;Ineffective,点了不能点的区域或短循环,没有实质推进;Incorrect,偏离目标、做完还继续,或推理和动作不一致。
这些单步再收成轨迹三档。不可行任务要能正确报出来,认不出就算失败。可行任务里,只做打开应用、切标签、滚动这类通用操作,不算部分完成,至少要有一步任务专属操作,例如输入指定内容或选中指定目标。
手机六项:50 步的 MobileWorld 不是第一
表 1。VenusBench-Mobile 报 149 题主池的成功率。MobileWorld 报 GUI-only、117 题、50 步,括号里是 100 步。MemGUI 报 Main Results 的 pass@1。
| 模型 | MobileGym | VenusBench-Mobile | AndroidWorld | MobileWorld | KnowUBench | MemGUI |
|---|---|---|---|---|---|---|
| UI-Venus-2-9B | 52.7 | 46.5 | 80.2 | 65.8(75.2) | 56.5 | 62.6 |
| UI-Venus-2-27B | 60.5 | 48.7 | 84.0 | 76.1(82.9) | 59.7 | 70.3 |
| 表内对照 | Seed-2.0-Pro 52.0 | Claude-Opus-4.6 36.5* | UI-Venus-1.5-30B-A3B 77.6 | Qwen-UI-Agent-27B 82.1(85.5) | Seed-2.0-Pro 51.6 | Seed-2.0-Pro 65.6* |
27B 在 MobileGym 上比 Seed-2.0-Pro 高 8.5。同表里 GUI 专用模型的最高对照是 21.5。VenusBench-Mobile 上,9B 和 27B 是 46.5、48.7,高于 Claude-Opus-4.6 的 36.5、Kimi-K2.6 的 31.2 和 Qwen3.6-27B 的 28.0。AndroidWorld 上 80.2、84.0,27B 比上一名 UI-Venus-1.5-30B-A3B 的 77.6 高 6.4。论文把 AndroidWorld 写成已经比较成熟、余量变小。KnowUBench 是 56.5、59.7,对照 Seed-2.0-Pro 51.6;早一代 GUI 模型 UI-Venus-1.5-8B 和 MAI-UI-8B 都是 26.0。MemGUI 上 27B 是 70.3,高于 Seed-2.0-Pro 的 65.6;9B 是 62.6,低于这一档对照。
MobileWorld 要分开读。50 步时 27B 是 76.1,高于 Kimi-K3 的 74.4、Seed-2.1-Pro 的 73.2 和 GPT-5.6-Sol 的 70.1,但低于 Qwen-UI-Agent-27B 的 82.1。100 步是 82.9,对照的 100 步是 85.5。
桌面:Verified 80.5,OSWorld 2.0 整题 2.8
OSWorld-Verified 评开放式电脑任务。DeskCraft 评长程专业桌面流程,以及执行中向用户澄清、处理打断、吸收事后反馈。OSWorld 2.0 是 108 条长程流程,官方预算 150 步,同时报整题 Binary Accuracy 和 Partial Score。
OSWorld-Verified 的对照来自各来源报告的 361 题设置,脚手架可以不同。DeskCraft 这一列是作者在 Standard 与 Interactive 的并集、共 538 题上自己算的合计,不是基准按 split 公布的数。OSWorld 2.0 的对照来自官方榜,工具设置可能因模型而异。
| 模型 | OSWorld-Verified | DeskCraft | OSWorld 2.0 整题 | OSWorld 2.0 部分分 |
|---|---|---|---|---|
| UI-Venus-2-9B | 70.8 | 48.0 | 0.0 | 7.5 |
| UI-Venus-2-27B | 80.5 | 55.5 | 2.8 | 13.2 |
| 表内对照 | Claude-Opus-4.8 83.4;Qwen-UI-Agent-27B 79.5 | Kimi-K2.6 41.4* | GPT-5.5 13.0;Claude-Opus-4.7 4.6 | GPT-5.5 46.7;Claude-Opus-4.7 20.3 |
27B 的 80.5 低于来源报告的 Claude-Opus-4.8 83.4,高于 Qwen-UI-Agent-27B 的 79.5、Seed-2.1-Pro 的 78.8 和 GPT-5.5 的 78.7。论文写明 Qwen-UI-Agent 可以使用命令行动作,所以这是榜单参照,不是同一脚手架下的消融。DeskCraft 上 27B 比 Kimi-K2.6 高 14.1,9B 的 48.0 仍比 41.4 高 6.6。
OSWorld 2.0 上,9B 整题是 0.0,27B 是 2.8。27B 低于 GPT-5.5 的 13.0,也低于 Claude-Opus-4.7 和两档 Claude-Sonnet-4.6 的 4.6。部分分 13.2 高于 Kimi-K2.6 的 7.1、MiniMax-M3 的 8.2,以及表内 Qwen3.5-9B、Qwen3.6-27B、Seed-2.0-Pro 的 2.5、3.8、6.3*,但低于 Claude-Opus-4.7 的 20.3 和 Claude-Sonnet-4.6(max)的 20.0。
网页四项用的不是同一套裁判
WebVoyager 原题 643 道、15 个真实网站。报告沿用 Fara 的过滤:大约 48 道已经做不成的题去掉,大约 50 道时间敏感题改成当前还能执行的日期。完成与否由 GPT-4o 根据轨迹和最终回复判断。表注写明,Fara1.5 和 GPT-5(SoM)用的是刷新后 595 题、100 步、三次平均。直播网站状态会随评测日期变化。
Online-Mind2Web 是 300 题、136 个网站,由 LLM 裁判。REAL 是 112 题、11 个高保真网站副本,环境可复现,完成与否用程序断言查状态,不是直播网页。Odysseys 是 200 题、跨站、直播网页。裁判是 gemini-3.1-flash-lite-preview,按每条 rubric 单独判。Avg. 是满足的 rubric 比例的平均,Perfect 是全部 rubric 都满足才算这题成功。
| 模型 | WebVoyager | Online-Mind2Web | REAL | Odysseys 均分 | Odysseys 满分 |
|---|---|---|---|---|---|
| UI-Venus-2-9B | 90.8 | 74.0 | 76.9 | 77.3 | 62.0 |
| UI-Venus-2-27B | 93.4 | 78.3 | 80.2 | 80.4 | 66.3 |
| 表内对照 | Fara1.5-27B 89.3;GPT-5(SoM)90.6 | UI-TARS-1.5 75.8 | Seed-2.0-Pro 与 Kimi-K2.6 均为 74.4* | Claude-Opus-4.6 68.9 | Claude-Opus-4.6 44.5 |
27B 的 WebVoyager 比 Fara1.5-27B 高 4.1,比 GPT-5(SoM)高 2.8。9B 是 90.8。Online-Mind2Web 上 9B 的 74.0 低于 UI-TARS-1.5 的 75.8,27B 是 78.3。REAL 上 27B 比 74.4 高 5.8,9B 的 76.9 高 2.5。Odysseys 上 27B 的均分、满分比 Claude-Opus-4.6 高 11.5 和 21.8。
定位和安全:有的列第二,盲区仍接近一半
表 4。VenusBench-GD 是英文指令的 micro-average。
| 模型 | VenusBench-GD | ScreenSpot-Pro | OSWorld-G-R | UI-Vision |
|---|---|---|---|---|
| UI-Venus-2-9B | 77.1 | 73.0 | 78.5 | 53.2 |
| UI-Venus-2-27B | 80.1 | 74.1 | 79.1 | 66.9 |
| 表内对照 | UI-Venus-1.5-30B-A3B 75.0 | Qwen-UI-Agent-27B 76.6 | Qwen-UI-Agent-27B 78.5 | Qwen-UI-Agent-27B 70.0 |
27B 在 VenusBench-GD 上比 UI-Venus-1.5-30B-A3B 高 5.1,9B 是 77.1。ScreenSpot-Pro 上 74.1 低于 Qwen-UI-Agent-27B 的 76.6,高于 UI-Venus-1.5-30B-A3B 的 69.6 共 4.5,也高于 Qwen 3.7 Plus 的 68.9 和 Seed 2.1 Pro 的 65.3。OSWorld-G-R 上 27B 是 79.1;9B 是 78.5,与 Qwen-UI-Agent-27B 相同,高于 Qwen 3.7 Plus 的 78.2。UI-Vision 上 66.9 低于 70.0,比 UI-Venus-1.5-30B-A3B 的 54.7 高 12.2。9B 在这一列是 53.2,低于 1.5 的 54.7。
表 6 是安全。ASR 是做出有害行为的任务比例,越低越好。OSHarm 分三类:用户故意滥用、第三方提示注入、模型自己的误操作。OSBlind 的指令表面无害,伤害来自执行环境。
| 模型 | OSHarm | OSBlind |
|---|---|---|
| UI-Venus-2-9B | 11.3 | 48.8 |
| UI-Venus-2-27B | 15.3 | 47.9 |
| Qwen3.5-27B | 18.0 | 89.3 |
| Qwen3.5-9B | 25.3 | 79.4 |
| Kimi K2.6 | 32.0 | 93.6 |
OSHarm 上 9B 比 27B 更低,两行都低于 Qwen3.5-27B 的 18.0。OSBlind 上对照从 Qwen3.5-9B 的 79.4 到 Kimi K2.6 的 93.6。9B、27B 降到 48.8 和 47.9。论文把相对 79.4 和 89.3 的下降说成最多接近一半。47.9 仍表示这一设置下接近一半任务会执行出有害行为。
表 5 是验证码类基准的 Pass@1,报告用来看「认出内容」和「变成可执行界面动作」是否接得上。这里只保留题量和分数,不写题面怎么解。VenusBench-CAPTCHA 219 例:9B 78.1,27B 79.9,对照最高 Qwen3.6-27B 53.0,两档相差 1.8。MCA-Bench 抽样 1000 例、20 类各 50:75.7 和 79.6,对照 51.7。Spatial-CAPTCHA-Bench 全部 1050 例:42.8 和 48.6,Seed-2.0-Pro 是 43.8,27B 只高 4.8,最好结果仍低于 50。NextGen-CAPTCHAs 保留 15 类、319 例:47.6 和 54.5,对照最高 Seed-2.0-Pro 20.4。Open CaptchaWorld 保留 16 类:50.7 和 56.3,27B 只比 Seed-2.0-Pro 的 55.6 高 0.7。
这些数不能被读成什么
训练用的四类轨迹和榜单不是同一套分。SGV 的 partial 不会变成表里的部分分。OSWorld 2.0 的 Partial Score 是该榜自己的指标。星号行是作者重跑。OSWorld-Verified 的 80.5 对 83.4 不是同一动作脚手架,DeskCraft 的 55.5 也不是官方 split 分数。WebVoyager 的 93.4 依赖刷新子集和 GPT-4o 裁判,直播网页会变。MobileWorld 只报了 GUI-only,50 步的 76.1 低于 Qwen-UI-Agent-27B 的 82.1。OSWorld 2.0 整题 2.8 低于表内多个通用模型,9B 是 0。ScreenSpot-Pro 和 UI-Vision 都不是第一。OSBlind 的 ASR 仍在 48 左右,而且 9B 在 OSHarm 上低于 27B,规模变大不等于安全指标变好。Grounding 关推理、温度 0,其他任务温度 1.0,两套设置不能混成一次推理的能力。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测协议和表内数字。
出处:蚂蚁集团 Venus Team,Shuheng Shen、Changhua Meng 等,UI-Venus-2 Technical Report,2026-08-27,https://arxiv.org/abs/2609.00028
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。