CodexQA

行业与实践研究与基准测试

整题只有 2.8%:蚂蚁 UI-Venus-2 用关键点把 GUI 轨迹和单步分开评

CodexQA 团队阅读约 8 分钟

27B 在 OSWorld 2.0 的 108 题、150 步上整题只有 2.8%,部分分 13.2。MobileWorld 50 步 76.1,低于 Qwen-UI-Agent 的 82.1。WebVoyager 刷新子集 93.4。OSBlind 的攻击成功率仍是 47.9。

本文目录

整题只有 2.8%:蚂蚁 UI-Venus-2 用关键点把 GUI 轨迹和单步分开评

蚂蚁集团 Venus Team 的技术报告 UI-Venus-2 Technical Report,arXiv 戳记 2026 年 8 月 27 日(2609.00028)。通讯作者是 Shuheng Shen、Changhua Meng。UI-Venus-2 是一套跨手机、网页和桌面的 GUI Agent,有 9B 和 27B 两档,分别从 Qwen3.5-9B、Qwen3.6-27B 初始化。报告把评测和训练信号拆开:榜单看任务是否做成,训练用的轨迹检查看关键点,单步对错在动作执行前就判定。

协议:温度、步数和星号先定死

推理时,通用任务温度 1.0,视觉分辨率用 Qwen3.5 的默认配置,默认开推理,并把完整推理历史喂回上下文。GUI grounding 关掉推理,温度设为 0。表里每一列,最好的加粗,第二名下划线。星号是作者重跑或复现,不是原榜原样抄来的。

图 1 把口径写在注里。MobileWorld 只用 GUI 成功率,117 题、50 步。WebVoyager 用刷新后的 595 题。Odysseys 是 200 题的 rubric 均分。VenusBench-CAPTCHA 是全部 219 例的 micro Pass@1。VenusBench-GD 是英文指令的 micro-average,点落在框内算对。图注还写了:优先选独立端到端系统、任务子集和步数预算最接近的结果,来源报告里的动作脚手架仍可能不同。

环境不是单应用。可执行移动应用 170 个以上,中文 100 个以上、英文 70 个以上,另有原生桌面系统。网页池来自公开浏览器 Agent 基准加 Tranco 排名,再做可达性检查,并用 Kimi 2.6 给动态性、可交互性、内容丰富度和画面质量打分,得到 4000 个以上域名、19 类。能力目录另外种入 InSTA-150k-v3 的 45000 条任务。网页执行用真实 Chrome,接口是 15 个动作的 Playwright。桌面任务写成 TaskSpec:受控桌面快照、安装步骤、所需文件和服务、出处、结果评价器。长任务切成子目标,上一段验收过的退出状态用来接着采下一段。

轨迹关键点和单步判定不是榜单分数

轨迹验证有两层。报告写明,Semantic Guided Verification(SGV)的结论用来给数据分层,不是直接的训练标签,也不是基准分数。

轨迹层不看模型自己有没有宣称成功。失败、超时、升级给用户的轨迹同样送去检查。流程五步:从任务目标抽出可核验关键点;轨迹切成固定窗口,点击位置在截图上画红点;各窗口并行判断哪些关键点已经满足;证据清楚的走硬规则,含糊的交给多模态终判,终判看结束信号、行为统计、窗口解释和最后一张截图;输出结论、理由、每个关键点的状态和证据截图。四类结果是 completed、partial、infeasible、failed。例子是往指定群发指定内容,关键点是进对群、写对标题和正文、确认发出。前两步做完但步数用尽,算 partial,不算 failed。completed 进高质量候选;partial 去截断或续写;infeasible 用来改任务可行性规则;failed 用来分开是任务设计、环境不稳还是模型不行。

单步层是事前判断。只看执行前能看到的东西:当前截图、声明的动作类型和目标、模型推理、任务目标。后面页面怎么跳,不拿来给这一步记分,避免把环境抖动算进动作质量。先看推理和动作是否一致,再看是否对准任务。四类:Correct,动作推进任务且模型知道自己做对了;Exploratory,明确不确定,但在试一条说得通的路;Ineffective,点了不能点的区域或短循环,没有实质推进;Incorrect,偏离目标、做完还继续,或推理和动作不一致。

这些单步再收成轨迹三档。不可行任务要能正确报出来,认不出就算失败。可行任务里,只做打开应用、切标签、滚动这类通用操作,不算部分完成,至少要有一步任务专属操作,例如输入指定内容或选中指定目标。

手机六项:50 步的 MobileWorld 不是第一

表 1。VenusBench-Mobile 报 149 题主池的成功率。MobileWorld 报 GUI-only、117 题、50 步,括号里是 100 步。MemGUI 报 Main Results 的 pass@1。

模型MobileGymVenusBench-MobileAndroidWorldMobileWorldKnowUBenchMemGUI
UI-Venus-2-9B52.746.580.265.8(75.2)56.562.6
UI-Venus-2-27B60.548.784.076.1(82.9)59.770.3
表内对照Seed-2.0-Pro 52.0Claude-Opus-4.6 36.5*UI-Venus-1.5-30B-A3B 77.6Qwen-UI-Agent-27B 82.1(85.5)Seed-2.0-Pro 51.6Seed-2.0-Pro 65.6*

27B 在 MobileGym 上比 Seed-2.0-Pro 高 8.5。同表里 GUI 专用模型的最高对照是 21.5。VenusBench-Mobile 上,9B 和 27B 是 46.5、48.7,高于 Claude-Opus-4.6 的 36.5、Kimi-K2.6 的 31.2 和 Qwen3.6-27B 的 28.0。AndroidWorld 上 80.2、84.0,27B 比上一名 UI-Venus-1.5-30B-A3B 的 77.6 高 6.4。论文把 AndroidWorld 写成已经比较成熟、余量变小。KnowUBench 是 56.5、59.7,对照 Seed-2.0-Pro 51.6;早一代 GUI 模型 UI-Venus-1.5-8B 和 MAI-UI-8B 都是 26.0。MemGUI 上 27B 是 70.3,高于 Seed-2.0-Pro 的 65.6;9B 是 62.6,低于这一档对照。

MobileWorld 要分开读。50 步时 27B 是 76.1,高于 Kimi-K3 的 74.4、Seed-2.1-Pro 的 73.2 和 GPT-5.6-Sol 的 70.1,但低于 Qwen-UI-Agent-27B 的 82.1。100 步是 82.9,对照的 100 步是 85.5。

桌面:Verified 80.5,OSWorld 2.0 整题 2.8

OSWorld-Verified 评开放式电脑任务。DeskCraft 评长程专业桌面流程,以及执行中向用户澄清、处理打断、吸收事后反馈。OSWorld 2.0 是 108 条长程流程,官方预算 150 步,同时报整题 Binary Accuracy 和 Partial Score。

OSWorld-Verified 的对照来自各来源报告的 361 题设置,脚手架可以不同。DeskCraft 这一列是作者在 Standard 与 Interactive 的并集、共 538 题上自己算的合计,不是基准按 split 公布的数。OSWorld 2.0 的对照来自官方榜,工具设置可能因模型而异。

模型OSWorld-VerifiedDeskCraftOSWorld 2.0 整题OSWorld 2.0 部分分
UI-Venus-2-9B70.848.00.07.5
UI-Venus-2-27B80.555.52.813.2
表内对照Claude-Opus-4.8 83.4;Qwen-UI-Agent-27B 79.5Kimi-K2.6 41.4*GPT-5.5 13.0;Claude-Opus-4.7 4.6GPT-5.5 46.7;Claude-Opus-4.7 20.3

27B 的 80.5 低于来源报告的 Claude-Opus-4.8 83.4,高于 Qwen-UI-Agent-27B 的 79.5、Seed-2.1-Pro 的 78.8 和 GPT-5.5 的 78.7。论文写明 Qwen-UI-Agent 可以使用命令行动作,所以这是榜单参照,不是同一脚手架下的消融。DeskCraft 上 27B 比 Kimi-K2.6 高 14.1,9B 的 48.0 仍比 41.4 高 6.6。

OSWorld 2.0 上,9B 整题是 0.0,27B 是 2.8。27B 低于 GPT-5.5 的 13.0,也低于 Claude-Opus-4.7 和两档 Claude-Sonnet-4.6 的 4.6。部分分 13.2 高于 Kimi-K2.6 的 7.1、MiniMax-M3 的 8.2,以及表内 Qwen3.5-9B、Qwen3.6-27B、Seed-2.0-Pro 的 2.5、3.8、6.3*,但低于 Claude-Opus-4.7 的 20.3 和 Claude-Sonnet-4.6(max)的 20.0。

网页四项用的不是同一套裁判

WebVoyager 原题 643 道、15 个真实网站。报告沿用 Fara 的过滤:大约 48 道已经做不成的题去掉,大约 50 道时间敏感题改成当前还能执行的日期。完成与否由 GPT-4o 根据轨迹和最终回复判断。表注写明,Fara1.5 和 GPT-5(SoM)用的是刷新后 595 题、100 步、三次平均。直播网站状态会随评测日期变化。

Online-Mind2Web 是 300 题、136 个网站,由 LLM 裁判。REAL 是 112 题、11 个高保真网站副本,环境可复现,完成与否用程序断言查状态,不是直播网页。Odysseys 是 200 题、跨站、直播网页。裁判是 gemini-3.1-flash-lite-preview,按每条 rubric 单独判。Avg. 是满足的 rubric 比例的平均,Perfect 是全部 rubric 都满足才算这题成功。

模型WebVoyagerOnline-Mind2WebREALOdysseys 均分Odysseys 满分
UI-Venus-2-9B90.874.076.977.362.0
UI-Venus-2-27B93.478.380.280.466.3
表内对照Fara1.5-27B 89.3;GPT-5(SoM)90.6UI-TARS-1.5 75.8Seed-2.0-Pro 与 Kimi-K2.6 均为 74.4*Claude-Opus-4.6 68.9Claude-Opus-4.6 44.5

27B 的 WebVoyager 比 Fara1.5-27B 高 4.1,比 GPT-5(SoM)高 2.8。9B 是 90.8。Online-Mind2Web 上 9B 的 74.0 低于 UI-TARS-1.5 的 75.8,27B 是 78.3。REAL 上 27B 比 74.4 高 5.8,9B 的 76.9 高 2.5。Odysseys 上 27B 的均分、满分比 Claude-Opus-4.6 高 11.5 和 21.8。

定位和安全:有的列第二,盲区仍接近一半

表 4。VenusBench-GD 是英文指令的 micro-average。

模型VenusBench-GDScreenSpot-ProOSWorld-G-RUI-Vision
UI-Venus-2-9B77.173.078.553.2
UI-Venus-2-27B80.174.179.166.9
表内对照UI-Venus-1.5-30B-A3B 75.0Qwen-UI-Agent-27B 76.6Qwen-UI-Agent-27B 78.5Qwen-UI-Agent-27B 70.0

27B 在 VenusBench-GD 上比 UI-Venus-1.5-30B-A3B 高 5.1,9B 是 77.1。ScreenSpot-Pro 上 74.1 低于 Qwen-UI-Agent-27B 的 76.6,高于 UI-Venus-1.5-30B-A3B 的 69.6 共 4.5,也高于 Qwen 3.7 Plus 的 68.9 和 Seed 2.1 Pro 的 65.3。OSWorld-G-R 上 27B 是 79.1;9B 是 78.5,与 Qwen-UI-Agent-27B 相同,高于 Qwen 3.7 Plus 的 78.2。UI-Vision 上 66.9 低于 70.0,比 UI-Venus-1.5-30B-A3B 的 54.7 高 12.2。9B 在这一列是 53.2,低于 1.5 的 54.7。

表 6 是安全。ASR 是做出有害行为的任务比例,越低越好。OSHarm 分三类:用户故意滥用、第三方提示注入、模型自己的误操作。OSBlind 的指令表面无害,伤害来自执行环境。

模型OSHarmOSBlind
UI-Venus-2-9B11.348.8
UI-Venus-2-27B15.347.9
Qwen3.5-27B18.089.3
Qwen3.5-9B25.379.4
Kimi K2.632.093.6

OSHarm 上 9B 比 27B 更低,两行都低于 Qwen3.5-27B 的 18.0。OSBlind 上对照从 Qwen3.5-9B 的 79.4 到 Kimi K2.6 的 93.6。9B、27B 降到 48.8 和 47.9。论文把相对 79.4 和 89.3 的下降说成最多接近一半。47.9 仍表示这一设置下接近一半任务会执行出有害行为。

表 5 是验证码类基准的 Pass@1,报告用来看「认出内容」和「变成可执行界面动作」是否接得上。这里只保留题量和分数,不写题面怎么解。VenusBench-CAPTCHA 219 例:9B 78.1,27B 79.9,对照最高 Qwen3.6-27B 53.0,两档相差 1.8。MCA-Bench 抽样 1000 例、20 类各 50:75.7 和 79.6,对照 51.7。Spatial-CAPTCHA-Bench 全部 1050 例:42.8 和 48.6,Seed-2.0-Pro 是 43.8,27B 只高 4.8,最好结果仍低于 50。NextGen-CAPTCHAs 保留 15 类、319 例:47.6 和 54.5,对照最高 Seed-2.0-Pro 20.4。Open CaptchaWorld 保留 16 类:50.7 和 56.3,27B 只比 Seed-2.0-Pro 的 55.6 高 0.7。

这些数不能被读成什么

训练用的四类轨迹和榜单不是同一套分。SGV 的 partial 不会变成表里的部分分。OSWorld 2.0 的 Partial Score 是该榜自己的指标。星号行是作者重跑。OSWorld-Verified 的 80.5 对 83.4 不是同一动作脚手架,DeskCraft 的 55.5 也不是官方 split 分数。WebVoyager 的 93.4 依赖刷新子集和 GPT-4o 裁判,直播网页会变。MobileWorld 只报了 GUI-only,50 步的 76.1 低于 Qwen-UI-Agent-27B 的 82.1。OSWorld 2.0 整题 2.8 低于表内多个通用模型,9B 是 0。ScreenSpot-Pro 和 UI-Vision 都不是第一。OSBlind 的 ASR 仍在 48 左右,而且 9B 在 OSHarm 上低于 27B,规模变大不等于安全指标变好。Grounding 关推理、温度 0,其他任务温度 1.0,两套设置不能混成一次推理的能力。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测协议和表内数字。

出处:蚂蚁集团 Venus Team,Shuheng Shen、Changhua Meng 等,UI-Venus-2 Technical Report,2026-08-27,https://arxiv.org/abs/2609.00028

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误