跨 设备 依赖 一 断 就 归 零: 百度 参与 的 JarvisGUI 用 终 态 评 GUI
150 道组合题,最好的整题成功是 HOLO2 的 12/150(8.0%)。多设备有依赖的整题成功率最高 2.0%,六行里四行是 0。换规划器到 Kimi K2.6,这一格仍是 2.0。

本文目录
跨设备依赖一断就归零:百度参与的 JarvisGUI 用终态评 GUI
北京航空航天大学、北京理工大学、百度的预印本 JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition,arXiv 戳记 2026 年 9 月 9 日(2609.10451)。作者包括 Zixiang Chen、Yuheng Lu、Zihao Cheng、Zeming Liu(通讯)、Jizeng Bai、Ziye Huang、Zhiyin Lin、Zihan Li、Yuhang Guo、Yunhong Wang、Haifeng Wang。Haifeng Wang 的单位是 Baidu Inc.。JarvisGUI 评的是跨 Android、Windows、Ubuntu 的 GUI Agent:任务图可以动态填参数,对不对只看环境终态,不看轨迹说得像不像。
任务是带类型的槽,成功是终态上的 0 或 1
一个任务写成五元组:输入槽、输出槽、自然语言模板、一组评价函数、目标平台。输入和平台是静态规格,输出、模板和评价函数要等具体输入值填进去才定下来。
执行是状态转移。第 i 步,Agent 拿着上一步的内部记忆、当前观测和指令,产出动作并更新记忆。环境再根据动作走到下一状态。异构时,一步的观测可以同时包含多台设备。结束时用评价函数看最终状态。每个评价函数是确定性的,把环境状态映射成 0 或 1,检查的是文件内容、DOM 这类能观察到的产物,用来躲开界面随机变化。
环境分四层:基础设施、环境控制、模型交互、评价执行。依赖 Docker 和 KVM 来并行虚拟机。没有 KVM 的环境,论文建议联系作者要实验入口,不保证自行复现。
数据从人工模板开始。标注员为每个平台写一批与具体输入无关的模板,动态部分用占位符。评价器是带参数的 Python 函数,标准同样用占位符,实例化时再填。组合任务用采样把任务接成有向图,类型系统保证多数情况下良类型。跨设备传文件时,另加辅助任务,把文件放到目标设备的临时目录。上游输出沿边传到下游输入,下游的描述和评价函数都按这个真实值重写,不是留着占位符。
118 道原子题,150 道组合题,轨迹上限 50 步
表 2:
- 单平台原子任务 118 道、31 个应用。Android 24 道 / 10 个应用,Ubuntu 56 / 11,Windows 38 / 10。
- 组合任务 150 道、29 个应用。单平台有依赖、跨平台无依赖、跨平台有依赖,各 50 道。
- 组合任务拆开是 442 个平台子任务:Ubuntu 187、Windows 138、Android 52,另有 65 个文件传输辅助,不计入某一平台的应用数。
对照 CRAB 的 18 道人工跨设备题。这篇平均每个组合流程大约 3 个子任务。不含 macOS 和 iOS,原因是虚拟化许可。轨迹长度封顶 50 步,避免超长循环的推理成本。文件传输走私有的、基于 AList 的网盘,不模拟物理 U 盘或蓝牙。没有面向老人和残障用户的无障碍场景。任务做了匿名,去掉敏感信息。DeepSeek 和 Qwen 只用于代码和文字润色,不参与打分。
主表看整题成功率,组合题另给子任务完成比
原子题分 Android、Windows、Ubuntu,看整题成功率 TSR:终态和用户目标严格对齐的题,除以题数。组合题分三类:单设备有依赖(SW)、多设备无依赖(MI)、多设备有依赖(MD)。组合题另外报子任务成功率 SSR:每题已完成子任务数除以所需子任务数,再对组合题平均。TSR 是整题 0 或 1,SSR 不是。
实验用 Planner–Grounder。规划器是通用视觉语言模型 Qwen3-VL-Plus,同时看三台设备的实时截图、用户指令和交互历史,按观察—规划—动作决定下一步抽象动作和目标平台。要点坐标的点击、滚动,交给对应的 Grounding Agent。表 3 里换的是这个落地模型,规划器相同。所以这些行不是「裸模型自己完成跨设备规划」。
表 3。原子列是 Android / Windows / Ubuntu / 总体 TSR。组合列按 SW、MI、MD、总体,每格是 TSR / SSR。
| 落地模型 | 规模 | 原子 TSR | 组合 TSR / SSR |
|---|---|---|---|
| UI-Venus-Ground | 7B | 33.3 / 18.4 / 51.8 / 37.3 | SW 4.0/23.2;MI 0.0/24.0;MD 0.0/9.7;总体 1.3/16.7 |
| UI-TARS-1.5 | 7B | 50.0 / 18.4 / 44.6 / 37.3 | 14.0/28.8;4.0/28.0;0.0/8.8;6.0/18.8 |
| MAI-UI | 8B | 37.5 / 7.9 / 39.3 / 28.8 | 8.0/24.0;4.0/27.0;0.0/6.5;4.0/16.1 |
| GUI-OWL | 32B | 41.7 / 18.4 / 51.8 / 39.0 | 12.0/28.8;8.0/29.0;2.0/6.9;7.3/18.1 |
| Qwen3-VL-Instruct | 30B(激活 3B) | 37.5 / 13.2 / 50.0 / 35.6 | 10.0/24.0;2.0/28.0;0.0/10.1;4.0/18.1 |
| HOLO2 | 30B(激活 3B) | 41.7 / 15.8 / 60.7 / 42.4 | 16.0/28.0;6.0/26.0;2.0/10.6;8.0/19.0 |
六行里 Windows 原子 TSR 最高只有 18.4,Ubuntu 最高 60.7。MD 的整题成功率只有 GUI-OWL 和 HOLO2 到 2.0,其余是 0。子任务还能做到大约 6.5 到 10.6,说明步骤做对一些,整条依赖链仍然断。MI 的整题成功率也低于 SW:HOLO2 是 6.0 对 16.0。论文把 MD 的失败归到两件事:只靠另一台设备的历史,推不出目标设备现在的状态;传文件再处理是严格顺序,中间一步失败,后面的规划作废。MI 则是三块屏幕一起看,以及把「C 盘」「回到电脑」对错平台。
附录表 9 是 95% bootstrap 区间和原始计数。原子题分母 118,组合题 150,子任务 442。
| 模型 | 原子 | 组合整题 | 组合子任务 |
|---|---|---|---|
| UI-Venus | 37.3% [28.8, 45.8](44/118) | 1.3% [0.0, 3.3](2/150) | 16.7% [13.0, 20.8](74/442) |
| UI-TARS-1.5 | 37.3% [28.8, 45.8](44/118) | 6.0% [2.7, 10.0](9/150) | 18.8% [14.5, 23.4](83/442) |
| MAI-UI | 28.8% [21.2, 37.3](34/118) | 4.0% [1.3, 7.3](6/150) | 16.1% [12.2, 20.2](71/442) |
| GUI-Owl | 39.0% [30.5, 48.3](46/118) | 7.3% [3.3, 12.0](11/150) | 18.1% [14.1, 22.6](80/442) |
| Qwen3-VL | 35.6% [27.1, 44.1](42/118) | 4.0% [1.3, 7.3](6/150) | 18.1% [14.3, 22.3](80/442) |
| HOLO2 | 42.4% [33.9, 51.7](50/118) | 8.0% [4.0, 12.7](12/150) | 19.0% [14.8, 23.6](84/442) |
组合整题最好也只有 12/150。区间很宽,2/150 的下界是 0。
换规划器没有拿掉这个瓶颈。同一套 HOLO2 落地,规划器从 Qwen3-VL-Plus 换成 Kimi K2.6:原子 TSR 45.8 / 23.7 / 66.1 / 48.3,组合 TSR 为 SW 22.0、MI 10.0、MD 2.0、总体 11.3。MD 仍是 2.0。总体从 8.0 到 11.3。Llama 4 Maverick 经常写不出要求的动作格式,各任务接近 0 分,表 8 没有给它逐列数字。
子任务数一多,整题成功率掉向 0。图 4 写的是单设备组合任务上,四段及以上的子任务,所有被测模型都接近 0。论文没有把图上的每个点写成表。失败分析只看能观察到的动作,不把同一种表面错误归因成唯一原因。HOLO2 在跨设备上的初步归类是三类:单设备子任务本身失败、跨设备传输失败、任务之间丢了上下文。其他模型手工看过,模式相似,没有另给计数。
这些数不能被读成什么
主表的规划器是同一个 Qwen3-VL-Plus,比的是落地模型加这套分层,不是模型单独的跨设备规划能力。Kimi 那一行才换了规划器,而且 MD 没有提高。评价看终态,不给部分分;SSR 才是子任务完成比。50 步上限、三台虚拟机、私有网盘,都不等于任意操作系统或物理外设。macOS、iOS 和无障碍场景不在这版里。区间是题目 bootstrap,不是重复运行。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测协议和表内数字。
出处:百度,Zixiang Chen、Yuheng Lu、Zihao Cheng、Zeming Liu、Haifeng Wang 等,JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition,2026-09-09,https://arxiv.org/abs/2609.10451
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。