Industry & PracticeResearch & Benchmarks
基于 AI 的 GUI 自动 化 测试: 2024 – 2026 研究 地图
GUI Agent 能把任务点完,不等于测出了缺陷。这篇按 2024 到 2026 年的综述和基准,分开任务完成率和真正的 GUI 测试。

In this piece
英文社区里常把两件事混在一起讲:一是让模型替人点界面完成任务的 GUI Agent 与 Computer Use,二是用模型生成步骤、执行操作并判定界面是否有缺陷的 GUI 自动化测试。前者是能力底座,后者才是质量工程要落地的对象。## 这条线是怎么长出来的
2023 年以前,GUI 自动化主要靠选择器、录制回放和少量图像模板。界面一改,脚本就失效。2023 到 2024 年,多模态模型让「看截图再决定下一步」变得可行,研究重心从「生成一段 Selenium 代码」转到感知、规划、行动的闭环。2024 年底到 2026 年,社区同时出现三类产物:把方法讲清楚的综述、在真实或仿真环境里测成功率的基准,以及专门问「能不能提出测试意图、执行测试、发现缺陷」的测试基准。
可检索的代表性综述包括:
- 《GUI Agents with Foundation Models: A Comprehensive Survey》(2024 年 11 月)
- 《Large Language Model-Brained GUI Agents: A Survey》(2024 年 11 月)
- 《GUI Agents: A Survey》(2024 年 12 月)
- 《OS Agents: A Survey on MLLM-Based Agents for General Computing Devices Use》(2024 年 12 月)
- 《AI Agents for Computer Use》(Sager 等,2025 年 1 月):从环境、交互、智能体三个视角整理约 86 个计算机控制智能体和 33 个数据集
- 《A Survey on (M)LLM-Based GUI Agents》(2025 年 4 月,arXiv:2504.13865):把现代 GUI Agent 拆成感知、探索、规划与行动
论文索引见 GitHub 上的 trycua/acu 与 showlab/Awesome-GUI-Agent。
和测试真正相关的基准
很多基准测的是任务完成率,不是缺陷发现率。选型时要分开看。
任务完成类,回答的是「模型能不能把这件事做完」:
- AndroidWorld(2024):动态 Android 环境,约 20 个应用、116 个任务,主要用成功或失败打分。后续讨论指出它偏二元结果和离线应用,对弹窗、动态内容覆盖不足。
- OSWorld、Windows Agent Arena:桌面与 Windows 任务环境。
- A3: Android Agent Arena(2025 年 1 月):强调在线应用和过程性评价,而不只看最终截图。
- SPA-Bench(ICLR 2025):智能手机智能体评测。
- WorldGUI(2025 年 2 月,arXiv:2502.08047):桌面 GUI 自动化,强调从任意起点开始,而不是总从同一初始界面出发。
测试过程类,更接近 QA 要的问题:
- GUI Testing Arena(GTArena,2024 年 12 月,arXiv:2412.18426)把自动化 GUI 测试拆成三个子任务:测试意图生成、测试任务执行、GUI 缺陷检测。数据包括真实移动应用、人工注入缺陷的应用和合成数据。论文的关键结论是:即便当时最强的多模态模型,也很难在三个子任务上同时做好。能点开界面,还不等于能测出缺陷。
读这些工作时建议盯三个问题。环境能不能复位,不能复位的在线应用分数不可比。成功判定是规则、人工,还是模型自己说「我做完了」,自判会虚高。有没有中间检查点,只有最终成败就无法区分「点错一步」和「完全不会」。
技术路线怎么选
| 路线 | 做法 | 适合 | 主要风险 |
|---|---|---|---|
| 结构感知 | 把 DOM 或无障碍树交给模型,生成 Playwright 等脚本 | Web、结构稳定 | 画布、跨端 App 看不见 |
| 纯视觉 | 截图、框选元素、再点击 | 无源码、桌面、老系统 | 费用高,小字和密集图标易偏 |
| 混合 | 视觉定位,再用结构信息校验 | 大多数端到端场景 | 两套信号冲突时要定优先级 |
| 录制加生成 | 人走一遍,模型整理成可维护脚本 | 企业回归 | 仍依赖用例写得清楚 |
| 探索式智能体 | 不给逐步脚本,让模型自己游走 | 补充覆盖 | 难复现,断言弱,成本高 |
2026 年英文社区对 Computer Use 的一种务实判断是:它已经能进入受监督的窄流程,例如检索、填表和测试执行,但离稳定的数字员工还远。基准从七成做到接近满分,难的是长尾异常,不是主路径。产品侧需要对照厂商最新文档:Anthropic Computer Use 用截图操作桌面;OpenAI Operator 于 2025 年 1 月以研究预览发布,随后并入 ChatGPT 的 agent 模式;通义 UI-TARS 则是面向界面交互微调的视觉模型,直接从截图预测动作。
对测试团队的含义
不要把 Computer Use 的任务成功率当成测试覆盖率。任务做完,不等于发现了缺陷。断言仍然要人来定,模型适合生成步骤和定位元素,不适合单独当唯一预言机。试点时先把回归集做成可复位、可判定的小环境。GTArena 的三分法可以直接当成验收表:意图是否合理、执行是否可复盘、缺陷是否真的被标出来。视觉路线必须留下每步截图和坐标,否则失败无法复盘。安全上,给模型的浏览器要隔离账号和支付环境,能登录系统也就能误操作生产。
建议阅读顺序
- Awesome-GUI-Agent 的综述目录,先建立地图。
- GTArena,看测试任务怎么拆。
- AndroidWorld、WorldGUI、A3,比较环境和评分差异。
- 再读本专题的国内实践与社区工具两篇。
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.