智测 OpenQA

行业与实践研究与基准测试

基于 AI 的 GUI 自动化测试:2024–2026 研究地图

智测团队 · OpenQA(openqa.cn)阅读约 4 分钟

GUI Agent 能把任务点完,不等于测出了缺陷。这篇按 2024 到 2026 年的综述和基准,分开任务完成率和真正的 GUI 测试。

本文目录

英文社区里常把两件事混在一起讲:一是让模型替人点界面完成任务的 GUI Agent 与 Computer Use,二是用模型生成步骤、执行操作并判定界面是否有缺陷的 GUI 自动化测试。前者是能力底座,后者才是质量工程要落地的对象。## 这条线是怎么长出来的

2023 年以前,GUI 自动化主要靠选择器、录制回放和少量图像模板。界面一改,脚本就失效。2023 到 2024 年,多模态模型让「看截图再决定下一步」变得可行,研究重心从「生成一段 Selenium 代码」转到感知、规划、行动的闭环。2024 年底到 2026 年,社区同时出现三类产物:把方法讲清楚的综述、在真实或仿真环境里测成功率的基准,以及专门问「能不能提出测试意图、执行测试、发现缺陷」的测试基准。

可检索的代表性综述包括:

  • 《GUI Agents with Foundation Models: A Comprehensive Survey》(2024 年 11 月)
  • 《Large Language Model-Brained GUI Agents: A Survey》(2024 年 11 月)
  • 《GUI Agents: A Survey》(2024 年 12 月)
  • 《OS Agents: A Survey on MLLM-Based Agents for General Computing Devices Use》(2024 年 12 月)
  • 《AI Agents for Computer Use》(Sager 等,2025 年 1 月):从环境、交互、智能体三个视角整理约 86 个计算机控制智能体和 33 个数据集
  • 《A Survey on (M)LLM-Based GUI Agents》(2025 年 4 月,arXiv:2504.13865):把现代 GUI Agent 拆成感知、探索、规划与行动

论文索引见 GitHub 上的 trycua/acu 与 showlab/Awesome-GUI-Agent。

和测试真正相关的基准

很多基准测的是任务完成率,不是缺陷发现率。选型时要分开看。

任务完成类,回答的是「模型能不能把这件事做完」:

  • AndroidWorld(2024):动态 Android 环境,约 20 个应用、116 个任务,主要用成功或失败打分。后续讨论指出它偏二元结果和离线应用,对弹窗、动态内容覆盖不足。
  • OSWorld、Windows Agent Arena:桌面与 Windows 任务环境。
  • A3: Android Agent Arena(2025 年 1 月):强调在线应用和过程性评价,而不只看最终截图。
  • SPA-Bench(ICLR 2025):智能手机智能体评测。
  • WorldGUI(2025 年 2 月,arXiv:2502.08047):桌面 GUI 自动化,强调从任意起点开始,而不是总从同一初始界面出发。

测试过程类,更接近 QA 要的问题:

  • GUI Testing Arena(GTArena,2024 年 12 月,arXiv:2412.18426)把自动化 GUI 测试拆成三个子任务:测试意图生成、测试任务执行、GUI 缺陷检测。数据包括真实移动应用、人工注入缺陷的应用和合成数据。论文的关键结论是:即便当时最强的多模态模型,也很难在三个子任务上同时做好。能点开界面,还不等于能测出缺陷。

读这些工作时建议盯三个问题。环境能不能复位,不能复位的在线应用分数不可比。成功判定是规则、人工,还是模型自己说「我做完了」,自判会虚高。有没有中间检查点,只有最终成败就无法区分「点错一步」和「完全不会」。

技术路线怎么选

路线做法适合主要风险
结构感知把 DOM 或无障碍树交给模型,生成 Playwright 等脚本Web、结构稳定画布、跨端 App 看不见
纯视觉截图、框选元素、再点击无源码、桌面、老系统费用高,小字和密集图标易偏
混合视觉定位,再用结构信息校验大多数端到端场景两套信号冲突时要定优先级
录制加生成人走一遍,模型整理成可维护脚本企业回归仍依赖用例写得清楚
探索式智能体不给逐步脚本,让模型自己游走补充覆盖难复现,断言弱,成本高

2026 年英文社区对 Computer Use 的一种务实判断是:它已经能进入受监督的窄流程,例如检索、填表和测试执行,但离稳定的数字员工还远。基准从七成做到接近满分,难的是长尾异常,不是主路径。产品侧需要对照厂商最新文档:Anthropic Computer Use 用截图操作桌面;OpenAI Operator 于 2025 年 1 月以研究预览发布,随后并入 ChatGPT 的 agent 模式;通义 UI-TARS 则是面向界面交互微调的视觉模型,直接从截图预测动作。

对测试团队的含义

不要把 Computer Use 的任务成功率当成测试覆盖率。任务做完,不等于发现了缺陷。断言仍然要人来定,模型适合生成步骤和定位元素,不适合单独当唯一预言机。试点时先把回归集做成可复位、可判定的小环境。GTArena 的三分法可以直接当成验收表:意图是否合理、执行是否可复盘、缺陷是否真的被标出来。视觉路线必须留下每步截图和坐标,否则失败无法复盘。安全上,给模型的浏览器要隔离账号和支付环境,能登录系统也就能误操作生产。

建议阅读顺序

  1. Awesome-GUI-Agent 的综述目录,先建立地图。
  2. GTArena,看测试任务怎么拆。
  3. AndroidWorld、WorldGUI、A3,比较环境和评分差异。
  4. 再读本专题的国内实践与社区工具两篇。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误