OpenQA

Industry & PracticeResearch & Benchmarks

基于 AI 的 GUI 自动化测试:2024–2026 研究地图

智测团队 · OpenQA(openqa.cn)4 min read

GUI Agent 能把任务点完,不等于测出了缺陷。这篇按 2024 到 2026 年的综述和基准,分开任务完成率和真正的 GUI 测试。

In this piece

英文社区里常把两件事混在一起讲:一是让模型替人点界面完成任务的 GUI Agent 与 Computer Use,二是用模型生成步骤、执行操作并判定界面是否有缺陷的 GUI 自动化测试。前者是能力底座,后者才是质量工程要落地的对象。## 这条线是怎么长出来的

2023 年以前,GUI 自动化主要靠选择器、录制回放和少量图像模板。界面一改,脚本就失效。2023 到 2024 年,多模态模型让「看截图再决定下一步」变得可行,研究重心从「生成一段 Selenium 代码」转到感知、规划、行动的闭环。2024 年底到 2026 年,社区同时出现三类产物:把方法讲清楚的综述、在真实或仿真环境里测成功率的基准,以及专门问「能不能提出测试意图、执行测试、发现缺陷」的测试基准。

可检索的代表性综述包括:

  • 《GUI Agents with Foundation Models: A Comprehensive Survey》(2024 年 11 月)
  • 《Large Language Model-Brained GUI Agents: A Survey》(2024 年 11 月)
  • 《GUI Agents: A Survey》(2024 年 12 月)
  • 《OS Agents: A Survey on MLLM-Based Agents for General Computing Devices Use》(2024 年 12 月)
  • 《AI Agents for Computer Use》(Sager 等,2025 年 1 月):从环境、交互、智能体三个视角整理约 86 个计算机控制智能体和 33 个数据集
  • 《A Survey on (M)LLM-Based GUI Agents》(2025 年 4 月,arXiv:2504.13865):把现代 GUI Agent 拆成感知、探索、规划与行动

论文索引见 GitHub 上的 trycua/acu 与 showlab/Awesome-GUI-Agent。

和测试真正相关的基准

很多基准测的是任务完成率,不是缺陷发现率。选型时要分开看。

任务完成类,回答的是「模型能不能把这件事做完」:

  • AndroidWorld(2024):动态 Android 环境,约 20 个应用、116 个任务,主要用成功或失败打分。后续讨论指出它偏二元结果和离线应用,对弹窗、动态内容覆盖不足。
  • OSWorld、Windows Agent Arena:桌面与 Windows 任务环境。
  • A3: Android Agent Arena(2025 年 1 月):强调在线应用和过程性评价,而不只看最终截图。
  • SPA-Bench(ICLR 2025):智能手机智能体评测。
  • WorldGUI(2025 年 2 月,arXiv:2502.08047):桌面 GUI 自动化,强调从任意起点开始,而不是总从同一初始界面出发。

测试过程类,更接近 QA 要的问题:

  • GUI Testing Arena(GTArena,2024 年 12 月,arXiv:2412.18426)把自动化 GUI 测试拆成三个子任务:测试意图生成、测试任务执行、GUI 缺陷检测。数据包括真实移动应用、人工注入缺陷的应用和合成数据。论文的关键结论是:即便当时最强的多模态模型,也很难在三个子任务上同时做好。能点开界面,还不等于能测出缺陷。

读这些工作时建议盯三个问题。环境能不能复位,不能复位的在线应用分数不可比。成功判定是规则、人工,还是模型自己说「我做完了」,自判会虚高。有没有中间检查点,只有最终成败就无法区分「点错一步」和「完全不会」。

技术路线怎么选

路线做法适合主要风险
结构感知把 DOM 或无障碍树交给模型,生成 Playwright 等脚本Web、结构稳定画布、跨端 App 看不见
纯视觉截图、框选元素、再点击无源码、桌面、老系统费用高,小字和密集图标易偏
混合视觉定位,再用结构信息校验大多数端到端场景两套信号冲突时要定优先级
录制加生成人走一遍,模型整理成可维护脚本企业回归仍依赖用例写得清楚
探索式智能体不给逐步脚本,让模型自己游走补充覆盖难复现,断言弱,成本高

2026 年英文社区对 Computer Use 的一种务实判断是:它已经能进入受监督的窄流程,例如检索、填表和测试执行,但离稳定的数字员工还远。基准从七成做到接近满分,难的是长尾异常,不是主路径。产品侧需要对照厂商最新文档:Anthropic Computer Use 用截图操作桌面;OpenAI Operator 于 2025 年 1 月以研究预览发布,随后并入 ChatGPT 的 agent 模式;通义 UI-TARS 则是面向界面交互微调的视觉模型,直接从截图预测动作。

对测试团队的含义

不要把 Computer Use 的任务成功率当成测试覆盖率。任务做完,不等于发现了缺陷。断言仍然要人来定,模型适合生成步骤和定位元素,不适合单独当唯一预言机。试点时先把回归集做成可复位、可判定的小环境。GTArena 的三分法可以直接当成验收表:意图是否合理、执行是否可复盘、缺陷是否真的被标出来。视觉路线必须留下每步截图和坐标,否则失败无法复盘。安全上,给模型的浏览器要隔离账号和支付环境,能登录系统也就能误操作生产。

建议阅读顺序

  1. Awesome-GUI-Agent 的综述目录,先建立地图。
  2. GTArena,看测试任务怎么拆。
  3. AndroidWorld、WorldGUI、A3,比较环境和评分差异。
  4. 再读本专题的国内实践与社区工具两篇。

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction