OpenQA

Industry & PracticeResearch & Benchmarks

基于 (M)LLM 的 GUI Agent 综述·下

智测团队 · OpenQA(openqa.cn)17 min read

下篇:数据集与基准(环境、任务、评测策略、成本/多样性/安全挑战)与未来方向。上篇见 gui-agents-survey-zh。

In this piece

基于 (M)LLM 的 GUI Agent 综述·下(中文全译)

本文是下篇,内容为第 IV–VI 节与署名许可。上篇(摘要至第 III 节应用):基于 (M)LLM 的 GUI Agent 综述·上。翻译说明与许可信息见上篇开头及本篇结尾。

IV 数据集与基准

对数据集和基准的全面理解对推进 GUI Agent 研究至关重要。在本节中,我们从三个关键维度分析现有基准和数据集:agent 运行所在的评测环境(§IV-A)、它们被设计来完成的具体任务(§IV-B),以及用来评估其性能的评测策略(§IV-C)。此外,我们批判性地考察当前数据集和基准面临的重大挑战(§IV-D)。

编译说明:原文本节含一张覆盖数十个基准、逐条列出环境/评测方法/评测策略/平台/任务的大表。为可读性,译文按四个维度编译代表性条目,完整对照表请以英文原文 Table 为准。

IV-A 环境

有效评测对评估和推进 GUI Agent 在真实场景中的能力至关重要。通过对现有文献的全面回顾,我们识别出当前与 GUI Agent 相关的基准和数据集所提供的评测环境可分为三类:静态副本、模拟环境和真实环境。

#### IV-A1 静态副本

静态副本是把 GUI 界面捕捉为固定、非交互表示(如截图或 HTML 快照)的评测环境。这些环境把与原始 GUI 的交互记录为静态数据,允许在无需实际应用运行的情况下做可复现评测。AitW 基于静态截图构建了一个大规模的人工标注动作序列及相关应用状态数据的数据集,包含 715,142 个回合、5,689,993 张截图和 30,378 条独特任务指令。PIXELHELP 记录了交互期间的触摸事件类型、被操纵的 UI 对象和视图层级。Mind2Web 以静态 HTML 快照形式保存网页交互,覆盖 31 个领域并包含超过 2,000 个任务。这些工作便利了大规模数据集的生成。然而,由于标注者无法详尽覆盖所有可能的执行路径,在评测期间无法探索或回放未缓存的操作路径。因此,这一方法只构成一种「伪交互」,可能在评测中导致假阴性。这一局限在 §IV-C1 详细讨论。

#### IV-A2 模拟环境

模拟环境复现真实世界以创建完全隔离且可控的交互场景,这消除了动态在线内容引入的变量,从而改进评测的可重复性。WoB 中的 MiniWoB 和 MiniWoB++ 手工设计小规模 HTML 页面来模拟真实网页任务中的交互。WoB 中的 FormWoB 把四个真实机票预订网站转化为网页任务,记录所有 HTTP 请求和响应以创建这些网站的离线近似。WebShop 从 amazon.com 抓取产品信息以创建一个模拟电商站点。WebArena 通过开发四个完全可运行、自托管的网页应用增强真实性,每个代表互联网的一个不同常见领域。VisualWebArena 在 WebArena 基础上纳入视觉模态信息。MMInA 数据集中的大多数任务派生自真实网站。然而,对需要从 HTML 文件提取图像的任务,用离线和开源网站作为替代以绕过网页保护机制。

尽管有这些进展,把 GUI Agent 应用到真实场景仍需要动态且真实的环境来评测。在线评测常涉及大量不确定性。例如,机票预订任务可能与静态评测方法无法考虑的天气条件紧密相关。此外,还必须考虑网络波动、安全验证和弹窗广告等因素。完全避免不确定性会阻碍 GUI Agent 有效处理复杂真实任务的能力。

#### IV-A3 真实环境

在真实环境中,任务在实际网站或应用上执行,要求 GUI Agent 直接与真实世界交互。像 MobileAgentBench、AndroidWorld 和 B-MOCA 这样的基准为移动设备上的真实任务提供评测环境。OSWorld 和 WindowsAgentArena 为桌面平台建立测试框架。CRAB 更进一步,设计跨平台任务,例如用智能手机拍照并把图像传到桌面计算机编辑。构建网页相关任务尤其有挑战,因为在线环境的快速演化可能使先前标注的任务过时。例如,Mind2Web 中的许多任务在对应的实时网站上不再可用。为解决这一点,WebCanvas 提供一个高效维护机制,通过周期监控和自动告警快速识别标注动作序列和关键节点的有效性,确保任务在真实环境中保持可操作。

尽管真实环境固有的不确定性对任务创建和维护构成重大挑战,在这类环境中构建任务已成为一个盛行研究趋势。这一发展对推进 GUI Agent 能力至关重要。

IV-B 任务

评估 GUI Agent 的性能需要清晰理解它们被设计来完成的具体任务。当前 GUI Agent 的基准和数据集可分为三种基本任务类型:感知、操作和对话,每个瞄准 agent 能力的不同方面。

#### IV-B1 感知

感知是 GUI Agent 与图形用户界面交互所必需的一个基础认知过程,涵盖界面元素的识别、提取和解读。对界面架构的这一全面理解为后续决策过程和用户交互提供基础。研究界已开发了大量专门为感知任务标注的基准和数据集。WebArena 和 VisualWebArena 提供测试 agent 视觉理解能力的网页信息检索挑战。WebSRC 引入基于网页的结构化阅读理解,要求 agent 分析网页的空间布局和逻辑层级以准确响应查询。ScreenPR 评估 agent 基于用户交互点为特定屏幕区域生成精确解释的能力。MultiUI 聚焦网页环境中的嵌入图像解读。VisualWebBench 通过描述任务评估网页理解,衡量 agent 整体综合和总结内容的能力。GUICourse 贡献了 GUIEnv,一个用于光学字符识别和视觉 grounding 的全面数据集。最后,AMEX 通过提供详细屏幕描述连同界面组件的功能标注来增强评测图景。

#### IV-B2 操作

操作任务代表 GUI Agent 交互中的一个关键阶段,其中 agent 执行特定动作以达成指定目标。这些任务涵盖像复杂软件操作和网页导航这样的场景,严格评估 agent 的规划和执行能力。操作复杂性的谱系始于简单的单步操作,其中 agent 处理直接、定义良好的任务。例如,MultiUI 提供测试基本动作选择的单步操作预测任务。类似地,GUICourse 内的 GUIAct 数据集提供 67,000 条单步操作指令,专门设计来评估 agent 的基础决策能力。随着复杂性增加,许多基准聚焦特定软件环境中的多步操作。AssistGUI 通过收集跨九个常用应用(包括 Premiere Pro、After Effects 和 PowerPoint)的 100 个任务来强调生产力场景。评测图景通过像 Spider2-V(提供 BigQuery 和 Airbyte 等平台中的数据科学和工程软件任务)和 VideoGUI(聚焦 Adobe Photoshop 和 Stable Diffusion 等专业工具中的视频编辑)这样的基准扩展到专业领域。操作复杂性的另一个关键维度出现在基于网页的环境中,其中导航任务要求跨互连页面的错综交互序列。WebShop 模拟要求产品搜索和选择的电商场景,而 MMInA 通过多跳导航任务推进挑战,其中 agent 必须遍历多个独立网站并整合来自多样源的信息以达成复杂目标。像 Mobile-Env、OSWorld、AndroidWorld 和 WindowsAgentArena 这样的基准提供了跨应用特定和基于网页操作的全面生态评测,覆盖更广场景,包括应用操作、系统设置、编程任务和多媒体应用。GUI Testing Arena 要求 agent 通过探索发现 GUI 缺陷。

#### IV-B3 对话

大多数现有基准和数据集假设 agent 能在接收指令后端到端完成任务,无需在执行期间与用户交互。然而,在真实场景中,用户可能需要在任务中途修改或增强其需求,或 agent 可能需要在关键决策阶段向用户寻求确认。为解决这一点,一些工作把任务扩展到基于对话的场景,更贴近真实应用需求。例如,MT-Mind2Web、WebLINX 和 GUICourse 中的 GUIChat 模块为网页导航和理解设计多轮对话任务。META-GUI 在 Android 平台上提供任务执行轨迹及相关对话数据。GUI-WORLD 进一步扩展到多平台环境,涵盖用于动态 GUI 理解的基于对话的数据。

IV-C 评测策略

有效的评测策略对跨不同任务和环境准确衡量 GUI Agent 的性能至关重要。通过我们的文献回顾,我们识别出两种主要的评测方法:聚焦所采取动作序列的基于轨迹的方法,和强调最终结果而不管具体路径的面向目标的方法。图 9 展示了这些评测策略之间的根本差异,凸显每种方法如何从不同视角评估 agent 性能。基于轨迹的方法追踪逐步动作与预定义路径的对照,而面向目标的方法验证最终目标是否达成而不管所采取的具体步骤。

#### IV-C1 基于轨迹的方法

基于轨迹的方法聚焦于分析 agent 在任务执行期间生成的动作或状态序列。逐步动作匹配,一种被广泛采用的评测方法,把 agent 生成的动作序列与真值比较以评估任务完成。如果两个序列精确匹配,任务被视为成功完成。然而,这一方法可能产生不公平的评测结果,因为 agent 在任务执行期间常需探索性步骤。如果 agent 执行了数据集中未考虑的动作,任务被判为失败。为解决这一局限,AndroidArena 引入使用最长公共子序列(LCS)来比较序列。与传统逐步匹配不同,LCS 通过容忍偏差来容纳探索性和冗余动作。具体来说,如果真值是 agent 生成序列的一个子序列,匹配被视为成功。尽管有优势,这类方法在真实评测中常导致高假阴性率。标注者无法详尽考虑所有可能的执行路径,且预定义数据集通常只提供单一参考路径。鉴于多个替代解可能有效完成任务,人工验证分数常高于基于轨迹方法产生的分数,如先前研究中所指出的。为缓解这一问题,LlamaTouch、WebCanvas 和 WebArena 仅聚焦序列中的关键节点。关键节点指无论采用何种方法都必须执行或遇到的动作或状态。如果 agent 的轨迹包含所有标注的关键状态,任务被视为完成。这一方法很好地适应动态真实环境,并减少了早期评测策略中盛行的假阴性问题。总之,基于轨迹的方法强调 agent 任务执行的过程。虽然它们在评测结果的可靠性上有问题,它们使研究者能利用轨迹细节设计细粒度指标,如特定动作类别的准确率。

#### IV-C2 面向目标的方法

面向目标的方法优先评估 agent 是否达成最终目标,而非达成它的具体步骤。对评测标准直接的任务,完成常可由单一信号匹配确定。例如,GUI-WORLD 通过比较 agent 输出文本与真值文本之间的相似度来评估任务成功。Mobile-Env 通过纳入多个信号并以逻辑表达式风格定义评测规则来扩展这一方法。这允许灵活处理需要同时满足多个条件或满足任一单一条件的场景。对更复杂多样的任务,如系统配置或软件操作,仅依赖像 UI 元素或截图这样的表面信号常缺乏稳健性。例如,在一个涉及编辑笔记并保存的任务中,按下「保存」按钮可能只触发一个短暂的成功通知,而不在 UI 状态中造成任何可察觉变化。此外,表面信号有时无法获取。例如,使用 UIAutomator 可能无法为动态屏幕内容转储视图层级。为增强成功评测的可靠性,MobileAgentBench 利用 Android 无障碍服务捕捉应用事件(如点击事件)作为补充信号。这确保了对任务成功更准确的评估。其他方法,如 MOBILE-ENV、B-MOCA 和 AndroidWorld,利用 Android 调试桥(ADB)访问底层系统状态并生成奖励信号。通过获得对包括文件系统、应用数据库和系统设置在内的系统资源的完全访问,这些方法提供更全面的评测。此外,像 OSWorld 和 WindowsAgentArena 这样的基准从系统最终状态提取关键组件并设计任务特定的评测脚本。与表面信号匹配相比,这一策略在判定任务成功方面达到显著更高的准确率。

#### IV-C3 图驱动技术

近期研究引入了图驱动评测技术,作为基于轨迹和面向目标方法之间的一个有前景的中间地带。Crab 把任务建模为有向图,编码子节点之间的序列和并行关系。在这个框架中,通向目标节点的多条路径优雅地表示替代解,允许多样却有效的执行策略。基于图的评测器系统地把复杂任务分解成可验证的子目标,每个子目标表示为一个节点并关联一个确认其完成的特定验证函数。类似地,WebVLN 通过构建一个网页作节点、超链接作边的导航图,把图论应用于视觉与语言导航任务。任务性能通过衡量 agent 最终目的地与导航图中目标网页之间的最短路径距离来定量评估。通过结合轨迹分析的结构严谨性与容纳多条解路径的灵活性,图驱动方法提供一个平衡的评测方法。它们提供基于轨迹方法特有的细粒度评估指标,同时保持面向目标方法固有的解灵活性,有效解决了两种传统评测范式的局限。

IV-D 挑战

当前 GUI Agent 基准和数据集面临若干影响其有效性和适用性的关键挑战。评测过程在计算资源、时间消耗和资金投入方面遇到重大成本壁垒,尤其对需要专门模型或人工判断的复杂多步任务。此外,现有基准在其内容、界面表示和文化上下文方面缺乏足够的多样性,常局限于英文、优化过的界面和区域特定示例。最后,这些评测环境引发重要的安全和隐私关切,因为它们需要广泛的系统访问并可能潜在暴露敏感信息。

#### IV-D1 成本

GUI Agent 基准的评测在时间、计算资源和资金投入方面面临重大成本挑战。例如,完成 OSWorld 中的每个任务需约 10–20 步。假设每步涉及通过本地模型和云 API 调用处理,每步耗时 10–30 秒,数百个任务的串行评测可能耗时一天或更长。OSWorld 通过允许在单机上并行模拟来缓解这一点以加速评测过程。WindowsAgentArena 引入原生云并行化以进一步减少内存和 CPU 需求。此外,一些基准涉及昂贵的评测,尤其那些需要人工判断的,如 ScreenPR。像 VideoGUI 和 GUI-WORLD 这样的基准依赖商业 LLM 做评测,增加了来自 API 调用的金钱成本。基准部署也引入一条学习曲线。像 MobileAgentBench 这样用户友好的基准提供仅需十行代码的评测参数配置。然而,虽然这对 AI/ML 界的研究者可能直接,但对没有技术背景的个人仍具挑战。

#### IV-D2 多样性

当前数据集和基准的有限多样性对开发稳健且可泛化的 GUI Agent 构成重大挑战。一些数据集只提供文本内容,未利用多模态信息。大多数数据集当前局限于英文,尽管可采用多语言模型做翻译。在 Mind2Web 中,数据集主要由美国用户频繁访问的网站组成,可能无法完全捕捉全球用户的浏览习惯。AndroidWorld 只包含下载量超过一百万的开源应用。这些流行应用常有高度优化的用户界面以增强用户体验,提供更多功能和快捷方式。这使得在优化较差的界面上测试 agent 更具挑战。AITW 捕捉 Google 应用跨不同 Android 版本的 UI 漂移。一个有前景的解决方案是 B-MoCA 中的环境随机化功能,它调整图标位置和大小、壁纸、语言设置和设备类型以模拟多样的真实场景。

#### IV-D3 安全

GUI Agent 基准和数据集的激增引发了必须为负责任的开发和部署而解决的关键安全和隐私关切。收集的数据可能包含敏感和私有信息,如个人详情、财务记录、浏览历史和认证凭据。如果数据集被误用,它们可能便利恶意目的,如绕过安全措施或使有害活动成为可能。这一问题因 GUI Agent 需要广泛访问权限才能跨应用和平台有效运行而加剧。像 OSWorld 和 WindowsAgentArena 这样的基准以系统级权限运行,如果未妥善保护可能被利用。此外,随着 agent 越来越能执行复杂的动作序列,安全漏洞的潜力增加。例如,设计来自动化表单填写的 agent,如果其数据集被攻破,可能被重新用于凭据收集或钓鱼攻击。基准中当前的安全措施常聚焦隔离环境,但缺乏对真实部署场景的全面威胁建模。GUI Agent 评测环境缺乏标准化安全协议代表该领域的一个重大空白。未来基准必须纳入稳健的匿名化技术、权限管理系统和对抗测试框架,以确保 GUI Agent 能被彻底评测而不损害用户安全或隐私。此外,数据收集方法的透明文档和显式同意机制对维持基准开发中的伦理标准至关重要。

V 未来方向与挑战

我们已系统地把 GUI Agent 组织成四个核心模块并考察了现有数据集和基准,现在我们讨论该领域的关键挑战和未来方向。我们探索数据收集和基准开发中的局限(§V-A)、多模态感知和视觉 grounding 中的挑战(§V-B)、策略规划中的复杂性(§V-C),以及强化学习方法在增强 GUI Agent 于复杂真实场景中能力方面的潜力(§V-D)。

V-A 数据收集与基准开发

GUI Agent 的数据收集和全面评测仍是未来研究的关键挑战。当前 GUI Agent 数据集主要由多步交互序列组成,但现有数据集常无法反映真实场景。例如,它们很少捕捉 agent 应如何在中断后恢复任务、处理意外系统提示,或适应变化的界面状态。未来研究应聚焦于开发纳入这些挑战性场景的更真实的多步数据集,例如中断后的任务恢复、对动态界面变化的适应,以及对意外系统响应的处理。开发高效方法来收集准确捕捉真实使用模式的高质量、多样交互数据至关重要。这包括创建测试 agent 跨中断和环境变化保持任务上下文能力的基准。同样重要的是建立能跨准确性、稳健性、效率和上下文理解等维度整体评估 GUI Agent 性能的标准化评测框架。解决这些挑战对把 GUI Agent 能力从简化的测试环境推进到真正功能性的真实应用至关重要。

V-B 多模态感知与视觉 Grounding

当前 GUI Agent 在屏幕理解和视觉 grounding 方面仍面临重大局限。根本挑战源于 GUI 图像的独特属性——与自然图像不同,它们具有层级布局,含大量需要精确理解的小元素。GUI 截图呈现复杂的分辨率挑战:虽然整体图像很大,但像图标和按钮这样的单个交互元素常极小,使准确检测困难。这一分辨率差异常导致多模态语言模型幻觉出界面元素或在导航任务中犯关键定位错误,严重限制它们在真实应用中的可靠性。未来研究可聚焦于开发专门方法来应对这些视觉感知挑战。有前景的方向包括用思维链推理增强对界面层级的上下文理解,以及整合能把复杂屏幕分解成可管理组件的专门视觉解析工具。像 SoM 和 OmniParser 这样的方法已通过应对这些特定局限展示了令人印象深刻的结果。虽然基于工具的方法提供即时改进,最终目标仍是推进到无缝整合感知和动作的端到端 GUI Agent。达成这一点将需要专门设计来处理 GUI 环境独特视觉特征的新颖架构和训练范式,可能纳入能高效处理宏观布局和微观界面细节两者的自适应注意力机制。

V-C 策略规划与决策

GUI Agent 在导航复杂界面环境时面临关键的规划和决策挑战。当意外中断发生时——如系统弹窗、网络错误或动态界面变化——当前 agent 常灾难性失败,要么过早终止任务,要么陷入重复失败动作的循环。这一问题因真实界面的不可预测性而加剧,后者频繁更新其元素和信息架构,在训练环境和部署场景之间造成根本失配。除处理中断外,GUI Agent 在不确定环境中的基本决策挑战上也有困难。当遇到模糊的 UI 元素或多条可行交互路径时,当前 agent 缺乏精密的推理能力来确定与特定用户上下文和偏好对齐的最优动作。现代界面的短暂本质进一步复杂化了这一挑战,因为像工具提示、模态对话框和动画过渡这样的瞬态元素造成一个不断移动的交互图景,静态规划模型无法有效导航。GUI 环境的这些时间方面要求对状态转换和时序约束有比当前感知框架所能提供的更精密的理解。

V-D 用于 GUI Agent 的强化学习

随着 DeepSeek R1 的发展,研究者已认识到带基于规则奖励的强化学习的潜力。越来越多建立在 R1 范式上的研究已在该领域取得显著进展。GUI Agent 在实际场景中需要多步推理和决策,这本质上与强化学习的探索性一致,使其成为增强这些 agent 能力的一个有前景方法。用强化学习训练 GUI Agent 能否达成更好性能仍是一个值得探索的开放问题。屏幕图像所代表的高维状态空间呈现计算挑战,而定义平衡任务完成与用户体验考虑的恰当奖励函数仍然困难。尽管有这些挑战,强化学习与 GUI Agent 的整合代表一个有前景的方向,可能潜在地导致更有适应性、能处理复杂真实界面的 agent。

VI 结论

在本综述中,我们系统回顾了 GUI Agent 研究的近期进展,把它们的架构组织成四个基本模块:感知、探索、规划和交互。我们对每个模块提供了详细解释,考察它们如何共同使 agent 能跨多样平台解读、导航和操纵图形用户界面。此外,我们探索了 GUI Agent 的各种应用场景并全面描述了现有基准,凸显它们与计算成本、语言和界面多样性以及安全关切相关的潜在挑战。最后,我们识别了当前 GUI Agent 系统中的剩余挑战,并勾勒出能推进这一快速演化领域的有前景未来研究方向。


署名与许可:原文 A Survey on (M)LLM-Based GUI Agents,arXiv:2504.13865v2 [cs.AI],2025-03-27 提交、2025-06-04 修订。原文以 CC BY 4.0 许可发布。中文全译由智测团队完成,译文同样以 CC BY 4.0 发布;图 1–9 版权归原作者。原文地址:https://arxiv.org/abs/2504.13865 。译文中省略了参考文献列表、文内引注编号,以及第 IV 节的完整基准大表(按四个维度编译了代表性条目);模型名、工具名、基准名保留英文。如译文与原文有出入,以英文原文为准。

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction