智测 OpenQA

行业与实践研究与基准测试

基于 (M)LLM 的 GUI Agent 综述(中文全译)

智测团队 · OpenQA(openqa.cn)阅读约 47 分钟

GUI Agent 综述全译:把架构拆成感知、探索、规划、交互四个模块,梳理移动/桌面/网页/游戏四类应用、基准与评测策略,并指出元素定位、长时程规划与安全执行等挑战。原文 CC BY 4.0。

本文目录

基于 (M)LLM 的 GUI Agent 综述(中文全译)

翻译说明:本文是 arXiv 论文 A Survey on (M)LLM-Based GUI Agents(arXiv:2504.13865,2025-03-27 提交,2025-06-04 修订 v2)的中文全译,由智测团队翻译。原文以 CC BY 4.0 许可发布,允许翻译与再分发,须署名。译文保留原文全部章节与论点;参考文献列表与文内引注编号从略,模型名、工具名、基准名保留英文。第 IV 节原文为数百行的基准数据集大表,译文按环境/任务/评测策略/挑战四个维度编译代表性条目,完整表格请以英文原文为准。图 1(GUI Agent 总览)随文保留,版权归原作者。

摘要

图形用户界面(GUI)Agent 已成为人机交互中一种变革性范式,从基于规则的自动化脚本演化为能够理解并执行复杂界面操作的精密 AI 驱动系统。本综述全面考察了快速发展的基于 (M)LLM 的 GUI Agent 领域,系统分析其架构基础、技术组件和评测方法。我们识别并分析了构成现代 GUI Agent 的四个基本组件:(1)感知系统,整合基于文本的解析与多模态理解以实现全面的界面理解;(2)探索机制,通过内部建模、历史经验和外部信息检索来构建并维护知识库;(3)规划框架,利用高级推理方法做任务分解与执行;(4)交互系统,以稳健的安全控制管理动作生成。通过对这些组件的严格分析,我们揭示了大语言模型和多模态学习的近期进展如何革新了跨桌面、移动和网页平台的 GUI 自动化。我们批判性地审视了当前评测框架,凸显现有基准的方法论局限,同时提出标准化方向。本综述还识别了关键技术挑战,包括精确的元素定位、有效的知识检索、长时程规划和安全感知的执行控制,同时勾勒出增强 GUI Agent 能力的有前景研究方向。我们的系统性回顾为研究者和实践者提供了对该领域当前状态的透彻理解,并对智能界面自动化的未来发展给出洞察。

索引词:大语言模型;AI Agent;GUI Agent

I 引言

图形用户界面(GUI)在现代计算系统中的无处不在,导致了对用户界面交互智能自动化的日益增长的需求。传统自动化方法主要依赖基于规则的脚本和屏幕录制/回放机制,已被证明不足以处理现代界面的复杂性和动态性。GUI Agent 的出现——它们是能够理解、导航并与数字界面交互的自主系统——代表了人机交互的重大进步,提供了弥合自然语言指令与复杂界面操作之间鸿沟的潜力。

GUI 自动化技术的演化反映了人工智能的更广泛进步。早期 GUI 自动化尝试的特征是脆弱的手工规则和简单的模式匹配技术,需要大量手工配置且缺乏对界面变化的适应性。计算机视觉和模式识别方法的引入带来了改进的灵活性,但在理解上下文和处理动态元素方面仍有困难。大语言模型(LLM)和多模态语言模型(MLLM)的近期整合标志着该领域的变革时刻,使 agent 能够以空前的精密程度理解自然语言指令、推理复杂任务并适应变化的界面状态。值得注意的是,随着 OpenAI o1 的发布和 DeepSeek R1 对其能力的成功复现,研究者已开始把这些推理模型应用到 GUI 自动化。

为应对早期方法的局限并利用近期 (M)LLM 的进展,当代 GUI Agent 已演化为建立在四个基本技术组件之上的精密系统。这些组件协同工作,以实现全面的界面理解、知识管理、智能规划和可靠执行。

图 1. GUI Agent 总览(原论文配图,版权归原作者)
  • 感知:agent 理解界面的能力已从简单文本解析演化到精密的多模态理解。感知的近期进展可分为基于文本的解析(利用 DOM/HTML 结构)和多模态理解(利用 MLLM 和专门的 UI 模型)。然而,在精确元素定位、动态内容追踪和分辨率适配方面仍存在挑战。
  • 探索:知识获取和管理对有效的 GUI 自动化变得至关重要。agent 现在构建全面的知识库,纳入内部理解(UI 功能、元素属性)、历史经验(任务轨迹、技能库)和外部信息(API 文档、网页资源)。挑战在于有效组织和检索这些知识以引导决策。
  • 规划:高级推理框架的整合显著改进了 agent 处理复杂任务的能力。现代方法利用各种思维链方法和反应式框架做系统规划。关键挑战包括长时程规划、错误恢复,以及在多条交互路径间保持一致性。
  • 交互:动作空间已从基本 GUI 操作扩展到精密的 API 集成,同时保持安全和可靠。当代 agent 采用多样的动作生成和执行策略,日益聚焦于安全控制和错误处理机制。

这四个组件——感知、探索、规划和交互——构成一个集成流水线,使 GUI Agent 能处理自然语言指令、理解界面上下文、规划恰当动作并安全执行。感知组件提供对界面的基础理解,探索构建并维护智能决策所需的知识。规划组件利用这些知识制定有效策略,再通过交互组件执行。这一架构框架已在各种应用中被证明有效,尽管每个组件都持续呈现驱动进行中研究的独特挑战。

现代 GUI Agent 运行在一个多样化的平台生态系统中,包括桌面应用、移动设备和网页浏览器,每个都呈现独特的挑战和机会。桌面环境要求对复杂应用界面的精确控制,而移动平台需要适配基于触摸的交互和变化的屏幕尺寸。网页浏览器通过动态内容和多样的界面实现引入额外复杂性。这种部署上下文的多样性推动了日益精密、能跨不同平台泛化同时保持可靠性和安全的 agent 架构的发展。

为系统评估 GUI Agent 的能力并追踪该领域的进展,研究者开发了各种数据集和基准。这些评测框架跨越不同平台和场景,从移动应用导航到网页浏览和桌面软件操作。静态基准聚焦评估特定组件能力,如元素定位准确率或任务规划效率,而动态基准评估真实场景中的端到端性能。然而,由于界面的多样性、用户交互的复杂性,以及需要同时评估功能正确性和用户体验方面,开发全面的评测方法仍然有挑战。建立标准化的评测框架对比较不同方法和引导未来研究方向至关重要。

本综述提供对 GUI Agent 研究的全面分析,有以下贡献:

  • 一个 GUI Agent 技术的系统性分类,围绕四个核心组件组织:感知、探索、规划和交互。
  • 对各种技术方法的详细考察,从基本构建块到最先进方法。
  • 对当前评测方法和基准的批判性分析,凸显其优势和局限。
  • 对挑战和机会的深入讨论,为未来研究方向提供洞察。

本综述余下部分系统地探索这些方面,从 II-A 节的 GUI Agent 架构概览开始。II-B 到 II-E 节深入四个核心组件:感知机制、探索策略、规划框架和交互方法。第 III 节考察跨不同平台的应用,第 IV 节讨论评测方法和基准。第 V 节分析挑战和未来方向,随后是第 VI 节的结论。在整个全面考察中,我们旨在为研究者和实践者提供对 GUI Agent 当前状态的透彻理解,同时凸显未来研究和开发的有前景方向。

通过本综述,我们寻求阐明 GUI Agent 开发中的快速进展和剩余挑战,为这个日益重要领域的未来进步提供基础。随着数字界面持续演化和激增,GUI Agent 在弥合人类意图与计算机执行之间鸿沟的角色变得日益关键,使对该领域的这一系统性考察既及时又必要。

II 架构

II-A 概览

在本节中,我们呈现一个理解当代 GUI Agent 架构的系统框架。如图 2 所示,我们把这些智能系统分解为四个基本模块:感知、探索、规划和交互。这一功能分解不仅提供了分析清晰度,也反映了 GUI Agent 内信息处理从感官输入到知识获取、决策,最终到物理动作的自然进程。

通过对近期文献(2021–2025)的全面分析,我们把 GUI Agent 架构分为四个主要类别:利用现成多模态模型的通用 MLLM 方法;专门为 GUI 任务微调多模态模型的训练 MLLM 方法;把专门功能分布到协作 agent 间的多 Agent 框架;以及主要依赖界面文本表示的基于 LLM 的方法。图 4 追踪了这些架构范式的时间发展和发表量,揭示了该领域的快速演化和日益增长的研究兴趣。

GUI Agent 内的信息流始于感知模块,它作为系统的主要感官接口(§II-B)。这个模块涵盖基于文本的感知(解析 DOM 树或 XML 结构)(§II-B1)、多模态感知(直接处理截图)(§II-B2),以及用于屏幕理解的专门工具(OCR、目标检测)(§II-B3)。与人类视觉处理类似,感知提供了所有后续过程所依赖的基础界面理解。

在这一感知基础上,探索模块使 GUI Agent 能获取、组织和利用多样的知识源(§II-C)。我们识别出三种不同的知识获取策略(§II-C1):内部探索(检查界面结构和功能)、外部探索(从文档或网页资源检索补充信息),以及历史探索(利用过去的交互和成功轨迹)。我们还在 §II-C2 讨论了 GUI Agent 如何利用知识。这个全面的知识管理系统使 agent 能带着上下文意识和适应性导航复杂界面。

规划模块构成 GUI Agent 的认知核心,实现对任务的系统推理和决策(§II-D)。在我们的分类中,我们跨三个维度分析规划能力:底层推理框架(基于 LLM(§II-D1)、MLLM(§II-D2),还是像 o1 系列系统这样的高级推理模型(§II-D3))、任务规划方法(包括迭代式和基于分解的方法),以及确保计划可靠性的验证机制(§II-D4)。这一精密的规划架构使 agent 能处理多步任务,同时保持一致性并适应环境反馈。

最后,交互模块使 GUI Agent 能在目标环境中执行规划好的动作(§II-E)。我们呈现一个基于动作类型、生成策略和安全控制机制的系统分类框架。这些交互能力代表 agent 处理流水线的顶点,把内部表示和计划转化为操纵界面的具体动作。

这四个模块——感知、探索、规划和交互——共同构成一个集成的信息处理流水线,使 GUI Agent 能接收用户指令、理解界面上下文、制定恰当的动作计划并可靠执行。感知模块提供对环境的基础理解,探索构建并维护智能决策所需的知识。规划模块利用这些知识制定有效策略,再通过交互模块实现。这一架构框架已在多样应用中展示有效性,尽管每个组件都呈现驱动该领域持续创新的独特研究挑战。

在后续小节中,我们详细考察每个核心组件,分析其理论基础、实现方法和技术挑战。通过这一系统分解,我们旨在提供对当前 GUI Agent 架构的全面理解,同时凸显未来架构创新的机会。

II-B 感知

眼睛是人体的重要部分,能收集视觉信息然后反映到大脑做决策。类似地,GUI Agent 的感知也是一个关键模块,从屏幕或当前屏幕的内部结构获取多模态信息,从而辅助任务规划和执行。经过广泛的文献研究,我们可以把 GUI Agent 的感知机制分为基于文本和基于多模态的方法,如图 3 所示。例如,基于文本的 GUI Agent 通过把网页 HTML 或系统提供的 XML 文件解析成结构化文本表示来感知当前屏幕。相反,多模态 GUI Agent 直接处理截图,利用在 GUI grounding 数据上预训练和微调的专门模型,从视觉信息中精确定位和解读界面元素。

在后续小节中,我们更深入地探讨这两种感知机制:§II-B1 详细考察基于文本的感知方法,阐明这些技术如何利用结构化数据理解界面语义;§II-B2 探索实现对界面直接视觉理解的多模态感知技术。此外,我们研究工具增强感知这一新兴领域(§II-B3),探索专门的工具和框架如何增强 GUI Agent 解读复杂屏幕元素的能力,超越仅基于文本或仅基于视觉方法的局限。

#### II-B1 基于文本的 LLM GUI Agent

基于文本的 GUI Agent 仅依赖文本信息作为输入,并主要利用闭源大语言模型,如 GPT-4o、Claude-3.5-Sonnet。例如,AutoDroid 提出了它自己的感知方法,把 UI 页面解析成 HTML 格式输入给大模型。AiTW 采用 PaLM 模型,输入也类似 HTML 结构。值得注意的是,它还利用 OCR 工具识别图标和文本以做信息增强。MobileAgent 是一个基于文本的 GUI Agent,采用标准程序操作做上下文学习,使模型理解下一步做什么。它的输入是一个包含任务目标、操作历史和当前页面 DOM 信息的提示词。像 AiTW 一样,它也用 OCR 和图标检测工具。AssistGUI 用闭源大模型 GPT-3.5 做了与生产力工具相关的实验。具体来说,它从像 Photoshop 和 Premiere Pro 这样生产力工具的教学视频中学习。对 AssistGUI,它采用 Google OCR 和 YOLOv8 等各种工具来解析当前屏幕并把信息整合进提示词。WebArena 是一个运行在浏览器上的 Web Agent,通过利用任务指令和从当前网页结构派生的 DOM 树,创建一个聚焦真实场景的虚拟环境。

然而,基于文本的 GUI Agent 仍面临如下若干局限:

  • 冗余:基于文本的 GUI Agent 必须处理大量的 HTML/DOM 树或 XML 文件,其中许多包含与当前任务无关的冗余信息。
  • 噪声:文本表示常包含实现细节、样式信息和其他噪声,可能分散对核心交互元素的注意。
  • 可得性:在各种平台上,全面的文本信息(完整的 XML 或 HTML 结构)可能无法获取或不完整,限制了 agent 对界面的理解。

为应对这些挑战,研究者已开始用多模态大语言模型做 GUI 屏幕理解,这使 agent 能直接解读界面的视觉元素,规避纯文本表示的局限,增强它们导航和交互图形环境的能力。

#### II-B2 基于多模态 LLM 的 GUI Agent

由于基于文本的 LLM GUI Agent 的局限,研究者日益利用 MLLM 来增强 agent 感知。关于多模态 GUI Agent 的近期研究可分为三种方法:(1)通用 MLLM 方法:直接利用像 GPT-4V 这样的通用模型做屏幕理解,无需为 GUI 任务专门训练。(2)训练 MLLM 方法:训练专门的多模态模型以做更深的 UI 理解,以 CogAgent 为例。(3)工具增强 MLLM 方法:采用用 OCR 和 Grounding DINO 等补充工具增强的多模态模型,以做全面的 UI 解读。

用通用多模态大模型理解 UI。 随着多模态技术的进步,像 GPT-4V、GPT-4o 和 Claude-3.5 Sonnet 这样的强大模型已经出现。大多数利用这些通用多模态大模型做屏幕理解的研究依赖闭源系统。若干值得注意的实现展示了这一方法。AppAgent 采用 GPT-4 通过截图和 XML 文件感知虚拟环境,把学到的信息存进相关文档。OS-Copilot 类似地在其三模块系统(规划器、配置器、执行器)中利用 GPT-4,但通过生成代码段来操作软件而与众不同,例如用 python-ppt 操纵 PowerPoint。有工作是聚焦网页的实现,利用 GPT-4 通过元素属性、文本选项和图像标注感知屏幕。Mobile-Agent 通过把 GPT-4 与 OCR 和 Grounding DINO 等补充工具整合,解决了基于文本的 GUI Agent 对 XML 和 HTML 依赖的局限。类似地,UFO 结合 MLLM 做 Windows 平台操作,而 Mobile-Agent-V2 通过实现一个同时利用基于文本的 GPT-4 和 GPT-4V 的多 agent 框架,扩展了其前身。

近期实现进一步专门化了这些方法。Cradle 用 GPT-4o 创建一个玩游戏框架,用 SAM 和 Grounding DINO 增强以改进感知。AppAgent v2 在 AppAgent 基础上通过 XML 处理增强 UI 理解能力,并整合 OCR 和检测模型。Agent S 专门针对定位能力,使用 GPT-4o 和 Claude-3.5-Sonnet,纳入 PaddleOCR 做截图理解。Mobile-Agent-E 采用 GPT-4o 做规划,同时利用 OCR、图标 grounding 和图标描述做 GUI 理解。Operator 框架利用 GPT-4o 的视觉能力连同强化学习做屏幕交互,而 Deep Research 整合 OpenAI 的 o3 模型以实现高效的多步推理来完成任务。

基于通用大模型的 GUI Agent 常整合各种工具以增强其能力。然而,这些方法面临若干重大局限:

  • 定位精度:尽管声称有元素定位能力,通用 MLLM 在精确识别和瞄准特定 GUI 组件方面仍有困难,尤其在复杂或密集的界面中。
  • 领域特定理解:GUI 界面采用独特的视觉语言、交互模式和结构层级,与自然图像显著不同。通用模型缺乏在 GUI 特定数据集上的充分预训练,导致对界面语义、组件关系和功能可供性的理解有限。
  • API 依赖:大多数实现依赖需要 API 访问的闭源模型,引入大量计算成本和潜在的速率限制。

为应对这些局限,研究者开发了专门聚焦于为 GUI 理解训练多模态大模型的方法。

用训练过的多模态大模型理解 UI。 为应对这些根本局限,研究者开发了专门为 GUI 理解训练的模型。早期基于多模态训练来理解屏幕的工作,如 UIBert,是一个基于 Transformer 的模型,通过 UI 图像、文本和视图分布学习 UI 界面的通用特征表示,并设计了五个预训练任务以达成一个通用模型。另一项早期工作是 META-GUI,它用 Faster R-CNN 从 UI 页面提取图像特征、用 BERT 提取文本特征,合并不同模态特征做训练。

然而,现有多模态模型仍面临 UI 定位不准的问题,并受分辨率影响,导致可能无法识别较小的图标。CogAgent 通过预训练来输出元素坐标并融合高分辨率和低分辨率图像,解决了定位问题。SeeClick 构建了多平台的 ScreenSpot 数据集,用 Qwen2-VL 训练以改进屏幕感知。CoCo-Agent 利用 LLaVA 输出精确元素坐标,同时纳入 OCR 和图标识别工具。MobileFlow 用 ViT 和 LayoutLMv3 做图像编码、配合基于 MoE 的 LLM,处理中文理解和隐私关切。AutoGLM 为 Android 和 Web 界面分离了定位和规划任务,提出用 ChatGLM 的自进化方法。OS-ATLAS 利用带屏幕截图、元素指令和坐标的大规模数据集做 GUI 感知。ShowUI 采用轻量级视觉-语言-动作框架做元素定位。Aguvis 通过纯视觉架构和大规模 GUI 数据集预训练增强定位准确率。Aria-UI 利用混合专家(MoE)方法作为纯视觉多模态模型,通过文本-图像混合操作历史强化上下文意识和定位。InfiGUIAgent 提出一个两阶段监督微调范式:初始阶段聚焦基础视觉-语义理解,后续阶段增强多步推理能力以优化 GUI 交互逻辑。值得注意的是,InfiGUIAgent 引入了一个层级式期望-反思推理框架,配合双阶段训练机制来深化 GUI 语义解析。PC-Agent 通过把 Molmo 多模态能力与来自系统 API 的外部反馈结合做自我验证,改进了定位稳健性。UI-TARS 通过利用大量 GUI 语料训练来增强屏幕感知。AppAgentX 通过用 OmniParser 检测截图中的 UI 元素、再把标注后的图像传给 LLM 做动作规划来感知屏幕。

尽管有这些专门方法,专门为 GUI 理解训练模型仍面临若干显著局限:

  • 跨平台不一致:GUI 元素在网页、移动和桌面平台间的风格、结构和交互模式差异显著,使单一模型难以有效泛化。
  • 分辨率约束:GUI 图像通常需要高分辨率才能准确解析,但许多模型难以识别和交互对完成任务至关重要的小图标和元素。
  • 训练资源密集:开发专门的 GUI Agent 需要大量计算资源和创建维护成本高昂的专门数据集。

#### II-B3 多工具协作 UI 解析

由于基于文本和多模态 GUI Agent 的泛化局限,研究者日益采用基于工具的方法来增强屏幕信息识别。如图 4 所示,该领域已出现若干专门工具:SoM 结合 Grounding DINO 和 SAM 来识别并语义标注屏幕对象,然后把这些标注与 GPT-4V 整合以做有效定位。类似地,OmniParser 采用多个专门模型——包括目标检测、OCR 和图标识别——来独立解析屏幕元素,然后为 GPT-4V 理解整合这些信息。这些方法通常利用一个多样工具箱,包括 OCR 系统、YOLO 检测器、Grounding DINO 和 IconNet,以做全面的 GUI 解析。通过用专门工具提取相关信息作为提示增强,这些方法显著减少了 GUI Agent 的感知负担。然而,这种工具辅助范式牺牲了端到端处理效率。在感知前必须采用多个识别算法,引入了大量计算开销和资源需求,在增强准确率和系统性能之间造成权衡。

II-C 探索

近年来,LLM 和 MLLM 的出现赋予智能 agent 稳健的自然语言理解和多模态感知能力。这些进展不仅改进了人-agent 交互的效率,也显著扩展了这类 agent 在复杂任务场景中的适用性。然而,智能 agent 在决策时从根本上在其内部知识的约束内运行。当面对异构的用户界面架构和持续演化的内容时,这些系统经常表现出无法满足实际要求的性能局限。为应对这些局限,研究者日益探索图形界面整合方法,聚焦于能更好感知和导航视觉环境的 GUI Agent,从而增强知识获取以做更高效的任务规划和决策,如图 8 所示。

在后续小节中,我们考察 GUI Agent 如何通过各种方法处理知识。§II-C1 呈现三种探索类型(内部、历史和外部),§II-C2 覆盖知识构建、存储和应用的操作方面。

#### II-C1 知识获取

在导航新环境时,人类利用各种信息源来获取知识和解决问题。类似地,设计来解读和交互图形界面的 GUI Agent 必须纳入多样的信息源以做有效操作。通过分析过去三年的相关研究,我们识别出三种不同的知识获取方法:

  • 内部探索:GUI Agent 利用内置的知识表示和推理能力。
  • 历史探索:GUI Agent 分析来自过去任务轨迹的成功示例。
  • 外部探索:GUI Agent 从像互联网这样的外部源检索补充知识和规则。

内部探索聚焦于收集关于用户界面功能、页面元素用途和应用概览的一系列信息。例如,AutoDroid 对 UI 页面做离线随机探索,总结元素功能和页面状态以构建知识库。类似地,AppAgent 和 AppAgent v2 采用多模态 agent 框架来分析交互期间所用元素和动作的角色,把所得知识记录为参考材料。为进一步增强 agent 对用户需求的理解,MobA 利用 LLM 基于日常活动轨迹总结用户偏好,建立用户记忆。此外,它把应用功能描述和访问过的页面记录为程序性记忆,帮助 agent 获取应用特定知识并改进泛化能力。内部探索使 GUI Agent 能通过检查界面结构、分析元素功能、在其内部框架内映射应用行为,来系统地构建全面的知识表示。

历史探索聚焦于收集关于历史任务轨迹、环境反馈和技能库的一系列信息,它利用过去的交互和结果来为当前决策过程提供信息。

环境反馈:与人类短期记忆类似,环境反馈指对前几步或紧接的前一个决策的信息的临时存储。这一反馈随后被应用于引导 agent 的后续决策过程。在 Reflexion 中,agent 收集基于语言的反馈,通过把二元或标量环境反馈转化为文本摘要来改进语言 agent。这些摘要使 agent 能反思失败的规划尝试,把其反思存进一个情景记忆缓冲区以纳入后续决策的上下文,从而实现更好的规划。在 OS-Copilot 中,工作记忆收集实时执行反馈,用它来调整所存储的陈述性和程序性记忆,防止 agent 重复同样的错误。

任务轨迹:Agents、Synapse 和 RaDA 存储在基础任务上训练 agent 期间收集的成功轨迹以补充 agent 知识。类似地,OS-Copilot 维护三种记忆:陈述性记忆(含过去轨迹的语义知识)、程序性记忆和工作记忆。为处理复杂控制任务,Agents 框架同时存储叙事性和情景性知识。叙事性知识总结完整任务经验以辅助复杂任务分解,而情景性知识为子任务规划提供层级式任务策略。由于输入提示的敏感性和基于大语言模型的 agent 的上下文长度限制,Expel 和 AutoGuide 从成功和失败轨迹中提取知识以生成状态相关的指南。这些指南用于实时状态以预测最优动作。通过 GUI Odyssey 训练的 OdysseyAgent 是一个用于跨应用导航的多模态 agent。鉴于任务相关上下文常涉及大量截图和延长的操作步骤,该框架采用一个历史回放模块,把历史图像标注压缩为决策输入。UFO 用双 agent 框架专门处理聚焦 UI 的任务。它记录两个 agent 的决策历史和执行结果来调节交互,实现与 Windows 操作系统的无缝整合。

技能库:Voyager,一个为 Minecraft 开发的具身 agent,维护一个不断增长的技能库,存储由自动课程模块提出的任务的有效技能代码,实现对游戏世界的持续探索。类似地,GITM 为每个遇到的任务维护一个常见计划的文本记忆库,提供可参考的经验知识。任务完成常遵循受某些规则支配的序列。KnowAgent 探索不同任务类型,总结对应的动作和基于规则的知识。这些知识用于微调大模型,增强它们理解和利用任务相关信息的能力。

外部探索涉及用像搜索引擎这样的工具从外部环境获取信息。在模拟人脑认知架构的 OS-Copilot 中,程序性记忆构成系统长期记忆结构的关键组件。这个记忆框架存储从互联网、用户交互和操作系统输出收集的全面事实和事件集合,以支持 agent 的决策过程。在 GITM 中,研究者从像 Minecraft Wiki 和详细的合成/冶炼配方这样的源构建一个全面的文本知识库。这个外部库在 Minecraft 环境中执行复杂任务分解时作为 agent 的重要参考。为改进决策效率并避免僵硬的操作指令,Mobile-Agent 搜索互联网以总结各种任务的标准操作流程,随后用作 agent 输入命令的蓝图。在 Agents 中,分解复杂任务时,agent 在网上搜索相似的分类示例和分类标准。这些知识与叙事记忆(或历史知识)结合,为决策提供更全面的参考。

#### II-C2 知识操作

GUI Agent 通过从各种源探索信息形成概念知识库。这个知识操作框架由三个相互连接的过程构成,用于跨像 Android 或 Windows 这样的环境运作。过程始于把概念转化为逻辑库,接着建立有效的最优结构组织,最后实现平衡访问速度和规划有效性的检索机制。这些集成的组件使 agent 能在实际应用中把知识付诸运作。

知识构建是知识处理流水线中的关键组件。一个设计良好的知识构建过程最大化有价值信息的提取,从而显著增强智能 agent 性能。基于时间特征,我们把知识构建过程分为两类:静态构建和动态构建。

静态构建:这个方法涉及对 GUI 页面的离线探索以收集信息,如 AutoDroid 所展示的,它随机探索 GUI 页面以生成转移图,并通过一个记忆生成器遍历这些图来创建元素功能描述和页面功能摘要。与 AutoDroid 的随机探索不同,AppAgent 和 AppAgent v2 聚焦于任务驱动的探索,引导 agent 更高效地操作特定元素。在这个过程中,agent 学习不同 UI 元素和动作在交互期间的功能关系,同时用从手工操作观察到的复杂功能补充 agent 的知识。MobileAgent 进一步对任务驱动的路径轨迹做离线知识提取,以派生出标准操作流程的更抽象知识。Expel 和 AutoGuide 从历史任务轨迹提取知识以生成状态相关的指南。首先,它们从收集的任务决策数据构建成功和失败轨迹对的数据集。然后它们在配对数据集中提取偏差发生前的轨迹,并用 LLM 做状态总结以生成对应指南。KnowAgent 针对特定领域任务做大规模离线知识构建,其中 GPT-4 生成任务探索动作和动作规则的初始知识库,随后被手工优化。由于缺乏实时交互和反馈机制,静态知识库常难以捕捉复杂场景中的上下文信息,导致它们对动态变化的 GUI 环境适应性较差。认识到这一局限,研究者已转向动态构建方法。

动态构建:MobA 实现三种记忆,它们最初由人类专家配置并在交互期间持续实时更新。WKM 作为一个世界知识模型来辅助 GUI Agent,它从手工标注的数据集提取专家轨迹,把偏好与 agent 生成的轨迹比较。这些偏好被输入 agent 以总结任务知识,每一步都基于专家轨迹关联一个状态摘要知识。OS-Copilot 利用最初由用户自定义的程序性记忆。对后续任务,agent 从记忆检索适用工具。当记忆缺乏合适工具时,工具生成器被激活以创建并执行新工具,收集反馈直到达到终止条件。任务完成时,反思模块评估每个工具的效用并决定是否相应更新记忆库。Agents 同时包含初始记忆构建和持续记忆更新。在初始阶段,基于一个数据集把任务生成为两类:环境无关任务和环境感知任务,随后由一个用网络知识补充的 agent 探索。agent 从完整任务和子任务收集经验,在与新任务交互时持续更新知识库。动态构建通过基于交互反馈实现实时知识精炼来增强适应性和上下文理解,解决了静态方法的局限。

知识存储:知识存储媒体的格式构成探索模块研究的一个关键维度,格式从自然语言到结构化数据库不等。每种存储范式提供针对特定应用上下文的独特优势,反映了自主系统中知识表示的多样方法。

自然语言作为一种基础知识存储媒体,实现对多样信息类型的直观表示和人类可解读的存储。AppAgent 和 AppAgent v2 通过自然语言表示知识,随后存进文档。Reflexion 和 Voyager 都利用自然语言做知识表示,前者在一个滑动窗口机制内维护经验反馈,后者把 Minecraft 技能直接编码进记忆,实现游戏期间高效的技能检索和利用。

数据库为复杂 agent 知识提供系统组织和高效检索机制,实现带精密索引能力的结构化存储。AutoDroid 实现一个双表知识架构,包含带 UI 交互元素功能描述的模拟任务表,和记录当前页面功能的用户页面功能表。Agents 框架纳入来自 Zhou 等人的记忆组件,利用 VectorDB 做高效知识存储,而 Agashe 等人在其数据库结构中区分由查询任务键控的叙事记忆和由查询任务及上下文子任务信息共同索引的情景记忆。

数据结构提供组织知识元素间复杂关系的通用框架,实现对 GUI Agent 层级、关联和序列信息的高效表示。MobA 的任务记忆基于 ICE 策略,其中任务和子任务被组织成层级树结构。这个结构适合有序子任务的序列,并捕捉每个任务的详细信息,包括任务状态、环境上下文和相关子任务。Expel 和 AutoGuide 采用带键值对的字典数据结构,以高效表示状态和指南之间的一对一对应。KnowAgent 为其知识库采用图结构来表示反映社交网络复杂性的复杂动作关系和序列。在这个框架中,动作作为节点(含动作名和定义),而规则作为连接边(编码规则描述),有效捕捉系统中不同动作之间的相互依赖。WKM 中的状态知识也以图结构存储,节点表示专家轨迹中的动作,边表示序列动作之间的状态知识。GITM 把子目标的动作列表存储在层级树结构中,清晰捕捉目标与对应计划之间的关系。

代码:可执行表示提供程序性知识的直接编码,使 agent 能通过函数库执行复杂操作。OS-Copilot 涉及的程序性记忆由一系列手工创建的工具库组成,以 API 服务和 Python 文件双重格式存储。Voyager 把技能存储为其架构内的值,形成一个全面的技能知识库,便利所学能力的直接执行。

知识应用:记忆检索的目的是从记忆提取有意义的信息以增强 GUI Agent 的动作,例如利用先前成功的动作来达成相似目标。记忆检索中的关键挑战集中在从 agent 的历史动作库识别和提取有价值信息。这个过程可按检索范围和方法分类,方法从针对性的单次检索到全面的多次提取策略不等。

单次检索:AppAgent、AppAgent v2 和 Agents 基于任务相关性检索知识,作为辅助 agent 的额外输入。AutoDroid 采用嵌入模型 Instructor-XL 来映射知识和任务描述,利用相似度函数(sim)比较两者并为 agent 规划检索知识。检索到的功能描述通过给当前页面对应 HTML 框架 UI 元素添加新的 onclick 属性来应用。Agashe 等人基于任务描述和层级子任务信息从知识数据库检索知识。Voyager 利用 GPT-3.5 基于任务描述生成环境反馈,并通过反馈嵌入从技能数据库检索前 5 个技能代码。运行在文本处理 LLM 上的 KnowAgent,最初检索存储在图中的相关知识并把它转化为文本格式。这有双重目的:在自学习过程中,每个生成的路径被过滤和合并以微调 agent,随后在下游任务中直接作为提示词提供。Qiao 等人利用任务知识和状态知识训练 WKM 模型,它通过从一般概览进展到具体细节来模拟人类知识构建过程。WKM 最初辅助 agent 建立一般规划路径,随后在执行期间实时生成当前状态。这个状态作为从数据库检索知识的键,识别 n 个可能的下一动作并基于 agent 预测的动作概率选择概率最高的那个。尽管有这些进展,当知识库存储多源信息时,单次检索方法可能呈现局限。这类方法可能片面、适应性差,潜在地遗漏关键信息并导致决策路径的重大偏差。为解决这些局限,近期研究提出了多次检索方法。

多次检索:OS-Copilot 通过两种不同机制检索不同的所存程序性记忆:通过 POST 请求的 API 调用,和匹配特定调用的 Python 文件信息。AutoGuide 在 agent 决策过程中整合键值对知识,其中状态总结模块首先实时总结当前状态以做状态匹配,随后当识别出多于 k 个匹配时由指南选择模块做进一步精炼。MobA 实现两种针对不同任务需求定制的互补检索方法。它们基于关系的检索通过从树结构记忆中的前一个动作节点及其父节点提取任务描述来瞄准动作模块,从而增强 agent 对后续动作的决策能力。同时,它们基于内容的检索利用余弦相似度搜索历史任务经验,便利复杂任务的层级分解。

II-D 推理与规划

GUI Agent 中的规划需要精密的推理能力,以有效导航复杂界面并达成用户目标。本节考察规划机制的理论基础和实际实现。我们首先分析当代 LLM(§II-D1)和 MLLM(§II-D2)中采用的推理框架,为理解高级规划技术建立基础。然后我们探索最先进 o1 类模型中整合多步推理和复杂决策树的新兴推理架构(§II-D3)。随后,我们全面分析 GUI Agent 特定的规划架构(§II-D4),聚焦规划器设计、验证方法和反馈整合系统,它们共同实现在图形用户环境中的稳健任务执行。

#### II-D1 LLM 推理

近年来,LLM 在上下文建模中展示了出色性能,这显著贡献于它们在自然语言处理任务中卓越的推理能力。受此启发,思维链(CoT)提示方法——引入中间推理步骤来引导 LLM 走过逐步推理过程——已成功解决多步推理问题。CoT 中的中间推理步骤提供了更透明的推理路径,有助于 LLM 的可解释性和评估。这个方法不仅增强了模型的推理能力,也为多步推理任务中的 Agent 规划提供了重要洞察。下面我们介绍 CoT 提示的几种常见变体。

CoT 是一种链式结构,把复杂任务分解成一系列更简单的步骤,顺序执行。CoT 结构可表示为 ⟨input, thought₁, thought₂, …, thoughtₙ, output⟩,其中 input 指模型接收的任务,thought 表示中间推理步骤,n 表示这类步骤的数量,output 是最终答案或解。从示例提示的角度,CoT 可分为两类:(1)zero-shot CoT,用像「让我们一步步思考」这样的短语提示推理,(2)few-shot CoT,其中少量示例提示引导模型走过增量推理。例如,Yuan 等人利用一个偏好引导的反向推理策略来生成增强 LLM 逻辑推理能力的示例模板。

ToT(思维树)通过使用树结构扩展了基于链的推理,在推理过程的每一步生成多个推理思路并做自我评估,以剪枝并规划最优路径。近期研究通过把蒙特卡洛树搜索(MCTS)与 LLM 结合进一步扩展了树结构,进一步增强了模型的推理能力。例如,ReST-MCTS* 把 MCTS 与强化自训练整合,SC-MCTS 通过增强的奖励模型、节点选择策略和反向传播方法改进了 LLM 在复杂推理任务中的准确率和速度。此外,RAP 构建一个世界模型并用 MCTS 有效平衡探索和利用。LATS 遵循 ReAct 框架并把 MCTS 应用于 LM Agent,通过搜索、交互和反思的协作过程实现更细致和自适应的问题求解机制。

GoT(思维图)通过采用引入循环和多对一连接的图结构,扩展了传统基于树的推理结构。这允许对子问题聚合和自我评估做更有效的建模。

ReAct(推理与行动)通过添加一个动作空间 Â = A ∪ L 来促进推理和动作之间的协同,在基于链的推理上构建,其中 L 表示推理轨迹,A 是允许动作的集合。具体来说,agent 首先基于分配的任务生成一个思路,然后基于这个思路执行一个动作,观察结果,并迭代这个过程直到任务完成。

随着 LLM 的推理能力变得日益复杂,有效评估其复杂推理路径变得日益重要和必要。一些研究,如 Self-Consistency、Best-of-N、过程监督奖励模型(PRM)和结果监督奖励模型(ORM),旨在通过评估中间推理步骤或最终结果来改进大语言模型的推理能力。同时,一些研究通过把复杂问题分解成更简单的子问题来解决它们。例如,Huang 等人把问题分解成一个有向无环图,并用问题分解意义表示(QDMR)提示方法基于图中节点间的依赖关系做逐步推理。此外,一些研究表明 LLM 能够通过自我精炼在推理过程中自我改进。例如,Quiet-STaR 用一种语言模型学习为每个 token 生成推理链的方法。

#### II-D2 多模态 LLM 推理

在 MLLM 的语境中,思维链推理不局限于自然语言,还能整合和分析像图像、视频和音频这样的其他感知信息,从而把文本思维链推理扩展到多模态思维链推理。Lu 等人提出了 ScienceQA 数据集,为随后引入多模态思维链推理(MCoT)概念奠定了基础。为进一步增强 MCoT 的推理能力,研究者探索了各种方法。KAM-CoT 通过整合思维链、知识图谱和多模态信息增强 MCoT 的推理能力。CCoT 利用场景图表示作为提示来鼓励 LLM 生成结构化描述作为推理步骤。此外,像 MM-REACT、VisCoT 和 VoCoT 这样的工作进一步整合视觉专家能力,增强多模态推理和动作能力。例如,VoCoT 通过多模态交叉对齐视觉地表示对象概念,从而实现一个由多步视觉支持引导的、面向对象的思维链推理过程。类似地,CoCoT 利用跨多张图像的信息做跨图像分析。为缓解推理过程中潜在的错误和幻觉,DDCoT 采用负空间线索来揭示子问题分解中的不确定性。同时,TextCoT 利用 MLLM 的图像描述能力把握图像的全局上下文,并利用定位能力检查局部文本区域。MC-CoT 采用类似 CoT-SC 的投票机制,但与 CoT-SC 不同,它在生成推理和答案推理两个阶段都引入投票,从而增强 LMM 推理的稳健性。CogCoM 模拟人类视觉推理过程,通过增量操作步骤推断正确答案。WoT 引入一个创新机制,把中间推理步骤结果转化为图像,然后用 MLLM 的视觉输入能力对该图像做进一步推理。在特定应用领域,Wei 等人把 MCoT 应用到医疗领域,通过整合医学知识和任务特定引导改进推理和信息提取效果。Focus 提出一个基于 MLLM 的双系统框架来定位 GUI 元素,它能生成显式的多阶段 CoT 以增强 grounding 能力。

此外,在文本转语音(TTS)领域,也有与思维链相关的工作。RALL-E 通过用 CoT 把任务分解成更简单的步骤来增强基于 LLM 的 TTS 的稳健性。同时,Hu 等人通过使用语音编码器生成的自动语音识别(ASR)转录文本连同编码语音作为 CoT 提示,增强了自动语音翻译(AST)的性能。此外,Gong 等人通过思维链提示把复杂的源到目标语音映射分解成中间生成步骤,改进了富有表现力的语音到语音翻译(S2ST)的翻译质量和参数效率。

#### II-D3 o1 类推理模型

自 OpenAI 的 o1 发布以来,研究者一直致力于复现其卓越的推理能力。o1 模型通过在给出答案前进行深度思考展示了优越的推理性能。作为该领域的重大突破,DeepSeek-R1 是复现 o1 的代表性模型,通过强化学习和可验证的基于规则的奖励成功复现了类似能力。具体来说,它采用群组相对策略优化(GRPO)算法而非传统 PPO 算法做训练,从而实现了一个「顿悟时刻」(模型重新评估答案并反思先前推理路径的现象)。受 DeepSeek-R1 成功的启发,开源社区内涌现了一波 R1 复现努力。这些复现努力主要聚焦两个方向:基于文本的模型和多模态推理模型。在基于文本的模型方面,Logic-RL 用一个仅 70 亿参数的模型成功复现了「顿悟时刻」,表明较小规模的模型也能通过强化学习获得强大推理能力。同时,R1-Searcher 创新性地提出一个两阶段强化学习方法,使 LLM 能在推理期间自主调用外部检索系统,这一方法有效克服了模型固有的知识局限。另一方面,在多模态推理领域,尽管 DeepSeek-R1 的成就影响重大,多模态领域的类似探索仍相对有限。Vision-R1 引入一个视觉强化微调方法,为不同视觉任务设计特定奖励函数(如 IoU 奖励和分类奖励)并采用 GRPO 策略参数更新,这一方法显著增强了模型在少样本学习和视觉推理任务中的性能。LMM-R1 通过一个两阶段规则奖励强化学习框架增强了一个 30 亿规模多模态模型的推理能力,它扩展 OpenRLHF 框架以支持多模态模型训练,从而使小模型能在复杂任务中展示强大推理和适应性。

#### II-D4 任务规划

在 GUI Agent 的组件中,规划能力至关重要,它辅助 GUI Agent 做任务规划、任务验证和提供反馈。在规划阶段,GUI Agent 通常遵循 CoT 范式。在规划阶段,推理过程常采用 ReAct 风格。例如,CoA 通过纳入动作历史改进了 CoT(思维链)推理。在此基础上,CoAT 通过整合屏幕描述和先前动作结果进一步增强 CoT 推理,从而改进推理准确率和上下文意识。

任务规划器。 GUI Agent 通常利用一个任务规划器来规划复杂任务,获得一系列可执行方案以便利任务完成。一般而言,GUI Agent 的任务规划器模块可分为两类——迭代规划和任务分解规划。

迭代规划:如图 6(a) 所示,GUI Agent 通过基于每一步的当前状态和反馈动态调整任务计划、并推断下一动作策略,来迭代地完成指令任务。例如,AppAgent 通过持续迭代逐步完成指令任务。此外,一些 GUI Agent 先生成一个整体计划再进行迭代。例如,Mobile-Agent 采用一种自规划方法,最初基于用户指令生成一个系统提示词,然后逐步完成每个操作步骤,提示词格式遵循 ReAct 风格。SheetCopilot 用一个基于状态机的规划器,通过来自 LM 或软件的反馈修订计划。迭代规划过程高度动态,允许系统基于每一步的反馈持续调整任务策略,有效适应环境变化并确保计划的可靠性和有效性。然而,处理复杂任务时,GUI Agent 的推理步骤可能变得过长,这会导致 LLM 生成幻觉,使后续规划偏离预期目标。

任务分解规划:如图 6(b) 所示,GUI Agent 把复杂任务分解成一系列子任务,然后为这些子任务推断动作策略,允许 agent 通过成功执行所有子任务来完成指令任务。与直接处理复杂任务相比,把任务分解成更简单的子任务允许语言模型更好地保持子任务与整体任务之间的紧密联系,从而降低大语言模型中灾难性遗忘或幻觉的风险。然而,基于任务分解的规划缺乏灵活性,因为子任务从一开始就固定,这使其难以适应环境的动态变化或意外障碍。Agent S 采用一个任务规划器把复杂任务分解成详细的、拓扑排序的子任务以完成用户指令。现有规划器,无论生成线性还是非线性结构计划,都要求 agent 以顺序方式执行任务。OS-Copilot 利用一个基于有向无环图(DAG)的规划器,允许许多独立任务并行化,从而最小化执行时间。类似地,VillagerAgent 把分解的子任务构建成一个 DAG 以实现结构化任务管理。此外,MobA 把长期任务分解成一系列子任务,允许每个子任务在动作模块内一步完成。如果一个子任务遇到错误或无法一步完成,它被进一步分解直到任务完全完成。

验证器。 GUI Agent 的成功执行依赖两个关键组件:精确规划和稳健验证机制。其中,验证器尤其重要,因为它直接评估 GUI Agent 生成输出的质量,确保其可靠性和有效性。验证器在确保 GUI agent 生成输出的质量方面起关键作用,主要功能是检查 GUI Agent 产生的推理步骤和任务执行状态以确保可靠性和准确性。一般而言,验证器利用像生成的轨迹和动作执行前后的环境这样的输入,来为给定任务上下文中的 agent 计算性能分数。GUI Agent 中的验证器通常利用其自身的 LLM 同时做生成和评估目的。Voyager 引入一个自改进的迭代提示机制来对任务状态做自我验证。Agent S 用验证器从完成的子任务总结策略作为经验,随后用作文本奖励为后续任务提供更好的策略建议。此外,Reflexion 通过基于 agent 生成的轨迹生成详细文本输出做更全面的评估。而且,Self-Consistency 方法常用于评估任务,从多个生成输出中选择最常见的答案作为最终解。LATS 提出一个把 agent 自身 LLM 生成的分数与自一致性评估结合来给推理节点赋值的机制。

反馈。 在实际应用场景中,GUI Agent 常需处理复杂任务的长期规划和执行。任务执行期间,agent 很可能遇到意外错误,这可能导致任务失败。例如,执行某操作后,UI 的实际状态可能与预期不符,或操作结果可能不满足预期目标。因此,反馈机制用于监控整个任务执行过程并向 agent 提供及时的语义反馈,允许在问题出现时快速调整和纠正任务计划。一般而言,反馈可分为两类:外部反馈和内部反馈。

外部反馈主要指环境反馈,它捕捉对 agent 任务执行的直接响应,例如 agent 动作后的观察结果。这一反馈使 agent 能评估当前执行步骤是否达成预期结果,为后续动作提供关键引导。环境反馈通常由 agent 通过像截图这样的特定方法获得。例如,ReAct 提出一个三元组 ⟨thought, action, observation⟩,利用每个动作后对当前环境状态的观察来向 agent 提供反馈。具体来说,thought 表示推理和审议过程,action 表示 agent 采取的动作,observation 是从环境获得的信息。Voyager 把环境反馈整合进任务执行过程。类似地,MP5 分析环境反馈以识别任务执行失败的根本原因,并用这一信息引导规划器精炼后续任务规划。这一机制防止系统继续沿错误路径前进,并允许根据环境状态灵活调整执行策略。LATS 用环境反馈作为观察扩展节点,并利用这一反馈直接提供评估奖励,从而辅助任务评估。

内部反馈通常指自反馈。一般而言,GUI Agent 利用其自身的 LLM 生成反馈,它要么用作下一动作提示词的一部分,要么存进一个记忆模块,使 agent 能通过语言反馈信号利用经验来快速精炼其决策计划并有效解决问题。反馈机制能显著增强 agent 在任务执行中的准确性和可靠性。LATS 通过自反思向 agent 提供额外语义信号。类似地,UFO 中的计划反思模块提示 agent 在每个决策步骤持续修改其计划,允许按需偏离原始路线。Agent S 采用类似方法,通过基于对整个子任务执行轨迹的观察提供反思性建议,帮助 agent 考虑替代策略并避免重复动作。此外,反馈模型的输入不限于动作轨迹。例如,Reflexion 基于奖励信号、轨迹信息和相关记忆生成语言自反馈,为 agent 的未来尝试提供详细且有价值的引导。Hu 等人在每次迭代中提供历史动作和当前步信息的简洁摘要反馈,这减少了反馈开销并缓解了信息过载导致的 agent 性能退化。

II-E 交互

GUI Agent 是设计来与图形用户界面交互以完成各种任务帮助用户的智能系统。这些 agent 依赖精密的交互机制来有效导航和操纵界面元素。这些 agent 的交互能力可精炼为三个紧密相关的组件:动作目标、动作生成和动作空间。动作目标定义引导 agent 任务执行的特定目标,直接与用户需求对齐以帮助更高效地完成日常任务并增强生产力(§II-E1)。动作生成涉及 agent 准确解读用户指令、深入理解 GUI 环境,并通过像 GUI Grounding 和各种生成策略这样的过程生成可执行动作的能力(§II-E2)。动作空间表示 agent 在界面约束内可用的完整可能操作集,包括用户动作模拟和 API 调用方法(§II-E3)。

#### II-E1 动作目标

动作目标定义引导 GUI Agent 任务执行的特定目标。这些目标直接与用户需求对齐,确保 agent 高效准确地完成所请求的操作。动作目标涵盖多样的应用领域,包括智能手机交互、工作任务自动化、表格数据处理、在线购物辅助、游戏自动化和网页导航。从根本上说,动作目标使 GUI Agent 能帮助用户更高效地完成日常任务,增强生产力并简化复杂过程。通过达成这些目标,GUI Agent 成为增强生产力和简化任务处理的有能力助手。

为达成不同目标,动作生成是关键一步。动作生成涉及 GUI Agent 准确解读用户指令、深入理解 GUI 环境,并基于这一理解生成可执行动作的能力。这个过程构成 agent 任务完成能力的核心,涵盖各种方法和策略,将在后续小节详述。

#### II-E2 动作生成

动作生成是 GUI Agent 把用户意图转化为可执行操作的核心过程。与仅通过 API 调用运行的传统智能 agent 不同,GUI Agent 独特地需要直接与图形界面元素交互,尤其通过对屏幕的精确点击操作。通过我们的系统回顾,我们把动作生成分为两个关键方面:GUI Grounding 和动作策略。

GUI Grounding 指 GUI Agent 为生成精确点击操作而在用户指令和界面元素之间建立连接的专门过程。GUI Agent 必须通过基于屏幕的交互直接与图形环境交互,使 GUI Grounding 成为一项独特而关键的能力。这个过程使 agent 能通过把抽象指令映射到特定界面元素来确定点击的精确坐标。对 GUI Agent,有效的 grounding 代表成功交互的基本要求,因为它允许它们通过针对性的点击操作来导航和操纵界面。这个元素定位过程——对任何基于屏幕的交互都至关重要——是其他动作可据以构建的基础。当前 GUI grounding 的方法可分为三种方法论:

  • 基于 MLLM 的 Grounding 利用视觉和文本信息把命令与界面元素连接。有工作利用屏幕截图连同用户命令把复杂任务分解成序列子任务。有工作通过纳入交互元素的详细 XML 描述增强这一方法。进一步的进展整合了像 OCR 这样的专门工具做文本定位、图标检测,和 CLIP 做视觉元素识别。有工作采用通过 OCR 和 IconNet 检测到的元素的数字标注,而有工作用 GPT-4V-ACT 提取并标注交互元素,辅以 HTML 分析。
  • 基于 LLM 的 Grounding 把 GUI 结构转化为大语言模型能有效处理的格式。有工作把 GUI 转化为带专用标签的简化 HTML,通过滚动组件系统地探索所有交互元素并记录可见 UI 元素。有工作把 HTML 信息与 OCR 处理结合以创建更准确的元素描述。采取不同方法,有工作聚焦于命令解读而非直接 GUI 理解,用有向无环图做任务分解,同时纳入外部知识和内部记忆。
  • 领域特定 Grounding 方法用专门技术瞄准特定应用上下文。有工作聚焦电子表格软件,分析列名和行数以增强任务解析。有工作采用一个创新的 HTML 元素排名系统,通过识别候选元素的视觉邻居并结合它们的标记和视觉特征来创建上下文丰富的表示,从而丰富表示。

生成策略。 虽然 GUI Grounding 特别聚焦于元素瞄准点击,GUI Agent 还必须生成更广范围的操作,包括滚动、导航、输入和多步交互。这些非点击操作需要超越简单元素定位的不同生成方法。基于我们的系统回顾,我们识别出生成这些复杂操作序列的两种主要策略:

  • 基于记忆的动作生成 利用来自先前交互或外部知识的信息。若干方法维护操作历史以为未来动作提供信息。有工作维护记录任务历史的操作流,基于指令和先前操作生成下一动作。有工作通过存储历史屏幕的聚焦内容增强这一方法。有工作通过自主探索构建记忆,检索相似场景以引导新任务的动作生成。外部知识整合出现在这样的工作中:有工作为电子表格操作提供详细文档,有工作把网络搜索的知识与历史经验结合以生成子任务。
  • 基于规划的动作生成 依赖执行前创建的结构化计划。有工作不仅生成即时的动作,还生成未来动作计划作为参考。有工作区分全局和局部规划,其中一个 HostAgent 生成粗粒度动作计划并选择合适应用,而一个 AppAgent 在那些应用内执行特定操作。像有工作这样的任务分解方法把复杂任务分解成序列子任务。这些规划策略使 GUI Agent 能系统地处理复杂任务,适应环境变化同时保持对整体目标的聚焦。

#### II-E3 动作空间

完成动作生成后,GUI Agent 需要一个定义良好的动作空间来有效执行操作。动作空间表示 agent 在界面约束内可用的完整可能操作集。这些约束在不同环境间变化,限制了特定上下文中能执行什么动作,如图 7 所示。对 GUI Agent,动作能力可分为两大类:

(1)用户动作模拟涉及模拟与图形界面的典型用户交互。这些动作模仿人类行为,如点击、输入和滑动。有工作定义了一组基本操作,包括(Tap、Long_Press、Swipe、Text、Back 和 Exit)来复现人-屏交互。一些系统用数字元素标注,把动作导向特定编号元素(如 Tap(5))。其他系统依赖基于坐标的瞄准(如 Click(0.3, 0.9))。这些差异源于不同的 GUI 理解方法:要么直接在截图上标注元素,要么用文本描述元素位置。

(2)API 调用动作利用外部或自定义 API 而非模拟直接用户交互。在一个工作中,执行器基于配置提示生成带恰当参数的可执行函数调用。这些可能包括像「mkdir new folder」这样的命令行指令或其他系统调用。当没有合适工具可用时,工具生成器为特定任务创建定制解决方案。通过这些多样的动作空间,GUI Agent 能跨不同场景灵活执行多样任务,同时保持操作安全和准确。

III 应用

GUI Agent 的发展使跨多样计算环境的自动化成为可能,每个环境都呈现独特的挑战和机会。本节考察四个主要应用领域:移动设备、桌面计算机、网页浏览器和游戏,分析它们各自的特征和技术要求。这四个应用领域既展示了 GUI Agent 的多功能性,也展示了每个环境呈现的特定技术挑战,如图 8 所示。这些应用的持续发展驱动核心技术的创新,同时揭示自动化和人机交互的新机会。

III-A 移动

移动环境代表 GUI Agent 的一个主要应用领域,其特征是基于触摸的交互和动态界面。移动应用的激增为自动化创造了重大机会,同时引入独特的技术挑战。

移动 GUI Agent 已在各种任务中展示了卓越能力。在系统操作中,AppAgent 实现对设备设置的精密控制,处理亮度调整、音量控制和其他系统配置。Mobile-Agent 通过实现全面的应用管理(包括安装、更新和移除流程)扩展了这些能力。在应用交互方面,CoCo-Agent 实现自动化社交媒体参与,而 MobileFlow 专门处理生产力应用,对中文界面提供特别优势。

移动 GUI Agent 的技术实现面临若干独特挑战。第一,基于触摸的交互模型需要精确的空间理解和手势模拟。SeeClick 通过高级元素定位技术解决这一点,实现高精度触摸事件模拟。第二,移动界面高度动态,有频繁的状态变化和过渡。Mobile-Agent-V2 通过一个精密的状态追踪系统应对这一挑战,跨应用切换和屏幕更新保持上下文意识。

安全考虑在移动环境中尤其关键。像 AppAgent-V2 这样的近期实现纳入了全面的安全协议,要求对敏感操作有显式用户确认并维护详细的操作日志。这种安全优先的方法在保护用户数据和设备完整性的同时确保可靠自动化。

III-B 桌面

桌面环境通过丰富的 API 和多样的交互方法为 GUI Agent 提供广泛的控制能力。桌面应用的复杂性要求精密的自动化策略和稳健的错误处理机制。

桌面 GUI Agent 已在系统级自动化中取得重大突破。OS-Copilot 展示了对操作系统功能的全面控制,包括文件管理、应用控制和系统配置。UFO 专门处理 Windows 环境,提供与原生应用和系统工具的精确交互。在生产力应用中,AssistGUI 实现办公套件的精密自动化,而 SheetCopilot 为电子表格操纵提供专门能力。

这些实现利用多种技术方法来达成可靠自动化。OS-Copilot 利用一种混合方法,把直接 API 调用与必要时的 GUI 交互结合。UFO 实现一个精密的元素检测系统,跨不同 Windows 版本和显示配置保持准确性。OS-ATLAS 通过一个层级注意力机制应对多窗口环境的挑战,有效管理复杂桌面布局。

桌面自动化的一个显著进展是自然语言理解与系统操作的整合。像 OS-Copilot 这样的近期工作展示了把高层用户指令转化为精确系统操作序列的能力,弥合用户意图与技术执行之间的鸿沟。

III-C 网页浏览器

网页浏览器为 GUI Agent 呈现一个标准化却动态的环境,DOM 结构提供一个一致的界面层,同时支持多样的交互体验。

聚焦网页的 GUI Agent 展示了卓越的多功能性。WebVoyager 通过精密的页面理解和交互规划执行复杂的网页导航任务。LASER 实现一种状态空间探索方法以做稳健的电商自动化,处理动态内容和可变的页面布局。AutoWebGLM 专门处理表单交互和数据提取,特别强调跨不同网站设计保持一致性。

网页 GUI Agent 的技术实现利用若干关键创新。WebArena 基于 DOM 的理解系统提供稳健的元素识别和交互规划。LASER 的状态追踪机制实现跨复杂网页应用的可靠导航,跨页面加载和状态过渡保持上下文。这些 agent 必须处理 AJAX 更新、动态内容加载和变化的网络条件,需要精密的状态管理和错误恢复机制。

III-D 游戏

游戏环境为 GUI Agent 呈现独特挑战,要求在动态、视觉复杂的环境中做实时决策和精确控制执行。

面向游戏的 GUI Agent 已在不同类型中取得令人印象深刻的结果。VOYAGER 在 Minecraft 中展示精密的资源管理和规划,把视觉理解与策略性决策结合。Cradle 为动作游戏实现精确控制机制,而 VillagerAgent 在多 agent 场景中管理复杂任务依赖。

游戏 GUI Agent 的技术实现需要若干创新方法。实时视觉理解通过专门的感知模型达成,常结合多种分析技术。Cradle 把 GPT-4V 与专门的游戏状态理解模型整合,实现稳健的场景解读。动作规划系统必须同时处理策略决策和战术执行,常在严格时间约束下运行。

游戏自动化的一个重大创新是技能学习系统的发展。VOYAGER 实现一个渐进式技能获取机制,允许 agent 学习并把基本动作组合成复杂操作序列。这一方法实现了对新游戏场景的适应和精密游玩策略的发展。


本文因篇幅分为上下两篇。下篇(第 IV 节数据集与基准、第 V 节未来方向、第 VI 节结论、署名与许可):基于 (M)LLM 的 GUI Agent 综述·下

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误