ATLAS: 通过 LLM 引导 的 抽象 和 自动 机 学习 发现 智能 体 策略
基于大语言模型(LLM)的智能体正越来越多地用于复杂任务,如软件测试和网络安全评估。虽然这些智能体展现出令人印象深刻的能力,但它们的行为难以理解、解释和分析。现有评估主要集中在任务成功率和执行轨迹上,对智能体所采用的策略
本文目录
ATLAS:通过 LLM 引导的抽象和自动机学习发现智能体策略(中文全译)
翻译说明:本文是 arXiv 论文 ATLAS: Discovering Agent Strategies through LLM-Guided Abstraction and Automata Learning(arXiv:2608.14352)的中文全译,由智测团队翻译。原作者:Ignacio D. Lopez-Miguel、Andreas Happe、Jürgen Cito、Ezio Bartocci、Martin Tappler(维也纳工业大学)、Bettina Könighofer(格拉茨工业大学)。原文以 CC BY 4.0 许可发布。译文保留原文全部章节、数据与结论;参考文献列表从略。
摘要
基于大语言模型(LLM)的智能体正越来越多地用于复杂任务,如软件测试和网络安全评估。虽然这些智能体展现出令人印象深刻的能力,但它们的行为难以理解、解释和分析。现有评估主要集中在任务成功率和执行轨迹上,对智能体所采用的策略提供的见解有限。我们提出了 ATLAS(Automata Learning for Agent Trajectory Analysis and Strategy Discovery,智能体轨迹分析与策略发现的自动机学习),这是一种从智能体轨迹中恢复可解释行为模型的方法。ATLAS 将轨迹抽象与自动机学习相结合,推断出捕捉观察到的智能体-环境交互策略的有穷状态模型。这些模型提供了人类可理解的见解,并支持对重复行为、决策点、成功任务完成路径和失败循环的自动化分析。作为概念验证,我们将 ATLAS 应用于由基于 LLM 的渗透测试智能体生成的轨迹。所得模型揭示了利用易受攻击机器的高层行为策略,这些策略很难仅从原始执行轨迹中识别。我们讨论了学习到的行为模型如何支持可解释性、模型引导的探索、审计和智能体系统的分析。我们还展示了从强大的前沿模型到紧凑语言模型的符号模型知识转移。此外,我们展示了如何通过模型转换在包含 12 台易受攻击机器的渗透测试案例研究中得出智能体行为的简洁解释。ATLAS 突出了模型驱动工程的一个新机遇:将智能体轨迹转化为明确的行为模型,从而能够对原本不透明的 AI 智能体进行系统化理解和分析。
关键词:AI 智能体,大语言模型,自动机学习,可解释 AI,马尔可夫链
这是作者版本的工作。最终版本将发表在 ACM/IEEE 第 29 届模型驱动工程语言和系统国际会议(MODELS 2026)上。https://doi.org/10.1145/3822455.3838777
1. 引言
智能体 AI 系统 (Yao et al., 2022) 正越来越多地用于解决需要许多连续步骤的任务。这些任务正变得日益复杂:智能体通常必须调用外部工具 (Schick et al., 2023),维护和从记忆中检索信息,与外部环境交互,结合人类或环境反馈,并随时间调整其行为。尽管存在这些挑战,智能体 AI 系统已在各个领域展现出卓越的成功,包括现实世界的网页导航、软件工程、机器人协调和医疗决策支持 (Ali et al., 2026)。
当前方法记录智能体-环境交互的轨迹,或构建环境模型来引导智能体行为 (Li, 2026)。然而,在构建智能体本身的显式行为模型方面,研究存在明显空白。没有这样的模型,基于模型的分析、比较、监控和验证仍然困难,但 LLM 驱动的决策复杂性使得手动建模实际上不可行。我们认为,记录的轨迹是关于智能体行为的未开发信息来源。因此,我们建议通过自动机学习自动恢复 AI 智能体的紧凑行为模型,以捕获高层任务解决策略。
建模智能体 AI 的新方向:通过自动机抽象的行为模型
在这项工作中,我们从观察到的交互轨迹中恢复智能体 AI 系统的行为模型。特别地,我们使用标签马尔可夫链(MCs),它为序列随机过程提供了自然表示:它们描述时间和随机行为,并捕捉不确定性,这是由基础模型支持的状态智能体所必需的。标签 MCs 提供序列行为的紧凑基于状态的模型。它们揭示重复的交互模式、分支决策、循环和随机选择,同时支持自动化分析,如概率模型检测 (Hensel et al., 2022; Baier et al., 2018)。
我们提出 ATLAS(智能体轨迹分析与策略发现的自动机学习)。这种方法自动学习 MCs,作为 AI 决策解决给定任务的行为模型。所提出的方法论包括以下步骤。
轨迹收集。
我们收集智能体在解决给定任务时产生的交互轨迹。
轨迹抽象。
由于原始动作和观察可能高度具体、嘈杂且语义冗余,我们利用基础模型计算抽象,将相似的智能体动作和环境观察分组为更高层次的类别。
自动机学习。
我们应用自动机学习 (de la Higuera, 2010; Vaandrager, 2017) 从带有由抽象动作-观察类别标记的状态的抽象轨迹中推断 MCs。
模型驱动工程。
学习到的模型成为一级工程工件,支持下流模型驱动工程任务,如解释、运行时监控 (Wang et al., 2026; Wang et al., 2025)、审计、模型切片、符号知识转移和形式化分析。
基础模型提供语义抽象,而自动机学习重建跨执行共享的底层行为结构。通过学习基于可观察行为差异的状态和转换,自动机学习可以推断智能体决策的潜在状态。
本文做出以下贡献:
- 一个 LLM 引导的智能体轨迹抽象管道,
- 一种恢复行为模型的自动机学习方法,
- 对渗透测试智能体的概念验证评估,展示恢复模型的两个应用(解释和符号知识转移)。
相关工作
当前使智能体 AI 系统更透明的方法包括思维链式推理 (Wei et al., 2022)、交错推理-动作轨迹 (Yao et al., 2022)、自我反思 (Shinn et al., 2023)、任务分解 (Yao et al., 2023) 和流程级评估 (Lightman et al., 2024)。AgentGuard (Koohestani, 2025) 构建随机模型进行验证,但依赖手动抽象。ReAct 式方法 (Yao et al., 2022) 将生成的推理步骤与外部动作(如搜索、查询工具或与环境的交互)交错。这个想法与思维链解释密切相关,其中模型暴露中间推理步骤以使其输出更易于检查 (Wei et al., 2022)。然而,此类轨迹主要描述特定的执行轨迹;它们不一定解释智能体更广泛的任务解决策略。与我们的工作精神最接近的是 ProbGuard (Wang et al., 2026) 和 Trace2Chain (Tran-Truong and Le, 2026),两者都创建马尔可夫链分别用于运行时监控和测量 LLM 智能体的可靠性。Trace2Chain 和 ProbGuard 在显式离散状态表示(可能满足马尔可夫性质)上拟合马尔可夫链,而我们的自动机学习方法直接从抽象交互轨迹中推断潜在行为状态。Preact (Li, 2026) 构建环境的有限状态模型以使重复的智能体任务更高效。
与我们的工作密切相关,Ayoughi 等人 (Ayoughi et al., 2024) 在安全案例研究中将被动自动机学习与基于机器学习的抽象相结合。他们使用决策树进行抽象,并从入侵检测系统中学习 Moore 机模型。相比之下,我们使用 LLM 引导的抽象结合随机自动机学习来学习智能体 AI 系统的行为模型。
最近的工作在各种上下文中探索了基于 LLM 的轨迹理解抽象,例如 Koohestani 等人 (Koohestani et al., 2026) 使用决策树谓词从智能体执行日志中构建抽象状态空间用于基于 MDP 的运行时验证;Sui 等人 (Sui et al., 2026) 将思维链推理步骤聚类为潜在马尔可夫链状态。最近的工作还探索了以自然语言形式从智能体轨迹中提取知识:TIM (Fang et al., 2026) 提取不同类型的提示,Trace2Skill (Ni et al., 2026) 从轨迹中创建所谓的技能,ExpeL (Zhao et al., 2024) 提取洞察。这些工件旨在指导未来的 LLM 智能体,而不是作为适合自动化分析的形式化行为模型。然而,这些出版物的近期表明人们对从智能体轨迹中学习可重用知识的兴趣日益增长。
据我们所知,现有方法中没有将语义 LLM 基础抽象与自动机学习相结合来从执行轨迹中恢复 AI 智能体行为模型的方法。
大纲。
在整个文章中,我们使用智能体渗透测试来说明 ATLAS 的步骤并证明其有用性。我们选择这个应用领域是因为它是一个高风险领域,具有特别的社会相关性,最近对前沿语言模型的网络进攻能力的担忧突出了这一点 (AI Security Institute (AISI), 2026)。
第 2 节提供了一个说明性示例,概述了我们应用于渗透测试的方法。它展示了由学习到的 MCs 支持的基于模型的分析。第 3 节更详细地介绍了所提出的模型恢复管道,包括 LLM 启用的动作和观察抽象以及 MCs 的学习。第 4 节报告了初步实验结果,通过从基准渗透测试场景中导出紧凑的 MC 抽象并将其应用于两个用例来展示该方法的潜力。我们在第 5 节总结我们的发现并得出结论,并在第 6 节提供未来计划的展望。
2. 学习渗透测试策略
我们通过恢复渗透测试 AI 智能体的符号行为模型来演示 ATLAS。特别地,我们将 HackingBuddyGPT (Happe and Cito, 2023) 与不同的 LLMs 结合在一套易受攻击的机器基准套件上执行 (Happe and Cito, 2024)。给定记录的轨迹,我们学习模型来捕获渗透测试期间智能体的行为策略和系统响应。
(a) 具体交互
Agent -> VM (SSH)
exec_command id
uid=1000(lowpriv) gid=1000(lowpriv)
...
exec_command sudo -l
Matching Defaults entries for lowpriv...
(ALL) NOPASSWD:ALL
...
exec_command sudo id
uid=0(root) gid=0(root) groups=0(root)
exec_command sudo -i
root@af467fadbde3:~# Got root!(b) 抽象交互
Agent -> VM
cmd.exec (id) -> DISCOVERY_USER
cmd.exec (sudo -l) -> EXPLOITABLE_SUDO
cmd.exec (id) -> EXPLOITABLE_ROOT
priv.esc (sudo -i) -> EXPLOITABLE_ROOT__success(c) 学习到的马尔可夫链
图 1 显示了在这个场景中如何从自动化智能体渗透测试到观察行为的简洁符号模型。该场景包括一个简单的权限提升漏洞:一台 Linux 主机暴露了错误配置的 sudo 策略,授予低特权用户无密码以 root 身份执行任意命令的能力。
步骤 1:渗透测试。
左面板描绘了智能体与易受攻击主机(即其环境)之间的交互:
- 智能体 → 环境:半结构化动作,主要是通过 SSH 执行的 bash 命令。
- 环境 → 智能体:非结构化观察,作为对所发出命令的命令行输出响应。
我们可以看到智能体成功了,即它打开了一个 root shell,安全分析师可以轻松理解原因。关键命令是 sudo -l 和相应的观察(已被截断),它告诉我们有权执行任意命令。观察此交互并未告诉我们:(1) 这总是有效吗?(2) 哪些观察影响智能体的决策?(3) 为什么智能体在已经有足够信息提升权限的情况下执行 sudo id?
步骤 2:轨迹抽象。
查看具体交互,我们可以看到即使在这个非常简单的示例中也已经有相当多的细节。直接从具体交互中学习行为模型对于除了最琐碎的示例之外的所有情况都可能不可行。因此,我们对智能体执行的动作和环境产生的观察对进行抽象。
中间面板显示了对应于具体交互的抽象交互。基于 LLM 的三阶段流程自动创建此类抽象序列,目标是简洁性和有用性。抽象过程将:
- 每个动作映射到一个动作类别,后跟括号中的可选动作目标,以及
- 每个观察映射到一个观察类别,描述输出的有用性和受影响的系统实体。
抽象有意牺牲低级细节以 favor 重复的行为模式:某些步骤已经更容易理解。我们可以观察到 sudo -l 导致发现一些可利用的东西。
步骤 3:自动机学习。
第三步应用 Alergia,一种适应 MCs 的自动机学习算法 (Carrasco and Oncina, 1994; Mao et al., 2016),在抽象交互序列上学习马尔可夫链。在右面板中,我们可以看到从 20 个抽象交互序列(包括中间面板中的序列)学习到的马尔可夫链。
马尔可夫链的状态用抽象动作和观察对加上可选的成功标签标记,边用概率标记。它总结了智能体的行为策略以及相应的系统响应,并揭示了几种模式:
(1) 智能体通常通过查询用户信息或通过 sudo -l 检查可用的 sudo 权限来开始侦察。
(2) 在用户发现之后,智能体要么:
- 产生一个格式错误的命令(LLM 的重复失败模式),要么
- 继续进行
sudo -l,这揭示了可利用的 sudo 权限。
(3) 观察到 EXPLOITABLE_SUDO 后,智能体在 30% 的情况下通过执行 sudo -i 立即成功。在剩余情况下,它在最终提升权限之前执行额外的探索动作。
此时,我们可以回顾上面的问题:(1) 学习到的模型表明所有观察到的执行路径最终都会达到成功的权限提升(也在省略的其他部分中)。(2) sudo -l 在两步内以 0.4 的概率导致成功;因此,对该命令的响应可能很重要。观察用户信息经常导致格式错误的命令,我们应该调查。(3) 我们不知道智能体为什么会执行 sudo id,尽管它应该知道可以立即利用,但我们知道它做出低效选择的频率更高(70% 的情况)。在第 4 节中,我们展示了恢复的行为模型如何支持多种下游分析。特别地,我们展示了如何将学习到的马尔可夫链中编码的符号知识转移到其他 LLMs,并使用模型切片来导出简洁的解释模型。
3. LLM 引导的抽象和模型学习
本节介绍 ATLAS 的两个主要组件:抽象过程,它将原始交互轨迹转换为紧凑的符号字母表;以及模型学习阶段,它使用该字母表将行为模型推断为概率有限状态模型。
抽象。
从智能体轨迹中学习行为模型的一个核心挑战是词汇差距:原始轨迹由具体的 shell 命令、工具调用和非结构化文本输出组成。抽象的目标是用保留行为意图同时支持自动机学习的语义有意义的符号替换低级命令和观察。
给定 k 个环境-智能体交互轨迹,我们的轨迹抽象方法完全是 LLM 驱动的,分三个阶段运行(见图 2):
(1) LLM 分类。 来自所有 k 次运行的交互被分批并通过结构化提示呈现给 LLM,指示它映射:
- 具体动作到动作类别,可选后跟括号中的动作目标,以及
- 具体观察到由两组件 Value_Target 格式组成的观察类别,例如 DISCOVERY_SUID、EXPLOITABLE_FILE 和 ERROR_NONE。
LLM 提出动作类别,描述智能体做了什么,以及输出类别,描述观察的语义价值和动作导致的观察目标。
(2) 类别规范化。 跨运行累积类别标签,创建描述语义等价动作和观察的冗余类别。
为了生成紧凑的标签集,我们将所有发现的类别提供给 LLM,并通过提示通过合并语义相似的标签来规范化它们。
(3) 每轨迹分配。 对于每次运行,我们将完整的交互序列和规范化的类别词汇呈现给 LLM,它将每个交互映射到结构化格式中的(动作类别,输出类别)对,产生适合自动机学习的抽象轨迹。带有格式纠正提示的重试机制处理偶尔的格式错误的 LLM 输出。
抽象步骤在非结构化智能体行为和形式化模型推断之间架起了桥梁。与使用粗糙预定义手动抽象函数或手动特征工程的方法不同,我们的 LLM 驱动分类适应每个环境中每次交互的语义内容和任务,以产生稳定的符号字母表。自动机学习使用该字母表恢复显式行为模型。
模型学习。
为了学习行为模型,我们建议应用 Alergia (Mao et al., 2016),一种基于状态合并的自动机学习算法。该算法将抽象交互序列作为输入,将它们排列在树中,并通过迭代树节点合并 followed by 转换概率归一化创建抽象马尔可夫链(MCs)。生成的 MCs 是抽象动作-观察对上的概率模型,捕获智能体的行为和环境的响应。
ATLAS 的性质。
完全自动化。 原始交互轨迹以很少的参数要求转换为简洁的行为模型。
状态检测。 Alergia 基于未来行为的观察差异检测状态。因此,它推断智能体决策中的潜在状态,而不依赖于环境的状态提取启发式方法 (Li, 2026)。与现有方法不同,它不需要马尔可夫抽象观察 (Koohestani, 2025; Tran-Truong and Le, 2026),但可以通过自动机学习从部分观察中推断捕获相关历史的潜在马尔可夫状态 (Muskardin et al., 2023)。
抽象的成本。 类别发现需要强大的 LLM,因为需要从头开始识别抽象类别。抽象分配是一项分类任务,可以由较小的语言模型执行(如第 4 节中的动态模式所示)。因此,在额外数据上进行模型细化的额外轨迹的抽象相对便宜。
通用性。 我们的重点是智能体的行为模型,但 ATLAS 自然地扩展到其他建模范式以支持额外的用途。通过 IoAlergia (Mao et al., 2016) 学习离散马尔可夫决策模型可以提供以环境为中心的视图,同时捕获低级决策的随机行为。通过 k-tails (Biermann and Feldman, 1972; von Berg and Aichernig, 2025) 学习非确定性(和非随机)模型可以提供专注于环境行为的视图。

4. 案例研究:学习到的行为模型的应用
在本节中,我们报告 ATLAS 的概念验证应用,学习 HackingBuddyGPT (Happe and Cito, 2023) 在来自 (Happe and Cito, 2024) 的 12 台易受攻击的 Linux 虚拟机上的马尔可夫链模型[^1]。我们展示了恢复模型的两个应用:将符号任务知识从前沿模型转移到紧凑语言模型,以及导出成功行为策略的简洁解释。
[^1]: 实验排除了十三个场景中的场景 4,因为基于 SSH 的设置不支持交互式 shell 命令。
ATLAS 设置
对于轨迹收集,我们在每台 VM 上使用 DeepSeek V4 Flash(非推理模式,128K 上下文)进行了 k=20 次渗透测试运行,限制为 20 轮。我们使用相同的模型通过图 2 中的方法生成抽象交互轨迹。此外,我们用成功/失败增强运行中的最后观察以指示运行是否成功。最后,我们应用 AALpy (Muskardin et al., 2022) 中实现的 Alergia 从 k 个抽象轨迹中为每个场景学习一个标签 MC。 alongside 每个学习到的行为模型和抽象,我们存储具体化映射,记录每个抽象动作类别的频繁具体命令。这些可用于接地抽象动作。
4.1. 从学习到的马尔可夫链进行知识转移
我们探索四种模式从学习到的 MCs 中提取可转移知识,具有不同的 LLM 依赖性。
我们将提取的知识称为策略摘要,我们通过增强系统提示使用它们来引导具有较弱、更便宜的执行器 LLM(ministral-14b 或 ministral-8b,都具有 262K 上下文)的智能体渗透测试。虽然我们通过 openrouter.ai 访问这些 LLMs,但它们可以在消费级 GPU 上运行。为了检查转移可行性,我们在每台 VM 上使用每种转移模式和与无辅助基线进行比较进行最多 20 轮的 5 次渗透测试以建立执行器能力的下限。整个管道用大约 3400 行 Python 实现,集成到 HackingBuddyGPT (Happe and Cito, 2023) 框架中。学习到的 MCs、抽象轨迹、具体轨迹和源代码包含在位于 https://doi.org/10.6084/m9.figshare.32841767 的复制包中。
#### 4.1.1. 转移模式
前两种转移模式查询前沿模型(DeepSeek V4 Pro),我们称之为知识 LLM,每台 VM 一次以生成策略摘要。
在最小模式中,知识 LLM 接收学习到的 MCs 和执行命令的紧凑摘要。它被提示生成 2-3 步的简洁策略。
引导模式与最小模式的不同之处在于知识 LLM 生成结构化的、更详细的指南,包括一般策略、最多 5 个具体步骤和探索建议。
常见路径模式以算法方式分析学习到的 MC,产生由导致成功的最常见步骤组成的策略摘要。
动态模式在渗透测试期间提供自适应指导。为此,我们在学习到的 MCs 与环境并行遍历。在每一步,(1) 我们确定一个有希望的动作并将其建议给执行器 LLM。(2) 在执行器执行每个具体命令后,一个便宜的分类器 LLM——我们简单地使用执行器 LLM——将具体(命令,观察)对映射到已知的动作和观察类别。(3) 基于此抽象标签,我们在学习到的 MC 中前进。动态策略摘要格式化为紧凑的单行,包括对最后一步的反馈、建议的下一个命令和探索提醒。
动态模式包括防重复机制和死端检测。它分离:
- 由恢复的行为模型驱动的符号高层规划,以及
- 由执行器 LLM 执行的低级执行。
#### 4.1.2. 结果
表 1. ministral-8b 的转移模式比较
| 转移模式 | Root/运行次数 | 成功率 | 利用的 VMs |
|---|---|---|---|
| 基线(无提示) | 3/60 | 5.0% | 3, 6 |
| 常见路径 | 1/60 | 1.7% | 13 |
| 最小 | 5/60 | 8.3% | 13 |
| 引导 | 5/60 | 8.3% | 13 |
| 动态 | 17/60 | 28.3% | 3, 7, 8, 13 |
表 2. ministral-14b 的转移模式比较
| 转移模式 | Root/运行次数 | 成功率 | 利用的 VMs |
|---|---|---|---|
| 基线(无提示) | 1/60 | 1.7% | 5 |
| 常见路径 | 7/60 | 11.7% | 2, 13 |
| 最小 | 7/60 | 11.7% | 5, 13 |
| 引导 | 13/60 | 21.7% | 1, 2, 8, 13 |
| 动态 | 23/60 | 38.3% | 2, 3, 5, 7, 8, 13 |
表 1 和表 2 显示了使用 ministral-8b 和 ministral-14b 作为执行器 LLMs 对不同转移模式和基线模式(无引导)的实验评估结果。表 2 显示提示提供了足够的信息来复制成功行为,尽管并非在所有场景中都是如此。虽然成功率通常会增加,但我们进一步观察到转移模式有很大影响。动态模式显然是最有效的,无论是在成功率还是独特场景成功方面。这与我们在实验期间做出的观察一致:小型模型难以遵循多步指令,因为它们难以跟踪当前状态。动态模式通过跟踪抽象状态(学习到的 MC 中的当前状态)并仅建议单个步骤来缓解这个问题。它构成了模型驱动规划和 AI 驱动执行的成功集成。
表 1 中 8b 模型可以观察到相同的模式,其中动态模式是最有效的。此外,我们可以看到常见路径降低了成功率。此模式创建了相对较大的提示,小型模型可能难以处理。虽然我们没有实现复制所有成功行为,但结果表明符号知识转移是可能的。恢复的行为模型实现了从具有 284B 参数的前沿模型(DeepSeek-V4-Flash)到 14B 参数模型(ministral-14b)的成功符号转移,后者解决了 50% 的基准任务,尽管其尺寸紧凑。
4.2. 解释模型提取
渗透测试智能体通常从侦察阶段开始,由学习到的策略模型捕获。因此,学习到的 MCs 包括与任务完成无关的细节,使得解释变得困难。类似的行为影响其他应用领域,例如源代码探索帮助编码智能体在实现更改之前定位相关代码 (Zhang et al., 2026),但分析探索活动可能提供有限的见解。
为了解决这个问题,我们建议从学习到的 MCs 中以观察为重点提取解释模型,简洁地捕获任务相关行为。下面,我们说明了两种解释导致观察标签 ol = success 的行为的方法。
从 MCs 中提取 DAG 是一种简单而有效的方法。给定 ol:(1) 确定从初始状态到 ol 的所有路径,(2) 修剪不存在于这些路径中的状态,以及 (3) 移除循环以创建有向无环图(DAG)。图 3(a) 显示了场景 2 的 DAG,其中包括所有到成功的最短路径,并将模型从 57 个状态压缩到 7 个状态。我们可以看到智能体总是从探索开始,关键步骤是读取 bash 历史。
修剪和折叠。
当任务需要大量探索时,DAGs 可能会变得很大。在这种情况下,我们建议切片学习到的模型,参数为 k,即每个状态保留的传出转换数量。它包括以下步骤:(top-k 修剪),仅保留每个状态中具有最高 k 概率的转换;(切片),修剪 ol 不可达的所有状态;以及 (折叠),确定强连通分量(SCCs)并将 SCC 中的所有状态合并为单个状态。
图 3(b) 说明了应用于场景 13 的此方法,将模型大小从 41 个状态减少到 7 个状态。浓缩模型包括两个 SCCs,一个有 2 个状态,一个有 11 个状态,主要包含探索活动。需要注意的是,重要步骤可能会折叠到 SCCs 中。我们可以观察到读取 admin_on_vac.txt 对成功很重要(q33),但它也包含在 scc2 中。
5. 结论
作为使我们 AI 智能体的潜在行为结构显式化的愿景的一步,我们提出 ATLAS,一个将 LLM 驱动抽象与形式化自动机学习相结合以恢复概率行为模型的模型学习框架,捕获智能体系统的行为结构。ATLAS 证明智能体轨迹可以转换为紧凑的符号行为模型。更广泛地说,我们认为智能体轨迹应该成为一级建模输入,而不是被动执行日志。
我们对渗透测试智能体的案例研究清楚地证明了这一需求:这些智能体在高风险环境中操作,在部分可观察性下导航,并在探索和剥削行为之间交替,从原始执行日志中仍然难以理解。
我们在案例研究中学到的行为模型揭示了循环、依赖于观察信息的分支点和成功的测试策略。符号知识转移的实验表明,恢复的行为模型不仅仅是描述性的。它们捕获的可操作知识可以在具有不同能力的语言模型之间重用,用于高层基于模型的规划。我们进一步展示了如何通过模型切片和简化从恢复的行为模型中导出简洁的解释模型。
这项工作贡献了一个概念框架、一个初始管道和一个案例研究演示,开启了模型恢复、运行时分析和 AI 驱动系统交叉领域的研究议程。通过将学习到的自动机视为工程工件,我们实现了跨智能体版本的比较分析,支持通过安全性和安全性监控进行基于模型的保证,以及智能体工作流的审计。我们邀请 MODELS 社区进一步研究针对日益自主的 AI 智能体行为模型的验证方法、抽象策略和模型管理技术。
6. 未来计划
我们实证表明 ATLAS 可以从渗透测试应用的智能体 AI 轨迹中恢复行为模型。
证明通用性。
最重要的下一步是向研究社区展示这种方法的更广泛潜力。为此,我们计划在渗透测试之外的各种智能体 AI 应用领域恢复行为模型,例如网页导航和软件工程,例如在智能体软件测试中。此外,我们将评估学习到的行为模型是否对 AI 智能体用户可理解和有用。因此,我们计划进行用户研究以评估恢复的行为模型是否支持对影响成功决策的因素的解释以及失败模式的识别。
模型驱动工程。
我们计划通过调查除知识转移和解释模型生成之外的进一步模型驱动活动来展示所提出方法的潜力。作为直接的下一步,我们将检查基于已识别失败模式的高层规划。除了在语言模型之间转移知识外,我们还看到了从学习到的模型中推导符号知识以调整智能体行为的巨大潜力。除了规划外,我们旨在使用概率模型检测的形式化验证来静态和运行时验证和调试智能体 AI 系统——学习到的行为模型可以部署为运行时监控器以检测偏离预期智能体行为的行为。证明这些更广泛的用途将有助于确立学习到的自动机作为分析、验证和改进智能体 AI 系统的通用工具。
可扩展性。
长轨迹、多样化和变化的任务以及异构环境可能对抽象发现和模型学习构成问题。我们必须为智能体系统定义有用的行为模型要求。一个重要的研究问题涉及什么使行为模型有用。模型应该提供粗略的完整覆盖,还是部分的细粒度细节?
结语。
解决这些问题和挑战将需要结合模型驱动工程、形式化方法、自动机学习、机器学习和符号 AI 的见解。我们相信,从智能体轨迹中恢复行为模型将为自主智能体系统的运行时监控、符号规划、策略恢复和系统化模型管理启用新方法。
致谢。
GenAI 用于润色文本(ChatGPT)、重构初始实现和添加功能,如分析脚本(Claude Code)。
这项工作得到了欧盟委员会在 Horizon Europe 研究和创新计划下的支持,资助协议编号为 No. 101034440(MSCA COFUND 博士项目 LogiCS@TUWien)、No. 101160022(VASSAL)和 No. 101212818(RobustifAI)。此外,它还部分由维也纳科学和技术基金(WWTF)项目 TAIGER 10.47379/ICT22-023、FFG 资助的项目 NEST(编号 FO999936797)和奥地利科学基金(FWF)10.55776/COE12 和 10.55776/PIN3275223 资助。
伦理和隐私声明。
我们的案例研究探讨了 LLMs 在渗透测试中的使用,这引起了关于我们工作被恶意行为者应用的担忧。由于我们建立了在此领域的现有工作之上,我们参考描述 HackingBuddyGPT (Happe and Cito, 2023) 的原始出版物以进行更彻底的伦理关切讨论。
署名与许可
本文翻译自 arXiv 论文 ATLAS: Discovering Agent Strategies through LLM-Guided Abstraction and Automata Learning(https://arxiv.org/abs/2608.14352),原文以 CC BY 4.0 许可发布。译者:智测团队。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。