审计 WebArena - Lite: 最终 分数 漏掉 了 多少 真正 完成 的 任务
165 个 WebArena Lite 任务的人工复核显示,自动评测器在四种 GPT 5.5 设定上漏掉 5.45 到 8.49 个百分点的成功。滚动循环和过早作答占失败的大头,早期进展也常常以失败收场。

本文目录
审计 WebArena-Lite 上的网页智能体评测:对任务结果与执行轨迹做人工复核
Chengguang Gan Zimeng He Yoshihiro Tsujii
Ken-ichiro Kobayashi Hiroki Itoh Kotaro Funakoshi
Techtouch 公司(Techtouch, Inc.)
东京科学大学(Institute of Science Tokyo)
摘要
网页智能体是大语言模型的一项重要应用,但它们的评测往往依赖基于规则或语言模型的评测器,而这些评测器只检查最终结果。对任务完成的人工核验,以及对失败轨迹的细致分析,仍然有限。我们在由 GPT 5.5 和一个未经训练的 Qwen3.5 9B 模型构成的六种评测条件下,审计全部 165 个 WebArena Lite 任务。这次审计保留原始分数,纠正自动评测器的假阴性,标出第一个有后果的错误,并检查整条轨迹上的进展。我们还研究一种记忆与分析支持机制(Memory and Analysis Support Mechanism,MASM),它维护显式的执行状态,以及 Guide Text,它提供与任务相关的过程性指导。在四种 GPT 5.5 设定上,人工复核找回了评测器漏掉的 5.45 到 8.49 个百分点的成功。在 25 步预算下,Guide Text 把带 MASM 的校正后成功率从 34.55% 提高到 38.18%。在未经训练的 Qwen3.5 9B 上,MASM 把评测器分数从 13.90% 提高到 18.80%。对 102 条失败的 GPT 5.5 轨迹的复核显示出常见的滚动循环、未完成的探索、过早作答、无效动作和不完整的表单流程。步骤级证据进一步表明,相当多的早期进展可以与最终失败并存。这些结果说明,为什么单靠最终分数不能完整说明网页智能体的行为,并促使我们采用有人工依据、关注轨迹的核验。
1 引言
大语言模型智能体越来越被期望去解释目标、收集信息、选择动作,并回应外部环境中的变化。网页智能体为研究这些能力提供了一个具体场景,因为许多日常和专业活动都经由浏览器界面发生。早期工作从示范和语言指令探索网页交互,后来的系统则把推理和行动结合起来,以支持更长的决策序列(Yao et al., 2023; Deng et al., 2023)。WebArena 已成为一个核心的交互基准:它为购物、社交讨论、软件开发、内容管理和基于地图的搜索提供可复现的网站,以及可以对照环境状态检查完成情况的任务(Zhou et al., 2024)。作为 VisualAgentBench 一部分引入的 WebArena Lite(Liu et al., 2025)保留了 165 个有代表性的任务,使重复评测更可行。
进展通常被概括为被自动评测器接受的任务比例。这个数字有用,但它把两种不同的能力混在一起。一种是智能体是否真的完成了任务。另一种是评测器是否认出了这次完成。精确字符串匹配、输出格式、部分状态检查,以及停止行为的差异,都可以在不改变智能体实际成就的情况下改变记录下来的分数。BrowserGym 这类统一环境改善了执行一致性(Le Sellier De Chezelles et al., 2024),但它们并不保证每一个最终判断都是正确的。
这一区分引出三个问题。第一,评测器有多经常拒绝一次其实满足用户请求的运行?第二,当任务确实失败时,失败从哪里开始,随后又出现什么行为?第三,在最终结果被赋予之前,已经做出了多少经过核验的进展?一个二元分数无法区分:从未到达相关页面的智能体,完成了大部分要求、到达正确状态然后继续行动的智能体,以及以不兼容格式返回语义上正确回答的智能体。
我们通过对全部 165 个 WebArena Lite 任务做有人工依据的审计来研究这些问题。我们保留原始评测器结果,并对照任务指令、环境状态、截图、执行记录和最终回答来复核失败的运行。我们标出第一个有后果的错误,并赋予一个细粒度的失败类别。我们还把任务分解成可核验的子目标,并在每个动作之后检查进展。所保留的实验只做评测:它们在 15 步和 25 步下比较配对的 MASM 与 Guide Text 条件中的 GPT 5.5,并加上一个未经训练的 Qwen3.5 9B 对 MASM 的消融。在这里报告的实验中,没有任何 GPT 生成的轨迹被用来训练或改进另一个模型。
这次审计揭示出测量表现与观察到的表现之间存在稳定缺口。人工复核在四种 GPT 5.5 设定上找回 5.45 到 8.49 个百分点。在配对的 25 步预算下,Guide Text 把带 MASM 的校正后成功从 165 个任务中的 57 个(34.55%)提高到 63 个(38.18%),尽管配对的任务翻转同时显示增益和退步。在最强的被审计设定里,102 次失败的 GPT 5.5 运行中,占主导的是滚动循环、未完成的探索、过早作答、无效的动作格式,以及不完整的工作流。进展记录显示,最初几个动作往往带来最大增益,而后面的步骤更多花在核验、恢复和重复探索上。这些发现意在改进网页智能体被评测和调试的方式,而不是提出一项排行榜声称。
我们的贡献是:
• 我们在六种评测条件下,对全部 165 个 WebArena Lite 任务做了有人工依据的审计,并在四种配对的 GPT 5.5 设定中量化假阴性。
• 我们在失败运行中标出第一个有后果的错误,并给出一套细粒度分类,把导航、信息收集、动作执行、停止和答案生成的失败分开。
• 我们在步骤层面评估任务进展,并表明同一个最终二元分数可以掩盖明显不同的轨迹。
• 我们用配对的任务证据分析 MASM、Guide Text 和动作预算,并由此得出对评测器设计、停止准则和部署监控的实用建议。
2 相关工作
网页智能体研究已经从离线示范推进到交互环境。Mind2Web 和 WebLINX 收集真实网页交互,而 AgentBench、WebArena、VisualWebArena、WorkArena 和 Online Mind2Web 在可执行或在线的网站上测试智能体(Deng et al., 2023; Lù et al., 2024; Liu et al., 2024; Zhou et al., 2024; Koh et al., 2024; Drouin et al., 2024; Xue et al., 2025)。WebArena Lite 选出 165 个有代表性的任务,以便更实用的评测周期,BrowserGym 则为受控实验提供共享接口(Liu et al., 2025; Le Sellier De Chezelles et al., 2024)。这些资源支持智能体之间的比较,但大多数被报告的结果仍然把每条轨迹收成一个最终成功值。
训练方法已经从提示式推理推进到从浏览器经验中学习。ReAct 交替进行推理和行动,NNetNav 生成额外的交互数据,WebRL 和 WebAgent R1 等近期方法则把强化学习用到长浏览器任务上(Yao et al., 2023; Murty et al., 2025; Qi et al., 2025; Wei et al., 2025)。另有工作用细粒度约束,挑选部分成功的轨迹用于训练(Logeswaran et al., 2026)。这些方法改进了浏览器策略,但它们的增益通常仍用开发期间所用的同一套自动信号来测量。
网页基准通常检查最终答案、URL、数据库字段或页面状态。LLM 评判提供更大的灵活性,但先前研究发现位置效应、自我偏好和不一致的判断(Zheng et al., 2023; Wang et al., 2024)。AgentRewardBench 对网页智能体确认了这个问题,并发现基于规则的评测器会少报成功完成(Lù et al., 2025)。AgentBoard 度量部分进展,WebGraphEval 则分析轨迹中反复出现的路径和关键决策(Ma et al., 2024; Qian et al., 2025)。合在一起,这些研究促使评测同时检查结果和产生结果的过程。
我们的工作是对完整的 WebArena Lite 任务集做有人工依据的审计,而不是再提出一种排行榜方法。我们同时保留原始结果和人工校正后的结果,标出第一个有后果的错误,给失败模式分类,并估计每一步的进展。我们用配对的评测条件研究 MASM、Guide Text 和动作预算。这一分析把智能体行为的变化与评测器伪迹分开,并把失败轨迹变成对评测器设计、停止准则和部署的实用指导。
3 研究范围与实验设计
我们在固定的 165 个 WebArena Lite 任务上研究评测可靠性和轨迹行为。每一种条件都按任务标识对齐,从而可以对增益、退步、动作次数和停止行为做配对分析。所保留的研究改变的是提示支持和动作预算,而不更新模型权重。这使范围集中在直接的 API 评测,以及由此产生的判断是否可靠。
3.1 WebArena-Lite 评测设定
WebArena Lite 包含 165 个任务,来自购物、购物管理、Reddit、GitLab 和地图环境。我们在每一次比较中使用相同的任务定义和标识。评测之前,网站容器被重置,相应的认证状态被重新建立。一次运行的最大预算是 15 或 25 个动作,并可以在智能体返回最终答案或明确停止时更早结束。
表 1 报告六种评测条件。四种使用 GPT 5.5:单独的 MASM,以及 Guide Text 加 MASM,各自处在 15 步和 25 步预算下。另外两种条件使用未经训练的 Qwen3.5 9B,在 25 步下分别有和没有 MASM,从而在没有行为克隆或参数更新的情况下,对结构化记忆支持做直接消融。对每一步,我们保留任务指令、当前 URL、简化的页面表示、所选动作、执行状态、前后截图和最终回答。MASM 条件还额外保留动作分析和更新后的记忆。
原始的 WebArena 评测器先运行。失败的 GPT 5.5 轨迹随后按第 4 节的协议复核。我们对这四种设定同时报告原始结果和人工校正后的结果。Qwen 消融只用来在原始评测器下度量 MASM 的效应。本版本报告的所有实验都直接评测发起该输出的模型;没有任何被记录的 GPT 输出被用来训练、微调、蒸馏或以其他方式改进另一个模型。
3.2 MASM 与 Guide Text
MASM 在每个浏览器动作之后增加两项结构化操作。第一,一个动作分析模块把观察到的转移与智能体的意图相比较。它的输入包括任务、已执行的动作、执行状态或错误、前后 URL、可见的页面证据和截图。它返回一条结构化记录,包含预期效果、观察到的结果、是、部分或否的判断,以及支持性说明。第二,一个记忆更新模块把当前记忆、最近五条动作记录和最新分析合在一起。它记录已核验的信息、对上一步的反馈、估计的进展、下一步和障碍。由此产生的记忆被提供给下一个动作提示。
Guide Text 是从先前任务流程导出的静态工作流证据。它描述有用的导航路线、必填字段和核验检查点,但不包含目标答案。如图 1 所示,Guide Text 进入动作规划和记忆更新。它不直接进入动作结果分析。这一分离很重要,因为分析应当判断观察到的转移,而不是复述建议的流程。动作模型仍然收到当前页面状态、动作历史、上一个动作和记忆,并且必须发出一个可执行的浏览器动作。我们在配对的模型和动作预算下,比较单独的 MASM 与 Guide Text 加 MASM。
图 1:Guide Text 与 MASM 的提示和状态流。Guide Text 支持动作规划和记忆更新,而动作结果分析以已执行的转移和环境证据为依据。
| 1. 步骤输入 任务:2023 年 1 月销量最好的前三件产品是什么?Guide Text:打开 Reports $\rightarrow$ Bestsellers;把 Period 设为 Month;输入 01/01/23–01/31/23;运行报告并核验三行。当前状态:URL、简化 HTML、动作历史、上一个动作和当前记忆。$\longrightarrow$ | 2. 动作提示与模型输出 任务指令:{task} 动作历史:{history} 智能体记忆:{memory} 简化 HTML:{page_text} HINT / 工作流数据:{guide_text} 输出:do(action="Click", element="549") |
|---|
| 3. 执行并观察 运行所选动作,并记录前后截图、URL、可见页面证据、执行状态和错误。$\longrightarrow$ | 4. 动作结果分析 输入:任务、动作、状态和观察到的转移。输出:预期效果、观察到的结果,以及是、部分或否。$\longrightarrow$ | 5. 记忆更新 输入:最近的动作、最新分析、当前记忆和 Guide Text。输出:已核验事实、进展、下一步,以及供下一个动作提示使用的障碍。 |
|---|
4 有人工依据的核验协议
自动成功只是我们评测的第一阶段。我们保留原始分数,然后审计最终结果以及产生它的轨迹。协议有三个相连的部分:纠正评测器的假阴性,标注第一个有后果的轨迹错误,以及估计每个动作之后经过核验的进展。全程使用同一套证据层级,使结果校正和过程分析保持一致。
4.1 自动评测与人工校正
WebArena 评测器先赋予原始二元分数。然后我们复核每一个失败的任务与模型配对。只有当任务要求可被证明已经满足,但评测器因为答案格式、过严的字符串匹配或其他有记录的评测器局限而拒绝这次运行时,失败才被改成成功。语义上不完整的答案、未执行的意图,以及仅由智能体自己的记忆支持的声称,不被校正。
复核者遵循一套证据层级。可得时优先使用环境状态和任务特定记录,其次是前后截图、动作执行结果、最终答案,以及模型的 Memory and Analysis。最后这一来源是辅助证据,绝不能推翻观察到的环境。每一次校正都记录适用的规则和支持证据。我们同时保留原始分数和校正后分数,这暴露评测器的敏感性,而不替换基准结果。完整的校正规则和任务结果矩阵见附录。
4.2 轨迹复核与失败标注
对失败的运行,复核者在一个并排的复核界面里检查有序的动作列表、前后截图、URL 变化、动作分析、记忆更新和最终回答。他们标出第一个有后果的错误:最早的那个动作、遗漏或无根据信念,它实质性地降低了在剩余动作预算内完成任务的机会。无害的探索步骤不会仅仅因为没有立刻增加进展就被标成错误。
每一个失败的任务与模型配对得到一个主要失败模式,以及一条记录次要效应的自由文本说明。分类法包含 16 个细粒度类别。主要例子包括滚动振荡、未完成的探索、过早作答、选错数值或实体、不改变页面状态的点击、精确的动作重复、重复的搜索查询、不完整的表单流程、无效的动作参数、导航循环、无根据的猜测,以及严格的答案格式不匹配。复核者还标记任务是否在智能体停止之前已经完成。这把任务执行的失败与停止及最终答案生成的失败分开。
含糊的情形被标出,交给第二次复核。一致性统计只在被独立双人标注的子集上计算;其余分歧通过检查同一份记录证据来解决。这一设计使分类法可复现,同时避免作出超出现有标注所能支持的、更强的一致性声称。
4.3 步骤级进展评估
二元成功不能区分一条没有有用进展的轨迹,和一条完成了大部分要求、或在停止之前已经做完任务的轨迹。因此我们把每个任务分解成一小组可核验的子目标,这些子目标来自指令和任务特定的评测器。设任务 $i$ 包含 $m_{i}$ 个子目标,并设 $z_{i,k,t}\in\{0,1\}$ 表示子目标 $k$ 在步骤 $t$ 之后是否已被核验。我们定义
$$P_{i}(t)=\frac{1}{m_{i}}\sum_{k=1}^{m_{i}}z_{i,k,t},\qquad\Delta_{i}(t)=P_{i}(t)-P_{i}(t-1).$$
(1)
除非任务给出显式的加权条件,子目标权重相等。一个子目标只有在被记录下来的环境转移所支持时才被计入。缺失或含糊的证据被视为未完成。
正的 $\Delta_{i}(t)$ 表示经过核验的进展,负值则记录因离开正确状态、覆盖有效输入或不必要的回溯而造成的退步。我们把完成步 $\tau_{i}$ 定义为所有必需子目标都已被核验的第一步。当 $P_{i}(\tau_{i})=1$ 但这次运行后来被判失败时,复核者通过检查完成状态是否持续、以及所需的最终回答是否被产生,来区分评测器假阴性和停止前已完成的错误。
Memory and Analysis 被用来恢复智能体意图中的子目标,并定位候选证据,但不被当作真值。进展判断以任务特定评分细则、环境状态、截图和动作效果为依据。这种步骤级视角即使在两次运行得到同一个最终二元分数时,也支持对探索效率、退步和停止行为的比较。
5 结果与分析
结果针对两个相关问题。第一,MASM、Guide Text 和动作预算如何改变被测得的成功。第二,这种测量有多少依赖于评测器,以及当最终判断是失败时,轨迹揭示了什么。
5.1 总体表现与人工校正后的成功
表 1 以次数和百分比报告所有被保留的评测条件。GPT 5.5 在 25 步下使用 Guide Text 和 MASM,给出最高的被审计结果:原始评测器接受 165 个任务中的 51 个(30.91%),而人工复核核验了 63 个(38.18%)。对应的仅 MASM 运行在复核后从 43 个(26.06%)升到 57 个(34.55%)。
表 1:被保留的 WebArena Lite 评测结果。Raw 与 Corr. 以次数(百分比)报告成功任务。Rec. 是从原始失败中找回的次数,以及百分点增益。Qwen 行构成只使用评测器的 MASM 消融,没有被纳入 GPT 5.5 的人工校正研究。
| 模型与支持 | 步数 | Raw $n$(%) | Corr. $n$(%) | Rec. $n$(百分点) |
|---|---|---|---|---|
| Qwen3.5 9B, untrained | 25 | 23 (13.90) | – | – |
| Qwen3.5 9B, untrained + MASM | 25 | 31 (18.80) | – | – |
| GPT 5.5 + MASM | 15 | 49 (29.70) | 58 (35.15) | 9 (+5.45) |
| GPT 5.5 + Guide Text + MASM | 15 | 49 (29.70) | 61 (36.97) | 12 (+7.27) |
| GPT 5.5 + MASM | 25 | 43 (26.06) | 57 (34.55) | 14 (+8.49) |
| GPT 5.5 + Guide Text + MASM | 25 | 51 (30.91) | 63 (38.18) | 12 (+7.27) |
在四种 GPT 5.5 设定上,人工复核一共找回 47 个成功结果,平均每个设定 11.75 个任务或 7.12 个百分点。单个校正从 9 个任务(5.45 个百分点)到 14 个任务(8.49 个百分点)。被找回的情形并不是对一个很大分数的边际改动:它们占每个设定中校正后成功的 15.5% 到 24.6%。常见原因包括语义正确但被严格格式拒绝的答案、被最终规则漏掉的成功状态变化,以及有效结果之后跟着一个不兼容的停止或作答动作。因此,原始结果和校正后结果应当一起报告。
5.2 MASM 的效应
对未经训练的 Qwen3.5 9B,在相同的 25 步预算下,MASM 把评测器分数从 165 个任务中的 23 个(13.90%)提高到 31 个(18.80%)。这八个任务(4.85 个百分点)的增益来自改变提示和状态表示,而不是模型权重。动作分析询问预期的页面转移是否发生,记忆更新则把已核验的事实、障碍和下一步带进随后的动作。
同一批记录也暴露出一个局限。记忆是模型生成的状态摘要,不是核验器。失败的运行有时尽管缺少点击、未保存表单或没有最终答案,仍声称完成度很高。因此,当 MASM 的结构化记录被对照环境证据来检查时,它最有用,正如我们的复核协议所做的那样。
5.3 Guide Text 的效应
在两次配对的 GPT 5.5 比较里,Guide Text 都有正向但不均匀的效应。在 15 步时,校正后成功从 165 个任务中的 58 个(35.15%)增加到 61 个(36.97%)。八个任务(4.85%)从失败变成成功,五个(3.03%)退步。在 25 步时,校正后成功从 57 个任务(34.55%)增加到 63 个(38.18%),其中只有 Guide Text 才成功的有二十个(12.12%),只有 MASM 才成功的有十四个(8.49%)。精确的配对检验在常规阈值上并不显著,但任务翻转仍然有信息,因为它们显示过程性指导在哪里改变了行为。指南覆盖为这一解释提供第二次检查。在有指南可用的 143 个任务中,校正后成功从 53 个(37.06%)升到 56 个(39.16%),七次增益、四次退步。没有指南的 22 个任务在两种条件下都保持 5 次成功(22.73%),一次增益被一次退步抵消。因此,总体改进集中在确实存在过程性证据的任务上,而不是一次一般性的提示改变。
表 2:15 步时按 Guide Text 是否可用划分的校正后 GPT 5.5 结果。增益和损失计数的是相对仅 MASM 的配对任务翻转。
| 子集 | 任务数 | MASM | Guide + MASM | 增益/损失 |
|---|---|---|---|---|
| 全部任务 | 165 | 58 (35.15%) | 61 (36.97%) | 8 / 5 |
| 有指南 | 143 | 53 (37.06%) | 56 (39.16%) | 7 / 4 |
| 无指南 | 22 | 5 (22.73%) | 5 (22.73%) | 1 / 1 |
表 3:有无 Guide Text 的配对 GPT 5.5 比较。
| 度量 | 15 步 | 25 步 |
|---|---|---|
| 校正后的 MASM 成功 | 58 (35.15%) | 57 (34.55%) |
| 校正后的 Guide Text + MASM 成功 | 61 (36.97%) | 63 (38.18%) |
| 仅 Guide Text | 8 (4.85%) | 20 (12.12%) |
| 仅 MASM | 5 (3.03%) | 14 (8.49%) |
| 净变化 | +3 (+1.82 pp) | +6 (+3.64 pp) |
| 精确配对检验 | $p=.549$ | $p=.392$ |
在 25 步时,动作类任务增加五次成功,混合类任务增加三次,检索类任务则失去两次(表 4)。购物管理贡献四次净成功,Reddit 两次,GitLab 和购物各一次;地图任务失去两次。当 Guide Text 提供确切路线、搜索短语或中间约束时最有帮助。当一份不完整的流程把模型锚在错误页面,或漏掉最终确认时,它可能有害。
表 4:25 步时按任务类型划分的校正后 GPT 5.5 成功。
| 任务类型 | MASM | Guide Text + MASM | 净变化 |
|---|---|---|---|
| 动作 | 11 (6.67%) | 16 (9.70%) | +5 |
| 混合 | 26 (15.76%) | 29 (17.58%) | +3 |
| 检索 | 20 (12.12%) | 18 (10.91%) | $-2$ |
表 5 的站点分解强化了任务类型的结果。增益集中在流程路线相对稳定的界面:购物管理增加四个任务,Reddit 增加两个,GitLab 和购物各增加一个。地图任务失去两个,在那里,不完整的地点或路线提示会在页面提供足够证据之前把运行锚住。
表 5:25 步时按站点划分的校正后 Guide Text 净效应。
| 站点 | 净变化 |
|---|---|
| 购物管理 | +4 (+2.42 pp) |
| +2 (+1.21 pp) | |
| GitLab | +1 (+0.61 pp) |
| 购物 | +1 (+0.61 pp) |
| 地图 | $-2$($-1.21$ pp) |
5.4 任务级增益、退步与效率
合计成功掩盖了干预对已解决任务集合的重新安排有多强。在 25 步比较中,165 个任务里有 34 个(20.61%)翻转了结果,尽管净增益只有六个。有代表性的增益包括打开正确的畅销报告、在多段路线中保持方向和出行方式、使用有效的产品查询,以及到达正确的成员管理或论坛订阅流程。退步包括跟随不完整的附近地点提示、进入无关的令牌页面、丢失目标论坛上下文,以及设置了报告日期却没有运行报告。附录 D 列出有代表性的情形。
这一干预也改变效率。在二十个只有 Guide Text 才解决的任务上,平均动作数从 15.0 降到 8.9,中位数从 14 降到 7,达到 25 动作上限的运行数从七次降到一次。这一模式比净分数本身更强:有用的过程性证据可以去掉宽泛探索,但一份差的指南也可以让智能体高效地走向错误状态。
5.5 失败模式与停止前的完成
我们标注最强被审计条件——25 步、带 Guide Text 和 MASM 的 GPT 5.5——中的 102 条失败轨迹。表 6 报告主要原因。滚动振荡是最大的一类,有 32 次失败(31.4%)。未完成的探索和过早作答各占 13 次(12.7%)。无效动作格式占 9 次(8.8%),不完整的表单或编辑流程占 8 次(7.8%)。合在一起,这些类别描述不同的修复目标:循环检测、分阶段的信息收集、完成检查、动作校验,以及显式的保存或提交核验。
表 6:25 步、带 Guide Text 和 MASM 的 102 条失败 GPT 5.5 轨迹的主要失败模式。
| 失败模式 | $n$ | 份额 |
|---|---|---|
| 滚动振荡 | 32 | 31.4% |
| 探索未完成 | 13 | 12.7% |
| 过早作答 | 13 | 12.7% |
| 无效动作格式 | 9 | 8.8% |
| 表单或编辑不完整 | 8 | 7.8% |
| 精确动作重复 | 7 | 6.9% |
| 错误的值或实体 | 6 | 5.9% |
| 点击后状态不变 | 4 | 3.9% |
| 搜索重复 | 3 | 2.9% |
| 无根据猜测 | 3 | 2.9% |
| 导航循环 | 2 | 2.0% |
| 其他执行错误 | 1 | 1.0% |
| 其余已定义模式 | 1 | 1.0% |
| 合计 | 102 | 100% |
一个单独的复核标记记录所请求的状态是否在停止之前已经到达。这一区分是必要的,因为一次运行可以完成浏览器操作,却仍因无效的最终动作、评测器不匹配,或继续交互而丢失正确状态而失败。反过来,记忆里一句 100% 的陈述,若没有页面或任务特定证据,不被接受为完成。这条证据规则防止乐观的自我报告被计成找回的成功。
5.6 步骤级进展与轨迹分析
结构化进展可以从记忆中抽出的,有 165 个 GPT 5.5 任务中的 91 个(55.2%)。在全部 102 次失败运行中,18 次(17.6%)声称至少完成 80%,7 次(6.9%)声称 100%。人工依据大幅收窄这些候选。在 40 个可分析、用尽动作预算的失败中,平均的最大已核验进展是 56.2%;八个达到至少 80%,没有一个达到 100%。
表 7:25 步 Guide Text 与 MASM 条件下 GPT 5.5 的进展证据。
| 度量 | 值 |
|---|---|
| 可抽出结构化进展 | 91/165 (55.2%) |
| 报告 $\geq 80\%$ 的失败运行 | 18/102 (17.6%) |
| 报告 $100\%$ 的失败运行 | 7/102 (6.9%) |
| 可分析的动作上限失败 | 40 |
| 平均最大已核验进展 | 56.2% |
| 达到 $\geq 80\%$ 的动作上限失败 | 8/40 (20.0%) |
| 达到 $100\%$ 的动作上限失败 | 0/40 (0.0%) |
前两个动作给出最大的平均报告增量,23.6 和 19.0 个百分点。接下来四个分别贡献 9.9、8.6、7.4 和 4.2 个百分点(表 8)。早期的陡增与导航和最初的信息收集一致,而后来的动作更多地与核验、恢复、重复探索和停止相关。报告的进展有助于定位这些转变,但七次声称 100% 的失败运行,与 40 个动作上限失败中零次被核验的完成之间的缺口,说明这个信号不能单独成立。
表 8:前六个动作上 GPT 5.5 报告进展增量的均值。
| 步骤 1 | 步骤 2 | 步骤 3 | 步骤 4 | 步骤 5 | 步骤 6 | |
|---|---|---|---|---|---|---|
| 增量(百分点) | 23.6 | 19.0 | 9.9 | 8.6 | 7.4 | 4.2 |
这一模式解释了为什么更长的预算不会自动提高成功:它创造更多恢复的机会,也创造更多循环或离开正确状态的机会。因此,一个关注轨迹的监控应当把快速早期进展之后的平台,当作去核验完成或改变策略的信号,而不是简单地把剩余预算花掉。
5.7 对可靠网页智能体评测的含义
从这次审计得出三项做法。第一,基准报告应当保留原始分数,但把校正规则、校正后结果和找回次数放在它旁边。第二,提示干预应当按配对的任务增益、退步和动作次数来比较,而不只按净准确率。第三,智能体监控应当把最终成功与有环境依据的进展、重复动作检测和一道显式的完成门结合起来。这些补充并不替换基准分数;它们说清分数里有什么,以及它在哪里失败。
6 局限与对效度的威胁
每种条件对每个任务只有一次 rollout,因此配对的任务翻转描述的是观察到的运行,而不是重复试验上的分布。15 和 25 的动作预算不能直接比较;因此我们最强的干预声称来自同一预算下配对的 Guide Text 比较。Qwen 的 MASM 消融以其原始评测器分数报告,没有接受与四种 GPT 5.5 设定相同的失败校正。尽管有固定的证据规则和对含糊情形的第二次复核,人工标签仍然基于判断。结构化进展只对 55.2% 的任务可用,并被用来定位证据,而不是当作真值。Guide Text 是由可得的流程记录构成的观察性干预,而不是随机化的来源:22 个任务没有指南,指南的具体程度也因任务而异。至少一个动作任务显示出可能承接了上一次运行的状态,另一份指南则把一个中间答案暴露到足以有泄漏风险的程度。我们把这些情形保留在配对数里,但在任务级审计中把它们标出,而不是把每一次翻转都解释成指南的因果效应。最后,API 行为、网站状态和认证在重新运行之间可能变化。
7 结论
最终的基准分数有用,但它既不能完整描述任务完成,也不能完整描述智能体行为。在四种 GPT 5.5 设定上,人工复核找回 47 个被漏掉的成功,对应于每个设定 5.45 到 8.49 个百分点。轨迹审计把 102 次失败运行归到可复现的原因上,并表明很高的自我报告进展常常缺少足够的环境证据。MASM 提高了未经训练的 Qwen3.5 9B 的评测器分数,而 Guide Text 既改变 GPT 5.5 的成功率,也改变被解决任务的身份。因此,可靠的网页智能体评测应当同时报告原始结果和校正后结果,并保留足够的轨迹证据,以解释失败、进展和停止行为。
8 伦理考量
所保留的研究只做评测。GPT 5.5 的输出被用来评测发起这些输出的 API 模型,并对它被记录的行为做人工分析。在本文报告的实验中,没有任何 GPT 生成的输出或轨迹被用来训练、微调、蒸馏或以其他方式改进另一个模型。这些记录只用于这一学术评测,不被用来开发、训练、评测或部署商业产品或服务。
参考文献
Deng 等人(2023)。作者:X. Deng、Y. Gu、B. Zheng、S. Chen、S. Stevens、B. Wang、H. Sun 与 Y. Su。题名:《Mind2Web:走向网页上的通用智能体》。出处:神经信息处理系统进展(Advances in Neural Information Processing Systems),第 36 卷。正文引用位置:第 1 节、第 2 节。
Drouin 等人(2024)。作者:A. Drouin、M. Gasse、M. Caccia、I. H. Laradji、M. Del Verme、T. Marty、L. Boisvert、M. Thakkar、Q. Cappart、D. Vazquez 等。题名:《WorkArena:网页智能体解决常见知识工作任务的能力如何?》。出处:arXiv 预印本,编号 arXiv:2403.07718。正文引用位置:第 2 节。
Koh 等人(2024)。作者:J. Y. Koh、R. Lo、L. Jang、V. Duvvur、M. Lim、P. Huang、G. Neubig、S. Zhou、R. Salakhutdinov 与 D. Fried。题名:《VisualWebArena:在真实视觉网页任务上评测多模态智能体》。出处:计算语言学协会第六十二届年会论文集长文卷(Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics, Volume 1: Long Papers),第 881–905 页。正文引用位置:第 2 节。
Le Sellier De Chezelles 等人(2024)。作者:T. Le Sellier De Chezelles、S. O. Shayegan、L. K. Jang、X. H. Lù、O. Yoran、D. Kong、F. F. Xu、S. Reddy、Q. Cappart 等。题名:《面向网页智能体研究的 BrowserGym 生态系统》。出处:arXiv 预印本,编号 arXiv:2412.05467。正文引用位置:第 1 节、第 2 节。
Liu 等人(2024)。作者:X. Liu、H. Yu、H. Zhang、Y. Xu、X. Lei、H. Lai、Y. Gu、H. Ding、K. Men、K. Yang 等。题名:《AgentBench:把大语言模型作为智能体来评测》。出处:国际学习表征会议(International Conference on Learning Representations),2024 年卷,第 52989–53046 页。正文引用位置:第 2 节。
Liu 等人(2025)。作者:X. Liu、T. Zhang、Y. Gu、I. L. Iong、S. XiXuan、Y. Xu、S. Zhang、H. Lai、J. Sun、X. Yang 等。题名:《VisualAgentBench:走向作为视觉基础智能体的大型多模态模型》。出处:国际学习表征会议(International Conference on Learning Representations),2025 年卷,第 95650–95707 页。正文引用位置:第 1 节、第 2 节。
Logeswaran 等人(2026)。作者:L. Logeswaran、J. Kim、S. Sohn、C. Glasscock 与 H. Lee。题名:《通过自动数据生成和细粒度评测来扩展网页智能体训练》。出处:arXiv 预印本,编号 arXiv:2602.12544。正文引用位置:第 2 节。
Lù 等人(2024)。作者:X. H. Lù、Z. Kasner 与 S. Reddy。题名:《WebLINX:借助多轮对话完成真实网站导航》。出处:arXiv 预印本,编号 arXiv:2402.05930。正文引用位置:第 2 节。
Lù 等人(2025)。作者:X. H. Lù、A. Kazemnejad、N. Meade、A. Patel、D. Shin、A. Zambrano、K. Stańczak、P. Shaw、C. J. Pal 与 S. Reddy。题名:《AgentRewardBench:评测网页智能体轨迹的自动评测》。出处:arXiv 预印本,编号 arXiv:2504.08942。正文引用位置:第 2 节。
Ma 等人(2024)。作者:C. Ma、J. Zhang、Z. Zhu、C. Yang、Y. Yang、Y. Jin、Z. Lan、L. Kong 与 J. He。题名:《AgentBoard:多轮大语言模型智能体的分析性评测板》。出处:神经信息处理系统进展第 37 卷(Advances in Neural Information Processing Systems 37),第 74325–74362 页。正文引用位置:第 2 节。
Murty 等人(2025)。作者:S. Murty、H. Zhu、D. Bahdanau 与 C. D. Manning。题名:《NNetNav:通过在真实环境中交互、以无监督方式学习浏览器智能体》。年份:2025。网址:https://arxiv.org/abs/2410.02907。正文引用位置:第 2 节。
Qi 等人(2025)。作者:Z. Qi、X. Liu、I. L. Iong、H. Lai、X. Sun、J. Sun、X. Yang、Y. Yang、S. Yao、W. Xu 等。题名:《WebRL:用自我演化的在线课程强化学习训练大语言模型网页智能体》。出处:国际学习表征会议(International Conference on Learning Representations),2025 年卷,第 79791–79821 页。正文引用位置:第 2 节。
Qian 等人(2025)。作者:Y. Qian、Y. Wang、J. Zhang、Y. Zong、M. Chen、H. Zhou、J. Huang、Y. Zeng、X. Hu、C. H. Song 等。题名:《WebGraphEval:用图表示对网页智能体做多轮轨迹评测》。出处:arXiv 预印本,编号 arXiv:2510.19205。正文引用位置:第 2 节。
Wang 等人(2024)。作者:P. Wang、L. Li、L. Chen、Z. Cai、D. Zhu、B. Lin、Y. Cao、L. Kong、Q. Liu、T. Liu 等。题名:《大语言模型并不是公平的评测者》。出处:计算语言学协会第六十二届年会论文集长文卷(Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics, Volume 1: Long Papers),第 9440–9450 页。正文引用位置:第 2 节。
Wei 等人(2025)。作者:Z. Wei、W. Yao、Y. Liu、W. Zhang、Q. Lu、L. Qiu、C. Yu、P. Xu、C. Zhang、B. Yin 等。题名:《WebAgent R1:用端到端的多轮强化学习训练网页智能体》。出处:二〇二五年自然语言处理经验方法会议论文集(Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing),第 7920–7939 页。正文引用位置:第 2 节。
Xue 等人(2025)。作者:T. Xue、W. Qi、T. Shi、C. H. Song、B. Gou、D. Song、H. Sun 与 Y. Su。题名:《这是进步的幻觉吗?评估网页智能体的当前状态》。出处:arXiv 预印本,编号 arXiv:2504.01382。正文引用位置:第 2 节。
Yao 等人(2023)。作者:S. Yao、J. Zhao、D. Yu、N. Du、I. Shafran、K. Narasimhan 与 Y. Cao。题名:《ReAct:让语言模型里的推理与行动协同起来》。出处:国际学习表征会议(International Conference on Learning Representations)。正文引用位置:第 1 节、第 2 节。
Zheng 等人(2023)。作者:L. Zheng、W. Chiang、Y. Sheng、S. Zhuang、Z. Wu、Y. Zhuang、Z. Lin、Z. Li、D. Li、E. Xing 等。题名:《用 MT-Bench 和 Chatbot Arena 来评判「以大语言模型为裁判」》。出处:神经信息处理系统进展第 36 卷(Advances in Neural Information Processing Systems 36),第 46595–46623 页。正文引用位置:第 2 节。
Zhou 等人(2024)。作者:S. Zhou、F. F. Xu、H. Zhu、X. Zhou、R. Lo、A. Sridhar、X. Cheng、T. Ou、Y. Bisk、D. Fried、U. Alon 与 G. Neubig。题名:《WebArena:用来构建自主智能体的真实网页环境》。出处:国际学习表征会议(International Conference on Learning Representations)。正文引用位置:第 1 节、第 2 节。
附录 A 完整的 165 任务结果矩阵
完整矩阵按共同的 WebArena Lite 任务索引组织。六种被保留的条件存放原始评测器结果,四种 GPT 5.5 条件还额外存放人工校正后的结果和校正规则。被审计的失败运行包括第一个有后果的错误步骤、主要失败模式、最大已核验进展,以及存在时的完成步。表 1 是这一矩阵的直接合计。
附录 B 人工复核指南与校正规则
只有当所请求的结果被记录下来的环境或最终答案所支持时,原始失败才被校正。被接受的校正包括语义等价的答案格式、无害的额外文本、在并未要求顺序时的严格排序差异,以及被最终字符串规则漏掉的成功状态变化。我们不校正无根据的意图、部分完成的表单、没有页面证据的推断答案,或与环境冲突的记忆陈述。
证据按下列顺序检查:任务特定的环境状态、前后截图、执行结果、最终答案,以及模型的 Memory 或 Analysis。复核者记录证据和一个校正代码。含糊情形交给第二位复核者,而不是根据模型的自我报告来解决。
附录 C 细粒度失败模式的定义
| 失败模式 | 操作定义 |
|---|---|
| 滚动振荡 | 反复上下滚动,却没有抽出新证据或改变策略。 |
| 探索未完成 | 运行在到达任务所需的页面或状态之前用尽预算。 |
| 过早作答 | 在获得所需证据或动作确认之前就发出最终答案。 |
| 错误的值或实体 | 智能体选择了一个相似但不正确的项目、人物、日期、计数或目的地。 |
| 点击后状态不变 | 一次点击使相关 URL、页面和任务状态保持不变,并且没有被修复。 |
| 精确动作重复 | 同一个可执行动作在同一状态中被重复。 |
| 搜索重复 | 查询被重复或改写,却没有收敛到可核验的证据。 |
| 表单或编辑不完整 | 缺少所需的输入、保存、提交或确认步骤。 |
| 无效动作格式 | 工具调用无法执行,因为动作名、元素或参数无效。 |
| 导航循环 | 智能体在页面之间反复移动或回溯,却没有保住进展。 |
| 其他执行错误 | 一个有效的高层计划因未归类的执行或界面错误而失败。 |
| 无根据猜测 | 答案没有依据观察到的页面或环境状态。 |
| 严格答案不匹配 | 任务已经完成,但语义上有效的答案被一条狭窄的输出规则拒绝。 |
| 缺少答案字段 | 答案漏掉了指令明确要求的若干值中的一个。 |
| 错误的页面或站点 | 智能体在不正确的项目、论坛、报告、产品或目的地上下文中行动。 |
| 停止前已完成 | 所需状态已经到达,但运行继续、破坏了该状态,或未能发出有效的停止。 |
102 次失败的 GPT 5.5 运行的完整计数分布见表 6。主要标签记录的是实质降低完成机会的第一个原因;后来的症状留在复核者说明里。
附录 D 逐任务的 Guide Text 增益与退步
表 9 列出表 4 和表 5 中合计的任务类型与站点结果背后有代表性的翻转。计数按任务标识配对,并使用人工校正后的结果。
表 9:配对 GPT 5.5 运行中有代表性的 Guide Text 增益与退步。
| 任务索引 | Guide Text 效应 | 观察到的机制 |
|---|---|---|
| 0 | 增益:一月销量前三 | 直达报告的路线和正确的日期区间。 |
| 18 | 增益:两段行程时间 | 保持各段方向和出行方式。 |
| 29 | 增益:磨牙症的产品搜索 | 提供有用查询和明确的完成条件。 |
| 130 | 增益:增加两名 GitLab 维护者 | 提供正确的成员页面流程。 |
| 132 | 增益:订阅一条热门论坛帖 | 保住论坛上下文并核验订阅。 |
| 12 | 退步:离 Hunt Library 最近的咖啡馆 | 不完整的指南把模型锚到一家无根据的咖啡馆。 |
| 63 | 退步:RSS 订阅源令牌 | 把模型重定向到无关的个人访问令牌页面。 |
| 134 | 退步:发布一个控制台问题 | 泛泛的提交指导丢失了目标论坛上下文。 |
| 149 | 退步:二月销售报告 | 日期已设置,但报告没有被运行和检查。 |
对 25 步时二十个仅 Guide Text 才成功的任务,平均动作从 15.0 降到 8.9,中位动作从 14 降到 7,达到动作上限的情形从七个降到一个。这些效率值是在配对翻转集合上计算的,而不是在全部任务上。
附录 E 步骤级进展标注协议
标注者先把指令分解成可以从环境检查的原子条件。在每一步,他们标出当前已核验的条件,并记录证据来源。当正确状态被覆盖时,当前进展可以下降。我们单独保留已达到的进展,$\widehat{P}(t)=\max_{s\leq t}P(s)$,这样后来的遗忘不会抹掉任务曾经已经完成的证据。超出量是第一次被核验的完成之后的动作数,不包括发出最终答案或停止所需的那一个动作。
记忆进展被用来选择候选步骤,而不是用来赋予最终标签。因此,七次记忆报告为 100% 的失败 GPT 5.5 运行,被对照截图、动作结果和任务评分细则来复核。40 个用尽动作预算的可分析失败中,没有一个达到 100% 的已核验进展。
附录 F 有代表性的被审计轨迹
任务 35 询问从 Joe Biden 的家乡开车到 Bridgeport 的时间。这次 GPT 5.5 运行得到大约三小时二十四分钟,并在第四步报告进展已满。随后它生成无效的最终动作格式,而一次正确的退出仍被记成执行错误。浏览器推理成功了,但停止语法和评测并不一致。
任务 149 说明相反的模式。智能体识别出预期的报告期并输入日期,但在运行和检查报告之前就停了。最终状态确实不完整,因此即使记忆报告了相当多的进展,也不做校正。这两个情形说明,为什么结果校正和轨迹诊断必须使用同一份环境证据。
附录 G 复核界面与分析工具
复核工具把每个任务上被保留的评测条件对齐到同一页。它显示原始结果和校正后结果、自动失败摘要、动作次数、前后截图、动作分析、记忆和最终回答。复核者记录裁决、失败模式、第一个错误步骤、校正后的答案和说明。筛选器暴露评测器分歧、特定于提示的失败、任务类型和未复核情形。用同一个界面做校正和轨迹裁定,使证据可见、标准一致。
附录 H 评测与环境细节
所有运行都使用 165 个 WebArena Lite 任务标识。评测在网站重置和认证状态重建之后执行。GPT 5.5 在四种提示与预算条件下被直接调用:15 步和 25 步的 MASM,以及 15 步和 25 步的 Guide Text 加 MASM。未经训练的 Qwen3.5 9B 在 25 步下分别有和没有 MASM 地被评测。任务顺序、重置流程、提示、动作记录、截图、评测器输出和人工校正记录都与研究产物一起保留。在本文报告的实验中,没有任何被记录的 GPT 输出被用作训练数据。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。