OpenQA

Industry & PracticeResearch & Benchmarks

智能体评测中的政策漏洞:当政策歧义伪装成智能体错误

智测团队 · OpenQA(openqa.cn)17 min read

智能体基准评测政策遵从,却假定每一条政策都能确定唯一正确的动作。自然语言政策会因沉默、歧义或自相矛盾而违背这一假定,从而允许多种站得住脚的解读,而单一金标准轨迹无法覆盖这些解读。我们对 τ²-bench 的两个领域做了审计,建立了此类政策漏

In this piece

智能体评测中的政策漏洞:当政策歧义伪装成智能体错误(中文全译)

翻译说明:本文是 arXiv 论文 Policy Loopholes in Agent Evaluation: When Policy Ambiguity Masquerades as Agent Error(arXiv:2609.14400)的中文全译,由智测团队翻译。原作者:Hongliu Cao。原文以 CC BY 4.0 许可发布。译文保留原文全部章节、数据与结论;参考文献列表从略。

原作者:Hongliu Cao 单位:Amadeus SAS 通信作者:caohongliu@gmail.com 版本:arXiv:2609.14400v1 [cs.CL],2026 年 9 月 13 日

说明:抓取到的源文件在正文「人工智能辅助使用」之后,未收录附录 A–F 与参考文献列表的正文(网页目录中仅有标题)。为避免编造案例与数据,下列译文只覆盖源文件中实际存在的正文;附录未译。

摘要

智能体基准评测政策遵从,却假定每一条政策都能确定唯一正确的动作。自然语言政策会因沉默、歧义或自相矛盾而违背这一假定,从而允许多种站得住脚的解读,而单一金标准轨迹无法覆盖这些解读。我们对 τ²-bench 的两个领域做了审计,建立了此类政策漏洞的分类体系,并表明受影响任务给出的分数不可靠:它们以不同方式压低不同模型的分数,也使每个模型在重复试验中更不一致。跨领域比较显示,漏洞要变得可利用,必须同时具备政策歧义与工具侧的宽松:当政策复杂度超过工具所能强制执行的范围时,智能体对缺口的消解彼此不一致,分数随之变得不可靠。政策规约的质量决定了评测质量的上限。基准开发者应在收集金标准标注之前先审计政策。

1 引言

智能体基准无论是对最终结果打分(Yao 等人,2025;Barres 等人,2025;Zhou 等人,2024;Jimenez 等人,2024),还是审计过程步骤(Levy 等人,2024;Li 等人,2025a;Ruan 等人,2024),都把政策规约当作没有歧义的地面真值。它们通常把智能体动作与一条金标准轨迹相比较,在智能体动作之上增加过程检查,或依赖工具守卫来拒绝无效操作。我们表明,这一假定在实践中可能失效。写给人类员工的自然语言政策对典型情形是够用的,但在决策边界上可以含糊,允许多种站得住脚的解读,而单一金标准动作无法代表这些解读。大语言模型智能体缺少人类员工用来穿越此类缺口的制度语境与上级请示渠道。因此,它们消解歧义的方式各不相同:一个模型升级请示,另一个保守行事,第三个即兴找出变通做法。每一种回应都可以在政策文本下站得住脚,而单一金标准评测把除一种之外的全部回应都当成错误,从而把政策歧义转化成虚假的能力差距。

我们把这些含糊之处称为政策漏洞:政策文本沉默、自相矛盾或内部不一致的地方,以至于一个称职的智能体可以为不止一种动作提供正当理由(形式定义见第 2 节)。例如,一条条款禁止修改基础经济舱航班,另一条条款则允许对所有预订更改舱位。智能体对「先升级舱位是否会使该航班变为可修改」意见不一。现有基准检查智能体是否遵从政策,却很少审计政策本身是否确定了唯一答案。这就留下一个盲区:一个遵守政策的智能体仍可能与金标准动作不一致。

我们提出一种两阶段的政策规约审计,把主动式条款分析与反应式轨迹核验结合起来,系统地暴露这些缺口。本文的主要贡献如下:

  1. 一套面向政策锚定基准的政策规约审计方法,结合主动式条款分析、反应式轨迹核验,以及五类漏洞分类体系:17 个漏洞中有 12 个仅由主动阶段发现(仅阶段 1),5 个经两个阶段双重确认。尽管两个领域都存在政策缺口,只有航空任务出现分数下降,零售任务不受影响(第 3 节、第 4 节)。
  1. 一个两因素机制的提议:基于跨领域分析,我们观察到,只有当政策复杂度超过工具级强制执行所能封住的范围时,政策歧义才会变得可利用,这解释了领域之间的鲜明分裂(第 4.2 节)。
  1. 一项可推广性分析,表明漏洞是政策的属性,而不是单个任务的属性:τ³-bench 的逐任务修补解决的是症状,却把含糊条款留下来继续产生新的冲突。逐任务补丁会不断增殖,并且可能彼此矛盾,而政策层面的修复可以跨任务推广(第 4.2 节)。

2 相关工作

我们将政策漏洞定义为基准政策文档中的这样一个点:政策文本含糊、对边界情形沉默,或允许多种站得住脚的解读,以至于一个称职的智能体仅凭书面文本就能为不止一种行动方案提供正当理由。漏洞不同于标注冲突;在标注冲突中,金标准动作在政策的任何一种解读下都不可接受。在漏洞中,金标准只是若干有效解释中的一种;在标注冲突中,金标准与政策文本相矛盾。冲突需要重新标注;漏洞需要收紧政策,或采用多金标准评测(详细比较见附录 B)。这些漏洞不是大语言模型误解的产物,而是政策规约本身所固有的。

当前的智能体基准(Yao 等人,2025;Zhou 等人,2024;Liu 等人,2024;Mialon 等人,2024;Jimenez 等人,2024;Xu 等人,2025)主要对照唯一的金标准结果来评测智能体。一条日益增长的工作线增加了过程检查(Cao 等人,2026):ST-WebAgentBench(Levy 等人,2024)、SOPBench(Li 等人,2025a)、GuideBench(Diao 等人,2025)与 INSURE-Dial(Kulkarni 等人,2026)对政策或指南遵从打分;Beyond-IVR(Balaji 等人,2026)评测客户支持中的业务依从;ToolEmu(Ruan 等人,2024)检查安全的工具使用;AgentHarm(Andriushchenko 等人,2025)、AgentDojo(Debenedetti 等人,2024)以及 Chang 等人(2025)测试智能体是否抵制有害或被注入的指令。近期工作也针对强制执行与失败检测:Zwerdling 等人(2025)在智能体工作流中强制政策依从,Nakash 等人(2025)对遵守政策的智能体做红队测试,Rabinovich 等人(2026)检测潜在的政策失败。尽管近期有所进展,最先进的方法仍有重要局限。政策最接近真实的基准(如 τ²-bench 那种带嵌套条件的散文)依赖最弱的核验:对照单一金标准轨迹做结果级匹配。核验更强的基准(可执行守卫、形式约束求解器(Winston 等人,2026;Anand 等人,2026))要求把政策翻译成形式规约,这可能丢失自然语言的细微差别;过程级评测(Gritta 等人,2026)仍然需要一条没有歧义的参考轨迹。这些局限造成一个缺口,漏洞可以从中出现。当政策真实到足以包含真正的歧义,而核验只检查结果是否匹配某一位标注者的解读时,替代解释无论在政策文本下多么站得住脚,都会被记为失败。

基准标签错误普遍存在(Northcutt 等人,2021),而人类分歧常常反映的是真正的歧义,而不是标注者出错(Pavlick 与 Kwiatkowski,2019;Plank,2022;Basile 等人,2021)。近期工作(Bavaresco 等人,2025;Bai 等人,2024)考察评测假定如何在审视之下瓦解。Ambig-SWE(Vijayvargiya 等人,2026)与 CondAmbigQA(Li 等人,2025b)把规约不足当作明确的评测对象,表明表面上的失败可能源于用户指令或查询中固有的歧义。我们把这一见解延伸到政策规约:当政策规约允许多种站得住脚的解读时,基于结果的评测与基于过程的评测都会继承这种歧义。正如法律中的制定法歧义会产生巡回法院分歧(不同法院从同一文本得出不同结论),基准中的政策歧义会产生模型分歧:不同模型从同一政策得出不同结论,却只有一种被任意判定为正确。

3 审计框架

我们为受政策约束的基准提出一种两阶段的政策规约审计。

阶段 1:主动式条款级审计

在查看任何任务结果之前,我们分析每一条政策条款,并施加四项诊断检验:范围(该条款是否覆盖这一情形?)、边界(它是否处理边界情形?)、组合(它是否与其他条款无歧义地组合?),以及假定(它是否依赖未言明的预设?)。任何未通过一项或多项检验的条款,都被标记为候选漏洞。

阶段 2:反应式轨迹级核验

对于智能体失败的任务,我们检查:(a)智能体是否依赖了某一具体政策条款;(b)该条款是否确实含糊或沉默;(c)一个称职的人类座席是否可以站得住脚地做出同样的决定。满足全部三项标准的任务被归类为受漏洞影响(完整标准见附录 A)。

漏洞分类体系

把这些检验应用到两个领域,得到五类漏洞(完整目录见附录 C)。范围缺口出现在政策对某一情形完全沉默之时。边界沉默漏洞出现在条款覆盖了总话题、却遗漏某一具体边界条件之时。条款冲突是指两条各自清晰的规则适用于同一情形时,产生相互矛盾的指导。隐含前提出现在一条规则依赖于政策从未定义的概念之时。组合歧义出现在各条规则单独看都清晰、但政策没有说明它们能否按顺序施加之时。

4 实验

我们把该审计框架应用于 τ²-bench 的航空领域(50 个任务)与零售领域(114 个任务)。轨迹来自 GPT-5、Kimi-K2-Thinking 与 Mistral-Large-3(各 4 次试验),合计 1,968 次运行。这三个模型代表三个不同的提供方与地区(OpenAI/美国、Moonshot/中国、Mistral/欧盟),并在漏洞任务上表现出不同的消歧行为,表明对漏洞的敏感来自基准政策,而不是任何一个模型或训练体制。全部 17 个漏洞都是在阶段 1 中仅根据政策文本识别出来的,当时尚未查看任何智能体轨迹。其中 5 个又在阶段 2 中、于至少有一次失败试验的任务上得到确认。这 5 个漏洞对应 7 个受影响任务,其余 12 个仅由条款分析所证实,说明两个阶段是互补的。完整目录见附录 C,每一项都有编号(航空为 L1–L16,零售为 R1–R2),下文表格引用这些编号。

4.1 航空领域:可被利用的漏洞

表 1:七个受漏洞影响的航空任务的逐任务成功率(成功次数/4 次试验)。底部两行比较漏洞任务与非漏洞任务的平均成功率。

任务漏洞GPT-5KimiMistral
2边界沉默(L3/4)0/40/41/4
5边界沉默(L5)4/43/42/4
13范围缺口(L16)2/44/43/4
27边界沉默(L3/4)0/40/40/4
29范围缺口(L16)0/42/43/4
32组合歧义(L6)1/40/40/4
45组合歧义(L6)2/43/41/4
漏洞任务平均32.1%42.9%35.7%
非漏洞任务平均64.5%48.3%40.7%

50 个航空任务中有 7 个至少受一个漏洞影响。最清楚的信号是不一致性:同一类政策缺口在不同任务上产生截然不同的结果:任务 27 在 12 次运行中成功 0 次,而任务 5 在 12 次运行中成功 9 次。差别不在于缺口本身的性质,而在于标注者把哪一种解释选成了金标准动作。漏洞任务上的任务内跨试验方差,比非漏洞任务高 1.62 倍(分别为 0.110 与 0.068,对应 21 个与 129 个模型–任务单元),量化了评测可靠性的代价(细节见附录 A.4)。

漏洞任务的平均成功率为 37%,非漏洞任务为 51%(表 1)。然而这一合计掩盖了各模型并不相同的差距:GPT-5 表现出 32.4 个百分点的漏洞惩罚;相比之下,Kimi 与 Mistral 在漏洞任务与非漏洞任务之间的表现差异较小(约 5 个百分点)。值得注意的是,GPT-5 也是非漏洞任务上最强的模型。如果漏洞任务只是更难,本应预期更强的模型受损更少,而不是更多。相反,观察到的模式表明,政策歧义制造了评测假象,对某些消歧策略的惩罚不成比例地更重。

反事实重新汇总量化了基准范围的影响:去掉这 7 个漏洞任务后,GPT-5 的总体成功率上升 4.5 个百分点,从 60.0% 升至其非漏洞任务成功率 64.5%;Kimi 与 Mistral 仅分别上升 0.8 与 0.7 个百分点;GPT-5 相对 Kimi 的领先从 +12.5 个百分点扩大到 +16.2 个百分点。因此,当前基准压低了最强模型的分数。然而,由于阶段 1 标出了 15 个有效的航空漏洞,而当前金标准轨迹只触及其中 7 个,这 7 个任务是政策问题的下界。在同一政策空间内提高任务多样性,可能会揭示更多漏洞。

漏洞失败反复出现三种模式。第一,边界沉默:在任务 2 与任务 27 中,补偿条款写的是「在确认事实并更改或取消之后」;智能体一致把「更改或取消」读成前提,因而扣下证明,但金标准编码的是宽松解读(成功率分别为 1/12 与 0/12)。第二,范围缺口:在任务 13 与任务 29 中,政策禁止修改基础经济舱航班或更改目的地,但对「取消后重新预订」是否能通过各自都被允许的动作达到同样效果保持沉默。有些智能体找到这一变通做法,另一些正确地拒绝,两种行为都站得住脚。第三,组合歧义:在任务 32 与任务 45 中,政策允许基础经济舱升级舱位,也允许非基础经济舱修改航班,但对这两者能否按顺序组合保持沉默。尝试两步变通(先升级、再修改)的智能体,与拒绝这样做的智能体发生分裂,从而产生不一致的分数。

核心问题不是成功率低或高,而是评测不可靠。高成功率的任务同样具有误导性:任务 5(总体 75%)仍然产生跨模型分歧(GPT-5 为 4/4,Kimi 为 3/4,Mistral 为 2/4),而且它是在查看任何轨迹之前、就从政策文本中被主动标出的。再加上能力倒置的差距(最强的模型遭受最大的惩罚)以及零成功特征(任务 27,0/12),这三条证据线与「任务难度混淆」不一致,而与「政策歧义压低分数」相一致。对漏洞的敏感,追踪的是模型默认的消歧策略是否碰巧符合标注者未言明的偏好,而不是模型质量。模型消解歧义的方式不同:Kimi-K2-Thinking 最保守,会拒绝其他模型尝试的变通做法;GPT-5 最常探索变通做法;Mistral-Large-3 最不一致。没有任何单一策略占优(附录 E)。完整案例研究见附录 D。

4.2 零售领域与跨领域分析

把同一套两阶段审计应用于零售领域(114 个任务,1,368 次运行),阶段 1 识别出两处政策歧义(R1–R2),阶段 2 确认的可利用任务为零。R1 涉及「只修改一次」约束中的一处轻微歧义:政策称工具「每个订单只能调用一次」,但没有说明「一次」是指一次成功执行,还是包括参数错误的失败调用在内的一次尝试。R2 涉及已修改订单的生命周期:政策对状态已变为 “pending (items modified)” 的订单日后能否取消或退货保持沉默。两者都是真正的文本缺口,但在两种情形中工具都把缺口封住了:修改订单会使其状态离开 “pending”,此后所有写调用都会被拒绝,因为前提不再成立。智能体从来没有机会去行使任何一种含糊解释。

#### 为何航空领域会、零售领域不会?

两个领域在政策复杂度与工具级强制执行上都不相同,而且这些因素似乎相互加强。然而,由于航空领域同时更复杂、又更少受工具校验约束,仅比较两个领域无法把二者各自的效应拆开。我们在机制层面的假设是:复杂政策更难编码成工具约束,从而使强制执行更依赖智能体推理。这一解释与观察到的模式相符,但要确认它,还需要更多领域,或对政策复杂度与工具强制执行做受控操纵。

航空政策包含相互关联、高度可组合的资格规则。例如,取消资格由四个析取条件定义,而补偿既要求符合条件的投诉,又要求一次更改或取消事件,还要加上会员、保险或商务舱身份。此外,多个工作流通过舱位等级、保险覆盖与会员身份等变量共享状态。这种复杂度使通过工具级约束做穷尽式强制执行变得不切实际。政策明确警告「API 不做检查」取消或补偿资格,把智能体留成唯一的执行者。因为预订在写入之后仍保留其状态,多步组合(先升级再修改、先取消再重新预订)是可能的,而不同智能体对含糊规则的执行方式不同。

零售资格是二元的:每个工作流由单一状态字段把关(“pending” 或 “delivered”),没有跨工作流依赖。这种简单性使工具强制执行可行:零售工具嵌入 32 项政策级校验,并把订单移入阻断后续写入的终态,形成一次性设计,多步序列无法出现。政策缺口在文本中仍然存在,但工具在任何智能体行为能够分歧之前就把它们封住了。表 2 概括这些结构差异。总之,当政策复杂度超过工具所能强制执行的范围时,漏洞变得可利用,评测变得不可靠。

表 2:政策复杂度与工具强制执行共同决定漏洞是否可利用。简单政策可以编码进工具;复杂政策则不能,从而把智能体留成唯一的执行者。

因素子项航空零售
政策复杂度已编目漏洞152
政策复杂度条件从句(if)2413
政策复杂度析取资格规则20
政策复杂度跨工作流依赖密集极少
工具强制执行「API 不做检查」声明20
工具强制执行工具级输入校验1832
工具强制执行阻断后续操作的终态14
结果被触发的漏洞任务70

#### 来自 τ³-bench 修订的佐证

与本文同时,τ³-bench 的发布独立地识别并修订了全部七个受漏洞影响的任务;这些任务落在它改动的 29/50 个航空任务之中(按固定提交计数;见附录 F)。在独立选取的零假设下,全部 7 个碰巧都落在该集合内的概率为 1.6%(超几何分布,N=50,K=29,n=7)。重叠不仅是统计上的,也是术语上的:τ³ 明确的「政策漏洞预防」类别包含四个任务(13、29、32、45),四个全都在我们的七个之中。其余三个(任务 2、5、27)被 τ³ 归在「不正确的动作」或「含糊的用户指令」之下,这是对同一种底层「并非唯一正确」判断的不同顶层标签,而我们的漏洞/冲突分类把这一判断统一了起来。然而,每一处修复改的都是用户指令或金标准动作;政策本身保持不变,底层歧义仍然存在。对 L6 而言,不一致最为尖锐:τ³ 对共享同一条款的两个任务硬编码了相反的答案(任务 32:允许变通;任务 45:拒绝变通),每一处都通过逐任务的用户指令来解决,而不是用一条澄清规则。这些修复处理的是症状,不是病因:它们保护了七个具体任务,却把含糊条款原样留给未来的任务。通过用户指令而不是政策澄清来修补歧义,会迫使以后每一位标注者去逆向工程维护者的意图。一句澄清性的政策句子就能推广,且不会产生相互矛盾的标注(见附录 F)。

5 结论

政策规约的质量是评测质量的上限。本文引入一种两阶段审计,把主动式条款分析与反应式轨迹核验结合起来,以暴露政策缺口。在审计 τ²-bench 的两个领域后,我们发现两者都包含允许多种站得住脚解读的歧义,但只有航空任务出现分数下降。基于跨领域分析,我们认定:当政策复杂度超过工具所能强制执行的范围时,智能体对歧义的消解并不一致。这些发现表明,政策歧义不只是标注假象;它对过程性智能体评测的效度构成根本威胁。来自 τ³-bench 的证据进一步强化了这一结论。逐任务补丁让底层歧义保持不变,甚至可能制造相互矛盾的金标准答案,而政策层面的纠正一次性地消解歧义,并推广到所有受影响任务。基准开发者应在收集金标准标注之前先审计政策,分别报告受漏洞影响与不受漏洞影响的分数,并在政策确实规约不足之处接受多个有效结果。若不采取这些步骤,基准分数就有风险测到的是政策规约不足,而不是智能体能力。

局限性

我们的审计覆盖一个基准中的两个领域;跨领域对照加强了可推广性,但仍需要更多领域来确认所提出的两因素机制,因为在我们的数据中复杂度与强制执行是共同变化的。主动审计由人工智能辅助、但由人驱动;完全自动化的条款级分析可能有助于更大的政策文档。进一步扩大审计规模,将需要同时自动化漏洞检测与验证;多智能体大语言模型评判框架(Cao 等人,2025)为后者提供了一条可能的路径。合理性检验涉及主观判断,我们用明确标准加以缓解(附录 A)。漏洞严重程度既取决于政策结构,也取决于工具设计;未来工作应在更多领域与基准族上量化这一交互。我们的分类体系针对带嵌套条件的散文式政策;使用图结构标准作业程序或形式约束规约的基准,可能呈现不同的漏洞分布。

伦理考量

本工作审计的是一个公开发布的基准,其中的用户是合成的、环境是模拟的;它不涉及人类受试者、私人数据,也不部署人工智能系统。虽然我们的分类体系原则上可能有助于识别现实政策中可被利用的歧义,但我们所列举的具体漏洞来自一个合成基准,而我们建议的主要缓解措施(收紧政策规约)会直接缩小任何此类攻击面。我们的审计旨在提高评测质量,而不是使已部署系统中的政策缺口被利用。

人工智能辅助使用

生成式人工智能工具被用于在审计期间协助政策条款分析(识别供人工复核的候选歧义),以及语法修正与校对。所有漏洞分类、分类体系决策与分析性主张均来自作者;作者对所提交工作的内容与完整性负全部责任。

署名与许可

  • 原文:Hongliu Cao,Policy Loopholes in Agent Evaluation: When Policy Ambiguity Masquerades as Agent Error,arXiv:2609.14400v1,2026 年 9 月 13 日。链接:https://arxiv.org/abs/2609.14400
  • 许可:CC BY 4.0
  • 译者:智测团队
  • 参考文献列表从略。源文件未收录附录 A–F 正文,故未翻译、亦未补写。

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction