Industry & PracticeTechniques & Tutorials
工具 智能 体 评 测 审计: 子 串 判定 接近 偶然, 参数 错误 约 六成 传 到 错 答案
AgentProp-Bench 用 14,750 条轨迹审计自动评测。子串判定与人工的 κ 只有 0.049;三模型集成 0.432。参数错误传到错答案的校准概率约 0.62。拒绝和恢复互不相关。编造工具调用最多占 37.5%。

In this piece
审计工具型语言智能体的自动评测、错误传播与运行时缓解
Bhaskar Gurram(Zasti Inc.,美国弗吉尼亚州阿什本)。许可证:CC BY 4.0。arXiv:2604.16706,2026 年 8 月 10 日(v2;v1 为 2026 年 4 月 17 日)。
摘要
人们普遍假定,给会调用工具的大语言模型(LLM,按提示生成文字并调用外部接口的模型)智能体做自动评测是可靠的,但这个假定很少拿人的标注来核对。本文提出 AgentProp-Bench,一份诊断用基准:十三个 LLM 智能体(九个专有、四个开放权重)在四个领域上的 14,750 条执行轨迹(trajectory,一次任务里按时间记下的步骤)。用它审计三个问题。第一,用子串启发式判定智能体输出,和人的标注只在偶然水平一致(Cohen’s $\kappa{=}0.049$,对两名标注者各自如此)。Cohen’s $\kappa$(科恩卡帕)衡量两套判定有多一致:0 接近瞎猜,1 是完全一致。三个 LLM 的集成达到中等一致($\kappa{=}0.432$),单个 GPT-4o-mini 评判器其实最强($\kappa{=}0.567$);两名标注者之间几乎完全一致($\kappa{=}0.835$)。第二,在经过核验的判定下,参数级错误传到错误最终答案的、经人校准的概率约为 $0.62$,专有模型和开放权重模型上都重复出现;模型拒绝被污染输入的能力和从中恢复的能力统计上独立(Spearman $\rho{=}0.041$。Spearman $\rho$ 是秩相关,看两个排序是否一起升降)。第三,若干智能体会编造工具执行:声称拿到了从未真正调用工具得到的结果(最多占轨迹的 37.5%)。端到端分数看不见这种失败。一个轻量的运行时拦截器,在每个会调用工具的模型上都降低幻觉(最多 $-24$ 个百分点),并且存在一个可调、在开放权重模型上净收益为正的工作点。任务、轨迹、人工标签和代码全部放出。
1 引言
会用工具的 LLM 智能体,把自然语言问题变成结构化的 API 调用,执行这些调用,再把结果合成最终答案(Yao et al., 2023; Schick et al., 2023; Qin et al., 2024; Patil et al., 2024)。这类智能体从演示走进已部署的语言技术之后,一个实际问题变得紧迫:怎么知道智能体是对的?实践中,答案被交给自动正确性指标:对照参考答案做子串或关键词匹配,以及越来越多地让一个 LLM 去评判另一个 LLM(Zheng et al., 2023; Liu et al., 2023; Kim et al., 2024)。这些指标给模型排名、度量稳健性、推动部署决定,却很少拿它们声称在近似的人类判断来核验。
这关系到评测的根基。效果测量是否可靠,取决于它的判定是否可靠(Cleverdon, 1967; Voorhees, 2000)。标注者之间的一致性,长期以来是自然语言处理评测里信任的通货(Artstein and Poesio, 2008; Card et al., 2020)。新的是被判定的对象:不再是短文本片段,而是多步流水线产出的、不确定的、语义复杂的产物。子串启发式假定输出和参考之间有稳定的字面对应。工具返回的是改写、重排格式或部分正确的内容时,这个假定正好失败。近期研究警告,LLM 评判器可以偏离人类评估者,或相对人类被操纵(Chiang and Lee, 2023; Alaofi et al., 2024)。评测仪器本身无效,关于工具型智能体的一切下游结论就从根上坏了。
传播把赌注又加大了。工具型智能体是一条流水线,早一步的错误可以静静地变成一个自信但错误的最终答案。本文关心两种失败。智能体可能接受并继续传递被污染的输入;更隐蔽的是,智能体可能编造工具执行:声称调用了工具、拿到了结果,但那次调用根本没发生。后者是一种单独的幻觉模式(Ji et al., 2023; Min et al., 2023; Huang et al., 2025),端到端正确性分数检测不到,必须给流水线装仪器,而不是只给输出打分。
本文提出诊断基准 AgentProp-Bench,研究围绕三个问题。RQ1(指标有效性):自动正确性指标和人对工具智能体输出的判断有多一致,由此造成的测量误差有多大?RQ2(传播):参数级错误到达错误答案的概率是多少,拒绝错误和从错误中恢复是一个维度还是两个?RQ3(缓解):在同期对照下,运行时拦截能不能降低下游错误,对哪些模型有效?贡献如下。
- 一次经过核验的审计:子串判定智能体输出处于偶然水平($\kappa{=}0.049$,两名标注者上都如此),三 LLM 集成只达到中等;传播结论对选用哪一个经过核验的评判器不变(第 5 节)。
- 按阶段的传播测量:在十三个模型上,参数错误到达错误答案的、经人校准的概率约为 $0.62$;拒绝和恢复统计上独立(第 6–7 节)。
- 对编造工具使用的刻画(最多 37.5% 的轨迹)。它伪装成稳健。一个运行时拦截器在所有会调用工具的模型上降低幻觉,在可调工作点上净收益为正(第 8–9 节)。
- 放出的基准:2,000 道任务、14,750 条轨迹、100 条人工标签(两名标注者)和分析代码。
2 相关工作
用 LLM 当评判器,以及评测有效性
用 LLM 评判生成文本已经很普遍(Zheng et al., 2023; Liu et al., 2023; Kim et al., 2024),可靠性仍有争议:Chiang and Lee (2023) 问 LLM 判断能否代替人;Bavaresco et al. (2024) 报告任务之间差异很大;Alaofi et al. (2024) 表明评判器可以被骗。检索评测里同样的争论还在进行(Faggioli et al., 2023; Thomas et al., 2024)。越来越多的评测方法工作表明,常用的自动指标和规程会误导:Opitz (2024) 发现换指标可以翻转排名;Mizrahi et al. (2024) 表明单提示评测得到不稳定的结论;Adlakha et al. (2024) 对照人的判断审计指令遵循问答的正确性指标;Chhun et al. (2024) 探查 LLM 评判器的有效性。本文将这条线延伸到工具型智能体:在这一设定下,第一次把集成评判器端到端地对照人工标注做核验,并表明传播结论不依赖于评判器。
工具型智能体及其评测
调用外部工具的智能体(Yao et al., 2023; Schick et al., 2023; Patil et al., 2024; Qin et al., 2024)由报告端到端任务完成的基准来评测(Yao et al., 2024; Liu et al., 2024; Yan et al., 2025)。这些基准给一个正确性数字,不定位失败从哪来、怎么传下去。最接近的是 Liu et al. (2026),事后把自然发生的幻觉归到流水线阶段。本文改为用受控注入从因果上测量传播,拿人工标签核验评测仪器,并在同期对照下评测一种运行时缓解。沙箱里的智能体风险仿真(Ruan et al., 2024)和运行时强制(Wang and others, 2026)与本文互补。
幻觉与缓解
幻觉在生成任务上已有综述(Ji et al., 2023; Huang et al., 2025);智能体特有的模式还加上参数错误和工具输出错误(Zhang et al., 2025)。本文把编造的工具使用看成来源失败(Simmhan et al., 2005):智能体断言了一条从未存在的数据谱系。缓解办法包括自洽(Wang et al., 2023)、自我修正(Madaan et al., 2023)、SelfCheckGPT(Manakul et al., 2023)和语义熵(Farquhar et al., 2024)。与基于采样的方法不同,本文的拦截器和单次执行并行,代价可忽略。
3 AgentProp-Bench 基准
任务设计
每道任务是一个元组 $(q,D,T_{q},a^{\star})$:问题 $q$、领域 $D$、可用工具集 $T_{q}$、参考答案 $a^{\star}$。难度分三档:易(一次工具调用)、中(两条工具链)、难(三条工具链或分支)。任务和参考由领域专用的 API 模拟器生成,再人工核对。AgentProp-Bench 有日历、天气、医疗和知识(消融)四个领域共 2,000 道任务,另加 300 道留出的零售任务。表 1 给出分解。每个领域提供 3–5 个工具,实现为确定性的 Python 函数,带 JSON 模式:校验输入、返回结构化响应,因此参数级注入的效果可以在工具输出里看到。
表 1:AgentProp-Bench 的数据构成。核心任务 2,000 道,跨四个领域,另加 300 道留出的零售任务。难度反映所需的工具链长度和推理深度。
| 领域 | 任务数 | 易 | 中 | 难 |
|---|---|---|---|---|
| 日历 | 667 | 192 | 282 | 193 |
| 天气 | 674 | 215 | 248 | 211 |
| 医疗 | 559 | 106 | 237 | 216 |
| 知识 | 100 | 0 | 46 | 54 |
| 零售(留出) | 300 | — | — | — |
错误注入规程
使用 P2 语义错误规程:在智能体第一次工具调用执行之前,把一个语义上关键的参数换成不正确但仍然符合模式的值。问伦敦天气时,城市参数可能被换成曼彻斯特:是合法城市,但是错的那一个。注入发生在参数生成阶段。因为工具按模式校验,效果在下游可以观察到。
轨迹采集
轨迹来自九个专有模型(GPT-4o、GPT-4o-mini、GPT-4.1-mini、GPT-4.1-nano、GPT-3.5-turbo、o3-mini、Gemini-2.0-Flash、Gemini-2.5-Flash、DeepSeek-V3)和四个开放权重模型,分属两个家族(Qwen2.5 的 3B/7B/14B,以及 Hermes-3-Llama-3.1-8B)。后者用 vLLM 在本地提供服务,套同一套提示式 ReAct 框架(ReAct,一边推理一边行动的提示格式),温度为 0。语义错误条件下,六个主要专有模型和全部四个开放权重模型各评 200 道任务,三个前沿专有模型各评 50 道:语义错误轨迹共 2,150 条。加上全部四种注入类型和拦截器实验,放出的基准共 14,750 条轨迹。
人工校准
使用这套仪器之前先核验它。两名标注者独立标注分层抽到的 100 条 P2 轨迹(每个专有模型 10–12 条,三个领域),标成正确或不正确。彼此看不见,也看不见任何自动裁定。沿用标注一致性传统(Artstein and Poesio, 2008),一致程度为 Cohen’s $\kappa{=}0.835$(原始一致率 92%),按 Landis and Koch (1977) 属于几乎完全一致,因此这些标签可以作为可靠参考。因为集成评判器偏向保守,另外用这些标签估计的条件概率报告经人校准的比率:$\mathbb{P}(\text{人判正确}\mid\text{集成判正确}){=}0.76$,$\mathbb{P}(\text{人判正确}\mid\text{集成判错误}){=}0.25$。
4 方法
评判规程
比较三种正确性指标。子串启发式:参考答案的前 20 个字符出现在回答的前 200 个字符里,或者参考答案里任一内容词(超过 3 个字符)出现在回答里,就标为正确。这模仿智能体基准里的常见做法。三 LLM 集成:GPT-4o、Gemini-2.5-Flash、GPT-4o-mini 用同一句提示做多数表决(2/3)。提示是:“若智能体的回答在实质上与参考一致,回答 yes,否则 no。”人工标注用同一标准。每个指标对照人的参考,用 Cohen’s $\kappa$ 打分(Cohen, 1960)。
阶段指示
三个指示来自彼此独立的数据列。$S_{1}{=}\mathbf{1}[\mathrm{EPS}{\geq}1]$:注入已经加到计划中的工具调用上。$S_{2}{=}\mathbf{1}[\mathrm{EPS}{\geq}2]$:改过的调用已经执行,并且有可观察的效果。$S_{3}{=}\mathbf{1}[\text{ensemble\_correct}{=}\textsc{false}]$:最终答案是错的。$S_{1}$、$S_{2}$ 只来自执行评分列 $\mathrm{EPS}$,$S_{3}$ 只来自答案级评判器,因此没有一个指示去读另一个指示的列。报告阶段到达概率 $p_{k}{=}\mathbb{P}[S_{k}{=}1]$、跳步条件率 $r_{k,k+1}{=}\mathbb{P}[S_{k+1}{=}1\mid S_{k}{=}1]$,以及从注入到错误的比率 $\mathbb{P}[S_{3}{=}1\mid S_{1}{=}1]$。
拒绝与恢复的分解
把稳健性拆成拒绝和恢复。拒绝是 $1{-}p_{S_{1}}$:在执行阶段被拒掉的注入所占比例。恢复是 $1{-}r_{2,3}$:已经执行的注入里,最终仍然答对的比例。在十三个模型上用 Spearman 相关检验二者是否独立。
运行时拦截器
拦截器并行跑三层。L1 统计模式校验错误和工具错误,超过阈值就弃权(abstention,系统拒绝给出答案)。L2 在思维链里扫描不确定关键词:error、invalid、unknown、missing、incorrect、wrong、cannot。L3 检查最终答案是否断言了任何观察都不支持的数值。它和智能体同时跑,并用同期的无拦截对照:两条臂对每个模型跑同样的任务,唯一差别是拦截器开没开。
统计规程
所有置信区间都是 95% 自助法区间(bootstrap,有放回地反复抽样来估计区间;1,000 次,种子 42)。两个比例的比较用 Cohen’s $h$ 作为效应量。开放权重运行在单张 L40S GPU 上,每个模型用 vLLM、同一套框架提供服务。
5 指标有效性(RQ1)
表 2 和图 1 报告每个指标与两名标注者的一致性。子串启发式对两者都在偶然水平($\kappa{=}0.049$ 和 $0.015$;在 92 条达成共识的轨迹上为 $0.036$),所以这个标题对选哪名标注者不敏感。三个单独的 LLM 评判器达到 $\kappa{=}0.24$–$0.40$,集成达到中等一致($\kappa{=}0.432$),单个 GPT-4o-mini 最强($\kappa{=}0.567$)。集成大约比启发式离人工标注近 $9$ 倍。
表 2:每种正确性指标相对两名人工标注者(A1、A2)及其 92 条共识的 Cohen’s $\kappa$($n{=}100$;标注者之间 $\kappa{=}0.835$)。子串启发式对两者都在偶然水平;GPT-4o-mini 是最强的单个评判器;集成仍作为主评判器保留(第 5 节)。
| 正确性指标 | 对 A1 | 对 A2 | 对共识 |
|---|---|---|---|
| 子串启发式 | 0.049 | 0.015 | 0.036 |
| GPT-4o(单个) | 0.336 | 0.244 | 0.324 |
| Gemini-2.5-Flash(单个) | 0.379 | 0.347 | 0.399 |
| GPT-4o-mini(单个) | 0.567 | 0.501 | 0.586 |
| 三 LLM 集成 | 0.432 | 0.383 | 0.448 |
图 1:每种正确性指标相对两名人工标注者及其共识的 Cohen’s $\kappa$。子串启发式落在偶然线上;集成和 GPT-4o-mini 达到中等一致。
保守偏差
表 3 是集成相对人工标签的混淆矩阵。集成把 25% 的轨迹标成正确,人标成正确的是 38%。主要分歧是集成拒绝了人接受的答案。因此集成判定的正确率把真实正确率低估约 $13$ 个百分点。上面的经人校准比率用来校正这一点。
表 3:集成评判器相对人工标签的混淆矩阵(轨迹条数,$n{=}100$)。集成标出 25 条正确,人标出 38 条;错误主要是拒绝了人接受的答案(19 格)。Cohen’s $\kappa$ 见表 2。
| 人工正确 | 人工不正确 | 合计 | |
|---|---|---|---|
| 集成判定正确 | 19 | 6 | 25 |
| 集成判定不正确 | 19 | 56 | 75 |
| 合计 | 38 | 62 | 100 |
为什么用集成,以及为什么这不要紧
在这 100 条标签上,单独的 GPT-4o-mini 比集成分数更高,但差距落在重叠的自助法置信区间里。单个评判器更容易有自我增强偏差。挑一个在校准所用标签上把一致性拉到最大的评判器,会过拟合这些标签。关键的是,只用 GPT-4o-mini 重算传播率,结论不变(第 6 节)。因此仍把集成当作主评判器,并在原始比率旁边报告经人校准的比率。
6 错误传播(RQ2)
表 4 报告 2,150 条语义错误轨迹上、每个模型的阶段到达率和跳步条件率。图 2 画出阶段到达率。从执行到错误答案的、按轨迹合并的跳步率是 $r_{2,3}{=}0.80$(第二阶段 271 条里的 217 条)。经人校准后,合并率为约 $0.65$。把十三个模型各自的估计平均,得到标题数字 $r_{2,3}{\approx}0.62$(模型范围 0.46–0.73)。边际的注入到错误率 $\mathbb{P}[S_{3}{=}1\mid S_{1}{=}1]$ 在集成下为 0.57–0.90,校准后为 0.53–0.70。它更稳,因为它算在更大的 $S_{1}{=}1$ 子集上。
表 4:语义错误注入下的传播阶段到达率与跳步率。$S_{1}$:$\varepsilon{\geq}1$;$S_{2}$:$\varepsilon{\geq}2$;$S_{3}$:集成判定为不正确。$r_{12}{=}P(S_{2}|S_{1})$,$r_{23}{=}P(S_{3}|S_{2})$,$P(S_{3}|S_{1})$ 是端到端传播。表中为点估计;95% 自助法置信区间($B{=}1{,}000$)在正文中报告,并随数据放出。
| 模型 | $n$ | $S_{1}$% | $S_{2}$% | $S_{3}$% | $r_{12}$ | $n_{S_{2}}$ | $r_{23}$ | $P(S_{3}\ | S_{1})$ |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek-V3 | 200 | 52.0 | 7.0 | 62.5 | 0.13 | 14 | 0.43 | 0.57 | |
| GPT-3.5-Turbo | 200 | 37.5 | 9.5 | 67.5 | 0.25 | 19 | 0.74 | 0.76 | |
| GPT-4.1-mini | 200 | 50.5 | 10.5 | 65.5 | 0.21 | 21 | 0.67 | 0.66 | |
| GPT-4.1-nano | 200 | 62.5 | 17.5 | 84.5 | 0.28 | 35 | 0.97 | 0.83 | |
| GPT-4o | 50 | 74.0 | 22.0 | 74.0 | 0.30 | 11 | 0.82 | 0.68 | |
| GPT-4o-mini | 200 | 40.0 | 22.5 | 71.0 | 0.56 | 45 | 0.84 | 0.84 | |
| Gemini-2.0-Flash | 200 | 5.0 | 1.0 | 67.0 | 0.20 | 2 | 0.50 | 0.90 | |
| Gemini-2.5-Flash | 50 | 50.0 | 6.0 | 76.0 | 0.12 | 3 | 0.67 | 0.84 | |
| Qwen2.5-14B | 200 | 42.5 | 9.5 | 62.5 | 0.22 | 19 | 0.89 | 0.65 | |
| Qwen2.5-3B | 200 | 49.5 | 14.0 | 82.5 | 0.28 | 28 | 0.86 | 0.74 | |
| Qwen2.5-7B | 200 | 73.0 | 28.0 | 71.5 | 0.38 | 56 | 0.80 | 0.63 | |
| Hermes-3-Llama-8B | 200 | 27.0 | 5.0 | 62.0 | 0.19 | 10 | 0.80 | 0.67 | |
| o3-mini | 50 | 74.0 | 16.0 | 70.0 | 0.22 | 8 | 0.63 | 0.76 |
图 2:P2 语义错误注入下、每个模型的阶段到达率(集成判定)。$S_{1}$ 注入已施加,$S_{2}$ 执行效果可见,$S_{3}$ 最终答案错误。阶段指示彼此独立计算。
对评判器的稳健性
只用 GPT-4o-mini 重算 $S_{3}$,合并的注入到错误率为 0.61,$r_{2,3}{=}0.74$;集成下是 0.71 和 0.80。GPT-4o-mini 没那么保守(它把 43% 的轨迹标成正确,接近人的 38%),所以它未校准的估计基本上和经人校准的集成数字重合。实质结论两边都成立:传播幅度大约在 0.6–0.8,取决于评判器。
基线与注入后的正确率
表 5 在同一集成下对照基线和 P2 正确率。在注入确实施加的条件下,大多数模型的 P2 正确率低于基线(例如 GPT-4o-mini 从 24.4% 到 16.2%;o3-mini 从 36.0% 到 24.3%)。注入让任务更难,方向符合预期。
表 5:每个模型的基线正确率与 P2(语义错误注入)正确率。P2 由三 LLM 集成判定,基线由启发式匹配判定。95% 置信区间来自 1,000 次非参数自助法。
| 模型 | $n_{\mathrm{BL}}$ | 基线% | 95% 区间 | $n_{\mathrm{P2}}$ | P2% | 95% 区间 | 启发式% |
|---|---|---|---|---|---|---|---|
| DeepSeek-V3 | 450 | 51.8 | [46.7, 56.4] | 200 | 37.5 | [31.0, 44.0] | 70.5 |
| GPT-3.5-Turbo | 450 | 50.4 | [45.8, 54.9] | 200 | 32.5 | [26.5, 39.5] | 67.5 |
| GPT-4.1-mini | 450 | 54.7 | [50.2, 59.3] | 200 | 34.5 | [28.5, 41.5] | 70.0 |
| GPT-4.1-nano | 450 | 45.3 | [40.4, 50.0] | 200 | 15.5 | [10.5, 21.0] | 67.5 |
| GPT-4o | — | — | — | 50 | 26.0 | [14.0, 38.0] | 62.0 |
| GPT-4o-mini | 450 | 40.0 | [35.3, 44.4] | 200 | 29.0 | [23.0, 35.5] | 49.0 |
| Gemini-2.0-Flash | 450 | 47.6 | [42.7, 52.2] | 200 | 33.0 | [27.0, 39.5] | 61.0 |
| Gemini-2.5-Flash | — | — | — | 50 | 24.0 | [14.0, 36.0] | 64.0 |
| Qwen2.5-14B | 450 | 55.6 | [51.3, 60.0] | 200 | 37.5 | [30.5, 44.5] | 70.5 |
| Qwen2.5-3B | 450 | 54.2 | [49.6, 58.7] | 200 | 17.5 | [12.0, 23.0] | 67.5 |
| Qwen2.5-7B | 450 | 49.1 | [44.2, 53.8] | 200 | 28.5 | [22.0, 34.5] | 57.0 |
| Hermes-3-Llama-8B | 450 | 58.2 | [53.8, 62.2] | 200 | 38.0 | [31.0, 44.5] | 71.5 |
| o3-mini | 50 | 40.0 | [28.0, 54.0] | 50 | 30.0 | [18.0, 42.0] | 54.0 |
7 稳健性是二维的
在十三个模型上,拒绝率和恢复率统计上独立(Spearman $\rho{=}0.041$,$p{=}0.893$;表 6、图 3)。能把被污染输入滤掉的模型,并不更可能在它放进来的被污染输入上推理正确。例如 GPT-4.1-nano 把中等拒绝(37.5%)和接近于零的恢复(2.9%)配在一起;Gemini-2.0-Flash 看起来拒绝率极高,原因见下一节。输入过滤和输出推理是结构上不同的控制,一个“稳健性分数”把它们混在一起,应当避免。
表 6:每个模型的拒绝率($1{-}P(S_{1})$)与恢复率($1{-}r_{23}$)。Spearman $\rho{=}0.041$,$p{=}0.893$($n{=}13$):拒绝被注入的错误,和从已经传开的错误里恢复,没有显著的单调关系。
| 模型 | 拒绝% | 恢复% |
|---|---|---|
| DeepSeek-V3 | 48.0 | 57.1 |
| GPT-3.5-Turbo | 62.5 | 26.3 |
| GPT-4.1-mini | 49.5 | 33.3 |
| GPT-4.1-nano | 37.5 | 2.9 |
| GPT-4o | 26.0 | 18.2 |
| GPT-4o-mini | 60.0 | 15.6 |
| Gemini-2.0-Flash | 95.0 | 50.0 |
| Gemini-2.5-Flash | 50.0 | 33.3 |
| Qwen2.5-14B | 57.5 | 10.5 |
| Qwen2.5-3B | 50.5 | 14.3 |
| Qwen2.5-7B | 27.0 | 19.6 |
| Hermes-3-Llama-8B | 73.0 | 20.0 |
| o3-mini | 26.0 | 37.5 |
图 3:十三个模型的拒绝($1{-}p_{S_{1}}$)对恢复($1{-}r_{2,3}$)。点的大小正比于 $n_{S_{2}}$。两轴统计上独立(Spearman $\rho{=}0.041$)。
8 编造的工具使用(RQ3a)
参数级注入只有在智能体真的发出可解析的工具调用时才能施加。因此按模型测量工具调用率;在没有工具调用的轨迹里,再测最终答案仍然声称完成了由工具得到的结果的比例。这种行为称为编造的工具使用。例如说“我已经取回了天气……”,但没有调用任何工具。分类器经手工裁定 40 条被标出的轨迹,精确率 92.5%(37/40)。表 7 显示,工具调用的遵守程度相差超过一个数量级:GPT-4o 和 GPT-4.1-nano 在 99–100% 的轨迹里调用工具;Gemini-2.0-Flash 只有 5%,编造占 37.5%;GPT-4o-mini 调用工具的比例是 40%,编造 12%。
表 7:P2 语义错误轨迹上的工具调用率与编造工具使用率。低调用率可以伪装成高“拒绝”。
| 模型 | 工具调用% | 编造% |
|---|---|---|
| GPT-4o | 100.0 | 0.0 |
| GPT-4.1-nano | 99.0 | 0.5 |
| o3-mini | 88.0 | 8.0 |
| DeepSeek-V3 | 86.0 | 7.0 |
| GPT-4.1-mini | 85.0 | 12.0 |
| Gemini-2.5-Flash | 76.0 | 16.0 |
| GPT-3.5-turbo | 59.5 | 14.5 |
| GPT-4o-mini | 40.0 | 12.0 |
| Gemini-2.0-Flash | 5.0 | 37.5 |
| Qwen2.5-7B | 99.5 | — |
| Qwen2.5-3B | 70.0 | — |
| Qwen2.5-14B | 61.0 | — |
| Hermes-3-Llama-8B | 37.0 | — |
这有两个后果。第一,不要把低的注入接纳率读成稳健:Gemini-2.0-Flash 表面上 95% 的拒绝,主要是没有调用或编造了工具调用,不是在过滤参数。第二,这解释了下面的拦截器结果:校验工具调用的监视器,只在模型发出调用时才起作用。编造的工具使用本身是一种幻觉模式,端到端分数和子串评判都浮不出它。
错误分析
手工查看第二阶段轨迹,看到三类。(i)传播级联,这是主要失败:注入后的调用 get_weather(city="Manchester") 执行了,智能体把曼彻斯特的天气当成伦敦来报告。这是一条 $S_{1}{\to}S_{2}{\to}S_{3}$ 的链,看不出不确定。(ii)拒绝:智能体注意到不匹配,重新发出改正后的调用。(iii)编造:智能体写出“我取回了伦敦的天气:晴,18°”,但没有工具调用。三类分别对齐恢复、拒绝和工具调用这几条轴。
推广到开放权重模型
两个家族的四个开放权重模型重复了传播效应。Qwen2.5-3B/7B/14B 和 Hermes-3-Llama-8B 的注入到错误率是 0.74、0.63、0.65 和 0.67,落在专有模型的范围内,也和校准后的约 $0.62$ 一致。因此传播不是专有 API 的产物。另外两个开放家族(Mistral-7B-v0.2、Phi-3.5-mini)不能稳定地发出工具调用(21.5% 和 0%),只作为规程遵守的观察报告,不打分。
9 运行时拦截(RQ3b)
表 8 和图 4 报告五个模型上的同期对照实验。拦截器在每个会调用工具的模型上都降低幻觉,置信区间都不含零:GPT-4o-mini($-23.0$ 个百分点)、Qwen2.5-7B($-24.0$ 个百分点)、Qwen2.5-14B($-8.0$ 个百分点)、Hermes-3-Llama-8B($-4.0$ 个百分点)。降幅最大的是一个开放权重模型,与最好的专有结果相当。唯一的空结果是 Gemini-2.0-Flash($-1.3$ 个百分点),正好是几乎不发出可注入工具调用的模型。空结果由机制预言,说明拦截器作用在执行拦截点,而不是作用在答案内容上。
表 8:拦截器的同期对照实验(五个模型)。对照/拦截:没有/有拦截器时的幻觉百分比;$\Delta$:降幅;弃权%:弃权比例;拦住:幻觉被正确弃权的条数;误伤:正确答案被错误弃权的条数。四个会调用工具的模型上都有下降;Gemini-2.0-Flash 的空结果来自它几乎不发出工具调用。
| 模型 | 对照% | 拦截% | $\Delta$ | 弃权% | 拦住 | 误伤 |
|---|---|---|---|---|---|---|
| GPT-4o-mini | 55.8 | 32.8 | $-23.0$ | 33.5 | 133 | 68 |
| Gemini-2.0-Flash | 44.5 | 43.2 | $-1.3$ | 2.8 | 16 | 1 |
| Qwen2.5-7B | 55.3 | 31.3 | $-24.0$ | 55.3 | 75 | 91 |
| Qwen2.5-14B | 45.0 | 37.0 | $-8.0$ | 27.0 | 24 | 57 |
| Hermes-3-Llama-8B | 43.0 | 39.0 | $-4.0$ | 13.3 | 16 | 24 |
图 4:同期对照下,五个模型有无拦截器时的幻觉率。四个会调用工具的模型都下降;Gemini-2.0-Flash 的空结果来自它几乎不发出工具调用。
一个可调、净收益为正的工作点
拦截器的阈值画出一条精确率/覆盖率前沿。默认的三层阈值把降幅放到最大;把弃权限制在模式层,则把精确率放到最大。在 Qwen2.5-7B 上,这给出一个净收益为正的工作点:下降 $13.3$ 个百分点,弃权精确率 0.62(抓住 39 条幻觉,扣下 24 条正确答案),与 GPT-4o-mini 相当。在 Hermes-3-Llama-8B 上,下降 $4.0$ 个百分点,精确率 0.62。两者都是严格的同期对照测量。操作者应按模型选工作点:工具调用强的用高精确率,弱的用高覆盖率。
10 讨论
智能体输出的自动评测必须核验,不能假定。占主导的启发式不比偶然好,在注入轨迹上把正确性多算了 34 个百分点,足够把基线对扰动的比较方向翻过来。即便经过核验的集成也只是中等。使用 LLM 评判器的研究应当报告相对人工标签的一致性、偏差方向和校准后的估计,这呼应了自然语言处理评测里对统计严格性的要求(Card et al., 2020)。稳健性至少是二维的(拒绝与恢复正交),第三条轴必须先测:模型到底会不会可靠地调用工具。因为编造的工具使用伪装成稳健,答案级打分看不见它。运行时拦截器表明,一个轻量的、单遍的监视器,可以把这些沉默失败里相当一部分变成明确的弃权。专有模型和开放权重模型都如此,工作点由部署者控制。
11 局限
集成评判器偏向保守:四个“错误”裁定里有一个是人判正确的假阴性。在 100 条、两名背景相近的标注者的标签上做校准,减轻了但没有消除这一点。更大、更多样的标注者群体是后续工作。每个模型的第二阶段子样本从 2 条到 56 条,因此强调合并的和边际的汇总,把最小的逐模型比率只当作方向。拦截器两条臂之间的差值对共享的评判偏差是稳健的,但每条臂的绝对比率没有人工标签核验。工具对着确定性模拟器执行,不是对着线上 API。每条轨迹只注入一个参数。多参数和多轮传播仍然开放。
12 伦理
这项工作研究评测可靠性。除两名标注者给模型输出打标签外,没有人类受试者,也不使用个人或敏感数据。把编造的工具使用摆出来,是为了提高已部署智能体的可信程度。放出代码、任务、轨迹和标签以支持复现。放出的产物不含私人信息。
13 结论
本文引入 AgentProp-Bench,并用它表明:对工具智能体输出做自动子串评测不比偶然好;经过核验的集成只达到中等;参数错误传到错误答案的校准概率约为 $0.62$,专有模型和开放权重模型都如此;拒绝和恢复相互独立;若干模型编造工具使用;运行时拦截器在所有会调用工具的模型上降低幻觉,工作点可调且净收益可以为正。全部产物已放出。
致谢
作者感谢 Yoshitha Challagulla 独立标注了用于标注者一致性分析的 100 条轨迹子集。全部代码、2,000 道任务、14,750 条执行轨迹和 100 条人工标签公开于 https://github.com/bhaskargurram-ai/agenthallu-bench 。
参考文献
- Adlakha et al. (2024). Evaluating correctness and faithfulness of instruction-following models for question answering. TACL 12, pp. 681–699.
- Alaofi et al. (2024). LLMs can be fooled into labelling a document as relevant. SIGIR-AP.
- Artstein and Poesio (2008). Inter-coder agreement for computational linguistics. Computational Linguistics 34(4), pp. 555–596.
- Bavaresco et al. (2024). LLMs instead of human judges? a large scale empirical study across 20 NLP evaluation tasks. ACL.
- Card et al. (2020). With little power comes great responsibility. EMNLP.
- Chhun et al. (2024). Do language models enjoy their own stories? prompting large language models for automatic story evaluation. TACL 12, pp. 1122–1142.
- Chiang and Lee (2023). Can large language models be an alternative to human evaluations? ACL.
- Cleverdon (1967). The cranfield tests on index language devices. Aslib Proceedings 19(6), pp. 173–194.
- Cohen (1960). A coefficient of agreement for nominal scales. Educational and Psychological Measurement 20(1), pp. 37–46.
- Faggioli et al. (2023). Perspectives on large language models for relevance judgment. ICTIR, pp. 39–50.
- Farquhar et al. (2024). Semantic entropy for detecting confabulations in large language models. Nature 630, pp. 625–630.
- Huang et al. (2025). A survey on hallucination in large language models. ACM TOIS 43(2).
- Ji et al. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys 55(12).
- Kim et al. (2024). Prometheus: inducing fine-grained evaluation capability in language models. ICLR.
- Landis and Koch (1977). The measurement of observer agreement for categorical data. Biometrics 33(1), pp. 159–174.
- Liu et al. (2024). AgentBench: evaluating LLMs as agents. ICLR.
- Liu et al. (2026). AgentHallu: benchmarking automated hallucination attribution of LLM-based agents. Preprint.
- Liu et al. (2023). G-Eval: NLG evaluation using GPT-4 with better human alignment. EMNLP.
- Madaan et al. (2023). Self-refine: iterative refinement with self-feedback. NeurIPS.
- Manakul et al. (2023). SelfCheckGPT: zero-resource black-box hallucination detection for generative large language models. EMNLP.
- Min et al. (2023). FActScore: fine-grained atomic evaluation of factual precision in long form text generation. EMNLP.
- Mizrahi et al. (2024). State of what art? a call for multi-prompt LLM evaluation. TACL 12, pp. 933–949.
- Opitz (2024). A closer look at classification evaluation metrics and a critical reflection of common evaluation practice. TACL 12, pp. 820–836.
- Patil et al. (2024). Gorilla: large language model connected with massive APIs. NeurIPS.
- Qin et al. (2024). ToolLLM: facilitating large language models to master 16000+ real-world APIs. ICLR.
- Ruan et al. (2024). Identifying the risks of LM agents with an LM-emulated sandbox. ICLR.
- Schick et al. (2023). Toolformer: language models can teach themselves to use tools. NeurIPS.
- Simmhan et al. (2005). A survey of data provenance in e-science. ACM SIGMOD Record 34(3), pp. 31–36.
- Thomas et al. (2024). Large language models can accurately predict searcher preferences. SIGIR.
- Voorhees (2000). Variations in relevance judgments and the measurement of retrieval effectiveness. Information Processing & Management 36(5), pp. 697–716.
- Wang et al. (2026). AgentSpec: customizable runtime enforcement for safe and reliable LLM agents. ICSE.
- Wang et al. (2023). Self-consistency improves chain of thought reasoning in language models. ICLR.
- Yan et al. (2025). The Berkeley function calling leaderboard (BFCL). ICML.
- Yao et al. (2024). $\tau$-Bench: a benchmark for tool-agent-user interaction in real-world domains. Preprint.
- Yao et al. (2023). ReAct: synergizing reasoning and acting in language models. ICLR.
- Zhang et al. (2025). A survey on the memory mechanism of large language model-based agents. ACM TOIS.
- Zheng et al. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. NeurIPS.
附录 A 标注规程
两名标注者独立标注 100 条分层的 P2 轨迹(九个专有模型、三个领域),对照参考答案把智能体的最终回答标成正确或不正确。指引与集成评判器的提示相同:“只要与参考匹配的核心事实在场且正确,就接受措辞上的小差别和额外解释;关键值错误、缺失或没有依据,则标为不正确。”标注者彼此看不见,也看不见任何自动裁定。标注者之间的 Cohen’s $\kappa{=}0.835$(原始一致率 92%)。
附录 B 评判提示与校准
每个集成评判器收到的提示是:“你在评估一个 AI 智能体的回答。若智能体的回答在实质上与参考一致,回答 yes,否则 no。只要核心事实正确,就接受措辞上的小差别。”多数表决(2/3)是集成裁定。人工校准使用 $\mathbb{P}(\text{人判正确}\mid\text{集成判正确}){=}0.76$ 和 $\mathbb{P}(\text{人判正确}\mid\text{集成判错误}){=}0.25$,来自这 100 条标签。
出处:Bhaskar Gurram,Auditing Automated Evaluation, Error Propagation, and Runtime Mitigation in Tool-Using Language Agents,2026-08-10,https://arxiv.org/abs/2604.16706,CC BY 4.0。
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.