CodexQA

行业与实践方法与教程

工具智能体评测审计:子串判定接近偶然,参数错误约六成传到错答案

CodexQA 团队阅读约 23 分钟

AgentProp-Bench 用 14,750 条轨迹审计自动评测。子串判定与人工的 κ 只有 0.049;三模型集成 0.432。参数错误传到错答案的校准概率约 0.62。拒绝和恢复互不相关。编造工具调用最多占 37.5%。

本文目录

审计工具型语言智能体的自动评测、错误传播与运行时缓解

Bhaskar Gurram(Zasti Inc.,美国弗吉尼亚州阿什本)。许可证:CC BY 4.0。arXiv:2604.16706,2026 年 8 月 10 日(v2;v1 为 2026 年 4 月 17 日)。

摘要

人们普遍假定,给会调用工具的大语言模型(LLM,按提示生成文字并调用外部接口的模型)智能体做自动评测是可靠的,但这个假定很少拿人的标注来核对。本文提出 AgentProp-Bench,一份诊断用基准:十三个 LLM 智能体(九个专有、四个开放权重)在四个领域上的 14,750 条执行轨迹(trajectory,一次任务里按时间记下的步骤)。用它审计三个问题。第一,用子串启发式判定智能体输出,和人的标注只在偶然水平一致(Cohen’s $\kappa{=}0.049$,对两名标注者各自如此)。Cohen’s $\kappa$(科恩卡帕)衡量两套判定有多一致:0 接近瞎猜,1 是完全一致。三个 LLM 的集成达到中等一致($\kappa{=}0.432$),单个 GPT-4o-mini 评判器其实最强($\kappa{=}0.567$);两名标注者之间几乎完全一致($\kappa{=}0.835$)。第二,在经过核验的判定下,参数级错误传到错误最终答案的、经人校准的概率约为 $0.62$,专有模型和开放权重模型上都重复出现;模型拒绝被污染输入的能力和从中恢复的能力统计上独立(Spearman $\rho{=}0.041$。Spearman $\rho$ 是秩相关,看两个排序是否一起升降)。第三,若干智能体会编造工具执行:声称拿到了从未真正调用工具得到的结果(最多占轨迹的 37.5%)。端到端分数看不见这种失败。一个轻量的运行时拦截器,在每个会调用工具的模型上都降低幻觉(最多 $-24$ 个百分点),并且存在一个可调、在开放权重模型上净收益为正的工作点。任务、轨迹、人工标签和代码全部放出。

1 引言

会用工具的 LLM 智能体,把自然语言问题变成结构化的 API 调用,执行这些调用,再把结果合成最终答案(Yao et al., 2023; Schick et al., 2023; Qin et al., 2024; Patil et al., 2024)。这类智能体从演示走进已部署的语言技术之后,一个实际问题变得紧迫:怎么知道智能体是对的?实践中,答案被交给自动正确性指标:对照参考答案做子串或关键词匹配,以及越来越多地让一个 LLM 去评判另一个 LLM(Zheng et al., 2023; Liu et al., 2023; Kim et al., 2024)。这些指标给模型排名、度量稳健性、推动部署决定,却很少拿它们声称在近似的人类判断来核验。

这关系到评测的根基。效果测量是否可靠,取决于它的判定是否可靠(Cleverdon, 1967; Voorhees, 2000)。标注者之间的一致性,长期以来是自然语言处理评测里信任的通货(Artstein and Poesio, 2008; Card et al., 2020)。新的是被判定的对象:不再是短文本片段,而是多步流水线产出的、不确定的、语义复杂的产物。子串启发式假定输出和参考之间有稳定的字面对应。工具返回的是改写、重排格式或部分正确的内容时,这个假定正好失败。近期研究警告,LLM 评判器可以偏离人类评估者,或相对人类被操纵(Chiang and Lee, 2023; Alaofi et al., 2024)。评测仪器本身无效,关于工具型智能体的一切下游结论就从根上坏了。

传播把赌注又加大了。工具型智能体是一条流水线,早一步的错误可以静静地变成一个自信但错误的最终答案。本文关心两种失败。智能体可能接受并继续传递被污染的输入;更隐蔽的是,智能体可能编造工具执行:声称调用了工具、拿到了结果,但那次调用根本没发生。后者是一种单独的幻觉模式(Ji et al., 2023; Min et al., 2023; Huang et al., 2025),端到端正确性分数检测不到,必须给流水线装仪器,而不是只给输出打分。

本文提出诊断基准 AgentProp-Bench,研究围绕三个问题。RQ1(指标有效性):自动正确性指标和人对工具智能体输出的判断有多一致,由此造成的测量误差有多大?RQ2(传播):参数级错误到达错误答案的概率是多少,拒绝错误和从错误中恢复是一个维度还是两个?RQ3(缓解):在同期对照下,运行时拦截能不能降低下游错误,对哪些模型有效?贡献如下。

  • 一次经过核验的审计:子串判定智能体输出处于偶然水平($\kappa{=}0.049$,两名标注者上都如此),三 LLM 集成只达到中等;传播结论对选用哪一个经过核验的评判器不变(第 5 节)。
  • 按阶段的传播测量:在十三个模型上,参数错误到达错误答案的、经人校准的概率约为 $0.62$;拒绝和恢复统计上独立(第 6–7 节)。
  • 对编造工具使用的刻画(最多 37.5% 的轨迹)。它伪装成稳健。一个运行时拦截器在所有会调用工具的模型上降低幻觉,在可调工作点上净收益为正(第 8–9 节)。
  • 放出的基准:2,000 道任务、14,750 条轨迹、100 条人工标签(两名标注者)和分析代码。

2 相关工作

用 LLM 当评判器,以及评测有效性

用 LLM 评判生成文本已经很普遍(Zheng et al., 2023; Liu et al., 2023; Kim et al., 2024),可靠性仍有争议:Chiang and Lee (2023) 问 LLM 判断能否代替人;Bavaresco et al. (2024) 报告任务之间差异很大;Alaofi et al. (2024) 表明评判器可以被骗。检索评测里同样的争论还在进行(Faggioli et al., 2023; Thomas et al., 2024)。越来越多的评测方法工作表明,常用的自动指标和规程会误导:Opitz (2024) 发现换指标可以翻转排名;Mizrahi et al. (2024) 表明单提示评测得到不稳定的结论;Adlakha et al. (2024) 对照人的判断审计指令遵循问答的正确性指标;Chhun et al. (2024) 探查 LLM 评判器的有效性。本文将这条线延伸到工具型智能体:在这一设定下,第一次把集成评判器端到端地对照人工标注做核验,并表明传播结论不依赖于评判器。

工具型智能体及其评测

调用外部工具的智能体(Yao et al., 2023; Schick et al., 2023; Patil et al., 2024; Qin et al., 2024)由报告端到端任务完成的基准来评测(Yao et al., 2024; Liu et al., 2024; Yan et al., 2025)。这些基准给一个正确性数字,不定位失败从哪来、怎么传下去。最接近的是 Liu et al. (2026),事后把自然发生的幻觉归到流水线阶段。本文改为用受控注入从因果上测量传播,拿人工标签核验评测仪器,并在同期对照下评测一种运行时缓解。沙箱里的智能体风险仿真(Ruan et al., 2024)和运行时强制(Wang and others, 2026)与本文互补。

幻觉与缓解

幻觉在生成任务上已有综述(Ji et al., 2023; Huang et al., 2025);智能体特有的模式还加上参数错误和工具输出错误(Zhang et al., 2025)。本文把编造的工具使用看成来源失败(Simmhan et al., 2005):智能体断言了一条从未存在的数据谱系。缓解办法包括自洽(Wang et al., 2023)、自我修正(Madaan et al., 2023)、SelfCheckGPT(Manakul et al., 2023)和语义熵(Farquhar et al., 2024)。与基于采样的方法不同,本文的拦截器和单次执行并行,代价可忽略。

3 AgentProp-Bench 基准

任务设计

每道任务是一个元组 $(q,D,T_{q},a^{\star})$:问题 $q$、领域 $D$、可用工具集 $T_{q}$、参考答案 $a^{\star}$。难度分三档:易(一次工具调用)、中(两条工具链)、难(三条工具链或分支)。任务和参考由领域专用的 API 模拟器生成,再人工核对。AgentProp-Bench 有日历、天气、医疗和知识(消融)四个领域共 2,000 道任务,另加 300 道留出的零售任务。表 1 给出分解。每个领域提供 3–5 个工具,实现为确定性的 Python 函数,带 JSON 模式:校验输入、返回结构化响应,因此参数级注入的效果可以在工具输出里看到。

表 1:AgentProp-Bench 的数据构成。核心任务 2,000 道,跨四个领域,另加 300 道留出的零售任务。难度反映所需的工具链长度和推理深度。

领域任务数易中难
日历667192282193
天气674215248211
医疗559106237216
知识10004654
零售(留出)300———

错误注入规程

使用 P2 语义错误规程:在智能体第一次工具调用执行之前,把一个语义上关键的参数换成不正确但仍然符合模式的值。问伦敦天气时,城市参数可能被换成曼彻斯特:是合法城市,但是错的那一个。注入发生在参数生成阶段。因为工具按模式校验,效果在下游可以观察到。

轨迹采集

轨迹来自九个专有模型(GPT-4o、GPT-4o-mini、GPT-4.1-mini、GPT-4.1-nano、GPT-3.5-turbo、o3-mini、Gemini-2.0-Flash、Gemini-2.5-Flash、DeepSeek-V3)和四个开放权重模型,分属两个家族(Qwen2.5 的 3B/7B/14B,以及 Hermes-3-Llama-3.1-8B)。后者用 vLLM 在本地提供服务,套同一套提示式 ReAct 框架(ReAct,一边推理一边行动的提示格式),温度为 0。语义错误条件下,六个主要专有模型和全部四个开放权重模型各评 200 道任务,三个前沿专有模型各评 50 道:语义错误轨迹共 2,150 条。加上全部四种注入类型和拦截器实验,放出的基准共 14,750 条轨迹。

人工校准

使用这套仪器之前先核验它。两名标注者独立标注分层抽到的 100 条 P2 轨迹(每个专有模型 10–12 条,三个领域),标成正确或不正确。彼此看不见,也看不见任何自动裁定。沿用标注一致性传统(Artstein and Poesio, 2008),一致程度为 Cohen’s $\kappa{=}0.835$(原始一致率 92%),按 Landis and Koch (1977) 属于几乎完全一致,因此这些标签可以作为可靠参考。因为集成评判器偏向保守,另外用这些标签估计的条件概率报告经人校准的比率:$\mathbb{P}(\text{人判正确}\mid\text{集成判正确}){=}0.76$,$\mathbb{P}(\text{人判正确}\mid\text{集成判错误}){=}0.25$。

4 方法

评判规程

比较三种正确性指标。子串启发式:参考答案的前 20 个字符出现在回答的前 200 个字符里,或者参考答案里任一内容词(超过 3 个字符)出现在回答里,就标为正确。这模仿智能体基准里的常见做法。三 LLM 集成:GPT-4o、Gemini-2.5-Flash、GPT-4o-mini 用同一句提示做多数表决(2/3)。提示是:“若智能体的回答在实质上与参考一致,回答 yes,否则 no。”人工标注用同一标准。每个指标对照人的参考,用 Cohen’s $\kappa$ 打分(Cohen, 1960)。

阶段指示

三个指示来自彼此独立的数据列。$S_{1}{=}\mathbf{1}[\mathrm{EPS}{\geq}1]$:注入已经加到计划中的工具调用上。$S_{2}{=}\mathbf{1}[\mathrm{EPS}{\geq}2]$:改过的调用已经执行,并且有可观察的效果。$S_{3}{=}\mathbf{1}[\text{ensemble\_correct}{=}\textsc{false}]$:最终答案是错的。$S_{1}$、$S_{2}$ 只来自执行评分列 $\mathrm{EPS}$,$S_{3}$ 只来自答案级评判器,因此没有一个指示去读另一个指示的列。报告阶段到达概率 $p_{k}{=}\mathbb{P}[S_{k}{=}1]$、跳步条件率 $r_{k,k+1}{=}\mathbb{P}[S_{k+1}{=}1\mid S_{k}{=}1]$,以及从注入到错误的比率 $\mathbb{P}[S_{3}{=}1\mid S_{1}{=}1]$。

拒绝与恢复的分解

把稳健性拆成拒绝和恢复。拒绝是 $1{-}p_{S_{1}}$:在执行阶段被拒掉的注入所占比例。恢复是 $1{-}r_{2,3}$:已经执行的注入里,最终仍然答对的比例。在十三个模型上用 Spearman 相关检验二者是否独立。

运行时拦截器

拦截器并行跑三层。L1 统计模式校验错误和工具错误,超过阈值就弃权(abstention,系统拒绝给出答案)。L2 在思维链里扫描不确定关键词:error、invalid、unknown、missing、incorrect、wrong、cannot。L3 检查最终答案是否断言了任何观察都不支持的数值。它和智能体同时跑,并用同期的无拦截对照:两条臂对每个模型跑同样的任务,唯一差别是拦截器开没开。

统计规程

所有置信区间都是 95% 自助法区间(bootstrap,有放回地反复抽样来估计区间;1,000 次,种子 42)。两个比例的比较用 Cohen’s $h$ 作为效应量。开放权重运行在单张 L40S GPU 上,每个模型用 vLLM、同一套框架提供服务。

5 指标有效性(RQ1)

表 2 和图 1 报告每个指标与两名标注者的一致性。子串启发式对两者都在偶然水平($\kappa{=}0.049$ 和 $0.015$;在 92 条达成共识的轨迹上为 $0.036$),所以这个标题对选哪名标注者不敏感。三个单独的 LLM 评判器达到 $\kappa{=}0.24$–$0.40$,集成达到中等一致($\kappa{=}0.432$),单个 GPT-4o-mini 最强($\kappa{=}0.567$)。集成大约比启发式离人工标注近 $9$ 倍。

表 2:每种正确性指标相对两名人工标注者(A1、A2)及其 92 条共识的 Cohen’s $\kappa$($n{=}100$;标注者之间 $\kappa{=}0.835$)。子串启发式对两者都在偶然水平;GPT-4o-mini 是最强的单个评判器;集成仍作为主评判器保留(第 5 节)。

正确性指标对 A1对 A2对共识
子串启发式0.0490.0150.036
GPT-4o(单个)0.3360.2440.324
Gemini-2.5-Flash(单个)0.3790.3470.399
GPT-4o-mini(单个)0.5670.5010.586
三 LLM 集成0.4320.3830.448

图 1:每种正确性指标相对两名人工标注者及其共识的 Cohen’s $\kappa$。子串启发式落在偶然线上;集成和 GPT-4o-mini 达到中等一致。

评判器与人工标注的一致性

保守偏差

表 3 是集成相对人工标签的混淆矩阵。集成把 25% 的轨迹标成正确,人标成正确的是 38%。主要分歧是集成拒绝了人接受的答案。因此集成判定的正确率把真实正确率低估约 $13$ 个百分点。上面的经人校准比率用来校正这一点。

表 3:集成评判器相对人工标签的混淆矩阵(轨迹条数,$n{=}100$)。集成标出 25 条正确,人标出 38 条;错误主要是拒绝了人接受的答案(19 格)。Cohen’s $\kappa$ 见表 2。

人工正确人工不正确合计
集成判定正确19625
集成判定不正确195675
合计3862100

为什么用集成,以及为什么这不要紧

在这 100 条标签上,单独的 GPT-4o-mini 比集成分数更高,但差距落在重叠的自助法置信区间里。单个评判器更容易有自我增强偏差。挑一个在校准所用标签上把一致性拉到最大的评判器,会过拟合这些标签。关键的是,只用 GPT-4o-mini 重算传播率,结论不变(第 6 节)。因此仍把集成当作主评判器,并在原始比率旁边报告经人校准的比率。

6 错误传播(RQ2)

表 4 报告 2,150 条语义错误轨迹上、每个模型的阶段到达率和跳步条件率。图 2 画出阶段到达率。从执行到错误答案的、按轨迹合并的跳步率是 $r_{2,3}{=}0.80$(第二阶段 271 条里的 217 条)。经人校准后,合并率为约 $0.65$。把十三个模型各自的估计平均,得到标题数字 $r_{2,3}{\approx}0.62$(模型范围 0.46–0.73)。边际的注入到错误率 $\mathbb{P}[S_{3}{=}1\mid S_{1}{=}1]$ 在集成下为 0.57–0.90,校准后为 0.53–0.70。它更稳,因为它算在更大的 $S_{1}{=}1$ 子集上。

表 4:语义错误注入下的传播阶段到达率与跳步率。$S_{1}$:$\varepsilon{\geq}1$;$S_{2}$:$\varepsilon{\geq}2$;$S_{3}$:集成判定为不正确。$r_{12}{=}P(S_{2}|S_{1})$,$r_{23}{=}P(S_{3}|S_{2})$,$P(S_{3}|S_{1})$ 是端到端传播。表中为点估计;95% 自助法置信区间($B{=}1{,}000$)在正文中报告,并随数据放出。

模型$n$$S_{1}$%$S_{2}$%$S_{3}$%$r_{12}$$n_{S_{2}}$$r_{23}$$P(S_{3}\S_{1})$
DeepSeek-V320052.07.062.50.13140.430.57
GPT-3.5-Turbo20037.59.567.50.25190.740.76
GPT-4.1-mini20050.510.565.50.21210.670.66
GPT-4.1-nano20062.517.584.50.28350.970.83
GPT-4o5074.022.074.00.30110.820.68
GPT-4o-mini20040.022.571.00.56450.840.84
Gemini-2.0-Flash2005.01.067.00.2020.500.90
Gemini-2.5-Flash5050.06.076.00.1230.670.84
Qwen2.5-14B20042.59.562.50.22190.890.65
Qwen2.5-3B20049.514.082.50.28280.860.74
Qwen2.5-7B20073.028.071.50.38560.800.63
Hermes-3-Llama-8B20027.05.062.00.19100.800.67
o3-mini5074.016.070.00.2280.630.76

图 2:P2 语义错误注入下、每个模型的阶段到达率(集成判定)。$S_{1}$ 注入已施加,$S_{2}$ 执行效果可见,$S_{3}$ 最终答案错误。阶段指示彼此独立计算。

各模型的阶段到达率

对评判器的稳健性

只用 GPT-4o-mini 重算 $S_{3}$,合并的注入到错误率为 0.61,$r_{2,3}{=}0.74$;集成下是 0.71 和 0.80。GPT-4o-mini 没那么保守(它把 43% 的轨迹标成正确,接近人的 38%),所以它未校准的估计基本上和经人校准的集成数字重合。实质结论两边都成立:传播幅度大约在 0.6–0.8,取决于评判器。

基线与注入后的正确率

表 5 在同一集成下对照基线和 P2 正确率。在注入确实施加的条件下,大多数模型的 P2 正确率低于基线(例如 GPT-4o-mini 从 24.4% 到 16.2%;o3-mini 从 36.0% 到 24.3%)。注入让任务更难,方向符合预期。

表 5:每个模型的基线正确率与 P2(语义错误注入)正确率。P2 由三 LLM 集成判定,基线由启发式匹配判定。95% 置信区间来自 1,000 次非参数自助法。

模型$n_{\mathrm{BL}}$基线%95% 区间$n_{\mathrm{P2}}$P2%95% 区间启发式%
DeepSeek-V345051.8[46.7, 56.4]20037.5[31.0, 44.0]70.5
GPT-3.5-Turbo45050.4[45.8, 54.9]20032.5[26.5, 39.5]67.5
GPT-4.1-mini45054.7[50.2, 59.3]20034.5[28.5, 41.5]70.0
GPT-4.1-nano45045.3[40.4, 50.0]20015.5[10.5, 21.0]67.5
GPT-4o———5026.0[14.0, 38.0]62.0
GPT-4o-mini45040.0[35.3, 44.4]20029.0[23.0, 35.5]49.0
Gemini-2.0-Flash45047.6[42.7, 52.2]20033.0[27.0, 39.5]61.0
Gemini-2.5-Flash———5024.0[14.0, 36.0]64.0
Qwen2.5-14B45055.6[51.3, 60.0]20037.5[30.5, 44.5]70.5
Qwen2.5-3B45054.2[49.6, 58.7]20017.5[12.0, 23.0]67.5
Qwen2.5-7B45049.1[44.2, 53.8]20028.5[22.0, 34.5]57.0
Hermes-3-Llama-8B45058.2[53.8, 62.2]20038.0[31.0, 44.5]71.5
o3-mini5040.0[28.0, 54.0]5030.0[18.0, 42.0]54.0

7 稳健性是二维的

在十三个模型上,拒绝率和恢复率统计上独立(Spearman $\rho{=}0.041$,$p{=}0.893$;表 6、图 3)。能把被污染输入滤掉的模型,并不更可能在它放进来的被污染输入上推理正确。例如 GPT-4.1-nano 把中等拒绝(37.5%)和接近于零的恢复(2.9%)配在一起;Gemini-2.0-Flash 看起来拒绝率极高,原因见下一节。输入过滤和输出推理是结构上不同的控制,一个“稳健性分数”把它们混在一起,应当避免。

表 6:每个模型的拒绝率($1{-}P(S_{1})$)与恢复率($1{-}r_{23}$)。Spearman $\rho{=}0.041$,$p{=}0.893$($n{=}13$):拒绝被注入的错误,和从已经传开的错误里恢复,没有显著的单调关系。

模型拒绝%恢复%
DeepSeek-V348.057.1
GPT-3.5-Turbo62.526.3
GPT-4.1-mini49.533.3
GPT-4.1-nano37.52.9
GPT-4o26.018.2
GPT-4o-mini60.015.6
Gemini-2.0-Flash95.050.0
Gemini-2.5-Flash50.033.3
Qwen2.5-14B57.510.5
Qwen2.5-3B50.514.3
Qwen2.5-7B27.019.6
Hermes-3-Llama-8B73.020.0
o3-mini26.037.5

图 3:十三个模型的拒绝($1{-}p_{S_{1}}$)对恢复($1{-}r_{2,3}$)。点的大小正比于 $n_{S_{2}}$。两轴统计上独立(Spearman $\rho{=}0.041$)。

拒绝与恢复相互独立

8 编造的工具使用(RQ3a)

参数级注入只有在智能体真的发出可解析的工具调用时才能施加。因此按模型测量工具调用率;在没有工具调用的轨迹里,再测最终答案仍然声称完成了由工具得到的结果的比例。这种行为称为编造的工具使用。例如说“我已经取回了天气……”,但没有调用任何工具。分类器经手工裁定 40 条被标出的轨迹,精确率 92.5%(37/40)。表 7 显示,工具调用的遵守程度相差超过一个数量级:GPT-4o 和 GPT-4.1-nano 在 99–100% 的轨迹里调用工具;Gemini-2.0-Flash 只有 5%,编造占 37.5%;GPT-4o-mini 调用工具的比例是 40%,编造 12%。

表 7:P2 语义错误轨迹上的工具调用率与编造工具使用率。低调用率可以伪装成高“拒绝”。

模型工具调用%编造%
GPT-4o100.00.0
GPT-4.1-nano99.00.5
o3-mini88.08.0
DeepSeek-V386.07.0
GPT-4.1-mini85.012.0
Gemini-2.5-Flash76.016.0
GPT-3.5-turbo59.514.5
GPT-4o-mini40.012.0
Gemini-2.0-Flash5.037.5
Qwen2.5-7B99.5—
Qwen2.5-3B70.0—
Qwen2.5-14B61.0—
Hermes-3-Llama-8B37.0—

这有两个后果。第一,不要把低的注入接纳率读成稳健:Gemini-2.0-Flash 表面上 95% 的拒绝,主要是没有调用或编造了工具调用,不是在过滤参数。第二,这解释了下面的拦截器结果:校验工具调用的监视器,只在模型发出调用时才起作用。编造的工具使用本身是一种幻觉模式,端到端分数和子串评判都浮不出它。

错误分析

手工查看第二阶段轨迹,看到三类。(i)传播级联,这是主要失败:注入后的调用 get_weather(city="Manchester") 执行了,智能体把曼彻斯特的天气当成伦敦来报告。这是一条 $S_{1}{\to}S_{2}{\to}S_{3}$ 的链,看不出不确定。(ii)拒绝:智能体注意到不匹配,重新发出改正后的调用。(iii)编造:智能体写出“我取回了伦敦的天气:晴,18°”,但没有工具调用。三类分别对齐恢复、拒绝和工具调用这几条轴。

推广到开放权重模型

两个家族的四个开放权重模型重复了传播效应。Qwen2.5-3B/7B/14B 和 Hermes-3-Llama-8B 的注入到错误率是 0.74、0.63、0.65 和 0.67,落在专有模型的范围内,也和校准后的约 $0.62$ 一致。因此传播不是专有 API 的产物。另外两个开放家族(Mistral-7B-v0.2、Phi-3.5-mini)不能稳定地发出工具调用(21.5% 和 0%),只作为规程遵守的观察报告,不打分。

9 运行时拦截(RQ3b)

表 8 和图 4 报告五个模型上的同期对照实验。拦截器在每个会调用工具的模型上都降低幻觉,置信区间都不含零:GPT-4o-mini($-23.0$ 个百分点)、Qwen2.5-7B($-24.0$ 个百分点)、Qwen2.5-14B($-8.0$ 个百分点)、Hermes-3-Llama-8B($-4.0$ 个百分点)。降幅最大的是一个开放权重模型,与最好的专有结果相当。唯一的空结果是 Gemini-2.0-Flash($-1.3$ 个百分点),正好是几乎不发出可注入工具调用的模型。空结果由机制预言,说明拦截器作用在执行拦截点,而不是作用在答案内容上。

表 8:拦截器的同期对照实验(五个模型)。对照/拦截:没有/有拦截器时的幻觉百分比;$\Delta$:降幅;弃权%:弃权比例;拦住:幻觉被正确弃权的条数;误伤:正确答案被错误弃权的条数。四个会调用工具的模型上都有下降;Gemini-2.0-Flash 的空结果来自它几乎不发出工具调用。

模型对照%拦截%$\Delta$弃权%拦住误伤
GPT-4o-mini55.832.8$-23.0$33.513368
Gemini-2.0-Flash44.543.2$-1.3$2.8161
Qwen2.5-7B55.331.3$-24.0$55.37591
Qwen2.5-14B45.037.0$-8.0$27.02457
Hermes-3-Llama-8B43.039.0$-4.0$13.31624

图 4:同期对照下,五个模型有无拦截器时的幻觉率。四个会调用工具的模型都下降;Gemini-2.0-Flash 的空结果来自它几乎不发出工具调用。

拦截器对幻觉率的影响

一个可调、净收益为正的工作点

拦截器的阈值画出一条精确率/覆盖率前沿。默认的三层阈值把降幅放到最大;把弃权限制在模式层,则把精确率放到最大。在 Qwen2.5-7B 上,这给出一个净收益为正的工作点:下降 $13.3$ 个百分点,弃权精确率 0.62(抓住 39 条幻觉,扣下 24 条正确答案),与 GPT-4o-mini 相当。在 Hermes-3-Llama-8B 上,下降 $4.0$ 个百分点,精确率 0.62。两者都是严格的同期对照测量。操作者应按模型选工作点:工具调用强的用高精确率,弱的用高覆盖率。

10 讨论

智能体输出的自动评测必须核验,不能假定。占主导的启发式不比偶然好,在注入轨迹上把正确性多算了 34 个百分点,足够把基线对扰动的比较方向翻过来。即便经过核验的集成也只是中等。使用 LLM 评判器的研究应当报告相对人工标签的一致性、偏差方向和校准后的估计,这呼应了自然语言处理评测里对统计严格性的要求(Card et al., 2020)。稳健性至少是二维的(拒绝与恢复正交),第三条轴必须先测:模型到底会不会可靠地调用工具。因为编造的工具使用伪装成稳健,答案级打分看不见它。运行时拦截器表明,一个轻量的、单遍的监视器,可以把这些沉默失败里相当一部分变成明确的弃权。专有模型和开放权重模型都如此,工作点由部署者控制。

11 局限

集成评判器偏向保守:四个“错误”裁定里有一个是人判正确的假阴性。在 100 条、两名背景相近的标注者的标签上做校准,减轻了但没有消除这一点。更大、更多样的标注者群体是后续工作。每个模型的第二阶段子样本从 2 条到 56 条,因此强调合并的和边际的汇总,把最小的逐模型比率只当作方向。拦截器两条臂之间的差值对共享的评判偏差是稳健的,但每条臂的绝对比率没有人工标签核验。工具对着确定性模拟器执行,不是对着线上 API。每条轨迹只注入一个参数。多参数和多轮传播仍然开放。

12 伦理

这项工作研究评测可靠性。除两名标注者给模型输出打标签外,没有人类受试者,也不使用个人或敏感数据。把编造的工具使用摆出来,是为了提高已部署智能体的可信程度。放出代码、任务、轨迹和标签以支持复现。放出的产物不含私人信息。

13 结论

本文引入 AgentProp-Bench,并用它表明:对工具智能体输出做自动子串评测不比偶然好;经过核验的集成只达到中等;参数错误传到错误答案的校准概率约为 $0.62$,专有模型和开放权重模型都如此;拒绝和恢复相互独立;若干模型编造工具使用;运行时拦截器在所有会调用工具的模型上降低幻觉,工作点可调且净收益可以为正。全部产物已放出。

致谢

作者感谢 Yoshitha Challagulla 独立标注了用于标注者一致性分析的 100 条轨迹子集。全部代码、2,000 道任务、14,750 条执行轨迹和 100 条人工标签公开于 https://github.com/bhaskargurram-ai/agenthallu-bench 。

参考文献

  • Adlakha et al. (2024). Evaluating correctness and faithfulness of instruction-following models for question answering. TACL 12, pp. 681–699.
  • Alaofi et al. (2024). LLMs can be fooled into labelling a document as relevant. SIGIR-AP.
  • Artstein and Poesio (2008). Inter-coder agreement for computational linguistics. Computational Linguistics 34(4), pp. 555–596.
  • Bavaresco et al. (2024). LLMs instead of human judges? a large scale empirical study across 20 NLP evaluation tasks. ACL.
  • Card et al. (2020). With little power comes great responsibility. EMNLP.
  • Chhun et al. (2024). Do language models enjoy their own stories? prompting large language models for automatic story evaluation. TACL 12, pp. 1122–1142.
  • Chiang and Lee (2023). Can large language models be an alternative to human evaluations? ACL.
  • Cleverdon (1967). The cranfield tests on index language devices. Aslib Proceedings 19(6), pp. 173–194.
  • Cohen (1960). A coefficient of agreement for nominal scales. Educational and Psychological Measurement 20(1), pp. 37–46.
  • Faggioli et al. (2023). Perspectives on large language models for relevance judgment. ICTIR, pp. 39–50.
  • Farquhar et al. (2024). Semantic entropy for detecting confabulations in large language models. Nature 630, pp. 625–630.
  • Huang et al. (2025). A survey on hallucination in large language models. ACM TOIS 43(2).
  • Ji et al. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys 55(12).
  • Kim et al. (2024). Prometheus: inducing fine-grained evaluation capability in language models. ICLR.
  • Landis and Koch (1977). The measurement of observer agreement for categorical data. Biometrics 33(1), pp. 159–174.
  • Liu et al. (2024). AgentBench: evaluating LLMs as agents. ICLR.
  • Liu et al. (2026). AgentHallu: benchmarking automated hallucination attribution of LLM-based agents. Preprint.
  • Liu et al. (2023). G-Eval: NLG evaluation using GPT-4 with better human alignment. EMNLP.
  • Madaan et al. (2023). Self-refine: iterative refinement with self-feedback. NeurIPS.
  • Manakul et al. (2023). SelfCheckGPT: zero-resource black-box hallucination detection for generative large language models. EMNLP.
  • Min et al. (2023). FActScore: fine-grained atomic evaluation of factual precision in long form text generation. EMNLP.
  • Mizrahi et al. (2024). State of what art? a call for multi-prompt LLM evaluation. TACL 12, pp. 933–949.
  • Opitz (2024). A closer look at classification evaluation metrics and a critical reflection of common evaluation practice. TACL 12, pp. 820–836.
  • Patil et al. (2024). Gorilla: large language model connected with massive APIs. NeurIPS.
  • Qin et al. (2024). ToolLLM: facilitating large language models to master 16000+ real-world APIs. ICLR.
  • Ruan et al. (2024). Identifying the risks of LM agents with an LM-emulated sandbox. ICLR.
  • Schick et al. (2023). Toolformer: language models can teach themselves to use tools. NeurIPS.
  • Simmhan et al. (2005). A survey of data provenance in e-science. ACM SIGMOD Record 34(3), pp. 31–36.
  • Thomas et al. (2024). Large language models can accurately predict searcher preferences. SIGIR.
  • Voorhees (2000). Variations in relevance judgments and the measurement of retrieval effectiveness. Information Processing & Management 36(5), pp. 697–716.
  • Wang et al. (2026). AgentSpec: customizable runtime enforcement for safe and reliable LLM agents. ICSE.
  • Wang et al. (2023). Self-consistency improves chain of thought reasoning in language models. ICLR.
  • Yan et al. (2025). The Berkeley function calling leaderboard (BFCL). ICML.
  • Yao et al. (2024). $\tau$-Bench: a benchmark for tool-agent-user interaction in real-world domains. Preprint.
  • Yao et al. (2023). ReAct: synergizing reasoning and acting in language models. ICLR.
  • Zhang et al. (2025). A survey on the memory mechanism of large language model-based agents. ACM TOIS.
  • Zheng et al. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. NeurIPS.

附录 A 标注规程

两名标注者独立标注 100 条分层的 P2 轨迹(九个专有模型、三个领域),对照参考答案把智能体的最终回答标成正确或不正确。指引与集成评判器的提示相同:“只要与参考匹配的核心事实在场且正确,就接受措辞上的小差别和额外解释;关键值错误、缺失或没有依据,则标为不正确。”标注者彼此看不见,也看不见任何自动裁定。标注者之间的 Cohen’s $\kappa{=}0.835$(原始一致率 92%)。

附录 B 评判提示与校准

每个集成评判器收到的提示是:“你在评估一个 AI 智能体的回答。若智能体的回答在实质上与参考一致,回答 yes,否则 no。只要核心事实正确,就接受措辞上的小差别。”多数表决(2/3)是集成裁定。人工校准使用 $\mathbb{P}(\text{人判正确}\mid\text{集成判正确}){=}0.76$ 和 $\mathbb{P}(\text{人判正确}\mid\text{集成判错误}){=}0.25$,来自这 100 条标签。

出处:Bhaskar Gurram,Auditing Automated Evaluation, Error Propagation, and Runtime Mitigation in Tool-Using Language Agents,2026-08-10,https://arxiv.org/abs/2604.16706,CC BY 4.0。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误