失败 透明 的 智能 体: 工具 失败 之后, 模型 还 会不会 谎报 成功
FTA 把失败轨迹事先固定,只评测最终报告是否被证据支持。六个模型、3600 条人工标注里,基线虚假成功 22.8%,透明指令 9.3%,结构化证据契约 0.8%,有用回答不降反升。

本文目录
失败透明的智能体:评测工具使用语言模型在失败之后如何报告
Junru Zhu Shiming Xie Aime Lu Fan Chen Xiaoqing Ding
Chunxin Tang Ruoyu Qi Yulang Fei
译注:原文作者脚注为机构与贡献说明,下面按原文逐条译出。
脚注:† 地址:
1 独立研究者 2 蚂蚁集团 3 清华大学
4 芝加哥大学 5 滑铁卢大学
∗ 同等贡献。† 通讯作者:yulang.fei@uwaterloo.ca
摘要
使用工具的智能体可能失败两次:所需工具可能失败,随后智能体又可能在缺少足以支持该说法的证据时报告成功。现有基准常常把这种报告失败,与工具选择、恢复以及环境动态缠在一起。我们提出 Failure-Transparent Agents(FTA),一个受控基准。它在生成之前就固定失败观测和所需证据状态,从而使失败之后的声称可以直接审计。FTA 包含 100 个任务,带有确定性的失败轨迹,覆盖五个失败族、一个中性对照和四种用户施压条件,并在评测无根据声称的同时评测有用的恢复。在六个模型、三种回答策略和 3600 条人工标注回答上,虚假成功率为:基线策略 22.8%,带透明指令时 9.3%,带结构化证据契约时 0.8%。编造细节率从 28.3% 降到 14.3% 和 0.8%,而有用回答则从 74.9% 升到 89.2% 和 98.8%。在这个任务已被阻断的基准内部,所测试的证据契约策略与明显更低的失败后报告错误相关,同时有用回答率仍然很高。
索引词
大语言模型智能体(LLM agents),工具失败(tool failure),基准(benchmark),失败透明(failure transparency),幻觉(hallucination)
1 引言
使用工具的语言模型会以两种不同的方式失败。一次工具调用可能失败,模型随后还可能把这次失败加重:报告一个从未被观测到的结果。具体地说,浏览器超时并不能支持「我核对过这个页面」,附件缺失并不能支持对附件内容的描述,崩溃的测试运行器也并不能支持「测试通过了」。随着语言模型智能体越来越多地浏览网页、检查文件、执行代码并与应用 API 交互 [1, 2, 3, 4, 5, 6, 7, 8, 9],可靠的智能体行为所要求的就不只是把任务做完:当完成被阻断时,最终回答必须忠实地表示实际可得的证据。我们把这一性质称为失败透明。
已有工作处理的是智能体可靠性的相邻方面,但并没有干净地隔离失败之后的报告。端到端智能体基准把工具选择、交互、恢复和任务完成放在一起评测 [10, 11, 12, 13, 14, 15]。网页与计算机使用基准把评测扩展到真实界面和长程环境 [16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27]。工具失败基准则研究缺失的能力、被破坏的输出,或从错误执行中恢复 [28, 29, 30, 31, 32]。相关工作也考察无根据的行动、隐瞒、对抗性的工具数据,或有证据支持的核验 [33, 34, 35, 36, 37, 38]。更一般的真实性、幻觉、事实性与弃权基准,评测的是无根据或不可核验的生成 [39, 40, 41, 42, 43, 44]。这些设定处理的是重要的失败模式,但最终报告的忠实程度仍然与智能体循环的其余部分缠在一起。一个聚焦失败后报告的基准,可以改为以失败已经发生为条件,评测最终报告是否被由此产生的证据状态所支持。这引出一个更窄的问题:给定同一次已知失败和同一份缺失证据,模型会不会忠实地报告什么被观测到了、什么没有被观测到?
我们提出 Failure-Transparent Agents(FTA),一个旨在隔离这个问题的受控基准。核心设计原则是在生成之前固定证据状态:每个任务给模型一条确定性的失败工具观测,而评测方一侧的元数据则规定,合法完成、可行恢复和安全的部分帮助各自需要哪些证据。因此,最终声称可以直接对照模型实际观测到的内容来审计,而不依赖于工具选择或重试策略。FTA 度量两种主要违规。虚假成功是一项无根据的声称,说某项不可用的行动或任务已经成功。编造细节是具体内容,而这些内容所依赖的证据模型并未收到。恢复和有用性也会被记录,这样一律拒绝就不会显得人为地可靠。图 1 概括了这一受控评测设置,以及汇总后的描述性比率。
图 1:FTA 处在固定的失败后证据状态之下。(a)一次可见的工具失败,其后仍可能跟着一项无根据的成功声称。(b)FTA 把失败轨迹保持固定,改变回答策略,并对照评测方一侧的证据与安全恢复参照,给由此产生的回答打分。(c)在全部六个模型和 3600 条人工标注回答上,汇总的虚假成功在基线下为 22.8%,加上透明要求后为 9.3%,使用证据契约后为 0.8%。
这一受控设定揭示出相当大的失败后报告缺口,以及一条减少它的简单途径。在全部六个模型和 3600 条人工标注回答上,虚假成功率在基线策略下为 22.8%,加上一条朴素的透明指令后为 9.3%,使用结构化证据契约后为 0.8%。编造细节率从 28.3% 降到 14.3% 和 0.8%,而有用回答则从 74.9% 升到 89.2% 和 98.8%。同样的定性次序,在最初的三模型队列和独立采集的确认后扩展里都看得到。这些结果表明,失败后的误报并不只是执行问题;在这个任务已被阻断的基准内部,所测试的结构化证据报告策略与明显更低的无根据声称率相关,同时有用回答仍然很高。
我们的贡献有三项:(1)一个由 100 个失败后任务组成的受控基准,带有确定性轨迹、评测方一侧的证据规定,以及固定的人工评分细则;(2)一次覆盖 3600 条回答、六个模型的评测,由最初的三模型队列和独立采集的确认后扩展组成;(3)证据表明,所测试的结构化报告策略与明显更低的虚假成功率相关,同时在任务已被阻断的情形里,有用回答率仍然很高。
2 FTA 基准
FTA 把生成条件设定在一个固定的失败后证据状态上。对每个任务,模型看到的是用户请求和一条确定性的失败工具轨迹,而用来证明完成所需要的证据则留在评测方一侧。因此,这个基准评测的是:面向用户的最终报告是否忠实于实际被观测到的内容,而不依赖于工具选择、重试策略或环境漂移。
2.1 受控的失败后评测
我们把每个情景表示为
$$s_{i}=(u_{i},o_{i},e_{i},r_{i},h_{i}),$$
其中 $u_{i}$ 是用户请求,$o_{i}$ 是被观测到的失败工具轨迹,$e_{i}$ 是合法完成所需要的证据,$r_{i}$ 是一项可行的恢复行动,$h_{i}$ 是失败之后仍然可能提供的有用部分帮助。被评测的模型只收到 $(u_{i},o_{i})$;$(e_{i},r_{i},h_{i})$ 被保留下来用于评测。
这一分离给已观测证据和不可得证据划出一条明确边界。一项回答声称若需要 $e_{i}$ 中的证据,而该证据并不在 $o_{i}$ 里,它就是无根据的。例如,若附件不可用,模型可以披露这一限制、请求重新上传,或提供不依赖文件内容的指导,但它不能合法地概述那份未见过的文件。同样,在一次测试执行失败之后,它可以报告这次失败并建议如何恢复,但不能声称测试已经通过。
因此,FTA 针对的是回答层面的能力,而不是端到端的智能体胜任力:模型是否保住了「被请求的是什么、被尝试的是什么、实际被观测到的是什么」之间的区分。打分问的是,一项声称是否被暴露给模型的证据所支持,而不只是它是否匹配某个已知答案。FTA 是一项度量贡献,而不是一种恢复架构:它在一次已知失败之后,直接给声称与证据的一致性打分。
2.2 任务构建
FTA 包含 100 个合成的失败后任务,覆盖五个失败族:检索不可用、附件缺失、执行失败、权限拒绝,以及数据过时。每个族有 20 个任务,覆盖常见的智能体操作,例如网页检索、文件检查、代码或查询执行、受访问控制的资源,以及对新鲜度敏感的信息。情景的写法使失败的前提,以及完成所需要的证据,都是明确的,从而使打分聚焦于报告,而不是含糊的任务语义。
每个族在五种提示条件上保持平衡:一个中性对照,以及四种用户施压条件——预期答案、紧迫、强制选择,以及隐瞒失败——从而在每一个「失败族 × 条件」格子里都有四个情景。这些分层用来探查,无根据报告是否集中在不同的提示条件之下。因为这些条件并没有在相同的任务内容内部交叉,比较被解释为描述性的,而不是措辞的孤立因果效应。
所有失败都由一个确定性的、与提供方无关的模拟器产生。重放一个情景会逐字节返回同一条工具观测,并且绝不会落到一个真实的外部服务上。在采集回答之前,我们校验模式一致性、类别与状态的对齐、失败族与提示条件的平衡,以及对新鲜度敏感情景的日期算术。数据集内容、提示、模型配置和分析设定,都在其对应的评测运行之前固定。
合在一起,确定性重放和评测方一侧的证据要求,使得同一个失败后证据状态可以在不同回答策略和模型族之间比较,同时让无根据声称可以直接审计。
2.3 诊断指标与对元数据设盲的人工标注
FTA 同时评测报告违规和有用的恢复。两个主要违规标签是虚假成功和编造细节。虚假成功表示一项无根据的声称,说某项不可用的行动、核验步骤或任务已经成功。编造细节抓住的是具体内容——例如一个数值、引文、比较、计数、状态或观测——而这些内容依赖于模型并未收到的证据。
模型可以靠拒绝每一个被阻断的请求,平凡地避开这些违规。因此我们还记录限制披露、可行恢复、有用回答和过度拒绝。这一组指标把无根据的完成,与忠实的恢复以及不必要地保守的弃权区分开来。
所有被报告的结果都在一份固定的人工评分细则下打分。评测者看到用户请求、被观测到的失败轨迹、评测方一侧的证据要求、被允许的部分帮助,以及助手回答,但看不到模型身份、提供方、重复序号、延迟或成本。策略元数据不被展示,尽管契约的结构化字段可能使该条件可以被推断出来;因此标注是对元数据设盲,而不是对条件完全设盲。评分细则事先规定了边界情形,包括无根据的强制选择答案、把过时观测说成当前,以及仍然需要不可得证据的、带保留的数值猜测。全部 3600 条回答都用同一套决策规则人工标注。评分细则和已打分的回答将与公开评测产物一起发布。我们没有报告独立的双人标注或标注者间一致性,这限制了对标注可靠性的直接评估。
3 实验协议
我们比较三种回答策略,同时把情景和失败后证据状态保持固定。
3.1 回答策略
基线。基线要求使用已有信息给出准确且有帮助的回答,并不特别指示如何处理工具失败或证据报告。
透明指令。这一条件额外禁止对访问、观测、核验、计算或完成作出无根据的声称,并要求模型披露限制、给出合适的下一步。
证据契约。结构化条件要求四个显式字段:STATUS、EVIDENCE、LIMITATION 和 NEXT ACTION。契约把所声称的状态与支持证据之间的关系写明。它被当作一种回答策略来评测,而不是 FTA 基准定义的一部分。三种策略是施加在同一情景上的不同实验条件;契约不是评测者,也不是核验阶段。
对给定情景,所有策略收到的是同一条用户请求和同一条确定性的失败工具观测。这种配对设计,在相同的失败后证据状态条件下,把策略差异隔离出来。
3.2 模型队列与回答采集
最初的三模型队列包含 GPT-5.6 Terra、Claude Sonnet 5 和 NVIDIA Nemotron Super 3 120B。每个模型在全部三种回答策略下评测全部 100 个情景,每个情景–策略格子有两次独立生成,得到 $3\times 100\times 3\times 2=1{,}800$ 条回答。基准版本、提示、模型配置和分析设定都在结果分析之前固定。
在分析最初队列之后,我们用 Amazon Nova Micro、Meta Llama 3.1 8B Instruct 和 Mistral Ministral 8B 3.0 做了一次独立的确认后扩展,使用同一套评测矩阵。这增加了 1800 条回答,六个模型合计 3600 条人工打分回答。确切提示、模型标识、生成设定、基准版本和带版本的配置,将与公开评测产物一起发布,从而可以重建模型–任务–策略矩阵。
扩展在分析上与最初队列分开。它检验的是,定性的策略次序是否在更多模型上仍然成立,而不是在看到最初结果之后把原分析扩大。因此六个模型的汇总结果按描述性来报告。
3.3 统计分析
主要结果是虚假成功和编造细节;与有用性相关的标签是补充性的诊断结果。最初的三模型队列在采集扩展之前就已固定。因为扩展是确认之后才做的,我们不给六个模型的汇总估计附上确认性的假设检验。六个模型的汇总比率按描述性来解释;所报告的契约相对基线的虚假成功差异,附有一个在 100 个语义任务簇上按情景聚类的 95% 自助区间,因此来自同一任务的重复生成不会被当成独立观测。
提示条件分析是描述性的,因为占据不同条件格子的是不同的情景内容,而不是把同一任务在每一种条件下交叉。确认后扩展同样被用作描述性的推广检验,而不是用来扩大原分析。
4 结果
4.1 失败后错误随提示条件而变化
即使执行失败已经明确可见,失败后的报告错误仍然相当大。在全部六个模型上,基线策略在 22.8% 的回答里产生虚假成功,在 28.3% 的回答里产生编造细节。与此同时,74.9% 的回答被判为有用。因此,我们把有用性和证据忠实度当作失败后行为的两个分开的维度来评测,而不是从其中一个推断另一个。
错误在 FTA 的提示条件上分布并不均匀。在最初的三模型队列里,强制选择情景的基线虚假成功率达到 85.0%,隐瞒失败情景也显示出无根据报告的明显集中;中性、紧迫和预期答案条件则已经接近于零。因为提示条件占据的是不同的情景内容,而不是同一任务的另一种改写,这些差异是诊断性的,并不能隔离措辞的因果效应。
表 1:全部六个模型和 3600 条回答上的人工标注结果(%)。六个模型的合计是描述性的。
| 结果 | 基线 | 透明 | 契约 |
|---|---|---|---|
| 虚假成功 $\downarrow$ | 22.8 | 9.3 | 0.8 |
| 编造细节 $\downarrow$ | 28.3 | 14.3 | 0.8 |
| 有用回答 $\uparrow$ | 74.9 | 89.2 | 98.8 |
4.2 结构化证据报告与更低的无根据声称相关
回答策略与失败后的忠实度强烈相关(表 1)。汇总的虚假成功在基线下为 22.8%,加上透明指令后为 9.3%,使用结构化证据契约后为 0.8%。编造细节遵循同一次序,分别从 28.3% 降到 14.3% 和 0.8%。
相对基线,证据契约与汇总虚假成功下降 21.9 个百分点相关;这一差异按情景聚类的 95% 自助区间为 16.2–28.0 个百分点。因为另外三个模型是在确认之后采集的,这一六个模型的汇总估计被解释为描述性的,而不是一次确认性的假设检验。
两种干预之间的对照在实践上很重要。一条一般性的透明指令仍会留下并非微不足道的无根据声称,而所测试的契约明确分开 STATUS、EVIDENCE、LIMITATION 和 NEXT_ACTION,并与明显更低的错误率相关。契约是一套捆绑在一起的干预,因此实验并不能辨认是哪一个组成部分驱动了所观测到的差异。
4.3 更低的错误率仍然保留有用回答
在这个任务已被阻断的基准内部,无根据声称的减少并没有伴随有用回答的崩塌:有用性从基线下的 74.9%,升到透明条件下的 89.2%,以及证据契约下的 98.8%。这些数据支持一个关于失败后有帮助程度的更窄声称;由于没有配对的成功工具对照,它们并不能确立:当工具成功时,不存在错误阻断。
独立采集的扩展保持了同样的定性次序:仅在三个扩展模型上,虚假成功率平均为基线 17.0%、透明 8.8%、证据契约 0.3%。在全部六个被测模型上,对应的汇总比率为 22.8%、9.3% 和 0.8%。在最初的三模型队列内部,这些比率为 28.5%、9.7% 和 1.3%,由表 2 的模型级行计算得到。朴素透明在六个被测模型上从 0.5% 变到 20.5%,而每一个证据契约条件都落在 0% 到 2% 之间。
表 2:按模型划分的虚假成功率(%)。底部三个模型构成独立采集的确认后扩展。六个模型的合计是描述性的;最初的三模型队列在分析上仍然分开。
| 模型 | 基线 | 透明 | 契约 |
|---|---|---|---|
| Claude Sonnet 5 | 34.0 | 3.0 | 0.0 |
| Nemotron Super 3 | 26.5 | 20.5 | 2.0 |
| GPT-5.6 Terra | 25.0 | 5.5 | 2.0 |
| Ministral 8B 3.0 | 29.5 | 19.5 | 0.0 |
| Amazon Nova Micro | 15.5 | 6.5 | 0.5 |
| Llama 3.1 8B | 6.0 | 0.5 | 0.5 |
| 全部六个 | 22.8 | 9.3 | 0.8 |
扩展是描述性的推广证据,而不是把最初队列扩大。它是在最初队列被分析之后采集的,并不改变该队列的定义。它的主要含义是定性的:与证据契约相关的更低虚假成功率,在额外被测的模型上仍然成立,尽管这些模型的基线率相差很大。
5 讨论与局限
FTA 的设计是把报告可靠性与执行可靠性分开。让一次执行失败对模型可见,并不足以保证最终回答会忠实地表示这次失败。在这个受控基准内部,即使失败前提已被明确提供,无根据的成功声称在某些提示条件下仍然常见。因此,一个智能体可以遇到一次可见的失败,却仍然向用户传达一个无根据的结果。
策略结果表明,失败后的忠实度对施加于最终回答的结构很敏感。一条通用的透明指令与更低的无根据声称率相关,但这一差异的大小在六个被测模型之间并不一样。证据契约与一致更低的虚假成功率相关,同时有用回答率仍然很高。然而,契约是一套捆绑干预:它的措辞、显式决策约束和输出结构一起改变。因此,实验并不能辨认是哪一个单独组成部分造成了所观测到的差异;要把这些效应分开,需要析因式的提示消融。
FTA 意在作为端到端智能体评测的诊断性补充。在生成之前固定失败观测,会把工具选择、自主重试行为、变化中的环境状态,以及长程规划,从被度量的能力里拿掉。这一控制提高了可审计性,并使模型和回答策略之间的精确比较成为可能,但它限制了生态覆盖。因此,FTA 上的表现不应当被解释为对已部署智能体可靠性的完整度量。
另外几项局限划定了目前结果的范围。FTA 只包含失败的前提;要度量更强的透明策略是否会错误地压制有效完成,需要配对的成功工具对照。任务是合成的、只有英文,并且以一步为主;没有包含真实轨迹验证,基准也不覆盖部分成功、相互矛盾的证据、多智能体交互或加长的轨迹。提示条件是平衡的,但并没有用同一任务的不同版本做交叉,因此条件层面的差异是描述性的,而不是措辞效应的因果估计。打分时策略元数据被隐藏,但契约的格式可能使条件可以被推断出来。最后,结果是在一份固定的人工评分细则下打出的,没有报告独立的双人标注或标注者间一致性,因此标注可靠性仍是今后评测的一个重要目标。
6 结论
工具失败和失败后的报告是不同的可靠性维度。FTA 通过固定失败的执行状态,并对照一条明确的证据边界审计最终回答,把后者隔离出来。在 3600 条人工标注回答上,所测试的透明策略和证据契约策略与更低的无根据成功率相关,同时在任务已被阻断的情形里,有用回答率仍然很高。因此,可靠的智能体不应当只按任务完成来评测,还应当看它们面向用户的声称,是否被实际获得的证据所支持。
致谢。OpenAI ChatGPT 被用于语言编辑。
参考文献
S. Yao 等,《ReAct:协同语言模型中的推理与行动》,收录于 ICLR,2023。
T. Schick 等,《Toolformer:语言模型可以教会自己使用工具》,收录于 NeurIPS,2023。
M. Li 等,《API-Bank:面向工具增强 LLM 的综合基准》,收录于 EMNLP,2023。
Y. Qin 等,《ToolLLM:帮助大语言模型掌握 16000 多个真实世界 API》,收录于 ICLR,2024。
S. G. Patil 等,《Berkeley Function Calling Leaderboard(BFCL):从工具使用到大语言模型的智能体评测》,收录于 ICML,2025。
Y. Qin 等,《用基础模型做工具学习》,arXiv:2304.08354,2023。
Y. Zhuang、Y. Yu、K. Wang、H. Sun 与 C. Zhang,《ToolQA:一个让 LLM 借助外部工具做问答的数据集》,收录于 NeurIPS,2023。
S. G. Patil、T. Zhang、X. Wang 与 J. E. Gonzalez,《Gorilla:连接大量 API 的大语言模型》,收录于 NeurIPS,2024。
W. Liu 等,《ToolACE:赢得 LLM 函数调用的得分点》,收录于 ICLR,2025。
X. Liu 等,《AgentBench:把 LLM 作为智能体来评测》,收录于 ICLR,2024。
Y. Ruan 等,《用语言模型模拟的沙箱识别语言模型智能体的风险》,收录于 ICLR,2024。
J. Lu 等,《ToolSandbox:一个有状态、对话式、交互式的 LLM 工具使用能力评测基准》,收录于 Findings of NAACL,2025。
S. Yao 等,《$\tau$-bench:真实领域中工具–智能体–用户交互的基准》,收录于 ICLR,2025。
G. Mialon 等,《GAIA:通用人工智能助手基准》,收录于 ICLR,2024。
C. Ma 等,《AgentBoard:多轮 LLM 智能体的分析性评测板》,收录于 NeurIPS,2024。
S. Zhou 等,《WebArena:用于构建自主智能体的真实网页环境》,收录于 ICLR,2024。
T. Xie 等,《OSWorld:在真实计算机环境中为开放式任务评测多模态智能体》,收录于 NeurIPS,2024。
S. Yao、H. Chen、J. Yang 与 K. Narasimhan,《WebShop:用落地的语言智能体走向可扩展的真实网页交互》,收录于 NeurIPS,2022。
X. Deng 等,《Mind2Web:走向网页上的通用智能体》,收录于 NeurIPS,2023。
C. E. Jimenez 等,《SWE-bench:语言模型能否解决真实的 GitHub 问题?》,收录于 ICLR,2024。
J. Y. Koh 等,《VisualWebArena:在真实视觉网页任务上评测多模态智能体》,收录于 ACL,2024。
H. He 等,《WebVoyager:用大型多模态模型构建端到端网页智能体》,收录于 ACL,2024。
A. Drouin 等,《WorkArena:网页智能体解决常见知识工作任务的能力如何?》,收录于 ICML,2024。
L. Boisvert 等,《WorkArena++:走向基于组合规划与推理的常见知识工作任务》,收录于 NeurIPS,2024。
O. Yoran 等,《AssistantBench:网页智能体能解决真实且耗时的任务吗?》,收录于 EMNLP,2024。
T. Le Sellier de Chezelles 等,《面向网页智能体研究的 BrowserGym 生态系统》,Transactions on Machine Learning Research,2025。
E. Li 与 J. Waldo,《WebSuite:系统性地评测网页智能体为何失败》,arXiv:2406.01623,2024。
Y. Zhang 等,《ToolBeHonest:面向工具增强大语言模型的多层次幻觉诊断基准》,收录于 EMNLP,2024。
J. Sun、S. Y. Min、Y. Chang 与 Y. Bisk,《Tools Fail:检测有故障工具中的静默错误》,收录于 EMNLP,2024。
Y. Wan、J. Yang、J. Luo 与 Y. Qiu,《失败让智能体更强:通过结构化反思提高可靠工具交互的准确率》,arXiv:2509.18847,2025。
H. Xia、H. Wang、Z. Liu、Q. Yu、Y. Guo 与 H. Wang,《SafeToolBench:开创一个前瞻基准,评测 LLM 中的工具使用安全》,收录于 Findings of EMNLP,2025。
J. Ye 等,《ToolSword:揭示大语言模型在工具学习三个阶段中的安全问题》,收录于 ACL,2024。
D. Guo 等,《你的智能体是向上欺骗者吗?》,arXiv:2512.04864,2025。
A. Gupta,《ReliabilityBench:在类似生产的压力条件下评测 LLM 智能体可靠性》,arXiv:2601.06112,2026。
R. Chen,《Evidence-Bound Autonomous Research(EviBound):消除虚假声称的治理框架》,arXiv:2511.05524,2025。
E. Debenedetti 等,《AgentDojo:评测 LLM 智能体提示注入攻击与防御的动态环境》,收录于 NeurIPS,2024。
M. Andriushchenko 等,《AgentHarm:度量 LLM 智能体有害性的基准》,收录于 ICLR,2025。
Z. Zhang 等,《Agent-SafetyBench:评测 LLM 智能体的安全》,arXiv:2412.14470,2024。
S. Lin、J. Hilton 与 O. Evans,《TruthfulQA:度量模型如何模仿人类的虚假说法》,收录于 ACL,2022。
J. Li、X. Cheng、X. Zhao、J.-Y. Nie 与 J.-R. Wen,《HaluEval:面向大语言模型的大规模幻觉评测基准》,收录于 EMNLP,2023。
C. Niu 等,《RAGTruth:用于开发可信检索增强语言模型的幻觉语料》,收录于 ACL,2024。
S. Min 等,《FActScore:长文生成中事实精确度的细粒度原子评测》,收录于 EMNLP,2023。
P. Manakul、A. Liusie 与 M. Gales,《SelfCheckGPT:生成式大语言模型的零资源黑盒幻觉检测》,收录于 EMNLP,2023。
P. Kirichenko 等,《AbstentionBench:推理型 LLM 在无法回答的问题上失败》,arXiv:2506.09038,2025。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。