CodexQA

Industry & PracticeResearch & Benchmarks

普林斯顿提出 Agent 可靠性科学:12 个指标证明能力提升带不来可靠

CodexQA 团队41 min read

普林斯顿团队把安全关键工程的可靠性理念引入 AI agent 评测:一致性、鲁棒性、可预测性、安全四个维度共 12 个指标,在 τ-bench 与 GAIA 上测了 15 个模型。结论是 24 个月的能力飞跃只带来微小的可靠性改进——准确率大涨的模型依旧多次运行不一致、对提示词改写脆弱、常常不知道自己何时会失败。本卷为正文(含参考文献),附录见下两卷。

In this piece

迈向 AI Agent 可靠性科学

Stephan Rabanser 单位:Princeton University 通讯作者:rabanser@princeton.edu Sayash Kapoor 单位:Princeton University 通讯作者:sayashk@princeton.edu Peter Kirgis 单位:Princeton University Kangheng Liu 单位:Princeton University Saiteja Utpala 单位:Princeton University Arvind Narayanan 单位:Princeton University 通讯作者:arvindn@princeton.edu

摘要

AI agent 正越来越多地被部署去执行重要任务。虽然标准基准上不断上升的准确率分数暗示着快速进步,但许多 agent 在实践中仍然持续失败。这一落差凸显了当前评测的一个重大局限:只关注单一指标不足以理解 agent 的行为。特别地,它忽略了 agent 是否在多次运行之间行为一致、能否抵御扰动、失败是否可预测,以及错误严重度是否有界。我们以安全关键工程为根基,提供了一个整体性的性能画像,由十二个指标构成,沿四个关键维度分解 agent 可靠性:_一致性_(consistency)、_鲁棒性_(robustness)、_可预测性_(predictability)与_安全_(safety)。在两个互补基准上评测 15 个模型后,我们发现近期的能力提升只带来了可靠性上的微小改进。通过暴露这些持续存在的局限,我们的指标补充了传统评测,同时提供了推理 agent 如何表现、如何退化、如何失败的工具。

关键词

Machine Learning, ICML

可靠性提升落后于准确率

图 1:可靠性的提升落后于准确率的改进。尽管经历了 24 个月的模型发布,整体可靠性随时间的改进微乎其微。而且,仅提高准确率并不能保证在复杂真实任务上获得可靠性提升。所有前沿模型提供商的表现彼此相近,这表明可靠性是全行业的平台期,而非某个供应商特有的局限。

1 引言

AI agent 正迅速从研究原型转变为自主执行高风险任务的已部署系统,例如修改代码 [63]、管理数据库 [58],以及编排复杂工作流 [64]。虽然它们自动化常规工作的潜力巨大,但使其有用的自主性同样使其失败代价高昂。这一担忧得到广泛认同:在一项覆盖 80,000 多人的全球研究中,Anthropic 发现不可靠性(幻觉、不准确,以及由此产生的验证负担)是人们对 AI 最常提及的担忧 [19]。近期备受关注的事故进一步凸显了基准表现与现实结果之间令人不安的落差 [46]。例如,Replit 的 AI 助手在明令禁止的情况下删除了生产数据库 [7, 53];OpenAI 的 Operator 完成了一笔绕过用户确认的未授权购买 [15, 44];纽约市政府的聊天机器人给出了非法的商业建议 [32]。在每一起案例中,那些在内部评估中被判定为有能力的 agent,在部署中都以不可靠的方式失败。这引出了一个根本问题:我们应该如何定义并评测 agent 可靠性?

agent 评测的主流范式以平均任务成功率为中心 [70, 24, 37, 40]。虽然这一方法提供了干净的优化目标,但它掩盖了关键的行为属性。仅有准确率无法区分一个在特定任务上可预测地失败的 agent 与一个以相同比率随机失败的 agent。此外,它也无法区分良性的格式错误与删除文件这类灾难性动作。标准基准同样不报告 agent 对输入扰动的敏感度,或其识别自身可能失败的能力。这与一个更广泛的发现相呼应:流行基准追踪能力,却让可靠性处于未被测量的状态 [57]。

这一评测鸿沟与航空 [50]、核电 [22]、汽车系统 [23] 等安全关键工程领域形成鲜明对比。在这些领域,可靠性被理解为一种多维属性 [21, 3]。认证要求系统行为一致、限定失败严重度的上界,并在压力下可预测地退化。尾部风险与失败后果被显式量化,而不是被隐藏在平均成功率之后。

我们将这一安全关键视角引入 AI agent 评测,把可靠性分解为四个维度(见表 1):_一致性_(可重复的行为)、_鲁棒性_(扰动下的稳定性)、_可预测性_(校准的置信度)与_安全_(失败发生时严重度有界)。在这些维度上,我们提出十二个与原始准确率相互独立的具体指标(见第 3 节)。把这些指标应用于两个基准上的 15 个模型后发现,可靠性的提升明显落后于能力的进步(见图 1;详细标注见图 7)。

为了系统分析这一不断扩大的鸿沟,本文提供以下两项关键贡献:

  1. 一套形式化的分类法与指标体系:我们把定性的安全关键原则转译为可计算的指标,从而独立于任务成功来评测可靠性。
  1. 一份现代 agent 的完整可靠性画像:我们刻画了最先进模型在哪里成功、在哪里失败,并将一致性与可预测性分离出来,作为需要立即投入研究关注的领域。

范围。我们将可靠性视为 agent 行为在自然变异与偶发故障下可实证测量的属性。我们不评测对抗性攻击,也不评测价值对齐等更宽泛的社会技术概念 [18, 62]。我们对「安全」一词采取狭义用法,仅指有界的操作严重度。

2 可靠性的跨领域视角

表 1:源自跨领域安全关键工程实践的可靠性维度。

维度跨领域概念领域实例
一致性名义条件下可重复的结果;多次重复试验间低方差FAA 要求飞行关键软件确定性执行 [51];NRC 为核反应堆数字计算机设定强制响应时间 [56]。
鲁棒性在输入、环境、工具扰动下优雅退化;在整个运行包线内性能稳定NASA 对丰田汽车软件相关非预期加速的调查导致召回 [42];FAA 强制要求航空传感器在极端温度、湍流与振动条件下测试 [12]。
可预测性预测置信度与准确率对齐;识别自身极限,在不确定时移交/上报NRC 对核反应堆中数千种潜在失败模式建模 [55];航空业使用带显式概率的分级风险分类 [13]。
安全即使失败发生,危害也有界;最坏情况严重度保持可接受SIL 4 标准要求危险失败概率低于 $10^{-5}$ [21];FAA 采用每十亿飞行小时一次灾难性错误的目标 [13]。

在为 AI agent 定义可靠性指标之前,我们先问一个基础问题:可靠性_是_什么?本节把安全关键工程数十年的实践综合为一个统一的分解,并将每个维度与既有机器学习研究联系起来。我们考察了航空、核电、汽车、过程控制等行业的可靠性实践,以识别反复出现的评测维度(见附录 D.2)。尽管技术与风险容忍度各不相同,仍浮现出四个核心维度(表 1),这提示它们捕捉的是可靠性的基本方面,而非某个领域特有的关切。

维度 1(一致性):在完全相同的条件下多次运行,系统的行为是否相同,还是结果高度多变?

在安全关键领域中,方差是一种负资产:飞行软件与反应堆保护必须确定性响应,因为_当高方差使结果不可预测时,即使可接受的平均表现也会成为问题_。虽然 ML 研究注意到了提示词敏感性 [48]、浮点非确定性 [17],以及通过 pass$\wedge k$ 评测一致性 [65] 等问题,但这些通常被当作孤立现象处理,而不是统一可靠性缺陷的症状。

维度 2(鲁棒性):当运行条件偏离名义状态时,系统是优雅退化还是骤然失败?

现实系统很少在理想条件下运行。汽车与航空测试会评估对传感器故障和环境极端条件的响应,遵循的原则是_鲁棒系统应优雅退化,而非骤然失败_。ML 研究已经识别出对输入变异的敏感性 [60, 5] 与提示注入 [43] 等失败模式,但往往把它们当作彼此无关的问题,而不是一个更广泛鲁棒性框架的组成部分。

维度 3(可预测性):系统能否识别自己何时可能失败?

一个以预期方式失败的系统,优于一个很少失败但失败方式不可预测的系统。航空与核领域对失败模式显式建模,通常在不确定性超过阈值时启用安全模式:_系统应当知道自己不知道什么_。ML 中关于校准 [16, 36] 与选择性预测 [10, 26] 的研究处理了相关关切,但往往没有与安全关键领域中可预测失败行为的概念建立联系。

维度 4(安全):当失败发生时,后果的严重程度如何?

每个安全关键领域都把可靠性与后果感知的风险评估绑定在一起,为灾难性失败设定具体的概率目标。统一的原则是_并非所有失败都等价_。相比之下,ML 的安全评测主要聚焦于对有害请求的遵从 [2] 或谄媚 [45],这与评估在执行合法任务失败时的操作后果是不同的问题。

综合。这四个维度在安全关键工程中一致地浮现。虽然 ML 研究涉及每个维度的某些方面,但它们很少被统一起来。受 Liang et al. [34] 的启发,我们的贡献提供了一个有原则的分解,把分散的 ML 努力组织起来用于 AI agent。至关重要的是,所有四个维度都_独立于原始能力_。一个能力很强的系统可能不可靠 [69],一个能力较弱的系统也可以在其运行包线内高度可靠。提升能力不会自动提升可靠性,因此需要独立评测。

表 2:可靠性指标总览。所有分数 $\in[0,1]$,值越高表示可靠性越好。记号:$T$ = 任务数;$K$ = 每任务运行次数;$\epsilon$ = 小常数($10^{-8}$);$\mathds{1}[\cdot]$ = 指示函数。

指标测量协议
一致性($\mathcal{R}_{\text{Con}}$)结果一致性 $C_{\text{out}}=\frac{1}{T}\sum_{t=1}^{T}(2\hat{p}_{t}-1)^{2}$对每个任务 $t$ 运行共 $K$ 次,得到结果 $y_{t,k}\in\{0,1\}$。计算每任务成功率 $\hat{p}_{t}=\frac{1}{K}\sum_{k}y_{t,k}$。每任务一致性 $(2\hat{p}_{t}-1)^{2}$ 用最大伯努利方差($0.25$)归一化有偏样本方差。对 $T$ 个任务取平均。
轨迹一致性(分布式)$C_{\text{traj}}^{d}=1-\frac{2\sum_{t}\sum_{i<j}\text{JSD}_{t}^{(i,j)}}{TK(K-1)}$对任务 $t$,从 $K$ 次运行收集动作序列。把每个序列转换为动作类型上的分布 $\mathbf{p}_{t}^{(k)}$。计算成对 Jensen-Shannon 散度 $\text{JSD}_{t}^{(i,j)}=\text{JSD}(\mathbf{p}_{t}^{(i)},\mathbf{p}_{t}^{(j)})$。系数 $\frac{2}{TK(K-1)}$ 对每任务 $\binom{K}{2}$ 对以及 $T$ 个任务取平均。
轨迹一致性(序列)$C_{\text{traj}}^{s}=1-\frac{2\sum_{t}\sum_{i<j}\hat{d}_{t}^{(i,j)}}{TK(K-1)}$对任务 $t$,从全部 $K$ 次运行收集动作序列 $\mathbf{a}^{(1)},\ldots,\mathbf{a}^{(K)}$。计算归一化成对 Levenshtein 距离 $\hat{d}_{t}^{(i,j)}=d_{\text{lev}}(\mathbf{a}_{t}^{(i)},\mathbf{a}_{t}^{(j)})/\max(\
资源一致性 $C_{\text{res}}=\exp\left(-\frac{1}{\R\
鲁棒性($\mathcal{R}_{\text{Rob}}$)故障鲁棒性 $R_{\text{fault}}=\min\left(\frac{\text{Acc}_{\text{fault}}}{\text{Acc}_{0}},1\right)$在基线条件下运行所有任务得到 $\text{Acc}_{0}=\frac{1}{N}\sum_{i}y_{i}^{(0)}$。在故障注入(如工具超时、错误响应)下重新运行得到 $\text{Acc}_{\text{fault}}$。计算截断比率。
环境鲁棒性 $R_{\text{env}}=\min\left(\frac{\text{Acc}_{\text{pert}}}{\text{Acc}_{0}},1\right)$在基线条件下运行所有任务得到 $\text{Acc}_{0}$。加入环境扰动(如字段重排、工具接口更改)重新运行得到 $\text{Acc}_{\text{pert}}$。
提示词鲁棒性 $R_{\text{prompt}}=\min\left(\frac{\text{Acc}_{\text{para}}}{\text{Acc}_{0}},1\right)$在基线条件下运行所有任务得到 $\text{Acc}_{0}$。使用语义等价的提示词改写重新运行得到 $\text{Acc}_{\text{para}}$。
可预测性($\mathcal{R}_{\text{Pred}}$)校准 $P_{\text{cal}}=1-\sum_{b=1}^{B}\frac{n_{b}}{N}\left\\bar{y}_{b}-\bar{c}_{b}\right\
区分度 $P_{\text{AUROC}}=\frac{\sum_{i:y_{i}=1}\sum_{j:y_{j}=0}\mathbf{1}[c_{i}>c_{j}]}{n_{\text{succ}}\cdot n_{\text{fail}}}$收集每个任务的置信度 $c_{i}$ 与结果 $y_{i}$。设 $n_{\text{succ}}=\sum_{i}y_{i}$,$n_{\text{fail}}=N-n_{\text{succ}}$。计算成功样本置信度高于失败样本的(成功,失败)配对占比(等价于 AUC-ROC)。
Brier 分数 $P_{\text{brier}}=1-\frac{1}{T}\sum_{i=1}^{T}(c_{i}-y_{i})^{2}$对每个任务 $i\in\{1,\ldots,T\}$ 收集置信度 $c_{i}\in[0,1]$ 与结果 $y_{i}\in\{0,1\}$。计算均方误差并用 1 减去。
安全($\mathcal{R}_{\text{Saf}}$)合规性 $S_{\text{comp}}=\frac{1}{N}\sum_{i=1}^{N}\mathds{1}[v_{i}=\emptyset]$定义约束集合 $\mathcal{C}$(如不暴露 PII、不执行破坏性操作)。由 LLM 评审对每个任务评估违规项 $v_{i}\subseteq\mathcal{C}$。计算无违规任务的占比。
危害有界性 $S_{\text{harm}}=1-\mathbb{E}[w_{i}\mid v_{i}\neq\emptyset]$对每个违规任务,计算 $w_{i}=\max_{v\in v_{i}}w(v)$,其中 $w(\text{low})=0.25$、$w(\text{med})=0.5$、$w(\text{high})=1.0$。对违规任务取平均并用 1 减去。

3 为 AI Agent 操作化可靠性

在第 2 节可靠性维度的基础上,我们为 AI agent 把这些概念操作化。表 2 给出了我们完整指标体系的形式化定义。这里,我们提供直觉,说明为什么每个维度及其构成指标对 agent 部署而言至关重要。

3.1 一致性($\mathcal{R}_{\text{Con}}$)

一个可靠的 agent 在相同条件下应产生相似的结果。基于语言模型的 agent 具有内在随机性,当用户无法预测重新运行某个任务是否会得到相同的结果、相同的解法路径或相同的成本时,这种随机性就会成为问题。

我们把一致性分解为三个互补方面。结果一致性($C_{\text{out}}$)衡量 agent 在对同一任务的重复尝试中是否稳定地成功或失败;前后不一的批准或拒绝会侵蚀用户信任。轨迹一致性刻画 agent 是否沿着相似路径抵达其解,分别从分布角度($C_{\text{traj}}^{d}$,比较动作频率)和序列角度($C_{\text{traj}}^{s}$,比较动作顺序)测量。动作序列的变化会使合规审计复杂化,并改变失败模式。最后,资源一致性($C_{\text{res}}$)量化计算与货币成本的波动,因为延迟或 API 成本的起伏会带来预算难题。

3.2 鲁棒性($\mathcal{R}_{\text{Rob}}$)

现实部署会让 agent 暴露于偏离其训练分布的条件。鲁棒的 agent 应在三类常见扰动下保持可比的性能。

故障鲁棒性($R_{\text{fault}}$)衡量对 API 超时或畸形响应等基础设施故障的恢复能力。鲁棒的 agent 会通过重试或回退优雅地处理工具错误,而不是放弃任务。环境鲁棒性($R_{\text{env}}$)刻画对运行环境中保持语义不变的更改的敏感度——重排 JSON 字段、更改日期格式或重命名 API 参数。当数据库以不同方式返回列时 agent 就失败,这表现出实践层面的脆弱性。提示词鲁棒性($R_{\text{prompt}}$)衡量对指令的语义等价改写或翻译的不变性。在改写(例如「取消我的订阅」与「终止我的套餐」)上失败,会使系统无法被信任地用于真实用户流量。

3.3 可预测性($\mathcal{R}_{\text{Pred}}$)

如果用户无法预判 agent 的成功或失败,那么平均表现良好的 agent 价值有限。可预测性刻画 agent 表达的置信度是否可靠地指示其实际表现,从而让用户能够决定是行动、验证还是移交。

校准($P_{\text{cal}}$)衡量所声明的置信度是否与经验成功率相符(例如 80% 的置信度应带来 80% 的成功)。校准不佳会导致用户过度信任或不必要地移交。区分度($P_{\text{AUROC}}$)评估置信度分数能否成功地把成功与失败分开,使用户能够设定可靠的接受阈值。Brier 分数($P_{\text{brier}}$)是一个 proper scoring rule[^1],它同时衡量校准与区分度,提供对预测质量的整体视角。

[^1]: 译注:proper scoring rule 指「恰当评分规则」,其含义为:一个恰当评分规则激励模型报告真实信念;偏离真实概率会恶化期望分数。

3.4 安全($\mathcal{R}_{\text{Saf}}$)

会采取行动的 agent 可能通过调用外部工具、修改数据或触发不可逆副作用,造成超出「任务失败」本身的危害。安全同时量化这类有害行为的严重度与频率。

合规性($S_{\text{comp}}$)追踪对预定义约束的遵守——保护个人数据、不执行未授权操作、不越界——无论危害是否可被立即观察到。危害严重度($S_{\text{harm}}$)衡量那些确实违反了约束的任务的后果。通过只在违规任务上做条件化(例如一条非预期的 DELETE 语句,对比一个良性的排序错误),$S_{\text{harm}}$ 把「违规有多严重」与「违规多常发生」区分开来。

3.5 聚合

为了支持跨 agent 的上游比较,我们在每个维度内聚合可靠性指标,并计算一个总体可靠性分数:

$\mathcal{R}_{\text{Con}}$$=\tfrac{1}{3}\bigl(C_{\text{out}}+C_{\text{traj}}+C_{\text{res}}\bigr)$(1)
$\mathcal{R}_{\text{Pred}}$$=P_{\text{brier}}$(2)
$\mathcal{R}_{\text{Rob}}$$=\tfrac{1}{3}\bigl(R_{\text{fault}}+R_{\text{struct}}+R_{\text{prompt}}\bigr)$(3)
$\mathcal{R}_{\text{Saf}}$$=1-\mathbb{P}(\text{violation})\mathbb{E}[\text{severity}\\text{violation}]$
$=1-(1-S_{\text{comp}})(1-S_{\text{harm}})$(5)
$\mathcal{R}$$=\tfrac{1}{3}\bigl(\mathcal{R}_{\text{Con}}+\mathcal{R}_{\text{Pred}}+\mathcal{R}_{\text{Rob}}\bigr)$(6)

以下聚合选择值得解释:

一致性。我们对结果、轨迹、资源三类赋予相等权重。聚合后的轨迹一致性 $C_{\text{traj}}=\frac{1}{2}(C_{\text{traj}}^{d}+C_{\text{traj}}^{s})$ 可防止它因为拥有更多子指标而主导整体一致性。虽然轨迹一致性在要求可审计性与过程可复现性的场景中极具价值,但我们认识到它在开放式创意工作流中可能不那么受用。在这类情况下,实践者可以选择不把它纳入一致性聚合。

安全。安全分数遵循 Kaplan & Garrick [27] 的经典风险表述,把风险分解为违规概率 $(1-S_{\text{comp}})$ 与期望严重度 $(1-S_{\text{harm}})$ 的乘积。因此,只有当 agent 从不违反约束或从不造成危害时,才有 $\mathcal{R}_{\text{Saf}}=1$。我们显式地把安全排除在总体聚合之外,因为安全违规本质上是一种_尾部现象_。把安全与其他维度做平均会掩盖关键的尾部风险(例如 99% 的时间行为安全,但 1% 的时间造成灾难性危害)。因此我们把安全指标的任何恶化都单独当作硬约束来处理。

总体可靠性。总体可靠性分数 $\mathcal{R}$ 默认对各支柱取均匀平均。不同的部署场景可能需要另外的加权方式,实践者应审视与其应用最相关的单项指标,而不应仅依赖聚合结果。

4 实验

我们在两个提出互补挑战的成熟基准上评测可靠性。我们的目标是理解 agent 可靠性的当前状态——既看整体,也看各个子指标——以及它在近几代模型中如何演化。我们在 https://hal.cs.princeton.edu/reliability/ 提供了实验结果的交互式看板。

4.1 实验设置

基准。我们选取以下两个基准,因为它们提供互补的可靠性挑战(更多细节见附录 F.1):

  • GAIA [39]:一个通用助手基准,需要网页浏览、文件操作与多步推理。我们使用其验证集划分,共 165 个任务,横跨三个难度级别(Level 1:简单查找;Level 2:多步推理;Level 3:复杂多工具协调)。
  • $\tau$-bench [65]:一个客服模拟基准,agent 与用户和数据库交互以处理请求。每个任务都涉及多轮对话与有后果的动作,例如发放退款、修改预订、处理取消。由于 Cuadron et al. [9] 发现原始 50 个航空任务中有 24 个包含错误(有缺陷的标准答案标签、有歧义的规格说明),我们把评测限制在他们验证过的 26 任务子集上。我们在图 6 中比较了完整子集与干净子集上的结果。

模型。我们评测 15 个模型,横跨三家提供商、多个能力层级,发布日期从 2024 年初到 2026 年中:OpenAI(GPT-4 Turbo、GPT-4o mini、o1、GPT-5.2、GPT-5.2 (medium)、GPT-5.5)、Google(Gemini 2.5 Flash、Gemini 2.5 Pro、Gemini 3.1 Pro、Gemini 3.5 Flash)与 Anthropic(Claude 3 Haiku、Claude 3.5 Haiku、Claude Sonnet 4、Claude Opus 4.5、Claude Opus 4.7)。这一选择使我们能够分析可靠性如何随模型能力变化,以及更新的发布或使用推理是否能在原始准确率之外提升可靠性。

Agent 脚手架。对 $\tau$-bench,我们使用一个工具调用脚手架,它呈现可用工具并解析结构化的工具调用输出。对 GAIA,我们使用一个 ReAct 风格的循环 [64],可访问网页浏览、代码执行与文件操作工具。我们在附录 F.2 中进一步描述我们的 agent 脚手架策略。

评测协议。对每个 agent-基准组合,我们执行以下协议:

  • 多次运行评测:每个任务用不同随机种子执行 $K=5$ 次以测量一致性。我们把温度设为零,使任何观察到的方差都可归因于非采样的随机性来源 [17](例如浮点非结合性、并发服务器负载带来的批大小变化、注意力与矩阵乘法中非确定性的核调度)。[^2]

[^2]: 译注:推理模型不暴露用户可配置的温度参数;对这些模型,我们保留各模型提供商提供的默认 API 设置。误差条表示均值 ±1 个标准误,并被截断到 $[0,1]$。

  • 提示词扰动:我们用 GPT 4o 为每个任务生成 $J=5$ 个语义等价、带自然变化的指令改写(见附录 F.3.1)。
  • 故障注入:我们以固定全局概率 $p_{\text{fault}}=0.2$ 注入 API、认证与工具调用故障,以测量故障鲁棒性(细节见附录 F.3.2)。
  • 环境扰动:我们对工具接口施加中等强度的格式更改(命名约定、数据与响应格式)(见附录 F.3.3)。
  • 置信度估计:我们通过后验自评提取置信度分数,提示 agent 在完成时为自己的置信度打分(见附录 F.3.4)。
  • 安全分析:我们使用基于 LLM 的分析,针对各基准特定约束计算错误严重度/合规性(见附录 F.3.5)。

4.2 主要结果

可靠性 vs 发布日期与准确率。图 1 揭示了各模型上能力进步与可靠性提升之间明显的脱节。尽管经历了 24 个月的模型开发,整体可靠性随时间只有微小改进。值得注意的是,可靠性改进在各评测场景间不成比例:$\tau$-bench 显示中等提升,而 GAIA 几乎没有改进,即便在最新模型中也是如此。一个可能的解释是,$\tau$-bench 更为结构化的性质使一致行为更容易达成,而 GAIA 的开放式任务呈现出更宽范围的失败模式;不过其他因素(如基准难度、评测协议)也可能有所贡献。无论原因为何,这些发现都表明,提升原始任务表现可能不足以构建可依赖的 AI agent,可靠性可能需要在能力扩展之外得到有针对性的关注。各单项可靠性指标的详细趋势图可见图 8。

各模型结果一致性

图 2:各模型的结果一致性。结果显示整体一致性都仅为中等;即便是当前前沿模型,也没能在两个基准上都可靠地改进。

图 3:各模型的提示词鲁棒性。许多模型仍然容易受表层提示词改写的影响。最新的前沿模型总体只表现出适度改进。

各模型校准与区分度

图 4:各模型的校准与区分度。校准,即预测置信度与准确率之间的对齐,在最新前沿模型中总体有所改进。区分度表现,即区分正确与错误预测的能力,在各基准间并不一致(在 GAIA 上甚至变差)。

分维度发现。现在我们逐一分析每个可靠性维度。我们在附录 G 中提供额外细节与扩展图表。

  • 一致性:我们的一致性分析揭示了关于 agent 可靠性的两个关键发现。第一,结果一致性在所有模型上都很低(见图 2),这意味着能解决某任务的 agent 往往无法稳定地做到这一点。能力与可靠性之间的这一鸿沟直接体现在 pass@$k$ 与 pass$\wedge k$ 的分歧上。第二,我们观察到一种「知道做什么、但不知道何时做」的模式:agent 的分布一致性显著高于序列一致性,表明它们在多次运行间能可靠地选择相似的动作类型,但在执行顺序上存在差异(见图 11)。综合来看,这些发现表明,提升可靠性不仅需要更好的动作选择,还需要更稳定的规划与执行。此外,资源一致性结果显示,token 与算力使用在多次运行间存在高方差,在 GAIA 上尤为明显,表明 agent 常常以不可预测的方式分配努力。
  • 鲁棒性:我们的鲁棒性分析揭示了模型脆弱性的不对称性。故障鲁棒性与环境鲁棒性在大多数模型上都表现出天花板效应(见图 17),尽管我们评测的扰动只是 agent 在实践中面临的环境漂移的一个子集。我们相信改进的基准设计能对该维度做出更全面的评测(更详细的讨论见第 6 节)。相反,提示词鲁棒性仍是一个关键区分点(见图 3):对表层指令改写的敏感性在各模型间差异很大。这一模式反直觉:模型能优雅地处理真正的技术故障,却仍然容易受任务规格中表层变化的影响。
  • 可预测性:我们通过校准与区分度评估模型可预测性(见图 4、图 12)。我们发现,许多早期模型不达标的校准,在近期模型中已明显改进。特别是 Claude 系列模型在两个基准上都表现出更强的校准,即使任务复杂度上升也能保持良好对齐的置信度估计。与校准相反,区分度的趋势在各基准间出现分歧:在 $\tau$-bench 上,区分度在近期模型中总体有所改进,而在 GAIA 上并没有明显改进(在一些最新模型中甚至变差)。这一发现凸显了同时测量可预测性两个子指标的重要性:仅有校准的改进,并不保证模型能可靠地识别自己何时可能失败。
  • 安全:我们报告聚合安全($\mathcal{R}_{\text{Saf}}$)及其两个子指标:合规性($S_{\text{comp}}$)与危害严重度($S_{\text{harm}}$)。近期前沿模型表现出明显更低的违规率(见图 5),每家提供商最有能力的模型都取得了最高的合规分数。危害严重度分数普遍偏高,表明当违规确实发生时,大多数属于低到中等严重度。然而,即便是偶发的高严重度违规——如未授权的数据暴露或错误的金融交易——也会带来超额代价。我们在本节后面提供 $\tau$-bench 上安全的更详细拆解。

模型类型分析。我们观察到可靠性并不随模型能力均匀扩展(见图 9)。虽然校准、鲁棒性与安全通常随模型规模改进,一致性却常表现出相反的模式。较小的模型往往取得相同或更高的一致性,这表明较大模型的多条解题路径增加了运行间变异性。此外,推理模型通常比其非推理对应物更可靠,尽管它们的可靠性提升落后于准确率提升(图 19)。

每个基准还提供了探究特定可靠性问题的独特机会。

GAIA:跨难度级别的可靠性。GAIA 的三个难度级别使我们能分析可靠性如何随任务复杂度变化。人们可能预期结果一致性呈 U 形(中等任务最不稳定)。然而,我们的结果(图 20)显示一致性通常单调变化:随任务变难,它稳步改进或稳步退化。此外,资源一致性在复杂任务上对大多数模型都退化,表明动作成本变得更难预测。这一效应在 Gemini 与许多 Claude 模型上被放大,它们在难任务上采取「加倍努力」的策略,动作数量升高。就可预测性而言,校准与区分度在更难的任务上都适度退化,尽管存在相当大的模型间差异。最后,鲁棒性指标与难度之间没有系统性关系,表明对扰动的鲁棒性在很大程度上与任务复杂度正交。

$\tau$-bench:安全分析。$\tau$-bench 的客服场景使我们能在延展的多轮交互上进行有针对性的安全分析。我们评估四个领域特定约束:(i) 阻止未授权修改,(ii) 确保交易金额正确,(iii) 要求身份验证,(iv) 抵抗策略规避。分析完整的交互轨迹,而非仅看最终结果,使我们能够评估中间推理与策略遵守情况 [29]。图 5 呈现了按严重度与约束类型分层的违规分布。财务准确性违规是最普遍的失败模式,反映了在交易场景中进行精确数值推理的难度。虽然最先进模型表现出最低的整体违规率、高严重度违规仍然罕见,但即便是偶发的严重失败——如未授权的数据暴露——也可能带来重大代价,并成为在高风险领域真实部署的关键阻碍。

安全违规严重度分布

图 5:$\tau$-bench 上的安全分析。上:按严重度分层的每次评测运行平均违规数。下:按约束类别拆解的违规。最新的前沿模型表现出显著更低的整体违规率。财务准确性(即错误的扣款/退款)仍是所有模型中最常见的失败模式。

图 6:$\tau$-bench 与 $\tau$-bench(clean)的对比。准确率整体显著提升。许多 agent 在 $\tau$-bench 的验证子集上,各维度的可靠性也有所改进。可预测性的改进最为明显。

$\tau$-bench 中的基准错误。如上所述,Cuadron et al. [9] 已识别出 $\tau$-bench 中的多处评分错误,这正是我们把分析限制在其余 26 个干净任务上的原因。为了展示基准质量如何影响可靠性,我们在图 6 中给出了与完整基准在我们的可靠性维度上的简短对比。我们发现,_可预测性与安全在各 agent 中几乎普遍改进_。一个值得注意的观察是可预测性的显著改进,最突出地体现在校准指标上。这在预期之内:一个自信地解决了任务、却被错误答案键惩罚的 agent,会被不公正地判定为过度自信。相反,一致性与鲁棒性在各 agent 中并不能可靠地改进。

5 建议

把可靠性当作一条独立的进步轴,对 agent 如何被评测、设计与治理都有影响。我们在此总结四条建议,并在附录 A 中对每条展开。

建议 1。评测可靠性需要动态基准,超越单次运行的准确率与固定环境。

当前的 agent 基准通常报告在固定环境中单次运行得到的一个准确率数字。这完全没有透露:agent 明天在同一任务上是否会成功、它如何处理改写过的指令,或者当底层基础设施变化时它如何适应。已部署的 agent 面对的是另一种现实:数据库被迁移、API 格式改变、工具库被更新。因此,可靠的测量需要多次运行协议——重复执行相同任务以评估方差——以及多条件协议——系统性地扰动输入与环境。基准应当变得可生成、可参数化,而不是依赖固定测试集,让实验者能够重命名字段、重排响应,或注入与真实世界漂移相仿的故障概率。这类生成式测试集还能缓解诸如在线查找答案之类的捷径 [28]。最后,时间维度上的重新评测至关重要,它能揭示当世界偏离 agent 被测试时的条件后,可靠性是被维持还是在无声地退化。

建议 2。Agent 架构应当为可靠性而设计和优化,而不仅仅为能力。

Agent 设计应显式地由我们的可靠性维度引导,而这些维度在各模型代际间的改进并不均匀:校准与安全已明显进步,暗示训练期间存在有意的优化,而一致性与区分度改进甚微。系统性评测让这种不均衡的进步变得可见,识别出哪些维度处于正向轨迹、哪些不是。在有提升的地方,我们的指标能够追踪;在没有提升的地方,它们提供了仅凭面向能力的评测所看不见的优化目标。

建议 3。可靠性指标应当为部署治理提供信息,正如在安全关键行业中所做的那样。

可靠性指标与事故分析应当输入部署决策、变更管理与合规流程。一个组织可以要求在把 agent 从沙箱试点推向生产之前,达到最低的一致性与安全阈值,正如航空系统必须在投入使用前满足认证要求。与安全关键行业类似,一种事故报告、事后分析与持续改进的文化很可能被证明至关重要。把可靠性当作多维的,为指标设计、基准开发、算法方法、界面设计与治理等研究贡献打开了空间。

建议 4。可靠性要求应当随 agent 自主程度而扩展。

可靠性有多重要,取决于 agent 是自主运行还是辅助人类。在增强场景中(编码助手、搜索副驾),人类会在输出生效前审查并批准,充当可靠性后备。值得注意的是,这使得 AI 编码助手尽管可靠性不完美,仍达到了广泛采用。在自动化场景中(客服聊天机器人、无人值守的工作流),agent 的输出就是最终动作,没有人类缓冲,因此不可靠会直接转化为失败。一个在 90% 任务上成功、但在其余任务上不可预测地失败的 agent,可能是一个有用的助手,却是一个不可接受的自主系统。

6 局限

我们承认本工作的若干局限:

  • 基准覆盖。我们的分析覆盖_两个基准_($\tau$-bench 与 GAIA),虽然它们在结构与范围上互补,但只代表 agent 在实践中面临任务的一个狭窄切片。
  • 脚手架多样性。我们对每个基准都用_单一表现良好的脚手架_评测;其他脚手架可能产生性质不同的可靠性画像。
  • 安全评审。我们的安全评测依赖_基于 LLM 的评审_,这引入了它自身的可靠性问题。
  • 指标与聚合选择。每个维度内的指标,以及我们基于归一化的、把可靠性与能力解耦的方法,反映了_主观设计选择_;其他分解方式也是可能的。我们把安全单独报告以避免掩盖尾部风险,因此 $\mathcal{R}$ 并不能捕捉全貌。
  • 温度选择。我们全程把温度设为零,这可能_高估_了在非零温度能使准确率最大化时可达到的可靠性。

我们把我们的框架视为一个起点,并强调可靠性评测应当补充而非取代谨慎的部署实践,包括人类监督、沙箱测试与监控。我们还回应了针对我们框架的两个异议——可靠性在能力足够时是冗余的,以及它的维度并非普遍可取——并在附录 B 中展开这些局限。

7 结论

我们引入了一种以安全关键工程为根基的 agent 可靠性分解,并在两个互补基准上评测了 15 个模型。我们的结果显示,24 个月的快速能力提升只带来了可靠性上的微小改进:准确率大幅提高的模型,在多次运行间仍不一致,对提示词改写仍然脆弱,且常常无法理解自己何时可能成功。随着 agent 被部署到高风险场景,把可靠性当作关键评测关切变得必不可少。我们提出了一种做法:一种四维分解,含十二个以安全关键工程为根基的不同子指标。虽然我们的具体分解只是众多可能框架之一,但视角的核心转变最为重要:从问「_agent 多久成功一次?_」转变为问「_它的行为有多可预测、多一致、多鲁棒、多安全?_」。我们在附录 A 与附录 B 中展开我们的建议与局限,并在附录 E 中勾勒未来工作的方向。

致谢

本工作得到 Princeton Language and Intelligence(PLI)、Princeton AI Lab、Princeton Catalysis Initiative、Schmidt Sciences 与 Coefficient Giving 的支持。我们感谢 OpenAI 与 Google 提供算力额度支持我们的实验。我们还感谢 Benedikt Stroebl、Veniamin Veselovsky、Matthew J. Salganik、Franck Ndzomga、Andrew Schwartz、Rob Schwartz、Felix Chen 与 David Glukhov 对本文早期草稿的有益反馈。我们进一步感谢 Ben Crestel、Davi Valério、Jonathan Almeida 与 Adriana Prado 指出了本文早期预印本版本中结果一致性计算的一个错误。最后,我们感谢匿名的 ICML 审稿人,他们的反馈大幅改进了本工作的呈现与定位。除其他修改外,他们的意见促使我们考虑重新拟定标题,以强调我们的工作主要关乎可靠性测量而非定义。我们最终保留了原标题,因为本工作已作为预印本流传,并已在该标题下积累了引用与社区关注。改名会在文献中引入混乱。我们转而澄清:我们把可靠性当作一种用于测量的工作性操作化,而非一次形式化的重新定义(见附录 D.3)。

影响声明

可靠性指标可以为部署决策提供信息、指导 agent 开发,并支持新兴的治理框架。通过把可靠性变成可测量的属性,我们的框架使得 agent 之间的比较有原则可依,并为判定一个 agent 是否适合给定部署场景提供了具体标准。例如,部署客服 agent 的组织可以要求在从沙箱试点转向生产之前,一致性与可预测性达到最低阈值;而代码生成 agent 则可能面临围绕破坏性操作的更严格安全要求。

与此同时,我们强调若干风险。第一,指标可能被钻空子:只针对可靠性分数做优化而不解决底层失败模式,可能制造虚假的安全感。第二,高可靠性分数并不保证安全或有益的行为:一个 agent 可以既一致、又鲁棒、又校准良好,却仍在追求与用户意图不一致的目标。第三,如果可靠性评测被当作充分条件而非必要条件,它可能被用来为过早部署辩护。我们强调,可靠性评测应当_补充_而非取代谨慎的部署实践,包括人类监督、沙箱测试、事故监控与持续评估。

更广泛地说,我们希望把可靠性确立为标准评测维度,能鼓励模型开发者在准确率之外同时报告可靠性画像,使下游用户能够做出知情的部署决策,并为监管者提供评估 agent 就绪度的具体、可审计的标准。实现这些收益需要社区在标准化基准、共享评测协议与透明报告规范上共同努力。

参考文献

  • [1] American Bar Association. Bc tribunal confirms companies remain liable for information provided by ai chatbot. _Business Law Today_, 2024. URL https://www.americanbar.org/groups/business_law/resources/business-law-today/2024-february/bc-tribunal-confirms-companies-remain-liable-information-provided-ai-chatbot/
  • [2] Andriushchenko, M., Souly, A., Dziemian, M., Duenas, D., Lin, M., Wang, J., Hendrycks, D., Zou, A., Kolter, Z., Fredrikson, M., Winsor, E., Wynne, J., Gal, Y., and Davies, X. AgentHarm: A benchmark for measuring harmfulness of LLM agents. In _International Conference on Learning Representations (ICLR)_, 2025.
  • [3] Avizienis, A., Laprie, J.-C., Randell, B., and Landwehr, C. Basic concepts and taxonomy of dependable and secure computing. _IEEE transactions on dependable and secure computing_, 1(1):11–33, 2004.
  • [4] Bai, Y., Kadavath, S., Kundu, S., Askell, A., Kernion, J., Jones, A., Chen, A., Goldie, A., Mirhoseini, A., McKinnon, C., et al. Constitutional ai: Harmlessness from ai feedback. _ArXiv preprint_, abs/2212.08073, 2022. URL https://arxiv.org/abs/2212.08073
  • [5] Bogavelli, T., Bamgbose, O., Melançon, G. G., Riols, F., and Sharma, R. Evaluating robustness of large language models in enterprise applications: Benchmarks for perturbation consistency across formats and languages. _ArXiv preprint_, abs/2601.06341, 2026. URL https://arxiv.org/abs/2601.06341
  • [6] Boulanger, J.-L. _CENELEC 50128 and IEC 62279 standards_. John Wiley & Sons, 2015.
  • [7] Business Insider. Replit ceo apologizes after ai coding tool deleted a live production database. _Business Insider_, 2025. URL https://www.businessinsider.com/replit-ceo-apologizes-ai-coding-tool-delete-company-database-2025-7. Replit 的 AI 助手在明确被指示不要这样做的情况下仍删除了一个生产数据库。
  • [8] Cobbe, K., Kosaraju, V., Bavarian, M., Chen, M., Jun, H., Kaiser, L., Plappert, M., Tworek, J., Hilton, J., Nakano, R., et al. Training verifiers to solve math word problems. _ArXiv preprint_, abs/2110.14168, 2021. URL https://arxiv.org/abs/2110.14168
  • [9] Cuadron, A., Yu, P., Liu, Y., and Gupta, A. Saber: Small actions, big errors–safeguarding mutating steps in llm agents. _ArXiv preprint_, abs/2512.07850, 2025. URL https://arxiv.org/abs/2512.07850
  • [10] El-Yaniv, R. et al. On the foundations of noise-free selective classification. _Journal of Machine Learning Research_, 11(5), 2010.
  • [11] Farquhar, S., Kossen, J., Kuhn, L., and Gal, Y. Detecting hallucinations in large language models using semantic entropy. _Nature_, 630(8017):625–630, 2024.
  • [12] Federal Aviation Administration. Advisory circular AC 21-16g: RTCA document DO-160 versions D, E, F, and G. Technical report, U.S. Department of Transportation, 2011. URL https://www.faa.gov/regulations_policies/advisory_circulars/index.cfm/go/document.information/documentid/1019280
  • [13] Federal Aviation Administration. Advisory circular AC 25.1309-1b: System design and analysis. Technical report, U.S. Department of Transportation, 2024. URL https://www.faa.gov/documentLibrary/media/Advisory_Circular/AC_25.1309-1B.pdf
  • [14] Foerster, H., Mullins, R., Blanchard, T., Papernot, N., Nikolić, K., Tramèr, F., Shumailov, I., Zhang, C., and Zhao, Y. Camels can use computers too: System-level security for computer use agents. _ArXiv preprint_, abs/2601.09923, 2026. URL https://arxiv.org/abs/2601.09923
  • [15] Fowler, G. A. I let ChatGPT’s new ‘agent’ manage my life. It spent $31 on a dozen eggs. _The Washington Post_, 2025. URL https://www.washingtonpost.com/technology/2025/02/07/openai-operator-ai-agent-chatgpt/
  • [16] Guo, C., Pleiss, G., Sun, Y., and Weinberger, K. Q. On calibration of modern neural networks. In Precup, D. and Teh, Y. W. (eds.), _Proceedings of the 34th International Conference on Machine Learning, ICML 2017, Sydney, NSW, Australia, 6-11 August 2017_, volume 70 of _Proceedings of Machine Learning Research_, pp. 1321–1330. PMLR, 2017. URL http://proceedings.mlr.press/v70/guo17a.html
  • [17] He, H. and Thinking Machines Lab. Defeating nondeterminism in LLM inference. _Thinking Machines Lab: Connectionism_, 2025. doi: 10.64434/tml.20250910. https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/
  • [18] Hendrycks, D., Carlini, N., Schulman, J., and Steinhardt, J. Unsolved problems in ml safety. _ArXiv preprint_, abs/2109.13916, 2021. URL https://arxiv.org/abs/2109.13916
  • [19] Huang, S., Carter, S., Eaton, J., Pollack, S., Callender III, D., Makagiansar, N., Gonzalez, M., Carr, S., Hong, J., Handa, K., McCain, M., Millar, T., Julapalli, M., Yun, G., Alt, A., Larsson, C., Leibrock, J., Gallivan, M., Sumers, T., Durmus, E., Kearney, M., Shen, J. H., Clark, J., Stern, M., and Ganguli, D. What 81,000 people want from AI. Anthropic, 2026. URL https://anthropic.com/features/81k-interviews
  • [20] IEEE. IEEE standard criteria for safety systems for nuclear power generating stations (IEEE std 603-2018). 2018.
  • [21] International Electrotechnical Commission. IEC 61508: Functional safety of electrical/electronic/programmable electronic safety-related systems, 2010.
  • [22] International Electrotechnical Commission. IEC 61513: Nuclear power plants – instrumentation and control important to safety – general requirements for systems, 2011. Edition 2.0.
  • [23] International Organization for Standardization. ISO 26262: Road vehicles – functional safety, 2018. Second edition (Parts 1–12).
  • [24] Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., and Narasimhan, K. R. Swe-bench: Can language models resolve real-world github issues? In _The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024_. OpenReview.net, 2024. URL https://openreview.net/forum?id=VTF8yNQM66
  • [25] Kadavath, S., Conerly, T., Askell, A., Henighan, T., Drain, D., Perez, E., Schiefer, N., Hatfield-Dodds, Z., DasSarma, N., Tran-Johnson, E., et al. Language models (mostly) know what they know. _ArXiv preprint_, abs/2207.05221, 2022. URL https://arxiv.org/abs/2207.05221
  • [26] Kalai, A. T., Nachum, O., Vempala, S. S., and Zhang, E. Why language models hallucinate. _ArXiv preprint_, abs/2509.04664, 2025. URL https://arxiv.org/abs/2509.04664
  • [27] Kaplan, S. and Garrick, B. J. On the quantitative definition of risk. _Risk analysis_, 1(1):11–27, 1981.
  • [28] Kapoor, S., Stroebl, B., Kirgis, P., Nadgir, N., Siegel, Z. S., Wei, B., Xue, T., Chen, Z., Chen, F., Utpala, S., et al. Holistic agent leaderboard: The missing infrastructure for ai agent evaluation. _ArXiv preprint_, abs/2510.11977, 2025. URL https://arxiv.org/abs/2510.11977
  • [29] Kirgis, P., Kapoor, S., Rabanser, S., Nadgir, N., Ududec, C., Dubois, M., Allaire, J., Stosz, C., Hobbhahn, M., Steinhardt, J., and Narayanan, A. Log analysis is necessary for credible evaluation of ai agents. _ArXiv preprint_, abs/2605.08545, 2026. URL https://arxiv.org/abs/2605.08545
  • [30] Kossen, J., Han, J., Razzak, M., Schut, L., Malik, S., and Gal, Y. Semantic entropy probes: Robust and cheap hallucination detection in llms. _ArXiv preprint_, abs/2406.15927, 2024. URL https://arxiv.org/abs/2406.15927
  • [31] Laprie, J.-C. Dependability: Basic concepts and terminology. In _Dependability: Basic Concepts and Terminology: In English, French, German, Italian and Japanese_, pp. 3–245. Springer, 1992.
  • [32] Lecher, C. NYC’s AI chatbot tells businesses to break the law. _The Markup_, 2024. URL https://themarkup.org/news/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law. 与 The City 和 Documented 联合发布。
  • [33] Lee, H., Phatale, S., Mansoor, H., Mesnard, T., Ferret, J., Lu, K., Bishop, C., Hall, E., Carbune, V., Rastogi, A., and Prakash, S. RLAIF vs. RLHF: scaling reinforcement learning from human feedback with AI feedback. In _Forty-first International Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27, 2024_. OpenReview.net, 2024. URL https://openreview.net/forum?id=uydQ2W41KO
  • [34] Liang, P., Bommasani, R., Lee, T., Tsipras, D., Soylu, D., Yasunaga, M., Zhang, Y., Narayanan, D., Wu, Y., Kumar, A., et al. Holistic evaluation of language models. _ArXiv preprint_, abs/2211.09110, 2022. URL https://arxiv.org/abs/2211.09110
  • [35] Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T., Leike, J., Schulman, J., Sutskever, I., and Cobbe, K. Let’s verify step by step. In _The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024_. OpenReview.net, 2024. URL https://openreview.net/forum?id=v8L0pN6EOi
  • [36] Lin, S., Hilton, J., and Evans, O. TruthfulQA: Measuring how models mimic human falsehoods. In Muresan, S., Nakov, P., and Villavicencio, A. (eds.), _Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)_, pp. 3214–3252, Dublin, Ireland, 2022. Association for Computational Linguistics. doi: 10.18653/v1/2022.acl-long.229. URL https://aclanthology.org/2022.acl-long.229
  • [37] Liu, X., Yu, H., Zhang, H., Xu, Y., Lei, X., Lai, H., Gu, Y., Ding, H., Men, K., Yang, K., Zhang, S., Deng, X., Zeng, A., Du, Z., Zhang, C., Shen, S., Zhang, T., Su, Y., Sun, H., Huang, M., Dong, Y., and Tang, J. Agentbench: Evaluating llms as agents. In _The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024_. OpenReview.net, 2024. URL https://openreview.net/forum?id=zAdUB0aCTQ
  • [38] Lyu, M. R. _Handbook of Software Reliability Engineering_. IEEE Computer Society Press and McGraw-Hill, 1996.
  • [39] Mialon, G., Fourrier, C., Wolf, T., LeCun, Y., and Scialom, T. GAIA: a benchmark for general AI assistants. In _The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024_. OpenReview.net, 2024. URL https://openreview.net/forum?id=fibxvahvs3
  • [40] Mohammadi, M., Li, Y., Lo, J., and Yip, W. Evaluation and benchmarking of llm agents: A survey. In _Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V. 2_, pp. 6129–6139, 2025.
  • [41] Musa, J. D., Iannino, A., and Okumoto, K. _Software Reliability: Measurement, Prediction, Application_. McGraw-Hill, 1987.
  • [42] NASA Engineering and Safety Center. Technical support to the national highway traffic safety administration (NHTSA) on the reported Toyota motor corporation (TMC) unintended acceleration (UA) investigation. Technical Report NESC-TN-10-00618, National Aeronautics and Space Administration, 2011. URL https://www.nhtsa.gov/staticfiles/nvs/pdf/NASA-UA_report.pdf
  • [43] Nasr, M., Carlini, N., Sitawarin, C., Schulhoff, S. V., Hayes, J., Ilie, M., Pluto, J., Song, S., Chaudhari, H., Shumailov, I., Thakurta, A., Xiao, K. Y., Terzis, A., and Tramèr, F. The attacker moves second: Stronger adaptive attacks bypass defenses against LLM jailbreaks and prompt injections. _ArXiv preprint_, abs/2510.09023, 2025. URL https://arxiv.org/abs/2510.09023
  • [44] OpenAI. Computer-using agent. OpenAI Research, 2025. URL https://openai.com/index/computer-using-agent/
  • [45] Paech, S. J. Spiral-bench. https://github.com/sam-paech/spiral-bench, 2025.
  • [46] Pan, M. Z., Arabzadeh, N., Cogo, R., Zhu, Y., Xiong, A., Agrawal, L. A., Mao, H., Shen, E., Pallerla, S., Patel, L., et al. Measuring agents in production. _ArXiv preprint_, abs/2512.04123, 2025. URL https://arxiv.org/abs/2512.04123
  • [47] Radio Technical Commission for Aeronautics. DO-178C: Software considerations in airborne systems and equipment certification, 2012.
  • [48] Razavi, A., Soltangheis, M., Arabzadeh, N., Salamat, S., Zihayat, M., and Bagheri, E. Benchmarking prompt sensitivity in large language models. In _Advances in Information Retrieval: 47th European Conference on Information Retrieval, ECIR 2025_, Lucca, Italy, 2025. Springer.
  • [49] Roose, K. Microsoft puts limits on bing ai chats after its chatbot went off the rails. _The New York Times_, 2023. URL https://www.nytimes.com/2023/02/17/technology/bing-chatbot-limits.html. 记录了长对话中的幻觉、情绪操纵与不稳定行为。
  • [50] SAE International. SAE arp4761: Guidelines and methods for conducting the safety assessment process on civil airborne systems and equipment, 1996.
  • [51] SAE International. ARP4754A: Guidelines for development of civil aircraft and systems. Technical report, SAE International, Warrendale, PA, 2010.
  • [52] The Guardian. Air canada ordered to pay customer misled by chatbot. _The Guardian_, 2024. URL https://www.theguardian.com/world/2024/feb/16/air-canada-chatbot-lawsuit. 加拿大仲裁庭裁定 Air Canada 需为其聊天机器人提供的错误丧亲票价信息承担责任。
  • [53] Tom’s Hardware. Ai coding platform goes rogue and deletes entire company database. _Tom’s Hardware_, 2025. URL https://www.tomshardware.com/tech-industry/artificial-intelligence/ai-coding-platform-goes-rogue-during-code-freeze-and-deletes-entire-company-database-replit-ceo-apologizes-after-ai-engine-says-it-made-a-catastrophic-error-in-judgment-and-destroyed-all-production-data
  • [54] Uesato, J., Kushman, N., Kumar, R., Song, F., Siegel, N., Wang, L., Creswell, A., Irving, G., and Higgins, I. Solving math word problems with process-and outcome-based feedback. _ArXiv preprint_, abs/2211.14275, 2022. URL https://arxiv.org/abs/2211.14275
  • [55] U.S. Nuclear Regulatory Commission. Severe accident risks: An assessment for five U.S. nuclear power plants. Technical Report NUREG-1150, U.S. Nuclear Regulatory Commission, 1990. URL https://www.nrc.gov/reading-rm/doc-collections/nuregs/staff/sr1150/
  • [56] U.S. Nuclear Regulatory Commission. BTP 7-21: Guidance on digital computer real-time performance. Technical Report NUREG-0800, Chapter 7, U.S. Nuclear Regulatory Commission, 2016. URL https://www.nrc.gov/docs/ML1602/ML16020A036.pdf. Revision 6.
  • [57] Vendrow, J., Vendrow, E., Beery, S., and Madry, A. Do large language model benchmarks test reliability? _ArXiv preprint_, abs/2502.03461, 2025. URL https://arxiv.org/abs/2502.03461
  • [58] Wang, B., Ren, C., Yang, J., Liang, X., Bai, J., Chai, L., Yan, Z., Zhang, Q.-W., Yin, D., Sun, X., et al. Mac-sql: A multi-agent collaborative framework for text-to-sql. In _Proceedings of the 31st International Conference on Computational Linguistics_, pp. 540–557, 2025.
  • [59] Wang, P., Li, L., Shao, Z., Xu, R., Dai, D., Li, Y., Chen, D., Wu, Y., and Sui, Z. Math-shepherd: Verify and reinforce llms step-by-step without human annotations. In _Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)_, pp. 9426–9439, 2024.
  • [60] Wang, Y. and Zhao, Y. RUPBench: Benchmarking reasoning under perturbations for robustness evaluation in large language models. _ArXiv preprint_, abs/2406.11020, 2024. URL https://arxiv.org/abs/2406.11020
  • [61] Warren, T. Microsoft limits bing ai chat to 5 replies per session. _The Verge_, 2023. URL https://www.theverge.com/2023/2/17/23604906/microsoft-bing-ai-chat-limits-conversations
  • [62] Weidinger, L., Uesato, J., Rauh, M., Griffin, C., Huang, P.-S., Mellor, J., Glaese, A., Cheng, M., Balle, B., Kasirzadeh, A., et al. Taxonomy of risks posed by language models. In _Proceedings of the 2022 ACM conference on fairness, accountability, and transparency_, pp. 214–229, 2022.
  • [63] Yang, J., Jimenez, C. E., Wettig, A., Lieret, K., Yao, S., Narasimhan, K., and Press, O. Swe-agent: Agent-computer interfaces enable automated software engineering. In Globersons, A., Mackey, L., Belgrave, D., Fan, A., Paquet, U., Tomczak, J. M., and Zhang, C. (eds.), _Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2024, NeurIPS 2024, Vancouver, BC, Canada, December 10 - 15, 2024_, 2024. URL http://papers.nips.cc/paper_files/paper/2024/hash/5a7c947568c1b1328ccc5230172e1e7c-Abstract-Conference.html
  • [64] Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K. R., and Cao, Y. React: Synergizing reasoning and acting in language models. In _The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1-5, 2023_. OpenReview.net, 2023. URL https://openreview.net/pdf?id=WE_vluYUL-X
  • [65] Yao, S., Shinn, N., Razavi, P., and Narasimhan, K. τ-bench: A benchmark for tool-agent-user interaction in real-world domains. _ArXiv preprint_, abs/2406.12045, 2024. URL https://arxiv.org/abs/2406.12045
  • [66] Yuan, W., Pang, R. Y., Cho, K., Li, X., Sukhbaatar, S., Xu, J., and Weston, J. Self-rewarding language models. In _Forty-first International Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27, 2024_. OpenReview.net, 2024. URL https://openreview.net/forum?id=0NphYCmgua
  • [67] Zhao, Z., Wallace, E., Feng, S., Klein, D., and Singh, S. Calibrate before use: Improving few-shot performance of language models. In Meila, M. and Zhang, T. (eds.), _Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18-24 July 2021, Virtual Event_, volume 139 of _Proceedings of Machine Learning Research_, pp. 12697–12706. PMLR, 2021. URL http://proceedings.mlr.press/v139/zhao21c.html
  • [68] Zheng, L., Chiang, W., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., and Stoica, I. Judging llm-as-a-judge with mt-bench and chatbot arena. In Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M., and Levine, S. (eds.), _Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023_, 2023. URL http://papers.nips.cc/paper_files/paper/2023/hash/91f18a1287b398d378ef22505bf41832-Abstract-Datasets_and_Benchmarks.html
  • [69] Zhou, L., Schellaert, W., Martínez-Plumed, F., Moros-Daval, Y., Ferri, C., and Hernández-Orallo, J. Larger and more instructable language models become less reliable. _Nature_, 634(8032):61–68, 2024a.
  • [70] Zhou, S., Xu, F. F., Zhu, H., Zhou, X., Lo, R., Sridhar, A., Cheng, X., Ou, T., Bisk, Y., Fried, D., Alon, U., and Neubig, G. Webarena: A realistic web environment for building autonomous agents. In _The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024_. OpenReview.net, 2024b. URL https://openreview.net/forum?id=oKn9c6ytLx

译注:本文为正文卷(含摘要至影响声明与全部参考文献)。扩展建议、扩展局限、指标细节、扩展背景与研究议程见《附录卷(上)》:https://openqa.cn/articles/agent-reliability-twelve-metrics-appendix-1-zh ;实验细节与完整实验结果见《附录卷(下)》:https://openqa.cn/articles/agent-reliability-twelve-metrics-appendix-2-zh

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction