TRACE: 诊断 智能 体 评 测 中的 验证 器 脆性
验证器分数的变化不一定是能力变化。TRACE 用成对变异、轨迹检查和重新评分,把工具名评分缺陷与真正的行为失败分开。

本文目录
TRACE:诊断智能体评测中的验证器脆性
Radhika Gaonkar
Prime Intellect
摘要
验证器分数现在既充当大语言模型(LLM)智能体的基准指标,也充当训练奖励,而分数的变化通常被读成能力的变化。它也可能只是反映了评测本身的变化。我们引入 TRACE,一套把分数变化从判决变成可检验诊断的协议:它对评测的一个部分施加有针对性的改变,比较成对运行,检查智能体的行为是否改变,并对未改变的轨迹重新评分,以检验是否该由评分规则负责。在一套包含 25 个合成任务的受控实验中,重命名工具使一个脚本化智能体的分数下降 0.250,尽管它执行的操作完全相同;在评分时恢复原来的名称会消掉整个差距,而同一种变异在第二个智能体上暴露的是真正的行为失败。在四个 LLM 智能体参与的公开 $\tau^{2}$-bench 任务上,最初的 30 个任务研究发现奖励变化有正有负,其中那一个清晰的效应并不能复现。在随后更大规模的 88 个新任务、每种条件重复运行的跟进中,重命名工具或重新排版工具输出,使八组智能体–改变配对中的七组奖励变化落在 $\pm 0.10$ 以内,而故意误导的工具名则使每个智能体的奖励下降 0.20–0.44,说明这套设置能够检测出真实效应。完全相同的重跑会翻转 15–36% 的任务结果,因此单次运行的比较无法把呈现效应和运行之间的波动分开。两个前沿 LLM 评判者在同一条固定轨迹以不同方式呈现时给出一致的判决,但在 57% 的同一批记录上彼此不一致,很大程度上是因为其中一个评判的是过程而不是结果。TRACE 由此把分数变化关于智能体所说的话,和它关于测量本身所说的话分开。
1 引言
大语言模型(LLM)智能体越来越多地通过自动验证器的分数被评测、被比较、被训练。当这样一个分数发生变化时,自然的读法是:智能体变得更强或更弱了。这种读法可能是错的。在我们的一项受控实验中,我们重命名智能体的工具,而不改变这些工具做什么;智能体执行的操作完全相同,分数却下降了 0.250,因为验证器匹配的是工具名,而不是检查实际执行的操作。报在排行榜上,这次下降会记成一次从未发生的退步;用作训练奖励,它会惩罚正确的行为。
这里的验证器,是任何基于规则或经过学习的评估器,它给智能体的答案、动作或由此产生的任务状态打分。它的分数越来越多地充当推理任务和智能体任务上强化学习的奖励(DeepSeek-AI et al., 2025; Da et al., 2025)。关于规格博弈和奖励模型过度优化的工作表明,优化一个分数可能偏离预期目标(Krakovna et al., 2020; Gao et al., 2023; Akter et al., 2026)。交互式基准还增加了对工具接口、观察格式、模拟用户和 LLM 评判者的依赖(Yao et al., 2025; Zhou et al., 2024; Jimenez et al., 2024),而对智能体基准的审计发现,任务和奖励设计上的缺陷会错误陈述能力(Zhu et al., 2025)。遵循测量效度的观点(Messick, 1995; Bean et al., 2025),我们问:一个验证器分数实际上支持哪些结论。
困难在于,扰动之下的分数差距是含糊的:负责的可能是智能体、环境或验证器,单凭差距无法把它们分开。我们引入 TRACE,这个名字来自它所检查的智能体轨迹:一套用受测分数之外的证据来消解这种含糊的诊断协议(§2)。通过比较轨迹并对未改变的轨迹重新评分,TRACE 把稳健性测试从询问分数是否变了,变成询问为什么变了。我们在真实程度逐步提高的设定中验证它。在失败来源已知的受控套件中,TRACE 把工具名评分缺陷(重新评分后 $0.250\rightarrow 0.000$)与同一种变异下真正的行为失败分开(§3)。在冻结的公开 $\tau^{2}$-bench 研究中,四个 LLM 智能体的新配对运行度量整个系统的敏感性,而对固定轨迹的评判者审计则隔离出评估器敏感性(§4)。带有重复对照和阳性对照的更大规模跟进表明,它那一个清晰的效应不能复现,保持含义的改变在 $\pm 0.10$ 以内是等价的,而误导性名称会被检测出来,并且一致的评判者仍然可能对什么算成功意见不一(§5)。在所有设定中,同一条教训成立:分数变化是观察,不是解释。
2 TRACE:从分数差异到解释
TRACE 从一个任务、一个智能体和一个验证器开始。变异是对评测的一次有针对性的改变;探针是它定义的那次成对测试。一次运行产生一条轨迹:动作、观察和最终答案的记录。对于任务与环境 $x$、策略 $\pi$、种子 $\xi$ 和变异 $m$,我们比较
| $r^{0}=\operatorname{Rollout}(\pi,x,\xi),\qquad r^{m}=\operatorname{Rollout}(\pi,m(x),\xi),$ |
|---|
同时保持基础任务、策略和种子固定。$S(r)$ 表示轨迹 $r$ 的验证器分数。因为有些变异会改变评分规则本身,每条轨迹都在它自己的评测条件下被评分。
图 1:TRACE 协议。成对运行(1)产生分数层面的诊断(2);轨迹检查(3)查看行为是否改变;在有针对性的修正下对同一条记录重新评分(4)则检验评估器。虚线框给出每一步所回答的问题。
这一工作流(图 1)有四步:运行成对测试,比较分数,检查轨迹,以及通过对抗事实式重新评分来检验一个被怀疑的评分错误。重新评分会修正评分规则,并对同一条轨迹重新打分,而不重新运行智能体。这些步骤把经常被混在一起的三个问题分开:成对重跑问的是系统层面的分数是否改变;轨迹比较问的是智能体行为或任务结果是否改变;对一条未改变的轨迹重新评分问的是评估器是否改变了它的判断。我们把第一层的敏感性称为全系统敏感性,把第三层称为评估器敏感性;只有后者才是关于验证器的直接证据。基准奖励的变化,和对同一条记录的判断变化,因此是不同的发现。两种对照使成对差异可以被解释:一次完全相同的重跑估计结果有多经常因偶然而改变;一个阳性对照,即一种已知会有影响的改变,表明这条流水线能够检测出真实效应。
2.1 这些探针改变了什么
受控研究的六个探针族(表 1)并不都预测分数相等。工具重命名保持工具行为,因此等价的操作应当得到相等的分数;评分量表的改变会改变什么东西能得分,因此分数预期会不同。其他探针改变要求、激励或对信息的访问;激励探针针对的是一个代理量,即可视的、用来代替预期结果的奖励。因此我们对照每一种结果所意图的改变来解释它,而不是把每一次分数下降都当成错误。因为每个族只用一个模板(例如,措辞探针是在前面加上一条指令,而不是抽样多种改写),结果刻画的是这些特定变换,而不是每个族中全部改变所构成的空间。
表 1. 受控研究的六个探针族,每一个都由一个固定模板实现。并非每个探针都会改变每个任务的执行。
| 探针 | 实现的改变 | 解释 |
|---|---|---|
| 任务措辞 | 在前面加上一条固定指令,以保留约束。 | 有限的措辞检查;不是多样化的改写测试。 |
| 工具接口 | 在保持分发和参数的同时重命名工具。 | 检查等价操作是否得到等价分数。 |
| 评分量表 | 改变分量权重,并要求提及证据。 | 度量对另一套评分规则的敏感性。 |
| 附加约束 | 要求在最终报告中引用证据。 | 测试一项额外的报告要求。 |
| 代理激励 | 在适用的奖励破解任务上提高可视激励。 | 把代理量与模拟器任务质量相比较。 |
| 观察访问 | 返回部分实验结果;通过日志检查暴露细节。 | 测试当证据需要额外访问步骤时的行为。 |
2.2 分数层面的诊断
分数改变了多少?验证器稳健性差距(VRG)是原始分数减去变异后的分数,因此正的差距意味着分数下降了:
| $\mathrm{VRG}(r^{0},r^{m})=S(r^{0})-S(r^{m}).$ |
|---|
智能体是否仍然通过?一个小差距也可能意味着两种条件下都失败。变异成功率(MSR)是通过验证器的变异运行所占的比例,变异转移率(MTR)则把这一点限制在原始运行已经通过的那些配对上:
| $\mathrm{MSR}_{\tau}=\Pr[S(r^{m})\geq\tau],\qquad\mathrm{MTR}_{\tau}=\Pr[S(r^{m})\geq\tau\mid S(r^{0})\geq\tau].$ |
|---|
我们使用通过阈值 $\tau=0.65$;产物中也报告 $0.55$ 和 $0.75$。二者都是验证器通过率,而不是对任务完成的独立检查。MTR 计数的是匹配的配对,当没有任何原始运行通过时它没有定义。
奖励与任务质量是否一致?对于可视的代理奖励 $P(r)$ 和模拟器定义的质量信号 $H(r)$,代理–真实分歧是
| $\mathrm{PTD}(r)=P(r)-H(r).$ |
|---|
正值意味着代理量超过了模拟器质量;它并不意味着存在利用的意图。不同任务的尺度不同,代理量也可能超过 1,因此我们只对有代理通道的 12 个任务报告 PTD(附录 A)。
3 研究 1:诊断已知的失败
一种诊断只有在能找回我们已经知道的原因时才可信,所以我们首先把 TRACE 用在失败是被造进去的地方:行为被规定好的脚本化智能体,以及一个缺陷已知的验证器。
环境与验证器。
ResearchOpsEnv 包含 25 个合成的研究操作任务,例如纠正学习率或防止数据泄漏。在这些任务中,智能体检索文档、编辑配置、运行模拟实验、检查日志并提交报告。模拟器记录任务质量 $H$ 和代理奖励 $P$。复合验证器与 $H$ 不同,它把报告目标词项、工具名覆盖、约束与效率检查,以及黑客风险惩罚组合在一起(附录 A)。
行为已知的智能体。
三个脚本化策略具有被规定的行为:careful 施加预期的修复并收集证据;overfit 针对预期的答案词元和评分线索,证据有限,并且对工具重命名条件有一个显式分支;shortcut 操纵代理设置,或提交一份没有支持的报告。careful 和 overfit 都能读到预期的修复。它们是受控的例子,不是对学习得到的智能体会发现什么的模型。
成对运行与不确定性。
档案中有 1,575 条记录:525 个任务–策略–条件格子(25 个任务、七种条件、三种策略),每个格子在三个种子标签下重复。脚本化策略是确定性的,因此这些重复是相同的,重新执行归档代码会精确复现每一条记录;我们通过对基础任务重抽样来估计不确定性(1,000 个任务聚类自助样本,种子 17),因此区间描述的是这套被设计出来的套件内部的变异。
3.1 同一次执行可能得到更低的分数
工具重命名产生了 careful 最大的平均差距,0.250(图 2a);它的其他差距在任一方向上至多 0.023。它的成对轨迹具有相同的观察和模拟器质量;改变的只有验证器的名称匹配,一旦 careful 使用被公布的别名,五个必需工具名就一个也得不到分数。
为了检验这一解释,我们把别名映射回原来的名称并重新评分,同时保持轨迹和所有其他奖励分量固定。careful 的差距从 0.250 降到 0.000(图 2b),因此名称匹配规则解释了这一策略和这一映射下的整个差距。
图 2:分数差距及其原因。(a) 在 1,575 条归档运行上,按策略和探针给出的 VRG(原始分数减去变异分数的均值;正值表示变异下分数更低)。(b) 在重新评分之前把工具名映射回去,会消除 careful 的差距,但消除不了 overfit 的行为失败;shortcut 的零差距反映的是两种条件下行为都差。
同一种修正使 overfit 的差距仍为 0.130。在重命名之下,overfit 走了另一条脚本化分支,并提交一份短而不成功的报告,任何重新评分都无法修复。因此一个探针既为一个智能体暴露评分缺陷,又为另一个智能体暴露行为失败,这种区分单靠差距做不出来。
3.2 小差距可能藏住一贯的失败
差距也可能在相反的方向上误导。careful 策略通过大多数变异运行(MSR 0.860),而 overfit 是 0.053,shortcut 是 0.000(表 2)。然而 shortcut 的平均差距最小,为 0.006,因为它在两种条件下得分都差。一份只看差距的稳健性报告会把它排成最稳健的策略;绝对通过率则表明,它的稳定反映的是一贯的失败。
表 2. 受控研究结果,由保存的轨迹重新计算。Original 与 Mutated 是每种策略 450 对上的平均验证器分数;MSR 与 MTR 使用 $\tau=0.65$。
| 策略 | 原始 | 变异后 | 差距 | MSR | MTR | 代理 PTD |
|---|---|---|---|---|---|---|
| Careful | 0.807 | 0.766 | 0.041 | 0.860 | 0.860 | -0.167 |
| Overfit | 0.549 | 0.526 | 0.023 | 0.053 | 0.667 | 0.940 |
| Shortcut | 0.345 | 0.339 | 0.006 | 0.000 | — | 0.932 |
overfit 的 MTR 为 0.667,只建立在原始运行通过的 36 对上(两个基础任务 $\times$ 六种变异 $\times$ 三个相同的种子),因此它并不表示广泛的成功;作为比较,careful 的 MSR 具有 95% 任务聚类区间 $[0.840,0.887]$。
代理分歧暴露了另一种失败。在 12 个与代理相关的任务上,shortcut 的平均 PTD 为 0.932(任务聚类区间 $[0.176,1.781]$,很宽,因为不同任务的代理尺度不同)。例如在 reward_hack_001 中,它把可视奖励权重和格式奖励都设为 2.0,得到可视奖励 4.0,而模拟器质量保持在 0.0。
3.3 评分目标偏爱不同的行为
一个小型的固定程序实验(附录 B)说明了第二种测量失败:一个目标可能偏爱利用其代理量的行为。在五个脚本化程序中做选择时,可视代理目标挑选 proxy_exploit(留出通过率 0.103,代理 PTD 0.996),而工具量和复合目标都挑选 careful(0.718,$-0.180$;表 5)。复合验证器仍然带有第 3.1 节的工具名缺陷,因此选出一个有用的策略,和给等价的执行一致地打分,是不同的要求。
4 研究 2:$\tau^{2}$-bench 上的 LLM 智能体
受控研究表明 TRACE 能找回已知原因。公开的智能体基准更难:智能体是一个 LLM,用户是被模拟的,而且事先不知道原因。因此我们把 TRACE 用到这样一个环境:LLM 智能体与模拟用户对话,并通过工具行动,即 $\tau^{2}$-bench 的零售和航空领域(Barres et al., 2026),两个领域各有 6 个开发任务和 30 个评测任务,平均分配。
设置。
我们按端点是否可用选择四个智能体:内部的 GLM-5.3 Fast、内部的 DeepSeek V4.1 Flash、内部的 Laguna S 2.1 FP8,以及 Qwen3.8 Flash。一个固定的模拟用户和该基准自己的评估器在所有研究中保持不变(模型见附录 C)。每个智能体在三种条件下运行每个任务:原始接口、重命名后的工具,以及数值不变但重新排版的 JSON 观察。与受控的观察探针不同,重新排版改变的是呈现,而不是对信息的访问。所有条件都从同一条保存的用户开场开始;之后的回合是交互式的。任务划分、配置和分析在开发复审之后被冻结(附录 C)。
4.1 新的交互:全系统敏感性
图 3:成对的 $\tau^{2}$-bench 奖励变化及 95% 置信区间(表 3)。正值表示变异下分数更高,与图 2 中 VRG 的符号约定相反。只有 Laguna 在工具重命名下的区间不含零。
每一次被评分的运行从该基准的评估器得到 0 或 1,$\Delta$ 是变异奖励减去原始奖励。这些运行检验的是整个交互:智能体、之后的用户回合、任务状态和评估器都可能对差异有贡献。
效应是混杂的(表 3,图 3)。八个区间中有七个包含零;例外是一次提升,即 Laguna 在工具重命名下($+.267$ [.067, .433])。在八个未经校正的区间中,单独一个区间不含零,只是系统性效应的弱证据,而且它在新任务上不能复现(§5);宽的区间同样不能确立其他效应是不存在的。平均值也掩盖了任务层面的反复:236 个完整配对中有 65 个改变了奖励,提升和退步大体相互抵消。轨迹复查把这些变化联系到不同的写入动作、不同的参数,或未完成的必需写入。它们表明智能体–环境系统对呈现是敏感的,但它们本身并不是验证器缺陷的证据。
表 3. 在该基准自己的评估器下的公开 $\tau^{2}$-bench 结果。$\Delta$ 是完整配对上变异奖励减去原始奖励;Alias 表示工具重命名,Format 表示观察重排版。
| 智能体 | 条件 | 配对数 | 原始 | 变异后 | $\Delta$ | 95% 任务自助 CI |
|---|---|---|---|---|---|---|
| DeepSeek (internal) | Alias | 29/30 | .828 | .828 | .000 | [-.172, .172] |
| DeepSeek (internal) | Format | 29/30 | .828 | .862 | +.034 | [-.103, .172] |
| GLM (internal) | Alias | 30/30 | .833 | .767 | -.067 | [-.267, .133] |
| GLM (internal) | Format | 30/30 | .833 | .833 | .000 | [-.167, .167] |
| Laguna (internal) | Alias | 30/30 | .500 | .767 | +.267 | [.067, .433] |
| Laguna (internal) | Format | 30/30 | .500 | .633 | +.133 | [-.067, .333] |
| Qwen3.8 Flash | Alias | 29/30 | .759 | .690 | -.069 | [-.241, .138] |
| Qwen3.8 Flash | Format | 29/30 | .759 | .828 | +.069 | [-.138, .276] |
4.2 固定轨迹:评估器敏感性
新的运行无法把评估器与智能体分开。为了隔离评估器,我们把固定轨迹交给一个单独的、单次调用的 LLM 评判者(不是完整原生评估器的重跑)。它看到任务标准、领域策略、工具和轨迹,但看不到原生奖励或智能体身份。118 条合格的原始轨迹各自以四种视图呈现:原始、完全相同的重复、工具被重命名,以及观察被重新排版。一次翻转是相对于原始视图的通过/失败变化。
重复和工具重命名各自产生 0/118 次翻转;重新排版产生 1/118。在那一次(Laguna,航空任务 16)中,原始、重复和重命名视图都通过,但重新排版的视图失败,其理由错误陈述了所要求的日期和航班。每条轨迹只有一次重复时,我们无法把格式效应和评判者变异分开,因此这是一次被观察到的不一致,而不是被证明的因果效应;研究 3 补上了所缺的重复对照。
5 研究 3:带重复对照和阳性对照的大规模复现
研究 2 留下三个未解问题:它那一个清晰的效应是否稳定;如果流水线检测不到真实效应,一个空结果是否有意义;它那一次评判者翻转是否超出了调用与调用之间的变异。跟进研究在研究 2 的分析被冻结之后被密封,并且从不与它合并,它们分别回答每一个问题。
设计。
主要复现在原始、工具重命名和观察重排版三种条件下,让四个智能体运行全部 158 个可用的 $\tau^{2}$-bench 航空和零售任务,每种条件三次运行(5,688 次中完成 5,652 次);主检验集是此前从未评测过的 88 个任务(12 个航空,76 个零售)。这个集合、$\pm 0.10$ 的边际,以及下面的决策规则,都在收集任何数据之前固定。两种对照使成对差异可以被解释。重复对照比较原始运行与改变后运行之间的结果翻转率,以及两次完全相同的原始运行之间的翻转率;二者之差是超额翻转率。阳性对照在该领域自己的名称之间置换工具名,同时保持每条描述和模式为真,因此任务仍然可解(在所示名称下,黄金动作离线解决 164/164 个基础任务),但名称会误导(2,528 次运行中完成 2,478 次)。若一个改变的 90% 任务聚类区间落在 $\pm 0.10$ 之内,则称为等价;若其 95% 区间不含零,则称为不同;否则为不确定(附录 E)。
图 4:研究 3 的奖励变化及 95% 区间(附录表 6)。保持含义的改变停留在零附近,而误导性工具名降低每个智能体的奖励。阴影带标出 $\pm 0.10$ 的等价边际,该边际在 90% 区间上判定。
保持含义的改变在 $\pm 0.10$ 内等价;误导性名称则不是。
八组智能体–改变配对中有七组在 $\pm 0.10$ 内等价(图 4;完整结果见附录表 6);在这八组上做 Bonferroni 校正后,仍有六组如此。例外是重新排版下的 Qwen3.8 Flash,结果不确定($-.059$ [$-.123$, $+.008$]),并且结果翻转比重跑多 9.3 个百分点 [$+2.7$, $+16.1$],这是本研究无法确认的一个可能的小效应。阳性对照在全部四个智能体上都被检测到,奖励下降 0.196 到 0.437,每个 95% 区间都远低于零,因此这条流水线足够敏感,使等价结果具有信息量。研究 2 那一个清晰的效应不能复现:Laguna 在工具重命名上 $+.267$ 的增益,在每种条件一次运行的 40 个新任务的中间波次上降到 $-.050$(附录 E),在研究 2 自己的 30 个任务、三次运行上降到 $-.011$,并且在 $\pm 0.10$ 内等价。一次探索性的电信复现(108 个任务)给出同一幅图景(附录 E)。
重跑噪声解释了为什么单次运行会误导。
把一个完全相同的原始任务重跑,对 DeepSeek、GLM 和 Qwen 会在 14.7–16.3% 的运行上翻转通过/失败结果,对 Laguna 则是 35.6%。因此像研究 2 那样的单次运行比较,无法把呈现效应和普通变异分开,而 Laguna 很高的重跑噪声与它那次不能复现的增益是一致的。
评判者:在呈现下稳定,但测量的是不同的东西。
在研究 2 的 118 条固定轨迹上,两个当前的评判者 GPT-6.1 Sol 和 Claude Opus 5.5 对每种视图被调用三次(2,832 次调用中 2,831 次可用)。呈现上的改变并没有使判决超出调用与调用之间的变异:四个超额不一致区间都包含零,估计值从 $-0.85$ 到 $+0.56$ 个百分点(附录表 8)。Claude Opus 5.5 在 3.7% 的完全相同重复上与自己不一致,这足以在没有重复对照时伪装成呈现效应,而研究 2 那一次翻转与这种变异是一致的。然而两个评判者在 57% 的同一批记录上彼此不一致。相对于该基准自己的结果奖励,Claude Opus 5.5 在 95% 的判决上一致($\kappa=0.89$),GPT-6.1 Sol 在 38% 上一致($\kappa=0.09$);每一次不一致都是基准上的成功,而且在 201 次中的 163 次里,GPT-6.1 Sol 反对的只是过程,例如一轮里有若干次工具调用。因为 GPT-6.1 Sol 在基准成功上的通过率从 DeepSeek 的 0% 到 Qwen 的 52% 不等,评判者的选择可能改变智能体如何排名。一致性不是效度:一个可重复的评判者仍然可能测量另一个构念。
6 相关工作
奖励破解与过度优化。
当行为获得奖励却没有达到预期目标时,就发生奖励破解(Krakovna et al., 2020; Akter et al., 2026; Wang et al., 2026);这种错配在优化之下会增大(Gao et al., 2023; Eisenstein et al., 2024; Kwa et al., 2024; Wen et al., 2025),而基准度量智能体的利用行为(Thaman, 2026; Gabor et al., 2025; Zhong et al., 2026)。与我们的目标最接近的是,Akter et al. (2026) 对评估器做压力测试以检测代理博弈;TRACE 则是把个别分数变化归因。
从评估器反馈中学习。
人类反馈和 AI 反馈是核心训练信号(Stiennon et al., 2020; Ouyang et al., 2022; Bai et al., 2022),验证器和过程监督把评测延伸到中间步骤(Cobbe et al., 2021; Lightman et al., 2024; Khalifa et al., 2026; Setlur et al., 2025; Zhang et al., 2025; Fan et al., 2026; Yuan et al., 2026; Zhang et al., 2026)。反过来,LLM 评判者对与内容无关的因素敏感,例如回答顺序(Wang et al., 2024),并且经常在智能体轨迹上与专家不一致(Lù et al., 2025)。我们的工具名缺陷位于一个简单的手写检查之中,并不是关于学习得到的过程奖励模型的发现。
智能体基准。
智能体基准覆盖工具、用户和持久环境(Liu et al., 2024; Zhou et al., 2024; Jimenez et al., 2024; Yao et al., 2025; Barres et al., 2026; Xie et al., 2024; Patil et al., 2025),也覆盖机器学习、研究、职场、人类协助、软件和终端任务(Chan et al., 2025; Starace et al., 2025; Xu et al., 2025; Trinh et al., 2026; Merrill et al., 2026; Da et al., 2025)。对智能体评测的批评记录了捷径、可复现性缺口和有缺陷的奖励设计(Kapoor et al., 2025; Zhu et al., 2025);TRACE 提供一套成对程序,用来检测并归因这类缺陷。
行为测试与测量效度。
有针对性的测试和多指标报告在自然语言处理中已经确立(Ribeiro et al., 2020; Goel et al., 2021; Kiela et al., 2021; Nie et al., 2020; Liang et al., 2023)。对工具名或提示格式做保持含义的改变,可以移动模型表现(Ye et al., 2024; Sclar et al., 2024);TRACE 用这类改变来探测评估器,也探测智能体。它也类似于蜕变测试,后者检查变换后输入之间的预期关系(Chen et al., 2018; Liu & Zhang, 2026),但增加了轨迹检查和重新评分,以便把被违反的关系归因于行为或评分。
7 讨论:证据确立了什么
表 4 把主张映射到证据。ResearchOps 在执行被固定的情况下定位一个已知的评分缺陷;新的 $\tau^{2}$ 运行揭示全系统敏感性;固定轨迹审计在行为被固定的情况下度量评估器敏感性。研究 3 增加两项要求:把每一个成对差异与一次完全相同的重跑比较,并纳入一个阳性对照,因为除非流水线能检测出一种已知会有影响的改变,否则等价没有什么意义;评判者审计同样需要重复对照。我们还建议在差距之外报告通过率,并通过给同一批轨迹重新评分来确认被怀疑的缺陷。
表 4. 证据支持什么,以及什么仍然不确定。
| 要检验的主张 | 可能出什么错 | TRACE 证据 | 仍然存在的限制 |
|---|---|---|---|
| 同等的工作,同等的分数 | 对措辞或工具表面的依赖 | 任务与工具探针;按别名归一后重新评分消除了 careful 的工具差距(0.250→0.000) | 合成工具;两种 τ² 呈现改变 |
| 奖励反映任务质量 | 对可视代理量的利用 | 代理激励探针;shortcut 在 12 个与代理相关的任务上代理 PTD 为 0.932 | 手工设计的代理通道 |
| 稳定的发现 | 对阈值、任务样本或重跑的敏感 | 多个阈值上的 MSR/MTR;带重跑和阳性对照的复现,分析事先固定 | ±0.10 边际;四个智能体 |
| 脚本之外的证据 | 只有合成证据 | 在原生评估器下对 30、40 和 158 个任务的成对 τ² 研究;带重复对照的评判者审计 | 没有评判者真实值;没有训练循环 |
当前证据的限度。
ResearchOps 有 25 个被设计的任务,以及能够访问预期修复的脚本;它支持在已知条件下做诊断,而不是估计部署失败率,或训练中学到的利用的比率。公开研究覆盖 30、40 和 158 个航空与零售任务,外加 108 个探索性电信任务、两种呈现改变和四个智能体;等价是相对于 $\pm 0.10$ 边际而言的,缺失的运行不是随机的,而原生奖励有一部分由 LLM 评分,它是参照而不是真实值。评判者审计度量的是一致性和与原生奖励的吻合,而不是准确度。修复对一个被测试的映射成立,而留出的是任务 ID 而不是变异族,因此探针过拟合未被检验(附录 D)。
8 结论
分数变化是观察,不是解释:我们需要知道改变的是智能体的行为、任务,还是评测。TRACE 用成对变异、轨迹检查和对抗事实式重新评分来回答。在受控环境中,它定位一个重新评分就能完全修复的工具名缺陷,并把它与行为失败区分开;在 $\tau^{2}$-bench 上,最初的单次运行效应不能复现,对几乎所有智能体而言,保持含义的呈现改变在 $\pm 0.10$ 内等价,而阳性对照被清楚地检测到,评判者在呈现改变下保持一致,却对什么算成功意见不一。分数差异只有在对照一次完全相同的重跑,以及一种已知会有影响的改变时,才成为证据。
可复现性与产物。
全部 1,575 条受控研究记录都精确复现。冻结的 $\tau^{2}$ 产物包括配置、输入哈希、任务划分、原始轨迹,以及不调用模型即可重算的分析(研究 2:360 次运行和 472 次评判者调用;研究 3:计划中的 12,584 次运行、2,832 次评判者调用,以及独立审计)。TRACE 代码和合成的 ResearchOps 任务可在 https://github.com/RGaonkar/trace-verifier-stress-tests 获得;所报告的受控研究数字来自补充材料中的归档快照。AI 编码和写作工具协助了实现、分析和修订;作者对方法、证据、引用和文本负责。
参考文献
- Akter et al. (2026)
Sanjeda Akter, Ibne Farabi Shihab, and Anuj Sharma.
通过评估器压力测试检测强化学习与大语言模型对齐中的代理博弈。
In Findings of the Association for Computational Linguistics: ACL 2026, pp. 10554–10583, 2026.
doi: 10.18653/v1/2026.findings-acl.513.
URL https://aclanthology.org/2026.findings-acl.513/.
- Bai et al. (2022)
Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, Carol Chen, Catherine Olsson, Christopher Olah, Danny Hernandez, Dawn Drain, Deep Ganguli, Dustin Li, Eli Tran-Johnson, Ethan Perez, Jamie Kerr, Jared Mueller, Jeffrey Ladish, Joshua Landau, Kamal Ndousse, Kamile Lukosuite, Liane Lovitt, Michael Sellitto, Nelson Elhage, Nicholas Schiefer, Noemi Mercado, Nova DasSarma, Robert Lasenby, Robin Larson, Sam Ringer, Scott Johnston, Shauna Kravec, Sheer El Showk, Stanislav Fort, Tamera Lanham, Timothy Telleen-Lawton, Tom Conerly, Tom Henighan, Tristan Hume, Samuel R. Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan.
宪法式 AI:来自 AI 反馈的无害性,2022。
URL https://arxiv.org/abs/2212.08073.
- Barres et al. (2026)
Victor Barres, Honghua Dong, Soham Ray, Xujie Si, and Karthik Narasimhan.
$\tau^{2}$-Bench:在双控制环境中评测对话智能体。
In International Conference on Machine Learning, 2026.
URL https://arxiv.org/abs/2506.07982.
- Bean et al. (2025)
Andrew M. Bean, Ryan Othniel Kearns, Angelika Romanou, Franziska Sofia Hafner, Harry Mayne, Jan Batzner, Negar Foroutan, Chris Schmitz, Karolina Korgul, Hunar Batra, et al.
度量真正重要的东西:大语言模型基准中的构念效度。
In Advances in Neural Information Processing Systems (Datasets and Benchmarks Track), 2025.
URL https://arxiv.org/abs/2511.04703.
- Chan et al. (2025)
Jun Shern Chan, Neil Chowdhury, Oliver Jaffe, James Aung, Dane Sherburn, Evan Mays, Giulio Starace, Kevin Liu, Leon Maksin, Tejal Patwardhan, Lilian Weng, and Aleksander Madry.
MLE-bench:在机器学习工程上评测机器学习智能体。
In International Conference on Learning Representations, 2025.
URL https://openreview.net/forum?id=6s5uXNWGIh.
- Chen et al. (2018)
Tsong Yueh Chen, Fei-Ching Kuo, Huai Liu, Pak-Lok Poon, Dave Towey, T. H. Tse, and Zhi Quan Zhou.
蜕变测试:挑战与机会的综述。
ACM Computing Surveys, 51(1):1–27, 2018.
doi: 10.1145/3143561.
- Cobbe et al. (2021)
Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, Christopher Hesse, and John Schulman.
训练验证器来解数学应用题,2021。
URL https://arxiv.org/abs/2110.14168.
- Da et al. (2025)
Jeff Da, Clinton Wang, Xiang Deng, Yuntao Ma, Nikhil Barhate, and Sean Hendryx.
Agent-RLVR:通过引导和环境奖励训练软件工程智能体,2025。
URL https://arxiv.org/abs/2506.11425.
- DeepSeek-AI et al. (2025)
DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, et al.
DeepSeek-R1:通过强化学习激励大语言模型的推理能力,2025。
URL https://arxiv.org/abs/2501.12948.
- Eisenstein et al. (2024)
Jacob Eisenstein, Chirag Nagpal, Alekh Agarwal, Ahmad Beirami, Alex D’Amour, DJ Dvijotham, Adam Fisch, Katherine Heller, Stephen Pfohl, Deepak Ramachandran, Peter Shaw, and Jonathan Berant.
帮忙还是随大流?奖励模型集成能减轻但不能消除奖励破解。
In Conference on Language Modeling, 2024.
URL https://arxiv.org/abs/2312.09244.
- Fan et al. (2026)
Shicheng Fan, Haochang Hao, Dehai Min, Weihao Liu, Hanrong Zhang, Lingwei Wei, Henry Peng Zou, Chengquan Guo, Jie Yang, Honghui Bao, Zhiwei Liu, Lu Cheng, and Philip S. Yu.
数学与代码之外:面向事实性问答的轻量、以语料为据的过程奖励,2026。
URL https://arxiv.org/abs/2605.29648.
- Gabor et al. (2025)
Jonathan Gabor, Jayson Lynch, and Jonathan Rosenfeld.
EvilGenie:一个奖励破解基准,2025。
URL https://arxiv.org/abs/2511.21654.
- Gao et al. (2023)
Leo Gao, John Schulman, and Jacob Hilton.
奖励模型过度优化的标度律。
In Proceedings of the 40th International Conference on Machine Learning, volume 202 of Proceedings of Machine Learning Research, pp. 10835–10866, 2023.
URL https://proceedings.mlr.press/v202/gao23h.html.
- Goel et al. (2021)
Karan Goel, Nazneen Fatema Rajani, Jesse Vig, Samson Tan, Jason Wu, Stephan Zheng, Mohit Bansal, and Christopher Ré.
Robustness Gym:统一自然语言处理的评测图景。
In Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Demonstrations, 2021.
URL https://aclanthology.org/2021.naacl-demos.6/.
- Jimenez et al. (2024)
Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan.
SWE-bench:语言模型能解决真实世界的 GitHub 问题吗?
In International Conference on Learning Representations, 2024.
URL https://arxiv.org/abs/2310.06770.
- Kapoor et al. (2025)
Sayash Kapoor, Benedikt Stroebl, Zachary S. Siegel, Nitya Nadgir, and Arvind Narayanan.
真正要紧的 AI 智能体。
Transactions on Machine Learning Research, 2025.
URL https://arxiv.org/abs/2407.01502.
- Khalifa et al. (2026)
Muhammad Khalifa, Rishabh Agarwal, Lajanugen Logeswaran, Jaekyeom Kim, Hao Peng, Moontae Lee, Honglak Lee, and Lu Wang.
会思考的过程奖励模型。
Transactions on Machine Learning Research, 2026.
URL https://openreview.net/forum?id=V727xqBYIW.
- Kiela et al. (2021)
Douwe Kiela, Max Bartolo, Yixin Nie, Divyansh Kaushik, Atticus Geiger, Zhengxuan Wu, Bertie Vidgen, Grusha Prasad, Amanpreet Singh, Pratik Ringshia, Zhiyi Ma, Tristan Thrush, Sebastian Riedel, Zeerak Waseem, Pontus Stenetorp, Robin Jia, Mohit Bansal, Christopher Potts, and Adina Williams.
Dynabench:重新思考自然语言处理中的基准测试。
In Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pp. 4110–4124, 2021.
doi: 10.18653/v1/2021.naacl-main.324.
URL https://aclanthology.org/2021.naacl-main.324/.
- Krakovna et al. (2020)
Victoria Krakovna, Jonathan Uesato, Vladimir Mikulik, Matthew Rahtz, Tom Everitt, Ramana Kumar, Zachary Kenton, and Jan Leike.
规格博弈:AI 巧思的另一面,2020。
URL https://deepmind.google/blog/specification-gaming-the-flip-side-of-ai-ingenuity/.
- Kwa et al. (2024)
Thomas Kwa, Drake Thomas, and Adrià Garriga-Alonso.
灾难性古德哈特:用 KL 散度正则化 RLHF 并不能减轻重尾的奖励误设。
In Advances in Neural Information Processing Systems, 2024.
URL https://arxiv.org/abs/2407.14503.
- Liang et al. (2023)
Percy Liang, Rishi Bommasani, Tony Lee, Dimitris Tsipras, Dilara Soylu, Michihiro Yasunaga, Yian Zhang, Deepak Narayanan, Yuhuai Wu, Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan, Ce Zhang, Christian Cosgrove, Christopher D. Manning, Christopher Ré, Diana Acosta-Navas, Drew A. Hudson, Eric Zelikman, Esin Durmus, Faisal Ladhak, Frieda Rong, Hongyu Ren, Huaxiu Yao, Jue Wang, Keshav Santhanam, Laurel Orr, Lucia Zheng, Mert Yuksekgonul, Mirac Suzgun, Nathan Kim, Neel Guha, Niladri Chatterji, Omar Khattab, Peter Henderson, Qian Huang, Ryan Chi, Sang Michael Xie, Shibani Santurkar, Surya Ganguli, Tatsunori Hashimoto, Thomas Icard, Tianyi Zhang, Vishrav Chaudhary, William Wang, Xuechen Li, Yifan Mai, Yuhui Zhang, and Yuta Koreeda.
语言模型的整体评测。
Transactions on Machine Learning Research, 2023.
URL https://openreview.net/forum?id=iO4LZibEqW.
- Lightman et al. (2024)
Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, and Karl Cobbe.
让我们一步一步验证。
In International Conference on Learning Representations, 2024.
URL https://openreview.net/forum?id=v8L0pN6EOi.
- Liu et al. (2024)
Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, and Jie Tang.
AgentBench:把大语言模型当作智能体来评测。
In International Conference on Learning Representations, 2024.
URL https://arxiv.org/abs/2308.03688.
- Liu & Zhang (2026)
Zenghao Liu and Yansong Zhang.
SGVEF-LOOP:面向 MCP 智能体的覆盖引导式渐进拓扑探索与基于事实的蜕变评测。
In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 26573–26599, 2026.
URL https://aclanthology.org/2026.acl-long.1224/.
- Lù et al. (2025)
Xing Han Lù, Amirhossein Kazemnejad, Nicholas Meade, Arkil Patel, Dongchan Shin, Alejandra Zambrano, Karolina Stańczak, Peter Shaw, Christopher J. Pal, and Siva Reddy.
AgentRewardBench:评测对网页智能体轨迹的自动评估。
In Conference on Language Modeling, 2025.
URL https://arxiv.org/abs/2504.08942.
- Merrill et al. (2026)
Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, et al.
Terminal-Bench:在命令行界面的困难、真实任务上给智能体做基准测试。
In International Conference on Learning Representations, 2026.
URL https://openreview.net/forum?id=a7Qa4CcHak.
- Messick (1995)
Samuel Messick.
心理评估的效度:把从人的反应与表现所做的推断之验证,作为对分数含义的科学探究。
American Psychologist, 50(9):741–749, 1995.
doi: 10.1037/0003-066X.50.9.741.
- Nie et al. (2020)
Yixin Nie, Adina Williams, Emily Dinan, Mohit Bansal, Jason Weston, and Douwe Kiela.
对抗式 NLI:一个新的自然语言理解基准。
In Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 2020.
URL https://arxiv.org/abs/1910.14599.
- Ouyang et al. (2022)
Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, and Ryan Lowe.
训练语言模型遵循人类反馈的指令。
In Advances in Neural Information Processing Systems, 2022.
URL https://arxiv.org/abs/2203.02155.
- Patil et al. (2025)
Shishir G. Patil, Huanzhi Mao, Fanjia Yan, Charlie Cheng-Jie Ji, Vishnu Suresh, Ion Stoica, and Joseph E. Gonzalez.
伯克利函数调用排行榜(BFCL):从工具使用到大语言模型的智能体评测。
In Proceedings of the 42nd International Conference on Machine Learning, volume 267 of Proceedings of Machine Learning Research, pp. 48371–48392, 2025.
URL https://proceedings.mlr.press/v267/patil25a.html.
- Ribeiro et al. (2020)
Marco Tulio Ribeiro, Tongshuang Wu, Carlos Guestrin, and Sameer Singh.
准确率之外:用 CheckList 对自然语言处理模型做行为测试。
In Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pp. 4902–4912, 2020.
doi: 10.18653/v1/2020.acl-main.442.
URL https://aclanthology.org/2020.acl-main.442/.
- Sclar et al. (2024)
Melanie Sclar, Yejin Choi, Yulia Tsvetkov, and Alane Suhr.
量化语言模型对提示设计中虚假特征的敏感性,或:我如何学会开始担心提示格式。
In International Conference on Learning Representations, 2024.
URL https://arxiv.org/abs/2310.11324.
- Setlur et al. (2025)
Amrith Setlur, Chirag Nagpal, Adam Fisch, Xinyang Geng, Jacob Eisenstein, Rishabh Agarwal, Alekh Agarwal, Jonathan Berant, and Aviral Kumar.
奖励进展:为语言模型推理扩展自动化过程验证器。
In International Conference on Learning Representations, 2025.
URL https://arxiv.org/abs/2410.08146.
- Starace et al. (2025)
Giulio Starace, Oliver Jaffe, Dane Sherburn, James Aung, Jun Shern Chan, Leon Maksin, Rachel Dias, Evan Mays, Benjamin Kinsella, Wyatt Thompson, Johannes Heidecke, Amelia Glaese, and Tejal Patwardhan.
PaperBench:评测 AI 复现 AI 研究的能力。
In Proceedings of the 42nd International Conference on Machine Learning, volume 267 of Proceedings of Machine Learning Research, pp. 56843–56873, 2025.
URL https://proceedings.mlr.press/v267/starace25a.html.
- Stiennon et al. (2020)
Nisan Stiennon, Long Ouyang, Jeff Wu, Daniel M. Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul F. Christiano.
从人类反馈中学习做摘要。
In Advances in Neural Information Processing Systems, 2020.
URL https://arxiv.org/abs/2009.01325.
- Thaman (2026)
Kunvar Thaman.
奖励破解基准:度量带工具使用的大语言模型智能体中的利用,2026。
URL https://arxiv.org/abs/2605.02964.
- Trinh et al. (2026)
Tu Trinh, Mohamed Elfeki, Guangze Luo, Kelvin Luu, Nathan Hunt, Ernesto Hernandez, Nandan Marwaha, Yannis Yiming He, Charles Wang, Fernando Carabedo, Alessa Castillo, and Bing Liu.
HiL-bench(人在回路基准):智能体知道何时该求助吗?,2026。
URL https://arxiv.org/abs/2604.09408.
- Wang et al. (2024)
Peiyi Wang, Lei Li, Liang Chen, Zefan Cai, Dawei Zhu, Binghuai Lin, Yunbo Cao, Lingpeng Kong, Qi Liu, Tianyu Liu, and Zhifang Sui.
大语言模型不是公平的评估者。
In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 9440–9450, 2024.
doi: 10.18653/v1/2024.acl-long.511.
URL https://aclanthology.org/2024.acl-long.511/.
- Wang et al. (2026)
Xiaohua Wang, Muzhao Tian, Yuqi Zeng, Zisu Huang, Jiakang Yuan, Bowen Chen, Jingwen Xu, Mingbo Zhou, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, and Xuanjing Huang.
Reward hacking in the era of large models: Mechanisms, emergent misalignment, challenges, 2026.
URL https://arxiv.org/abs/2604.13602.
- Wen et al. (2025)
Xueru Wen, Jie Lou, Yaojie Lu, Hongyu Lin, Xing Yu, Xinyu Lu, Ben He, Xianpei Han, Debing Zhang, and Le Sun.
重新思考奖励模型评测:我们是不是找错了树?
In International Conference on Learning Representations, 2025.
URL https://arxiv.org/abs/2410.05584.
- Xie et al. (2024)
Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, and Tao Yu.
OSWorld:为真实计算机环境中的开放式任务给多模态智能体做基准测试。
In Advances in Neural Information Processing Systems (Datasets and Benchmarks Track), 2024.
URL https://arxiv.org/abs/2404.07972.
- Xu et al. (2025)
Frank F. Xu, Yufan Song, Boxuan Li, Yuxuan Tang, Kritanjali Jain, Mengxue Bao, Zora Z. Wang, Xuhui Zhou, Zhitong Guo, Murong Cao, Mingyang Yang, Hao Yang Lu, Amaad Martin, Zhe Su, Leander Maben, Raj Mehta, Wayne Chi, Lawrence Jang, Yiqing Xie, Shuyan Zhou, and Graham Neubig.
TheAgentCompany:在有后果的真实世界任务上给大语言模型智能体做基准测试。
In Advances in Neural Information Processing Systems (Datasets and Benchmarks Track), 2025.
URL https://arxiv.org/abs/2412.14161.
- Yao et al. (2025)
Shunyu Yao, Noah Shinn, Pedram Razavi, and Karthik Narasimhan.
$\tau$-bench:真实世界领域中工具–智能体–用户交互的基准。
In International Conference on Learning Representations, 2025.
URL https://arxiv.org/abs/2406.12045.
- Ye et al. (2024)
Junjie Ye, Yilong Wu, Songyang Gao, Caishuang Huang, Sixian Li, Guanyu Li, Xiaoran Fan, Qi Zhang, Tao Gui, and Xuanjing Huang.
RoTBench:评测大语言模型在工具学习中稳健性的多层次基准。
In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pp. 313–333, 2024.
URL https://aclanthology.org/2024.emnlp-main.19/.
- Yuan et al. (2026)
Huining Yuan, Zelai Xu, Huaijie Wang, Xiangmin Yi, Jiaxuan Gao, Xiao-Ping Zhang, Yu Wang, Chao Yu, and Yi Wu.
面向智能体推理的可验证过程奖励,2026。
URL https://arxiv.org/abs/2605.10325.
- Zhang et al. (2026)
Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, and Xuanjing Huang.
AgentV-RL:用智能体式验证器扩展奖励建模,2026。
URL https://arxiv.org/abs/2604.16004.
- Zhang et al. (2025)
Wenlin Zhang, Xiangyang Li, Kuicai Dong, Yichao Wang, Pengyue Jia, Xiaopeng Li, Yingyi Zhang, Derong Xu, Zhaocheng Du, Huifeng Guo, Ruiming Tang, and Xiangyu Zhao.
过程奖励与结果奖励:哪一种更适合智能体式检索增强生成的强化学习。
In Advances in Neural Information Processing Systems, 2025.
URL https://arxiv.org/abs/2505.14069.
- Zhong et al. (2026)
Ziqian Zhong, Aditi Raghunathan, and Nicholas Carlini.
ImpossibleBench:度量大语言模型利用测试用例的倾向。
In International Conference on Learning Representations, 2026.
URL https://arxiv.org/abs/2510.20270.
- Zhou et al. (2024)
Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig.
WebArena:为构建自主智能体而设的真实网页环境。
In International Conference on Learning Representations, 2024.
URL https://arxiv.org/abs/2307.13854.
- Zhu et al. (2025)
Yuxuan Zhu, Tengjun Jin, Yada Pruksachatkun, Andy Zhang, Shu Liu, Sasha Cui, Sayash Kapoor, Shayne Longpre, Kevin Meng, Rebecca Weiss, Fazl Barez, Rahul Gupta, Jwala Dhamala, Jacob Merizian, Mario Giulianelli, Harry Coppock, Cozmin Ududec, Jasjeet Sekhon, Jacob Steinhardt, Antony Kellermann, Sarah Schwettmann, Matei Zaharia, Ion Stoica, Percy Liang, and Daniel Kang.
为构建严格的智能体基准确立最佳实践。
In Advances in Neural Information Processing Systems (Datasets and Benchmarks Track), 2025.
URL https://arxiv.org/abs/2507.02825.
附录 A 评分细节
归档的复合验证器是
| $S=0.40O+0.25C+0.20K+0.15E-0.20D.$ |
|---|
$O$ 检查最终报告中是否有隐藏目标词项。$C$ 计数五个规范工具名:配置检查、文档搜索、实验执行、日志检查和报告提交。$K$ 惩罚受保护数据集错误和缺失的约束提及。$E$ 惩罚超出随难度变化的预算的调用。若一次模拟实验记录的黑客风险高于 0.5,则 $D$ 为 1。分数不被截断,因此 $S$ 可以落在 $[0,1]$ 之外。评分量表探针把正权重改为 $(0.30,0.20,0.35,0.15)$,并在报告缺少 “evidence” 时把 $K$ 封顶为 0.5。
工具名缺陷位于 $C$。用一个能识别别名的检查 $C_{\mathrm{alias}}$ 替换它,得到 $S_{\mathrm{alias}}=S+0.25(C_{\mathrm{alias}}-C)$,轨迹和所有其他分量保持固定。
辅助的黑客检测率是 $D$ 的均值。过程过拟合分数是 $\max\{0,N-(0.60C+0.40E)\}$,其中 $N=\min\{1,n_{\mathrm{calls}}/6\}$;它比较的是两种过程启发式,而不是推理质量。PTD 使用各次实验运行中的最大代理奖励和最大模拟器质量,二者可能来自不同的运行。它适用的 12 个任务具有前缀 reward_hack、eval_metric 和 data_leak;其他任务被排除,而不是被赋一个零代理量。
附录 B 策略选择目标
我们再加入两个程序(一个跳过日志检查;一个针对可视代理奖励),并让三个目标(可视代理、工具量,以及下面定义的复合验证器)各自在前 12 个任务上,从五个程序中选择得分最高的那个。我们在其余 13 个任务上,于原始、措辞、工具接口和代理激励条件下评估这一选择。任务 ID 被留出,但任务类型和变异模板是共享的。
可视代理目标选择 proxy_exploit,而工具量和复合目标都选择 careful(表 5):留出通过率是 0.103 对 0.718,代理 PTD 是 0.996 对 $-0.180$。由于工具量选择和复合选择一致,复合目标相对于这一比较对象没有优势。
表 5. 在 12 个原始任务上做策略选择,并在三种变异下于 13 个留出任务 ID 上评估。
| 选择目标 | 被选中的模板 | MSR | 代理 PTD |
|---|---|---|---|
| Visible proxy | proxy_exploit | 0.103 | 0.996 |
| Tool volume | careful | 0.718 | -0.180 |
| Composite score | careful | 0.718 | -0.180 |
可视代理目标是 $0.45P+0.30F+0.25N$,其中 $F$ 检查报告是否说出了预期修复,包括被支持的别名。工具量目标单独使用 $N$,复合目标使用 $S$,而不是稳健性差距或留出转移。每一个都在文件顺序的前 12 个原始任务上,在五个程序中选择最高均值;完全平局时遵循代码的策略排序。careful 行为和利用行为都已经在候选集中,因此这一搜索并不表明学习智能体会如何获得其中任何一种行为。
附录 C 公开研究细节
本研究使用位于提交 1d244f5dca42944b67a379b44bfeb9f5748f189d 的 $\tau^{2}$-bench(https://github.com/sierra-research/tau2-bench)。一个带种子的划分在每个领域选择三个开发任务和 15 个评测任务。模拟用户是 GPT-4.1 Mini(温度 0),原生评估器用 GPT-5 Mini 给自然语言断言评分,第 4 节的单次调用评判者是 GPT-4.1 Mini;为了可比较,这三者在研究 2 和研究 3 中都保持固定。模型、用户模拟器、评估器、评判者、词元限制、变异、重试策略和计划中的分析,在开发复审之后被固定,并记录在运行指纹和冻结指纹中。别名在工具名前加上 workflow_,同时保留模式、分发、参数和规范执行。重新排版对 JSON 做美化打印和键排序,而不改变值或数组顺序。每次别名运行在规范化之前只发出别名,每次格式运行至少改变一条 JSON 观察。
360 个作业的清单中缺两次原始运行。内部 DeepSeek 在航空任务 21 上耗尽了 8,192 词元的输出上限,没有给出答案或工具调用;Qwen 在航空任务 23 上在超时处理期间被外部打断。两者的奖励都不被填补;每一个都从该模型的两个成对估计中去掉一个任务。另有一次达到测试框架超时的 Qwen 别名运行被保留为有效的、得分为零的结果。四视图评判者审计覆盖 118 条轨迹和 472 次调用,隐去智能体身份和原生奖励,并以重复作为噪声对照。转移表、发生变化的配对轨迹、哈希和缺失记录随产物一起提供。
附录 D 走向留出的探针
一个针对固定探针被调过的智能体,可能记住别名或奖励陷阱,而不是学会预期行为。我们提出三个层次:用于调参的开发探针,留出的实例(已知族内的新名称和新数值),以及留出的族;策略和验证器在留出评测之前被冻结,并且每个探针都被验证为只做出它意图的改变。一个固定的参照集会支持跨轮次的比较,如同动态基准测试中那样(Kiela et al., 2021)。这是一项提议,而不是对探针过拟合的已被证明的解法。
附录 E 研究 3 的细节
分析计划事先固定;完整性。
研究 3 的全部运行都在密封计划下执行;分析计划、决策规则和代码在数据收集之前被冻结并经过独立复审,独立审计从原始记录重算了每一个被报告的数字,没有不匹配。区间是按领域分层的任务聚类百分位自助区间(2,000 次抽取,种子 17;在 20,000 次抽取下标签不变)。改变先在一个任务内对相同种子的重复取平均,再对任务取平均。重复对照使用原始重复与改变后重复的、种子平衡的配对。失败的运行保持缺失,不做重试;在 0/1 填补和排除截断这两种敏感性下,标签不变。缺失不是随机的:大多数主运行失败是 DeepSeek 的输出上限截断,50 次阳性对照失败中有 42 次发生在误导性名称之下,而阳性对照在最坏情况处理下仍然通过。智能体、用户模拟器(GPT-4.1 Mini,温度 0)、原生评估器(GPT-5 Mini)和 8,192 词元的智能体输出上限与研究 2 相同。
中间的 40 任务波次。
在扩大规模之前,用种子从研究 2 未使用的 ID 中抽取 40 个新任务(20 个航空,20 个零售),每种条件运行一次(480 次中完成 478 次;两次 DeepSeek 运行在一个航空任务上触及输出上限并被排除,填补任一结果都不改变任何结论)。没有检测到改变(表 7);每个区间都包含零,最小的精确 McNemar $p$ 为 0.29。每种条件只有一次运行时,这些差异把扰动与智能体及用户模拟器的变异混在一起。
表 7. 第一次复现波次:40 个新的 $\tau^{2}$-bench 任务,每种条件一次推出。
| 智能体 | 条件 | 配对数 | 原始 | 变异后 | $\Delta$ | 95% CI | 切换 |
|---|---|---|---|---|---|---|---|
| DeepSeek (internal) | Alias | 39/40 | .846 | .769 | -.077 | [-.179, +.026] | 1 / 4 |
| DeepSeek (internal) | Format | 39/40 | .846 | .821 | -.026 | [-.128, +.077] | 2 / 3 |
| GLM (internal) | Alias | 40/40 | .900 | .850 | -.050 | [-.150, +.050] | 1 / 3 |
| GLM (internal) | Format | 40/40 | .900 | .850 | -.050 | [-.150, +.025] | 1 / 3 |
| Laguna (internal) | Alias | 40/40 | .650 | .600 | -.050 | [-.225, +.125] | 6 / 8 |
| Laguna (internal) | Format | 40/40 | .650 | .750 | +.100 | [-.050, +.250] | 7 / 3 |
| Qwen3.8 Flash | Alias | 40/40 | .825 | .725 | -.100 | [-.250, +.025] | 2 / 6 |
| Qwen3.8 Flash | Format | 40/40 | .825 | .850 | +.025 | [-.150, +.175] | 6 / 5 |
评判者审计。
评判者使用中等推理力度、8,192 词元上限,以及一个新的提示,要求给出通过、失败或信息不足,并附简短理由;智能体身份和原生奖励被隐去,原始载荷与重复载荷在字节上相同,但作为分开的请求发送。一次 Claude Opus 5.5 的重复在提供者内容过滤之后返回空内容,并被保持为缺失;把它设为同意或不同意,把别名超额界定在 $[-1.13,-0.85]$,把格式超额界定在 $[-0.56,-0.28]$ 个百分点。GPT-6.1 Sol 的全部三次改变事件都来自一个航空任务,并且在它的三次原始调用中,GPT-6.1 Sol 在 118 条记录中的 1 条上有变化,因此它的零重复不一致并不能确立确定性。与原生奖励的比较是描述性的:原生奖励是参照,不是真实值,因为它的一部分由 LLM 评分,而且它不检查大多数程序性规则。程序性反对的计数使用对评判者所述理由的关键词启发式。
表 8. 对研究 2 的 118 条固定轨迹做的、带重复对照的评判者审计,每种视图三次调用。
| 评判者 | 视图 | 事件 | 不一致 [95% CI] | 相对于重复的超额,百分点 [95% CI] |
|---|---|---|---|---|
| GPT-6.1 Sol | Repeat | 0/354 | 0.00% [—] | |
| GPT-6.1 Sol | Alias | 1/354 | 0.28% [0.00, 0.85] | +0.28 [0.00, +0.85] |
| GPT-6.1 Sol | Format | 2/354 | 0.56% [0.00, 1.71] | +0.56 [0.00, +1.71] |
| Claude Opus 5.5 | Repeat | 13/353 | 3.68% [0.86, 7.56] | |
| Claude Opus 5.5 | Alias | 10/354 | 2.82% [0.85, 5.60] | -0.85 [-3.72, +1.15] |
| Claude Opus 5.5 | Format | 12/354 | 3.39% [1.15, 5.93] | -0.28 [-2.82, +2.23] |
电信(探索性)。
同一设计用在 108 个电信任务上(3,888 次运行中完成 3,867 次;只给智能体工具起别名;200 步上限),八组配对中有七组在 $\pm 0.10$ 内等价,重新排版下的 Laguna 不确定,并且没有任何改变超出重跑噪声(表 9)。一条电信轨迹包含由智能体复现的、类似凭据的字符串,因此原始电信轨迹在发布前需要脱敏。
表 6. 航空和零售 $\tau^{2}$-bench 上的研究 3。上半部分:在 88 个从未评测的任务上做工具重命名(Alias)和观察重排版(Format),每种条件三次运行。下半部分:误导性名称的阳性对照。
| 智能体 | 改变 | 任务数 | 原始 | $\Delta$ | 95% CI | 90% CI | 标签 | 重跑翻转 | 超额翻转 [95% CI] |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek (internal) | Alias | 87 | .843 | -.027 | [-.068, +.011] | [-.061, +.004] | equiv. | .147 | -.031 [-.077, +.012] |
| DeepSeek (internal) | Format | 86 | .841 | -.016 | [-.054, +.020] | [-.049, +.016] | equiv. | .147 | -.023 [-.065, +.020] |
| GLM (internal) | Alias | 88 | .831 | -.002 | [-.053, +.051] | [-.044, +.042] | equiv. | .157 | -.028 [-.070, +.015] |
| GLM (internal) | Format | 88 | .833 | +.030 | [-.011, +.072] | [-.008, +.064] | equiv. | .159 | -.023 [-.068, +.027] |
| Laguna (internal) | Alias | 88 | .610 | +.004 | [-.061, +.068] | [-.053, +.057] | equiv. | .356 | -.019 [-.091, +.049] |
| Laguna (internal) | Format | 88 | .610 | .000 | [-.068, +.068] | [-.057, +.057] | equiv. | .356 | +.015 [-.053, +.080] |
| Qwen3.8 Flash | Alias | 88 | .812 | -.049 | [-.102, +.004] | [-.095, -.004] | equiv. | .163 | +.034 [-.019, +.091] |
| Qwen3.8 Flash | Format | 88 | .812 | -.059 | [-.123, +.008] | [-.114, -.004] | inconcl. | .163 | +.093 [+.027, +.161] |
| DeepSeek (internal) | Misleading | 154 | .844 | -.227 | [-.286, -.171] | [-.277, -.180] | different | .140 | +.180 [+.109, +.250] |
| GLM (internal) | Misleading | 157 | .818 | -.226 | [-.297, -.156] | [-.285, -.168] | different | .159 | +.194 [+.120, +.266] |
| Laguna (internal) | Misleading | 158 | .633 | -.437 | [-.497, -.377] | [-.487, -.386] | different | .304 | +.196 [+.104, +.291] |
| Qwen3.8 Flash | Misleading | 158 | .791 | -.196 | [-.266, -.127] | [-.253, -.139] | different | .181 | +.187 [+.113, +.266] |
表 9. 探索性电信复现,108 个任务,每种条件三次运行;列与表 6 相同。
| 智能体 | 改变 | 任务数 | 原始 | $\Delta$ | 95% CI | 90% CI | 标签 | 重跑翻转 | 超额翻转 [95% CI] |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek (internal) | Alias | 108 | .759 | -.035 | [-.088, +.017] | [-.080, +.009] | equiv. | .185 | +.009 [-.037, +.059] |
| DeepSeek (internal) | Format | 108 | .756 | -.023 | [-.074, +.028] | [-.068, +.020] | equiv. | .187 | +.019 [-.035, +.074] |
| GLM (internal) | Alias | 108 | .994 | +.003 | [-.006, +.012] | [-.006, +.012] | equiv. | .012 | -.003 [-.012, +.006] |
| GLM (internal) | Format | 108 | .994 | -.015 | [-.037, +.003] | [-.034, .000] | equiv. | .012 | +.015 [-.003, +.037] |
| Laguna (internal) | Alias | 108 | .404 | +.006 | [-.052, +.065] | [-.043, +.056] | equiv. | .309 | -.019 [-.068, +.031] |
| Laguna (internal) | Format | 108 | .404 | -.056 | [-.114, +.003] | [-.105, -.006] | inconcl. | .309 | -.037 [-.086, +.019] |
| Qwen3.8 Flash | Alias | 108 | .787 | -.040 | [-.080, -.000] | [-.074, -.006] | equiv. | .148 | +.022 [-.012, +.059] |
| Qwen3.8 Flash | Format | 108 | .789 | +.008 | [-.037, +.054] | [-.029, +.045] | equiv. | .151 | +.040 [-.009, +.093] |
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。