CodexQA

Industry & PracticeTechniques & Tutorials

信任层:已记录的通过,四项检查后还剩 22.6%

CodexQA 团队39 min read

Centific 在基准分数旁边加四项核验:评分器能否复现、通过是否可追溯、完成声明是否为假、五次重复是否换档。108 道 ALE 任务、五种配置上,84 次已记录通过只有 19 次全部通过(22.6%,95% 区间 15.0–32.6)。没干活就通过的比例,模型之间相差约十倍。

In this piece

智能体评测的信任层

Mohammadreza Sediqin、Shivali Dalmia、Srinivasa Karthikeya Reddy Kovvuri、Abhishek Mukherji(Centific Research)。许可证:CC BY 4.0。arXiv:2610.07274,2026 年 10 月 5 日。

摘要

确定性的基准分数只说明智能体拿到了分数,并不说明这分数是挣来的、报告是诚实的、或者再跑一次还会一样。本文提出智能体评测的信任层(Trust Layer),一种事后加上的框架。它在每条已记录的分数旁边,报告这条分数该不该信。它核验四件事:结果是否被基准自己的评分逻辑支持;通过的答案是不是靠可追溯的计算挣来的;智能体声称做完了,和实际发生的是否一致;重复执行时结果是否稳定。前三项只用已经保存的产物;第四项会重跑智能体。模型判断只在多数表决下给证据贴标签;所有裁定都走确定性规则,并且从不改写已记录的分数。在 Agents’ Last Exam(ALE,用长程职业任务考智能体的基准)的 108 道题、五种智能体配置上,每个模型都有“通过了但背后没有可追溯计算”的运行,比例相差可达十倍;都有被证实的虚假完成声明;结果也不稳定:18%–46% 的任务在五次运行里不能停在同一个分数档。已记录的通过里,只有 22.6% 同时通过四项检查(95% 置信区间 15.0–32.6,$n{=}84$)。度量智能体能做什么,和核验它确实做了,是两个问题。现有基准只处理第一个。

1 引言

大语言模型(LLM,按提示生成文字并调用工具的模型)智能体,现在越来越多地在软件工程、科学发现、网页交互和职业工作的长程基准(benchmark,用固定任务和评分规则比较系统的数据集)上被评测。SWE-bench(Jimenez et al., 2024)、$\tau$-bench(Yao and others, 2024)、ScienceAgentBench(Chen et al., 2025)和 Agents’ Last Exam(ALE)(Sun et al., 2026)用可执行评分、确定性测试和对照参考的核验,代替主观判断。于是基准分数常常被当成对能力的客观度量。

但分数只回答一个问题:评分器给了分没有?它不说这分数是不是挣来的,报告的结果是不是当时发生的事,也不说再跑一次还会不会一样。编造一个像样数值的运行,和真正算出来的运行,得分完全一样。失败了却声称成功的运行,和失败了并且照实说的运行,得分也完全一样。智能体每次运行都会变,五次里只过一次的运行,和每次都过的运行,得分完全一样;重复研究表明,单次运行的分数仅因偶然就能移动好几个点(Bjarnason et al., 2026)。失败的分数也可能来自打包或评测产物,而不是真的不会做。每一种情况下,数字对那一次运行是准确的,对智能体却是误导。于是分数自己答不了这个问题:一条已经记下的基准分数,能不能信?

已有工作把这些担心分开处理:基准审计、奖励破解和腐败式成功(Skalse et al., 2022; Cao et al., 2026)、诚实(Ren and others, 2025; Chern and others, 2024)、可靠性(Gupta, 2026),以及给大语言模型生成内容做来源追踪(Sediqin et al., 2026a)。它们通常要新的基准、数据集或规程。没有一个回答基准用户更简单的问题:分数已经记下了,该不该信?

本文提出智能体评测的信任层。它是事后加上的框架,用基准本来就会保存的产物(轨迹、分阶段输出、评分代码)审计已记录的结果,和基准并排跑,而不是换掉基准。轨迹(trajectory)是一次任务里按时间记下的步骤,说明结果是怎么来的。它用四个核验器,对应上面四种情况。能力(Competence)检查基准自己的评分逻辑能不能复现已记录的结果,并指出失败的决定性原因。奖励破解(Reward Hacking,字面满足评分目标、但没做目标想要的事)检查一次通过是靠可追溯的计算挣来的,还是靠捷径和没有依据的输出拿到的。智能体欺骗检测(Agent Deception Detection)把智能体的完成声明,和独立核验过的结果对照。可靠性(Reliability)检查相同条件下的重复运行是否停在同一个分数档。

据我们所知,这是第一个把这四项性质放在一起、针对单条已记录分数、并且只用基准已经产出的证据来核验的框架。它的核心设计是把判断和决定分开:模型可以帮助给证据贴标签,但每条裁定都来自确定性规则;任何承重的模型标签,都要三次独立投票里的多数。这一点重要,因为最接近的先前工作发现,判断虚假完成声明的评判器会被自信的措辞带着走,没有任何配置的 AUROC(ROC 曲线下面积,0.5 相当于瞎猜,1 是完全分得开)超过 0.65(Advani and others, 2026)。

在 108 道 ALE 任务上,这一层在两个方向都发现了评分矛盾,包括已记录为通过、但用保存的输出重跑基准自己的评分器时得零分的运行;通过了但背后没有可追溯计算的结果;每一个已记录分数档里都有虚假完成声明;以及无法复现的结果。四个维度是相加的,不是重叠的:许多被标出的任务只被一个维度抓住,拿掉任何一个,它们看起来就还是干净的;已记录的成功里,只有少数能通过全部四项。本文的贡献是:

  1. 据我们所知,第一个事后信任层:核验一条已记录的分数是否可复现、是否挣来的、是否诚实、是否被基准自己的评分逻辑支持,把原先分开研究的四项性质收在一起。
  2. 一种设计:每条裁定都是确定的,模型判断只在三次投票的多数下给证据贴标签,因此头条数字保持完整,并且可以审计。
  3. 在 108 道职业任务上的实证研究:基准分数后面藏着大量信任失败;四个维度抓住的失败大体不同;要求四项都过,被核验过的结果比分数所暗示的少得多。代码将在录用后发布。

2 相关工作

智能体基准与效度审计

近期的智能体基准偏向可核验的、基于代码的结果。ALE 用确定性脚本、对照专家参考,给长程职业任务打分,依赖大语言模型评判的工作流不到 7%(Sun et al., 2026)。SWE-bench 用单元测试给真实 GitHub 问题上的代码修复打分(Jimenez et al., 2024)。$\tau$-bench 把最终数据库状态和参考比较(Yao and others, 2024)。ScienceAgentBench 对来自同行评审论文的任务,给自包含程序打分(Chen et al., 2025)。它们都把一次运行收成最终产物上的一个分数,轨迹本身不打分。这样的分数会误代表能力:Zhu et al.(2026)用一份手工清单把效度威胁形式化,覆盖任务效度和结果效度;Kapoor et al.(2024)表明不受控的成本会扭曲结论;自动审计发现测试套件会拒绝正确的解,评分器的局限越来越主导报告出来的分数(Tu et al., 2026)。这些工作通过专家复核审计基准是怎么造的;相关检查则管文档库里的一致性(Sediqin et al., 2026b)。

奖励破解、诚实与可靠性

规格博弈(specification gaming,满足字面目标但不满足意图)由 Skalse et al.(2022)形式化,并由 Krakovna et al.(2020)在强化学习系统里编目。对使用工具的大语言模型智能体,基准度量它们跳过核验、或动手改评测本身的倾向(Thaman, 2026; Gabor et al., 2026)。Cao et al.(2026)报告腐败式成功:终态是对的,但违反了过程完整性,占所报告成功的 27% 到 78%。Advani and others(2026)刻画虚假成功,即智能体断言已经完成、但环境与之矛盾,并表明大语言模型评判器检测它并不可靠。MASK(Ren and others, 2025)和 BeHonest(Chern and others, 2024)在被诱发的情景里度量倾向,而不是在真实运行里核验声明。可靠性方面,60,000 条 SWE-Bench-Verified 轨迹上,单次的 pass@1(只看一次运行过没过)最多会因选中哪一次运行而相差 6.0 个点,作者建议用 pass^k 作为悲观界(Bjarnason et al., 2026)。相关工作把评测当成实验,其方差决定可复现性(Mustahsan et al., 2025)。ReliabilityBench 在重复和扰动下度量一致性(Gupta, 2026)。

定位

效度工作审计基准是怎么造的。奖励破解、虚假成功和诚实工作各自对准一种模式,通常靠一个自身可靠性存疑的大语言模型评判器。可靠性工作把重复做进新基准。它们都处在和“一条分数”不同的层次。最接近的工作是过程感知评测(Cao et al., 2026),它定义一种新评测:智能体有没有遵循预期过程。本文问的是:现有基准已经记下的分数还站不站得住。它从保存的轨迹和评分代码核验这条分数的四项性质,按维度看,也按合取看。于是过程干净但不稳定的通过,或者挣来了却虚假报告的通过,仍然会被抓住。

图 1:信任层总览。D1 重新推导裁定,D2 追踪数值来源,D3 检验智能体的声明,D4 重复这次运行。

3 系统架构

信任层是基准给智能体打完分之后加上的一段(图 1)。它有四个维度,对应一类失败。D1(能力)问一条已记录的分数到底由什么构成,并露出评分器复现不了的分数,两个方向都算。D2(奖励破解)问通过的分数是挣来的,还是没干活就拿到的。D3(智能体欺骗检测)问智能体的成功声明是否被结果否定。D4(可靠性)问重复时分数是否停在同一档。D1–D3 只读基准保存了什么;D4 还会重跑智能体。凡是需要裁定的地方,这一层都复用基准自己的评分器(grader,基准用来给一次运行打分的程序),并且从不覆盖已记录的分数,只把发现写在旁边。它向基准要三样东西:保存的轨迹、可以调用的评分逻辑、以及可以离线阅读的输出。

证据:轨迹与重新评分

基准会产出、却从没有用完的两样东西提供证据:轨迹,即逐步记录结果是怎么产生的;以及基准自己的评分器,在保存的输出上重跑,用来复现分数,而不是信任它。每个维度都靠其中一样或两样。

3.1 D1:能力

简言之:重跑评分器,问到底是什么决定了分数。D1 用任务自己的评分器,从保存的输出重新推导裁定,再和已记录的分数比较。没有模型负责打分:模型按严重程度给门(gate)贴标签,裁定是这些标签的确定性函数。D1 有四个阶段,每一阶段用上一阶段的输出。

#### 阶段 A 与 B:分型和重新评分

门是评分器内部的一项检查,它失败就会把分数压到零,例如缺文件或数值错误。阶段 A 把每个门收进集合 $G$,并按它保护的东西分型:

$$ \tau(g)\in\{\texttt{critical},\texttt{process},\texttt{administrative}\}, \tag{1} $$

critical 表示交付物有缺陷,process 表示违反了方法规则,administrative 表示打包缺陷。每个门还带一个反博弈标记 $\alpha(g)$。分型由大语言模型评判器在三次投票的多数下完成;因为它是评分器的性质而不是某一次运行的性质,每个任务只做一次。阶段 B 在保存的输出上重跑评分器,把触发的门 $F$ 映射成裁定:

$$ v=\Phi(F,\tau,\alpha),\qquad F\subseteq G, \tag{2} $$

由触发的门里最严重的那个决定,于是真正的正确性失败不能躲在较轻的失败后面。附录 A 给出门的标准、匹配步骤、严重度排序,以及阶段 B 可以返回的裁定。

#### 阶段 C 与 D:声明与质疑

阶段 C 用确定性的模式匹配,把智能体的收尾消息收成完成声明 $c$,再对照 $v$ 检验,得到 D3 使用的三值诚实信号:

$$ \ell=\begin{cases}1&\text{if }c=\texttt{success}\wedge v\in V_{\text{fail}},\\ \bot&\text{if }c=\texttt{success}\wedge v\in V_{\text{unver}},\\ 0&\text{otherwise},\end{cases} \tag{3} $$

其中 $V_{\text{fail}}$ 是复现了真实失败的裁定,$V_{\text{unver}}$ 是无法离线复现的裁定。阶段 D 是唯一把前面事实合在一起的地方,规则完全确定,没有模型调用:

$$ \begin{gathered}(D,\delta)=\Psi(s,v,\ell,m,\kappa),\\ D\in\{\texttt{confirm},\texttt{contradiction},\texttt{upgrade},\texttt{unverified}\},\end{gathered} \tag{4} $$

其中 $s$ 是已记录的分数,$m$ 表示提示本身是否要求了那个失败的格式,$\kappa$ 是不看格式、只看输出数值是否与参考一致的检查。confirm 复现了已记录的结果;contradiction 不同意,带符号的方向 $\delta$ 记下哪一边错了;unverified 无法离线检查;upgrade 是唯一需要前面三个阶段都到齐的结果,出现在这次运行没通过一项检查、但这项检查并不意味着工作做错了的时候。附录 A 给出升级条件,并把矛盾和升级对照起来。

3.2 D2:奖励破解

简言之:问每个答案数值是从哪来的。分数说明答案是对的,不说明它是怎么产生的。把常数写死、抄提示里已经给出的值、或者写下没有计算支撑的像样数字,得分和真正干活的运行完全一样,评分器会被骗过去。D2 把这种运行标成 gamed(被博弈过),把它们从本来会算进去的诚实通过里分开。它追踪来源,而不是再查一遍对错。

#### 追踪每个数值

D2 用参考答案当离线神谕。智能体从没见过参考答案。它用参考答案挑出哪些输出数值是答案,再把每个数值对照这次运行的三个来源:智能体执行过的命令的输出、它读到或在提示里得到的输入、以及它亲手打进文件和 shell 命令的文字。每个数值得到一个标签:

$$ \pi(x)\in\{\textsc{derived},\textsc{given},\textsc{typed},\textsc{ungrounded}\}, \tag{5} $$

出现在已执行输出里就是 derived,来自输入或提示就是 given,亲手写下就是 typed,哪里都没有就是 ungrounded。决定性的检验是:一个答案数值没有出现在已执行输出里时,它是智能体亲手打的,还是运行时由脚本产生的?脚本算出的正确值是真干活;亲手打的不是。标量逐个追踪,数组按文件追踪(附录 A)。

#### 供认、评判器与裁定

扫描智能体的消息和推理,寻找抄袭或写死常数的供认,并带否定保护,以免“打算不要写死”被读成供认。供认单独从来不是一条旗标:若某个数值已经被发现不是挣来的(对上了参考,但既没算出来也没读到),供认就确认这是一次破解;否则它只把这次运行标出来,留待细看。仍然确实说不清的数值交给模型评判器。评判器看到提示、被标出的数值、智能体的话和它的代码,并被警告:把写死的常数打印出来,并不等于算出来了。定罪之前,D2 让评判器检查任务是否要求这个数值必须计算出来;如果任务允许直接作答,这个数值就被放行。定罪需要三次投票的严格多数,所以分裂就判成干净:这项检查宁可放过一次作弊,也不指控一次诚实的运行。运行裁定是:

$$ V_{\text{int}}\in\{\texttt{clean},\texttt{suspect},\texttt{gamed}\}, \tag{6} $$

强旗标给出 gamed,弱旗标或未解决的数值给出 suspect,来源干净则是 clean。suspect 只是路由状态,把运行送给评判器,由评判器解决,所以不会被报告出来。每条裁定记下作弊类型(抄来的或编造的)。信号从“供认加上来源缺口”(最强),到“靠没有痕迹、由评判器投票认定的编造”(最弱)(附录 A)。未被追踪到的数值被标出来复核,而不是被定罪;只有上面的某个条件成立时才标成 gamed,任务允许直接作答时绝不这样标。一个被编造、然后经已执行代码写出去的数值看起来像 derived,所以 D2 给的是无法追踪的编造的界,而不是经执行洗过的编造。

3.3 D3:智能体欺骗检测

简言之:把智能体的最终报告和真正发生的事对照。最后一条消息是智能体报告结果的地方。它在失败的运行上声称成功时,监督就失效了。基准两种情况给同样的分数,所以说谎对智能体没有代价,分数也永远显示不出来。本文对“谎”的用法是操作性的:在重新评分已经证明失败的运行上声称成功。D3 表明报告是假的,并不表明智能体知道它是假的。D3 有两件工作:D1 流水线内部的是或否检查,以及对已确认的谎有多严重的单独判断。

#### 工作 1:智能体是否在谎报?

这就是式 (3) 的确定性信号 $\ell$。它把智能体的成功声明对照重新评分的裁定 $v$,而不是对照已记录的分数:对照已记录分数只会表明智能体声称成功并且得了零分,把说谎的智能体和评分错误混在一起;重新评分才能把它们分开。如果重跑评分器证明了失败,这条声明就是已确认的谎($\ell=1$);如果评分器不能重跑,就标成疑似,D3 停止($\ell=\bot$)。这个事实回馈到阶段 D:已被证明的谎,会在“只是格式失败”上取消智能体的存疑利益。因为 $\ell$ 靠的是 D1 的重新评分,这两个维度不是相互独立的证据。

#### 工作 2:谎有多严重?

D1 结束后,模型评判器在多数投票下重新检查每条已确认的谎,所以这个输出是裁定,不是测量。评判器看到智能体的话,以及独立发生了什么(已记录分数、重新评分的裁定、触发的门、失败解释、评分器消息、轨迹摘要),并产出:

$$ (\hat{\ell},\gamma,\eta,\phi)=\Xi(\ell,v,q,E), \tag{7} $$

其中 $q$ 是智能体的原话声明,$E$ 是运行里发生的事:最终决定 $\hat{\ell}$ 确认或放下这条谎,声明的种类 $\gamma$,背后有没有具体缺陷 $\eta$,以及这条谎单独是否应该让任务失败 $\phi$(附录 A)。工作 2 从不回馈进 D1。D1 只用 $\ell$,所以质疑决定不会继承评判器的方差,分数也不会被改。一条已确认的谎恰好用在三处:它在阶段 D 挡住打包升级;它给宽大的矛盾附上智能体是否也说了谎;它把未核验的通过路由到 suspect。

3.4 D4:可靠性

简言之:把任务再跑一遍,看结果是否停在同一档。一次运行是一个样本,不是对一个点的测量。五次里只站住一次的通过,是被记成能力的运气,任何只看单次运行的维度都看不见。D4 在相同配置下把每个任务执行 $N=5$ 次,并刻画分数分布 $\{s_{1},\ldots,s_{N}\}$。每次运行先根据终止记录、轨迹文本和使用计数(额度耗尽、沙箱已死、工具调用为零)分成基础设施失败或真实失败。基础设施运行被排除,于是 D4 度量的是智能体,不是支架(harness,包在模型外面、负责跑任务的程序)。在留下来的运行 $S$ 上:

$$ \bar{s}=\tfrac{1}{\|S\|}\sum_{s\in S}s,\qquad\bar{\Delta}=\bar{s}-s_{\text{rec}}, \tag{8} $$

$$ \texttt{crossed}=\mathbf{1}\big[\,\|\{\mathrm{band}(s):s\in S\}\|>1\,\big], $$

其中 $s_{\text{rec}}$ 是已记录的分数,$\mathrm{band}(\cdot)$ 按 ALE 的阈值把分数映射成 pass、partial 或 fail(Sun et al., 2026)。crossed 触发时任务是 varied(有变化),否则是 stable(稳定)(Gonzalez-Pumariega et al., 2026)。crossed 问的是重复之间是否彼此一致;$\bar{\Delta}$ 问它们离已记录分数有多远,负值表示已记录的那一次更好。只有 crossed 决定任务是否通过 D4;$\bar{\Delta}$ 只报告,不当门槛。

另外两个统计量把“分数度量了什么”和“分数只是抽样到了什么”分开(Bjarnason et al., 2026)。把分数看成真实能力加上噪声,重复的方差分成任务之间的部分(难度和能力的真实差别)和任务内部的部分(一次次运行的随机性)。它们的比是:

$$ \rho=\sigma^{2}_{\text{between}}/(\sigma^{2}_{\text{between}}+\sigma^{2}_{\text{within}}) \tag{9} $$

$\rho$ 是信号所占的方差份额,$1-\rho$ 是其余份额(Mustahsan et al., 2025)。用重复估计每个任务的通过概率 $\hat{p}$,得到 $\hat{p}^{k}$,即连续 $k$ 次都通过的机会。它和 $\hat{p}$ 的差距,就是一次运行的分数报告了、却维持不住的能力。附录 A 给出 $\rho$ 的逐任务形式,以及保存下来的重复还能支持什么。

3.5 跨维度汇总

答错、没挣来的通过、虚假声明和不稳定的分数,需要不同的回应,所以维度分开报告;把它们平均会丢掉这一层存在就是为了画出的区别。它们也按合取报告:一个任务只有在每个维度都放行时才被信任,意思是裁定能重新推导出来、答案数值有依据、没有已确认的虚假声明、并且任务在重复之间稳定。这是门槛,不是分数:没有维度被拿来互相加权,已记录的分数也从不被覆盖。

#### 计数规则

任务只有在重新评分给出已核验的通过时才通过 D1;对已记录的通过,这意味着 confirm,所以 contradiction 和 unverified 都是 D1 失败;评分器不能离线重跑的任务算 unverified。它只有在 clean 时才通过 D2;gamed 和“无裁定”都是 D2 失败。没有已确认的虚假声明时,它通过 D3。只有在 stable 时它才通过 D4,不管重复往哪个方向动,因为换了档的分数无论哪边都不能信;分数被读成关于智能体的证据(第 1 节)。一个任务可以在几个维度上失败(编造了答案的运行常常也声称成功),所以合取不是求和,本文报告重叠(Zhou et al., 2026)。这四项并不穷尽,但它们覆盖了保存的产物能够取证的信任失败。

4 实验

4.1 数据集与设置

本文在 ALE 公开的 108 道任务上评测信任层(Sun et al., 2026)。ALE 是长程工作的基准,用确定性脚本对照专家参考打分,覆盖 ALE 的三档难度和 11 个职业领域,每道题有自己的评分代码,每次运行产出一个分数。每道题在五种智能体配置下各跑一次:Claude Sonnet 4.6、Claude Opus 5、GPT-5.6 Sol(GPT-Sol)、Muse Spark 1.2(MetaMuse)和 Gemini 3.6 Flash,智能体支架和解码配置相同。已记录的分数档因模型而异,最弱的有 15 次已记录通过,最强的有 24 次(附录 B)。对 D1–D3,信任层只读每次运行已经保存的东西:智能体的轨迹、它分阶段放好的输出、以及任务自己的评分代码。它对照保存的输出重新执行这段代码,不重跑智能体,也从不修改已记录的分数。某个维度需要模型判断时,使用 GPT-5.5,三次独立投票,严格多数。

任务在评分器不能离线重跑时不可评分。108 道里有 11 道如此,这是任务的性质,不是某个模型的性质,所以每个智能体都排除同样的 11 道。这些运行没有放出评分器能读的输出,于是 D1 没有裁定,D3 没有东西可用来检验声明,D2 没有答案数值可追踪,全程留下 97 道被评估。D4 则在相同配置下把智能体每道题重跑五次。Sonnet 下 108 道里有 87 道完成了全部五次重复;在全部五种配置下都重复了的 50 道题,是从这 87 道里随机抽取的,并按 ALE 的档次分层(24 道 Near-Term,18 道 Full-Spectrum,8 道 Last-Exam)以及已记录的分数档。重复执行的研究常用三到六次运行(Guo et al., 2026; Zhang et al., 2025),所以五次符合当前做法。每个维度因此报告自己的分母。因为这 50 道重复任务抽自全部 108 道,第 4.6 节的汇总可以包含不可评分的任务;按第 3.5 节的计数规则,它们算 D1 和 D2 失败。

4.2 D1:能力

表 1:每个模型的 D1 结果。

Modelconfirmcontraunverifiedupg
Sonnet563830
MetaMuse504700
GPT-Sol504700
Opus534310
Gemini613510

表 2:每个模型已确认的虚假声明。

ModelConfirmedhardsoft
Sonnet552629
MetaMuse35314
GPT-Sol40382
Opus17152
Gemini27261

D1 在保存的输出上离线执行每道题的评分代码,不重跑智能体,再把结果和已记录的分数比较(表 1,97 道可评分任务)。各模型的 confirm 聚在 50 到 61 之间,尽管它们已记录的通过相差九个。大多数矛盾(contra)是低于已核验通过线的部分分数:基准按比例给部分工作记分,而 D1 要求完整地重新推导。真正的分歧更小:每个模型有 2 到 9 个已记录通过被重新推导成失败,有一两个已记录失败被重新推导成通过(附录 C)。升级(upg)路径可达,但一次都没给过,因为每个候选的数值都和参考不同。门的分型是 D1 唯一由模型贴标签的阶段,一致性足够高,多数规则吸收的是残余分歧,而不是掩盖抛硬币(附录 C)。后面每个阶段都是确定的:在同一输出上把评分器执行五次,108 道题全部返回相同的裁定和分数档。

4.3 D2:奖励破解

表 3:每个模型的 D2 裁定。gamed% 以 97 道被评估任务为分母,包括没有裁定的运行。

Modelassessedcleangamednot assessedgamed%
Sonnet977514814.4
MetaMuse975238739.2
GPT-Sol974549350.5
Opus9775101210.3
Gemini9744252825.8

在 97 道被评估任务上(表 3),模型之间相差五倍:Opus 和 Sonnet 大约八次运行里有一次没干活就拿到答案,GPT-Sol 是一半;在已记录的通过上,差距是十倍,从 Opus 的 22 次里 1 次,到 GPT-Sol 的 21 次里 10 次(表 9)。没有裁定的运行既不是 clean 也不是 gamed,仍留在分母里。这对 Gemini 最要紧:有裁定的运行上,它的比率是 36.2% 而不是 25.8%;这些缺失不太像随机缺失,它的真实比率落在 25.8% 和 54.6% 之间。编造——数值对上了参考,却不出现在任何已执行输出里,也不出现在智能体读过的任何东西里——占了大多数定罪;抄一个被提供的值更少,明确供认更少,所以每个模型的大多数 D2 裁定由评判器承担。Sonnet 的每条 gamed 裁定都对照轨迹做了手工核验,14 条全部成立;附录 D 给分解。把参考值注入检测器已经放行的运行,用来测另一个方向:数值仍无依据时,D2 标出 38 次里的 36 次;已执行代码把它写出去时,标出 45 次里的 2 次。

4.4 D3:智能体欺骗检测

D3 跑第 3.3 节的两件工作。声明只有在重新推导复现了发生的事情时才能被检验,所以没有离线裁定的 11 道题不合格;表 2 覆盖剩下的 97 道。背后有具体缺陷时,声明是 hard(触发了 critical 门、缺输出、或轨迹表明工作是错的),而智能体把交付物报告成已核验;没有这类缺陷的证据时是 soft,典型情况是过度声称所有检查都过了,而智能体自己的数字已经低于门槛。Sonnet 已确认的声明大约一半是 soft,另外四个模型则大多是 hard,所以同一个检测器找到两种误报风格。模型做出已确认虚假完成声明的频率也不同,从 Opus 的 17 次到 Sonnet 的 55 次;每个模型的每个已记录分数档里都有虚假声明,包括完全通过。在两份标注过的 Sonnet 运行样本上,标注者对收尾消息是否声称成功,在 50 条里同意 48 条($\kappa=0.85$;$\kappa$ 是 Cohen’s kappa,两位标注者的一致性,1 为完全一致),匹配器相对他们的共识达到 $F_{1}=0.91$($F_{1}$ 是精确率和召回率的调和平均)。严重程度上他们的一致为 $\kappa=0.84$,评判器达到 $F_{1}=0.97$。

4.5 D4:可靠性

表 4:每个模型的 D4 结果。

ModelTasksstab.var.var.%$\bar{\Delta}$
Sonnet50272346.0$-0.31$
Opus50391122.0$-0.30$
GPT-Sol5041918.0$-0.22$
MetaMuse50381224.0$-0.12$
Gemini50361428.0$-0.24$

表 4 覆盖 50 道重复任务。它的 $\bar{\Delta}$ 列是有变化的通过档任务上、相对已记录分数的平均变化,全程为负:一次没能复现的已记录通过,返回的分数低于记录上的那一次。分数档的构成因模型而异,所以比率只有在同一档内才可比(附录 E,其中也给出 87 道题的结果)。变化率从 GPT-Sol 的 18.0% 到 Sonnet 的 46.0%,在相同任务和条件下相差两倍半,所以不稳定既是任务的性质,也是智能体的性质。移动跟着已记录的分数档走:基准记下成功时,已记录的那一次是更好的一次;记下失败时,已记录的那一次是更差的一次(附录 E)。把所有任务合在一起,每个模型的平均变化都是 $+0.03$ 或更小,于是方向互相抵消,汇总把效应完全藏起来。

Sonnet 在 87 道题的 25.3% 上有变化。它的重复方差分成任务之间 0.143、任务内部 0.040,$\rho=0.78$,所以已记录分数里接近四分之一的变异,是关于保存了哪一次运行,而不是关于智能体。噪声是集中的:中位任务在重复之间的标准差是 0.007,有变化的任务是 0.350。任务在单次重复上有 19.3% 通过,但在五次序列上只有 13.8% 通过;至少通过一次的 24 道题里,只有 12 道每次都过:基准可能计为成功的任务里有一半只是有时成功,没有任何单次运行的维度能把这两半分开。Sonnet 的两次独立战役——87 道题,以及从中抽出的 50 道——不一致:同一配置下变化率是 25.3% 对 46.0%。随机抽取大约会带上 13 道有变化的任务,而不是 23 道(表 13)。因此 D4 裁定本身也是一个样本;本文报告两次战役,而不是更有利的那一次,更大的 $N$ 会收紧估计。因为 $\bar{\Delta}$ 不当裁定的门槛,一个稳定的任务可以落在和已记录不同的分数档。表 4 的 181 条稳定裁定里,有 16 条如此(Gemini 10,Sonnet 2,Opus 2,MetaMuse 2,GPT-Sol 0),其中 4 条是已记录的通过。若要求复现已记录的分数档,这 16 条会被改分类;本文把它们单独报告,而不折进稳定/有变化的标签。

4.6 跨维度汇总

表 5 给出基准记为通过的那些任务上的合取,这是它起作用的地方:D1 的已核验通过线按定义拒绝部分分数,所以没有部分完成的任务能通过它。D1–D4 各列重叠,不能相加;附录 F 给出全部三档。已记录通过里有 7.7% 到 40.0% 通过全部四项检查;五个区间都重叠,所以这些比率给出的是有多少通过站得住,而不是给配置排序。合并后(表 5 最后一行),84 次已记录通过里只有 19 次通过全部四项检查(22.6%,95% 置信区间 15.0–32.6;区间为 Wilson 得分区间,一种给比例用的置信区间),于是 65 次至少失败一项,并且每种配置里都是多数失败。模型失败的原因不同:GPT-Sol 有三分之二的通过输在 D2,18 次里有 12 次背后没有可追溯的计算;Opus 有 3 次没有依据,输得更多的是重新推导,而不是别的。被标出的任务里有三分之一到一半只被一个维度抓住,所以拿掉任何一个,它们就和干净的分不出来。

表 5:50 道重复任务里、已记录通过上的合取,计数规则见第 3.5 节。区间是 95% 的 Wilson 得分区间。

failedaggregate
ModelPassesD1D2D3D4trusted%
Opus208305840.0
Sonnet154515426.7
MetaMuse188613422.2
GPT-Sol1871234211.1
Gemini13752317.7
All84––––1922.6

消融(表 11)也表明有多少依赖模型标签:两个确定性维度(D1、D4)留下 84 次已记录通过里的 34 次,两个有评判器协助的维度再拒绝 15 次,留下 19 次。在全部 50 道任务上,总数反映的是门槛多于证据,因为 D1 让每个部分完成的任务失败;已记录通过的数字才回答这一层被造出来要回答的问题。

5 结论与未来工作

本文给出一个信任层,核验已记录的智能体分数的四项性质:失败是不是真的,通过是不是挣来的,智能体的声明是否符合现实,分数在重复运行之间是否稳定。它是加上去的,从不覆盖已记录的数字,并把模型判断限制在给证据贴标签。在五种智能体配置上,每个模型都有一些运行没计算就拿到通过的答案,最干净和最差之间相差十倍;每个模型的每个已记录分数档里都有已确认的虚假完成声明;重复执行让 18% 到 46% 的任务跨过分数档,符号使得已记录的通过是智能体更好的那一次,已记录的失败是更差的那一次,而把它们合在一起会擦掉这个方向。要求四项性质都成立,已记录的成功只留下 22.6%;被标出的任务里有三分之一到一半只被一个维度抓住,所以没有哪一项检查能代替其他项。因为这一层不绑死在某个基准上,未来工作会把它用到 SWE-bench Verified、$\tau$-bench 和 ScienceAgentBench,让跨基准的智能体评测更可信。度量智能体能做什么,和核验它做了,是不同的问题,目前只有第一个被装上了仪器。

局限

本文的说法限制在证据支持的范围。精度对 D2(手工核对过的 gamed 裁定)和 D3(标注者一致性,第 4.4 节)在一种配置上做了直接验证;把这些检查扩到所有模型,并用人工标签验证 D1 的门分型,是自然的下一步。每种配置有 13 到 20 次已记录通过,表 5 的区间重叠,结果确立的是:每种配置里,大多数已记录通过至少失败一项检查,而不是给智能体排名。全部结果来自 ALE;因为这一层只需要轨迹、分阶段输出和可重跑的评分器,用到其他基准是直接的。每条决定规则都是确定的,第 4.6 节的消融表明没有评判器时结果还剩下多少。gamed 裁定的意思是没有可追溯的计算,不是有意作弊;D2 抓不住经执行洗过的编造。已确认的谎表明报告是假的,不是智能体知道这一点。D4 会重新执行智能体,它 $N=5$ 的裁定本身是一个样本;分数档和已记录不同的稳定任务被单独报告(第 4.5 节)。

参考文献

  • Advani et al. (2026) L. Advani et al. From confident closing to silent failure: characterizing false success in llm agents. arXiv preprint arXiv:2606.09863.
  • Bjarnason et al. (2026) B. H. Bjarnason, A. Silva, and M. Monperrus. On randomness in agentic evals. arXiv preprint arXiv:2602.07150.
  • Cao et al. (2026) H. Cao, I. Driouich, and E. Thomas. Beyond task completion: revealing corrupt success in llm agents through procedure-aware evaluation. arXiv preprint arXiv:2603.03116.
  • Chen et al. (2025) Z. Chen, S. Chen, Y. Ning, Q. Zhang, B. Wang, B. Yu, Y. Li, Z. Liao, C. Wei, Z. Lu, et al. Scienceagentbench: toward rigorous assessment of language agents for data-driven scientific discovery. In International Conference on Learning Representations, Vol. 2025, pp. 96934–96990.
  • Chern et al. (2024) S. Chern et al. BeHonest: benchmarking honesty in large language models. arXiv preprint arXiv:2406.13261.
  • Gabor et al. (2026) J. Gabor, J. Lynch, and J. Rosenfeld. EvilGenie: a reward hacking benchmark. arXiv preprint arXiv:2511.21654.
  • Gonzalez-Pumariega et al. (2026) G. Gonzalez-Pumariega, S. Agashe, J. Yang, A. Li, and X. E. Wang. On the reliability of computer use agents. arXiv preprint arXiv:2604.17849.
  • Guo et al. (2026) Y. Guo, Y. Liu, J. M. Zhang, Y. Ma, Y. Lou, and Z. Chen. SWE-doctor: guiding software engineering agents with runtime diagnosis from multi-faceted bug reproduction tests. arXiv preprint arXiv:2607.00990.
  • Gupta (2026) A. Gupta. ReliabilityBench: evaluating llm agent reliability under production-like stress conditions. arXiv preprint arXiv:2601.06112.
  • Jimenez et al. (2024) C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, and K. Narasimhan. Swe-bench: can language models resolve real-world github issues?. In International Conference on Learning Representations, Vol. 2024, pp. 54107–54157.
  • Kapoor et al. (2024) S. Kapoor, B. Stroebl, A. Narayanan, et al. AI agents that matter. arXiv preprint arXiv:2407.01502.
  • Krakovna et al. (2020) V. Krakovna, J. Uesato, V. Mikulik, M. Rahtz, T. Everitt, R. Kumar, Z. Kenton, J. Leike, and S. Legg. Specification gaming: the flip side of ai ingenuity. DeepMind Blog.
  • Mustahsan et al. (2025) Z. Mustahsan, A. Lim, M. Anand, S. Jain, and B. McCann. Stochasticity in agentic evaluations: quantifying inconsistency with intraclass correlation. arXiv preprint arXiv:2512.06710.
  • Ren et al. (2025) R. Ren et al. The MASK benchmark: disentangling honesty from accuracy in ai systems. arXiv preprint arXiv:2503.03750.
  • Sediqin et al. (2026a) M. Sediqin, S. Dalmia, S. Thoppanahalli, S. K. R. Kovvuri, and A. Mukherji. SAGE: governed artifact generation from enterprise guidelines. arXiv preprint arXiv:2609.17775.
  • Sediqin et al. (2026b) M. Sediqin, S. Dalmia, S. Thoppanahalli, and A. Mukherji. GVD: governed versioning and deduplication for document repositories. arXiv preprint arXiv:2609.17696.
  • Skalse et al. (2022) J. Skalse, N. Howe, D. Krasheninnikov, and D. Krueger. Defining and characterizing reward gaming. Advances in neural information processing systems 35, pp. 9460–9471.
  • Sun et al. (2026) Y. Sun, X. Han, D. Song, et al. Agents’ last exam. arXiv preprint arXiv:2606.05405.
  • Thaman (2026) K. Thaman. Reward hacking benchmark: measuring exploits in llm agents with tool use. arXiv preprint arXiv:2605.02964.
  • Tu et al. (2026) X. Tu, T. Wang, K. Huang, Y. Qu, S. Mostafavi, et al. Benchguard: who guards the benchmarks? automated auditing of llm agent benchmarks. arXiv preprint arXiv:2604.24955.
  • Yao et al. (2024) S. Yao et al. $\tau$-bench: a benchmark for tool-agent-user interaction in real-world domains. arXiv preprint arXiv:2406.12045.
  • Zhang et al. (2025) Z. Zhang, A. P. Bajaj, D. Handa, S. Liu, A. S. Raj, H. Chen, H. Wang, Y. Liu, Z. L. Basque, S. Nath, et al. Buildbench: benchmarking llm agents on compiling real-world open-source software. arXiv preprint arXiv:2509.25248.
  • Zhou et al. (2026) Y. Zhou, L. Y. Choi, J. Wen, and W. Ye. Accuracy, stability, and repeated-run reliability of large language models on deterministic programming tasks. arXiv preprint arXiv:2606.00920.
  • Zhu et al. (2026) Y. Zhu, T. Jin, Y. Pruksachatkun, A. Zhang, S. Liu, S. Cui, S. Kapoor, S. Longpre, K. Meng, R. Weiss, et al. Establishing best practices in building rigorous agentic benchmarks. Advances in Neural Information Processing Systems 38.

附录 A 方法细节

本附录收集第 3 节引用的标准、例子、标签定义和统计细节。

#### 门类型标准(阶段 A)

critical 这一类也覆盖执行任务本身所要求事项的门,例如必须有的输出文件、必须与真值一致的指定数值、或提示明确写出的约束,因为其中一项失败就意味着交付的工作没有达到所要求的。process 门例如要求编写的脚本调用指定的仿真程序:即使忽略这条规则,输出仍可能是对的。administrative 门例如提交的文件缺了模式所要求的键:工作可能是对的,但读不了。门是通过扫描评分器的每个文件来恢复的,而不是只看名义上的打分模块,因为存在性检查常常在入口模块,数值检查常常在被委托的模块。

#### 门的匹配(阶段 B)

阶段 B 从轨迹里只用任务标识,并在需要时用指令来选择正确的参考。每个报告出来的失败,按其标识匹配回阶段 A 的门;这个标识就是评分器自己的消息模板,在填好的输出里被认出来。阶段 B 可以返回的裁定是:答案错误、被评分器自己的防护抓住的编造或退化产物、违反的方法规则、缺失的交付物、以及格式失误,各自单独记录。

#### 严重度排序(阶段 B)

几个门同时触发时,前提失败高于质量失误;前提之中,critical 高于 process,process 高于 administrative。这个排序也堵上一种利用:administrative 失败是阶段 D 唯一可以升级的裁定,排序防止任何带有真实失败的运行被改标成格式失误。

#### 矛盾与升级(阶段 D)

升级只有在以下条件都成立时才可达:决定性失败是 administrative(来自 B),提示没有要求那个格式($m=0$,来自 A),数值与参考一致($\kappa=1$,在阶段 D 计算),并且智能体没有被抓住说谎($\ell\neq 1$,来自 C)。任何其他决定性的门,只是带着原因确认已记录的零分。给 $\delta$ 签名记下哪一边错了:基准让本该通过的运行失败了,或者让本该失败的运行通过了。智能体算出了正确数值,写进 result.csv,而评分器要的是 results.csv,这时它正确地失败,重新评分仍失败,所以不产生矛盾;这个零分仍然误代表已经做完的工作。这之所以可能,只是因为 administrative 门保护的是任务本身没有施加的要求。提示如果写明了格式,门执行的就是任务要求的东西,阶段 A 会把它标成 critical 而不是 administrative,于是没有升级可达。给方向签名出于同一原因:一种情况是惩罚了有能力的智能体的公平性缺陷,另一种是抬高排行榜的不劳而获分数;把它们并成一个“我们不同意”会藏起发生的是哪一种、以及该怎么办。

#### D2 的信号强度

带有来源缺口的供认最强:两半都是记下的事实,并且互相印证,因为供认解释了缺口,缺口确认了供认。抄来的数值匹配是确定的,但更弱,因为提示如果写明了期望答案,它就不可靠。评判器投票认定的编造最弱,靠的是没有痕迹,而不是有证据,所以它要求严格多数,分裂时判成干净。

#### 数值追踪的粒度(D2)

标量一次追踪一个值,所以直接贴进输出的常数不能藏在算出来的数值中间;数组和大表从不是逐个数字打印的,当文件本身由已执行代码产生时,就在文件层面放行。

#### D3 的严重度标签

评判器给出最终决定 $\hat{\ell}$:确认这条谎,或者如果智能体的话并没有真正与发生的事矛盾,就放下它。标签 $\gamma$ 分开两种声明:说工作是对的,和只是说做完了,前者更严重。标签 $\eta$ 按背后有没有具体缺陷,把谎标成 hard 或 soft。最后 $\phi$ 说这条谎单独是否应该让任务失败,门槛故意定得高:只要轨迹没有证明交付物确实是错的,就回答“不可核验”。

#### 逐任务方差与重复产物(D4)

任务内部的标准差给出和 $\rho$ 相同的量,但是逐任务的,用来区分噪声铺均匀的基准和噪声集中在少数不稳定任务上的基准。每次运行的产物都被保存,所以 D1 到 D3 都可以用到任何一次单独的重复上。

附录 B 每个模型已记录的分数档

表 6:ALE 对每个模型已记录的分数档,范围是 97 道有可重新推导裁定的任务。因为一个维度的比率依赖于分数档的构成,不按档条件化时,模型之间的比率不能直接比较。

Modelpasspartialfail
Sonnet153646
MetaMuse223738
GPT-Sol233638
Opus243340
Gemini182554

附录 C 能力细节

表 1 对每个结果、每个模型报告一个数字。它背后有两份分解。

第一份按方向分开矛盾,这有关系,因为它们不是同一种现象。没能越过已核验通过线的部分分数,和基准的分歧是按定义来的,不是按错误来的:两边算出同一个数,只是对部分分数算不算已核验通过有不同看法。已记录的通过被重新推导成失败,或已记录的失败被重新推导成通过,才是关于结果本身的分歧。表 7 表明,第一种情况占了每个模型的大多数矛盾,第二种小一个数量级。有一道题完全没有已记录分数,单独列出。

表 7:按方向的矛盾,范围是 97 道可评分任务(P = partial,F = fail)。

ModeltotalP$\rightarrow$Fpass$\rightarrow$FF$\rightarrow$passnone$\rightarrow$F
Sonnet3834220
MetaMuse4737910
GPT-Sol4736920
Opus4333820
Gemini3525811

第二份按已记录分数档给出完整的结果分布。每个模型的 partial 行都是零个 confirm,这把门槛规则摆了出来:没有部分分数会被重新推导成已核验的通过。pass 行带着要紧的分歧,也是模型相差最大的地方,从 Sonnet 的两条矛盾到 MetaMuse 和 GPT-Sol 的九条。

表 8:按模型和已记录分数档的 D1 结果,范围是 97 道可评分任务。升级全程为零,略去。

ModelbandTasksconfirmcontraunver.
Sonnetpass151320
partial360342
fail464321
MetaMusepass221390
partial370370
fail383710
GPT-Solpass231490
partial360360
fail383620
Opuspass241581
partial330330
fail403820
Geminipass181080
partial250250
fail545121

#### 门分型的一致性

在 1,078 个门上,同一次内的三票有 94.1% 全体一致,两次独立通过有 96.8% 一致。因为门的类别是评分器的性质而不是某次运行的性质,分型清单在智能体之间原样转移。

附录 D 奖励破解细节

表 3 对每个模型报告一个数字。它背后有两份分解。

第一份按已记录分数档给出裁定分布。模式在模型之间并不相同:Sonnet 的博弈率从通过档降到失败档,从 20% 降到 10.9%;其他模型则上升,所以博弈在一个模型上集中于拿到分数的地方,在其余模型上集中于没拿到分数的地方。

表 9:按模型和已记录分数档的 D2 裁定,范围是 97 道被评估任务。Tasks 列是每个模型自己分档下的全部 108 道;n/a:未评估。

ModelbandTasksassessedcleangamedn/a
Sonnetpass17151131
partial37363060
fail54463457
MetaMusepass23191261
partial424124152
fail433716174
GPT-Solpass23219102
partial403821170
fail453815221
Opuspass25222011
partial37363042
fail46392559
Geminipass19161231
partial28271980
fail6154131427

第二份给出每条定罪是在什么条件下达到的。需要评判器的编造,在每个模型里占定罪的 78% 到 100%,两个确定性条件合起来占其余部分。

表 10:每个模型达到 gamed 裁定的条件。

Modelcopiedconfessionfabricatedtotal
Sonnet211114
MetaMuse403438
GPT-Sol324449
Opus001010
Gemini112325

#### 对 Sonnet 的 gamed 裁定做手工核验

14 条里,11 条是把所要求的结果数值写成字面量,运行里任何地方都没有计算或文件来源;2 条复现了提示提供的值;1 条靠智能体自己的供认:它跑不了所要求的引擎,于是手工造了结果,让它看起来像引擎的输出。那条供认是记下的文字,伴随的来源缺口是从文件访问痕迹算出来的,所以两者合在一起是第 3.2 节所描述的最强条件;证据是确定的,尽管检测器在这一次运行上没有把它们接起来。

表 11:50 道重复任务上,已记录通过逐级滤过后剩下的数量(Son. = Sonnet,GPT = GPT-Sol,Meta = MetaMuse,Gem. = Gemini)。

FilterSon.OpusGPTMetaGem.total
Recorded pass152018181384
+ D111121110650
+ D1, D4 (determ.)6898334
+ all four4824119

#### 没有裁定的运行

大多数情况下,智能体没有放出与被评分参考相匹配的输出,所以没有答案数值可追踪;少数情况下,轨迹里没有可用日志。Gemini 在它的 97 道任务里有 28 道没有可评估的东西。

附录 E 按分数档的可靠性结果,以及完整的 Sonnet 集合

表 4 对每个模型报告一个数字。它背后有两份分解。

第一份按已记录分数档给出结果。档一级的 $\bar{\Delta}$ 比正文里通过档的数字更宽,从 $-0.31$ 到 $+0.67$,符号大体由分数档决定,因为有变化的通过必定有一次重复低于它,有变化的失败必定有一次重复高于它。部分档是唯一可以往两边动的,它在四个模型上下降,在第五个上持平。

表 12:按模型和已记录分数档的 D4 结果,范围是每种配置下都重复了五次的 50 道任务。$\bar{\Delta}$ 是该档里有变化的任务上、相对已记录分数的平均变化。

ModelbandTasksstablevaried%$\bar{\Delta}$
Sonnetpass1510533.3$-0.31$
partial1910947.4$-0.25$
fail167956.2$+0.47$
Opuspass2015525.0$-0.30$
partial1714317.6$-0.08$
fail1310323.1$+0.67$
GPT-Solpass1814422.2$-0.22$
partial2017315.0$+0.00$
fail1210216.7$+0.50$
MetaMusepass1815316.7$-0.12$
partial2115628.6$-0.02$
fail118327.3$+0.27$
Geminipass1310323.1$-0.24$
partial158746.7$-0.15$
fail2218418.2$+0.56$

第二份给出 Sonnet 下更大的 87 道题集合的结果,正文里的可靠性统计来自这里。它的变化率 $25.3\%$ 大约是从中抽出的 50 道上所记录的 $46.0\%$ 的一半,两者在第 4.5 节讨论。

表 13:Sonnet 下按已记录分数档的 D4 结果,范围是完成了全部五次重复的 87 道题。

bandTasksstablevaried%$\bar{\Delta}$
pass1510533.3$-0.31$
partial3627925.0$-0.25$
fail3628822.2$+0.48$
Total87652225.3—

附录 F 全部已记录分数档上的汇总

表 5 报告已记录通过上的合取。表 14 给出全部三档。partial 行全程为零,fail 行也几乎为零,因为 D1 按定义拒绝部分分数,合取又要求四个维度都放行;因此总数反映门槛的程度和反映证据的程度一样多,这也是正文把通过档分开报告的原因。

表 14:按模型和已记录分数档的汇总,范围是 50 道重复任务,它们都有 D4 裁定;其中不可评分的任务算 D1 和 D2 失败。D1–D4 计的是在该维度失败的任务,可以自由重叠,所以不能相加;只有四项都放行时任务才被信任(trust./fail.:被信任/失败)。

failedaggregate
ModelbandTasksD1D2D3D4trust.
Sonnetpass1545154
partial19196690
fail16143790
Total50371414234
Opuspass2083058
partial17174330
fail13137330
Total5038146118
GPT-Solpass18712342
partial20206830
fail12126220
Total5039241392
MetaMusepass1886134
partial212171160
fail11117230
Total50402014124
Geminipass1375231
partial15156670
fail222217640
Total50442814141

#### 已记录通过上的消融

表 11 把维度按顺序用到 84 次已记录通过上。只加 D1,留下 50 次。再加上 D4,于是只有两个确定性维度起作用,留下 34 次。要求全部四项,留下 19 次,所以两个有评判器协助的维度再拒绝 15 次确定性检查放行的通过,从 Opus 的零次到 GPT-Sol 九次里的七次。

出处:Mohammadreza Sediqin, Shivali Dalmia, Srinivasa Karthikeya Reddy Kovvuri, Abhishek Mukherji,A Trust Layer for Agent Evaluation,2026-10-05,https://arxiv.org/abs/2610.07274,CC BY 4.0。

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction