CodexQA

行业与实践研究与基准测试

带证书的选择性自动评测:任务聚类会让独立同分布证书失真

CodexQA 团队阅读约 24 分钟

智能体轨迹按任务成团,独立同分布的选择性证书会把自动化说得过高。任务级自助法 TaskBoot 在合成与真实语料上都守住错误预算,一个 40 亿参数评判器在工具使用和网页上分别证明约三成到六成评测可以自动接管。

本文目录

大语言模型智能体评测的带证书选择性自动化

程光(Chengguang Gan),单位:独立研究者。梁云浩(Yunhao Liang),单位:中国科学院大学。张清豪(Qinghao Zhang),单位:釜山国立大学。倪诗文(Shiwen Ni),单位:深圳理工大学。通讯:chengguangg1024@gmail.com

摘要

评测大语言模型智能体,到最后仍然要由人来读轨迹,因为自动评判器并不保证自己错得有多频繁。我们问的是一个操作问题:在一张证书保证「自动裁决的轨迹里,错误率不超过预算 $\alpha$」的前提下,评判器能接管多大比例的智能体评测?智能体语料拒绝标准答案。很多智能体会尝试同一批任务,轨迹因此成团到达、彼此相关,现有选择性评判方法的独立同分布证书会把安全程度说得过高:一张朴素证书可以声称自动化了 $98\%$,但在 $17.5\%$ 的任务重抽样里,它的实际错误超过了预算。我们提出一种任务级自助证书。它在我们测试的每一种情形里都有效,同时覆盖率与朴素证书相当;在现实的任务数量上,有限样本、对聚类有效的替代方案什么也证明不了。在这张证书之下,一个用监督微调(SFT)和拒绝加权群体相对策略优化(GRPO)训练的 40 亿参数对数概率评判器,在 $\alpha{=}0.1$ 时,于工具使用语料和网页语料上分别证明了 $0.30$–$0.59$ 的评测份额可以被自动接管。在被强力引出的前沿模型里,它是唯一在两份头条语料上都给出证书的评判器。可证明的覆盖率在训练之前就可以从基础成功率和区分度预测出来(留一语料 $R^{2}{=}0.96$)。最后,这张证书同时充当自训练过滤器:在已证明区域内采集的伪标签,污染率按构造以 $\alpha$ 为上界(六次采集的实际值为 $0.000$–$0.041$),使评判器可以在零条目标域训练标签的情况下,以域内强度进入一个未见过的领域。

1 引言

一个大语言模型智能体是否真的完成了任务,在实践中仍然由人来回答:程序化检查器会在真实网站上标错结果(Lù 等,2025;Xue 等,2025),于是基准作者退回到对完整轨迹做专家标注,每条轨迹要花上数分钟。大语言模型评判器承诺吸收这项工作,也有一连串研究在度量它们与人类的一致程度(Zhuge 等,2024;Pan 等,2024)。然而,一致率并不是决定要不要打开评判器的团队需要知道的东西。他们需要知道:在错误超过自己能容忍的程度之前,评判器能从队列里接管多少;而且这个数字必须在下一批上成立,不能只在上一批上成立。

我们把这个问题当成认证问题来研究:给定一个评判器、一个错误预算 $\alpha$ 和置信水平 $1-\delta$,找出可以被自动裁决(作为失败拒绝,或作为成功放行)的最大轨迹比例,使得自动裁决轨迹中的错误率以概率 $1-\delta$ 不超过 $\alpha$。这个带证书的覆盖率,就是可以被证明拿掉的人工评测工作所占的比例(图 1)。在给定风险水平上认证一条固定决策规则,是已经走得很熟的路(Bates 等,2021;Angelopoulos 等,2025),最近也被用到聊天机器人回答的大语言模型评判器上(Jung 等,2025;Badshah 等,2026)。智能体评测打破了这一切所依赖的关键假设。

这个断裂是结构性的。智能体语料的构造方式,是让许多智能体或许多次采样去打同一批任务:同一次订票流程的五次尝试会一起成功或一起失败,因为难度主要住在任务里。轨迹因此成团、彼此相关,违反了独立同分布证书所假设的可交换性。这种违反不是表面的。在我们聚类最重的语料上(任务内相关 $\rho=0.80$),标准的独立同分布证书欣然证明了 $98\%$ 的自动化;一次任务重抽样审计显示,它的实际错误在 $17.5\%$ 的重抽样里超过预算,而它承诺的是 $5\%$(第 3 节)。教科书上的修补则失败在相反方向:设计效应校正,以及有限样本、对聚类有效的构造(每个任务只留一条轨迹、任务级先学后测),在现实的任务数量上几乎什么也证明不了(第 4 节)。一张无效的证书和一张空洞的证书之间,哪一张都不能用。

我们的第一项贡献,是一张既有效又可使用的证书:TaskBoot。它是施加在预先声明的阈值网格上的任务级自助检验,并用 Bonferroni 方法记账。在已知真实结果的合成研究里,它违反保证的试验最多占 $1\%$,落在预算之内,一直到 20 个任务簇都如此,同时覆盖率几乎精确地对齐朴素证书;在真实语料上,凡是存在可用评判器的地方,它证明 $0.30$–$0.84$,而每一种有限样本、对聚类有效的替代方案都证明 $0$。本文中的全部证书,包括我们用来对比的前沿评判器的证书,都由这同一套程序计算:阈值在留出任务上校准,并在样本外审计。

证书固定之后,评判器成为研究对象,并出现三项发现。第一,一个 40 亿参数的对数概率评判器,先微调,再用拒绝加权的 GRPO 目标训练,在 $\alpha{=}0.1$ 时于工具使用上证明 $0.297$、于网页上证明 $0.585$,并且是强力引出的前沿模型里唯一在两份头条语料上都给出证书的评判器;唯一胜过它的前沿配置,每次裁决的成本大约是它的 $100$ 倍,而任何单调再校准都救不了其余模型,因为证书只通过名次依赖分数(第 5 节)。第二,带证书的覆盖率在任何训练之前就可以预测:基础成功率与基础区分度上的一个两参数关系,以留一语料 $R^{2}=0.96$ 解释留出覆盖率,三道门则预测强化学习何时会在监督微调之上再增加覆盖率(第 6 节)。第三,证书兼任自训练过滤器:在已证明区域内采集的伪标签,污染率按构造以 $\alpha$ 为上界(六次采集的实际值为 $0.000$–$0.041$),使评判器可以在零条目标域训练标签的情况下,以域内强度进入未见领域,并把我们最大的工具使用语料推过它最好的监督评判器(第 7 节)。

单语料上的带证书选择性自动化

在一份语料上的带证书选择性自动化。(a)一个校准后的阈值自动拒绝低分轨迹;证书给自动裁决轨迹中的错误率加上界。(b)对同一任务的多次尝试是相关的:重抽样的是任务,不是轨迹。

经验范围是七份语料:工具使用、终端、三份网页语料(其中包括来自五个线上基准的 1302 条专家标注轨迹),以及代码修复。协议预先登记:任务级划分由一颗种子固定,超参数只在校准数据上选择,每种配置只读一次测试集。认证失败的语料留在正文里:真实结果从不出现在轨迹中时,评判器是盲的;饱和语料让强化学习没有东西可加;十三项测试任务则根本支撑不起一张证书。

2 相关工作

评判智能体轨迹。

智能体的自动评测不可靠,这一点已有充分记录:基于规则的评测器在真实网站上少报成功,大语言模型评判器则多报成功(Lù 等,2025;Xue 等,2025)。补救办法是训练或提示更好的评测器(轨迹评判器(Pan 等,2024)、智能体式评判器(Zhuge 等,2024)、过程奖励模型(Chae 等,2025)),并报告与人类标签的一致率。我们走的是这些工作都没走的一步:给评判器的部署附上一份统计保证,使「评判器有多好」变成「它能被证明吸收多少工作」。Lù 等(2025)提供了我们的一份语料。

带保证的选择性预测。

风险受控的选择性决策,其机制已经成熟:选择性分类(Geifman 与 El-Yaniv,2017)、风险控制预测集(Bates 等,2021)、先学后测(Angelopoulos 等,2025)、共形风险控制(Angelopoulos 等,2024)。最近两篇论文把它实例化到大语言模型评判器上:Jung 等(2025)认证一个选择性评判器在聊天机器人回答上与人类的一致,Badshah 等(2026)用共形风险控制包住一个成对评判器。两者都假设实例可交换,而第 4 节表明这个假设是承重的:独立同分布证书变得反保守,恰恰发生在现代智能体评测所使用的多次采样情形里。面向层次数据的、知道聚类的共形方法是存在的(Dunn 等,2023;Barber 等,2023),但它们的有限样本构造在现实任务数量上塌缩到零覆盖;据我们所知,无效与空洞之间那个能工作的点仍然空着。预测驱动的评测(Boyeau 等,2024)用评判器标签加少量人类标签来认证汇总指标;我们认证的是逐条轨迹的决策,被估计的量不同。

训练评判器,以及自己训练自己的评判器。

用强化学习提高评判器准确率现在已是标准做法(Whitehouse 等,2026;Xu 等,2026;Wang 等,2024),GRPO(Shao 等,2024)是常用优化器;我们的 GRPO 阶段不同的是目标,不是机器:一个瞄准带证书覆盖率的非对称奖励,其方向我们做了消融。自我改进的模型(Yuan 等,2024;Wu 等,2025;Zhang 等,2026;Zhao 等,2026)用启发式规则给自己的训练数据把关,失败模式也有记录:R-Zero 里伪标签准确率随迭代从 $79\%$ 掉到 $63\%$(Huang 等,2026)。共形过滤器出现在经典半监督学习里(Lienen 等,2023;Tanha 等,2022),也出现在带错误发现率控制的一次自动标注里(Huang 等,2025),但此前没有系统把环路闭上:由一张部署证书来把关采集、训练和重新认证。第 7 节建造这个环路,并度量它的保证在哪里结束。最后,微调后的小评判器已知能在域内比得上大评判器(Kim 等,2024;Zhu 等,2025),前沿模型的对数概率在基于人类反馈的强化学习之后会校准不良(Tian 等,2023;Kadavath 等,2022);我们的前沿对比用证书当尺子,把这两点观察都磨得更尖,命题 1 则表明再校准不能改变判决。

3 带证书的选择性自动化,以及聚类为何把它打破

设定。

一份语料是轨迹的集合 $x_{gj}$,其中 $g\in\{1,\dots,G\}$ 索引任务,$j\in\{1,\dots,m_{g}\}$ 索引不同智能体或不同次采样对任务 $g$ 的尝试。每条轨迹带一个二元结果 $y_{gj}\in\{0,1\}$($1$:智能体真的完成了任务),来自专家标注或一个受信任的预言机。评判器把轨迹映射到分数 $s(x)\in[0,1]$,即它对 $\Pr(y{=}1\,|\,x)$ 的估计。一条选择性自动化规则是一对阈值 $(\theta_{\mathrm{rej}},\theta_{\mathrm{rel}})$:$s(x)\leq\theta_{\mathrm{rej}}$ 的轨迹被自动拒绝,$s(x)\geq\theta_{\mathrm{rel}}$ 的被自动放行,其余交给人。两种自动决策承担不同的风险,分开认证:

$$\mathrm{err}_{\mathrm{rej}}(\theta)=\Pr\!\big(y{=}1\,\big|\,s(x)\leq\theta\big),$$

$$\mathrm{err}_{\mathrm{rel}}(\theta)=\Pr\!\big(y{=}0\,\big|\,s(x)\geq\theta\big),$$

也就是拒绝侧丢弃成功的比率,以及放行侧把失败当成成功送出去的比率。对一个带误差泛函 $\mathrm{err}$、覆盖率 $\mathrm{cov}(\theta)=\Pr(\text{在 }\theta\text{ 处被自动裁决})$ 的侧面,我们报告的对象是

$$\mathrm{cov}^{\star}(\alpha,\delta)\;=\;\max_{\hat{\theta}}\;\mathrm{cov}(\hat{\theta})$$

$$\text{满足}\;\;\Pr\big(\mathrm{err}(\hat{\theta})>\alpha\big)\leq\delta,$$

概率取在整套选择程序之下:在错误预算 $\alpha$、置信度 $1-\delta$ 下,可以被证明拿掉的最大评测工作比例。全文中 $\delta=0.05$,$\alpha\in\{0.1,0.2\}$;拒绝侧是主要对象,因为我们的语料在那里才承认非平凡的证书,放行侧则在非零的地方报告。

一张证书的三处用途

总览。一张证书固定部署的工作点(第 4 节),在训练之前就可以从语料结构预测(第 6 节),并为一套自训练环路把关,其污染由同一个 $\alpha$ 界定(第 7 节)。

语料与协议。

我们建造七份语料,覆盖智能体实际被评测的领域(表 1;细节见附录 F):工具使用对话(Tool,来自 $\tau^{2}$-bench)、终端会话(Term)、三份网页语料,即 Web-A(五个线上网页基准上的 1302 条专家标注轨迹)和两份分别由弱智能体与前沿智能体产生的 MiniWoB++ 语料,以及两份代码修复语料。每份语料都按任务划分成 SFT/RL/CAL/TEST,只用一颗声明过的种子;每一个被选中的超参数只用 CAL,每种配置只读一次 TEST。轨迹渲染成文本,不包含奖励或预言机信号:评判器必须从智能体看见了什么、做了什么来推断结果。

语料。$n$:测试轨迹数;$G$:测试任务数;$\pi$:成功率;$\rho$:结果的任务内相关;$\mathrm{DEFF}=1+(\tilde{m}-1)\rho$,$\tilde{m}$ 是按大小加权的平均簇大小;$n_{\mathrm{eff}}=n/\mathrm{DEFF}$。

语料领域$n$$G$$\pi$$\rho$DEFF$n_{\mathrm{eff}}$
Tool($\tau^{2}$)工具使用对话128084.48.255.0257
Term终端会话52013.34.4317.630
Web-A(ARB)线上网页,专家标签20068.26.492.291
Web-MMiniWoB++,40 亿参数智能体51232.16.8013.039
Web-FMiniWoB++,前沿智能体25632.26.816.738
Code-O代码修复(OpenHands)899382.45.642.0459
Code-S代码修复(多语言)217.24.001.021

聚类很大,而且它打破独立同分布证书。

一个任务内部的结果强烈相关:在我们的语料上 $\rho$ 从 $0.25$ 到 $0.81$,设计效应高达 $17.6$:每一项终端任务携带的信息大约相当于两条独立轨迹,而不是四十条。标准证书忽略这一点:Jung 等(2025)和 Badshah 等(2026)共用的构造,在这里变成:只要把自动裁决错误的 Clopper–Pearson 上界按水平 $\delta/|\Theta|$ 算出来,并且算的时候假装轨迹相互独立,这个上界不超过 $\alpha$,就认证 $\theta$。我们用重抽样任务、并在它选中的阈值上重算实际错误来审计它。在 Web-M 上($\rho=0.80$,$G=32$,每个任务八次采样;这是 pass@$k$ 的评测样式),它选出一个覆盖 $98\%$ 轨迹的阈值,预算为 $\alpha=0.2$,而实际错误在 $17.5\%$ 的任务重抽样里超过预算,是所承诺的 $\delta=5\%$ 的三倍半($\alpha=0.1$ 时为 $6.9\%$)。在轻度聚类的语料上,审计通过($\leq 3.2\%$;附录 D):失败恰恰发生在高 $\rho$、任务少、采样多的情形,而这正是现代智能体评测生产出来的情形,一张可用的证书必须在这里活下来。

4 TaskBoot:一种任务级自助证书

证书必须同时尊重两道方向相反的约束:在任务聚类下有效,以及在 $G\in[10,100]$ 个任务时不空洞,而真实语料提供的就是这个数量。TaskBoot 化解这个张力的办法,是用每个候选阈值自己的错误在任务重抽样下的分布来检验它。

步骤。

固定一个侧面(比如拒绝)、一个预先声明的网格 $\Theta$,$|\Theta|=40$ 个分数分位,以及分成 $G$ 个任务的校准数据 $\{(s_{gj},y_{gj})\}$。对阈值 $\theta$,令

$$\widehat{\mathrm{err}}^{(b)}(\theta)\;=\;\frac{\sum_{g\in\mathcal{B}_{b}}\,k_{g}(\theta)}{\sum_{g\in\mathcal{B}_{b}}\,n_{g}(\theta)},\qquad b=1,\dots,B,$$

其中 $\mathcal{B}_{b}$ 是有放回抽出的 $G$ 个任务的多重集,$n_{g}(\theta)=\#\{j:s_{gj}\leq\theta\}$,$k_{g}(\theta)=\#\{j:s_{gj}\leq\theta,\,y_{gj}=1\}$,分别是每个任务被覆盖的条数和错误条数。若 $\{\widehat{\mathrm{err}}^{(b)}(\theta)\}_{b=1}^{B}$ 的上 $\big(1-\delta/|\Theta|\big)$ 经验分位不超过 $\alpha$,则阈值 $\theta$ 被认证;程序返回覆盖率最大的已认证阈值(算法 1),$\delta/|\Theta|$ 是网格上的 Bonferroni 校正。这是一种近似,不是有限样本定理:随着 $G$ 增长,自助分位一致地估计聚类错误比的抽样分布(Field 与 Welsh,2007)。要紧的问题是:在我们手头的 $G$ 上,这种近似是否已经成立?我们用已知真实结果的模拟,以及在每一份真实语料上的样本外审计来回答。

算法 1:TaskBoot

TaskBoot(一个侧面;图中为拒绝侧)

TaskBoot 一张图里的三步

一张图里的 TaskBoot:预先声明的分位网格(a),对每个阈值的选择性错误做任务重抽样检验(b),最大覆盖选择,部署方式是在 CAL 上校准、在 TEST 上审计(c)。

在已知真实结果时的有效性。

我们用任务效应模型模拟聚类的评判器分数:任务效应 $u_{g}\sim\mathcal{N}(0,\tau^{2})$ 在 $G\in\{20,50,100,500\}$ 个任务上诱导标签相关 $\rho\in\{0.1,0.5,0.8\}$;每种程序在一次模拟的校准抽取上选择阈值,我们在一份新的、含 $1.5\times 10^{5}$ 条轨迹的总体上度量该阈值的真实选择性错误,每个格子 300 次试验(完整协议与网格见附录 B)。TaskBoot 在每一个格子里违反保证的试验最多占 $1\%$,包括 $G{=}20$,同时覆盖率与朴素 Clopper–Pearson 相差不超过一个百分点。有限样本、对聚类有效的替代方案有效但无用:每个任务只留一条轨迹,或对任务均值损失使用 Hoeffding 界,要到 $G$ 达到数百才证明出非零覆盖;设计效应校正 $n\mapsto n/\mathrm{DEFF}$(Kish,1965)在高 $\rho$ 时同样生硬。三种对抗设计(对齐 Web-M 的参数、大小与结果相关、重尾簇大小)并没有在总体水平上打破朴素证书(它的 Bonferroni 松弛吸收了很多),因此证据要说精确:朴素认证通不过真实高 $\rho$ 数据上的任务重抽样审计($17.5\%$,第 3 节),而我们构造不出任何 TaskBoot 失败的情形。一律安全,覆盖率上没有代价。

在真实语料上,替代方案什么也证明不了。

把五种程序都跑在真实测试分数上(附录 C):每任务一条的 Clopper–Pearson 和任务均值 Hoeffding 在全部七份语料上恰好证明 $0$($G$ 从 7 到 382),设计效应校正后的 Clopper–Pearson 在 $\alpha=0.1$ 时处处证明 $0$,而只要存在可用评判器,TaskBoot 就证明 $0.30$–$0.84$。在一张可能过度承诺的证书(Web-M 上的 $98\%$)和总是什么也不承诺的证书之间,TaskBoot 是工作区间里唯一的居住者。

样本外审计。

因为保证对 $G$ 是渐近的,本文中的每一次部署都经过审计:$\hat{\theta}$ 在 CAL 任务上校准,实际选择性错误在与之任务不交的 TEST 上度量一次。全部审计通过:例如 $\alpha=0.1$ 时,拒绝错误的实际值在 Web-A 上为 $0.027$–$0.037$,在 Tool 上为 $0.011$–$0.012$(全部列在附录 D)。因此下面的每一张证书都被支撑了两次:一次是真实结果已知的模拟,一次是真实结果未知的留出审计。

训练之前就可以度量可证明性

可证明性可以事前度量。最好的带证书拒绝覆盖率,对上训练前指标 $(1-\pi)(2A_{0}-1)$。最大的残差(Term)来自 $n_{\mathrm{eff}}$ 最小的语料,证书里的有限样本松弛先于评判器质量而收紧。

5 证书之下的评判器

一个小的对数概率评判器。

评判器是一个 40 亿参数的指令模型,被提示成一个持怀疑态度的审计员:它阅读渲染后的轨迹,必须用一个裁决词作答。它的分数是重新归一化的下一个词元概率

$$s(x)\;=\;\frac{p_{\mathrm{LM}}(\texttt{SUCCESS}\mid x)}{p_{\mathrm{LM}}(\texttt{SUCCESS}\mid x)+p_{\mathrm{LM}}(\texttt{FAIL}\mid x)},$$

在一次前向传播里读出,推理关闭:每条轨迹按构造都能解析,分数是连续的,这两点都是证书需要的。训练分两阶段。SFT 在任务不交的 SFT 划分上,用带裁决标签的轨迹微调(附录 H);随后 GRPO(Shao 等,2024)在 RL 划分上优化一个非对称奖励:对采样裁决 $v$ 与标签 $y$,

$$r(v,y)\;=\;\mathbf{1}[v=y]\;-\;\lambda\,\mathbf{1}[v{=}\texttt{S},y{=}0]\;-\;\mu\,\mathbf{1}[v{=}\texttt{F},y{=}1],$$

于是 $\mu>\lambda$ 对丢弃成功(拒绝侧错误)的惩罚重于把失败送出去,把概率质量推出拒绝尾部,而证书恰恰在那里读取它。强度 $\mu\in\{1,3,5\}$($\lambda{=}1$)在 CAL 上按带证书覆盖率选择,从不在 TEST 上选择;测试最优的那一臂只报告一次,并标成预言机。

主要结果:$\alpha{=}0.1$、$\delta{=}0.05$ 时的带证书拒绝覆盖率(TaskBoot,阈值在 CAL 上校准),以及测试 AUROC。GRPO 的臂在 CAL 上选择。灰色:$G$ 低于模拟验证过的区间($G\geq 20$),证书只为完整起见而报告。预言机臂和 $\alpha{=}0.2$ 的结果见附录 E。

AUROC$\alpha{=}0.1$ 时的带证书覆盖率
语料基座SFTGRPO基座SFTGRPO$\Delta_{\mathrm{RL}}$情形
Tool.798.899.903.000.293.297$+.004$可训练
Web-A.897.925.922.510.560.585$+.025$可训练
Web-M.983.976.977.832.789.836$+.047$饱和
Web-F.983.991.994.707.758.758$\pm.000$饱和
Code-O.531.645.530.000.000.000—评判器失明
Term.864.871.873.290.379.369$-.010$$G{=}13$
Code-S.913.800—.619.619——$G{=}7$

主要结果。

表 2 是本文的中心表。在两份可训练语料上,次序 $\text{GRPO}>\text{SFT}>\text{基座}$ 在干净的选择协议下成立:Tool 从 $0$ 到 $.293$ 再到 $.297$(测试预言机臂达到 $.321$;每一臂,包括最差的,都保持在 SFT 或以上),Web-A 从 $.510$ 到 $.560$ 再到 $.585$,CAL 独立地选出了预言机也会选的那一臂。边际是有节制的;使它们有意义的是,每一处都是在预先登记的协议下,被拿掉的评测工作的一次经过认证、经过审计的增量。其余语料的失败有三个可诊断的原因,第 6 节把它们变成一个预测模型:在 Code-O 上,结果由一套从不出现在轨迹里的留出测试集决定,因此没有任何评判器,无论训练过还是前沿,能够着力;在 Web-M/Web-F 上,基座评判器已经接近完美,SFT 把预算所允许的东西用尽了;Term 和 Code-S 只是缺少任务。

哪个奖励方向要紧,以及在哪里要紧。

方程 (5) 有三支自然的臂:准确率($\lambda{=}\mu{=}1$)、拒绝加权($\mu{>}\lambda$)、放行加权($\lambda{>}\mu$)。在 Tool 上,方向就是效应:拒绝加权臂证明 $.321$,准确率为 $.297$,放行加权为 $.293$(相对 SFT 没有增益)。把拒绝覆盖率推动起来的,不是泛泛的强化学习打磨。在 Web-A 上,三支臂都落在同一个 $.585$ 的平台上:从一个强的 SFT 起点出发,任何 GRPO 打磨都会净化尾部,方向不再可分。两种机制都是真的;实践者应先试拒绝加权臂,并预期它在 SFT 评判器仍有余量时最要紧(全表见附录 E)。

被强力引出的前沿评判器,对上训练过的 40 亿参数评判器,由同一套程序认证。CoT:先思维链,再口头说出的概率;SC-$k$:$T{=}1$ 时 $k$ 次采样的投票份额;logprob:原生词元概率。成本:每次裁决的相对推理成本。

评判器引出方式Web-ATool
AUROC$\alpha{=}.1$ 时的证书AUROC$\alpha{=}.1$ 时的证书
gpt-5.6-solCoT 加概率.929.704.794.000
claude-sonnet-5CoT 加概率.905.497.847.000
gemini-2.5-proCoT 加概率.753.000——
gemini-2.5-proSC-5.680.000——
claude-sonnet-5SC-10.686.000——
gpt-4ologprob.753.000——
训练过的 40 亿参数(本文)logprob.922.585.903.297

前沿评判器的认证并不稳定,再校准也帮不上。

表 3 跑的是一个持怀疑态度的审稿人会要求的那些引出方式。图景不是「小模型打败前沿」(最强的推理模型在 Web-A 上胜过我们的评判器,$.704$ 对 $.585$,推理成本大约是 $100$ 倍),而是前沿评判并不迁移:同一个模型在两个预算下于 Tool 上都证明为零(AUROC $.794$,对齐我们未训练的基座),六种前沿配置里有四种在任何地方都什么也不证明,只有训练过的 40 亿参数模型在两份语料上都给出证书。这些是排名失败,不是分数刻度失败,下游也修不好:

(名次不变性)。

TaskBoot 的带证书覆盖率,对评判器分数的任何严格递增变换都不变。特别地,Platt 缩放、保序回归和温度缩放,都让表 3 里的每一张证书保持不变。

证明是直接的:网格由分数分位建成,方程 (3) 里的每一个计数都只通过比较依赖分数(附录 A)。尽管如此,后果值得写明:一张证明为 $0$ 的评判器不能靠再校准获救,只能靠重排,也就是换一个评判器。

覆盖率买到了什么。

按每条轨迹六分钟复核,表 2 的工作点大约在每千条轨迹上拿掉 Tool 的 30 个复核小时、Web-A 的 59 个,被拿掉的部分保证错误 $\leq 0.1$(附录 L);评判器跑在一块本地 GPU 上,轨迹留在本地,并且能自己把覆盖率长出来(第 7 节)。

由证书把关的自训练($\alpha{=}0.1$ 时的带证书拒绝覆盖率);迁移评判器从未见过目标语料。

目标语料评判器$\alpha{=}.1$ 时的证书采集(污染)目标标签
Web-A迁移(第 0 轮).575—0
加 CertHarvest 第 1 轮.585262/914(.008)0
把 175 条 CAL 标签改花在 SFT 上.540—175
域内上限(SFT 到 GRPO,第 5 节).585—914
Web-M迁移(第 0 轮).830—0
加 CertHarvest 第 1 轮.820837/1296(.002)0
Tool域内 SFT.293—2600
加 CertHarvest 第 1 轮.343296/2200(.000)$+0$
加 CertHarvest 第 2 轮.347338/2200(.003)$+0$

6 带证书的覆盖率在训练之前就可以预测

七份语料、三种失败情形、两次成功:这个模式规则得足以建模。令 $\pi$ 为语料成功率,$A_{0}$ 为未训练基座评判器的 AUROC,两者都可以在任何训练之前,从几百条带标签轨迹量出来。$(1-\pi)$ 是拒绝侧的原料,$(2A_{0}-1)$ 把基础区分度重新标度;它们的乘积对带证书覆盖率预测得相当好:

$$\widehat{\mathrm{cov}}^{\star}\;=\;a\,(1-\pi)(2A_{0}-1)+b,$$

$a{=}1.08$,$b{=}{-}0.05$,在七份语料上对各自达到的最好带证书覆盖率拟合(图 4)。留一语料,这个关系以平均绝对误差 $0.039$ 解释留出覆盖率的 $R^{2}=0.96$;样本内 $R^{2}=0.98$。两个因子都挣到了自己的位置:丢掉 $(1-\pi)$,留一交叉验证的 $R^{2}$ 塌到 $0.38$,只用 AUROC 只达到 $0.47$;较早的版本带过一个样本量饱和因子,交叉验证认为它不必要而拒绝(附录 K)。这是经验模型,不是定律(七个点,一颗种子),但它的实践内容在这个保留之下仍然成立:一个团队可以用基座评判器给几百条轨迹打分,在花一个 GPU 小时做训练之前,读出自己的评测队列里大约有多大比例可以被证明自动化。

强化学习何时有帮助的三道门。

GRPO 是否在 SFT 之上再增加覆盖率,由三个条件推出,每一个都在表 2 里看得见:

$$\underbrace{A_{0}\gg 0.5}_{\text{评判器学得会}}\,\wedge\,\underbrace{A_{\mathrm{SFT}}<A_{\mathrm{sat}}}_{\text{SFT 未饱和}}\,\wedge\,\underbrace{n_{\mathrm{eff}}\gtrsim n_{\min}(\alpha,\delta)}_{\text{样本够}},$$

其中 $n_{\min}$ 是一张证书能够作用其上的最小有效样本($\alpha{=}0.1$、$\delta{=}0.05$ 时约 $29$:零错误的 Clopper–Pearson 点)。Tool 和 Web-A 三道门都通过,并显示出强化学习增益。Code-O 失败在第一道:结果住在留出测试集里,不在轨迹里,所以评判器是盲的,每一种训练方法都继承同一个大约 $0.53$–$0.65$ 的天花板。这是领域的性质,不是数据集的性质:第二份被纳入的代码语料($6{,}306$ 项任务)的 AUROC 落在同一条带上。Web-M 和 Web-F 失败在第二道:基座 AUROC $0.983$ 没有给 SFT 留下预算看得见、还可以净化的东西,我们试过的智能体组合(40 亿、80 亿、两个前沿模型生成新轨迹)都没有改变这份语料的可评判性。Term($n_{\mathrm{eff}}{=}30$)和 Code-S($21$)失败在第三道:无论评判器做什么,证书都分辨不出比它自己的有限样本松弛更小的改进。同一效应出现在选择里:Tool 的 CAL 在三支 GRPO 臂上证明 $0.150/0.149/0.145$(近得排不出名次),因此表 2 报告的是被最好与最差的臂括住的 CAL 选择。这些门是事后陈述的;它们的价值在于每一道都可以在训练之前度量,第 7 节前瞻地使用它们。

7 作为自训练过滤器的证书

自我改进的模型有一个共同弱点:决定哪些自生标签值得信任的过滤器是启发式的,它一漂移,污染就静静地复利(Yuan 等,2024;Huang 等,2026)。我们已经有一个非启发式的过滤器:从一个以预算 $\alpha$ 认证过的区域里采集的伪标签,按证书的定义,错误率至多为 $\alpha$(概率 $1-\delta$)。CertHarvest 把它做成可操作的程序(算法 2,附录 J):在 CAL 任务的一半上校准一个已认证的拒绝区域,把其中内容伪标成失败,再训练,再认证。认证永远做在伪标签碰不到的、由人标注的 CAL/TEST 任务上,于是环路不能侵蚀它自己的保证。

这个界每次被使用时都成立。

在六次采集上(三份语料,池子为 $914$–$2{,}200$ 条轨迹),对照被扣住的真实结果,实际污染为 $.041/.008/.024/.000/.003/.002$:从不超过 $0.10$ 的预算。过滤器就是部署保证本身,不是它的一个代理。

以零条训练标签进入一个领域。

按留一语料训练,完全没有网页数据,一个评判器已经在 Web-A 上证明 $0.560$;一轮 CertHarvest 就把差距收到域内 GRPO 上限($.585$),而 Web-A 训练标签为零。同一个评判器在 Web-M 上证明 $0.830$,直接对齐那个上限(表 4)。两个对照:同样的 175 条 CAL 标签若改花在监督上,只证明 $0.540$;迁移弱的地方(Tool,AUROC $.794$),CertHarvest 拒绝采集:没有证书,就没有自训练。

域内增长,以及迭代在哪里结束。

从 Tool 上的域内 SFT 评判器出发,对未见过的 RL 池做带证书采集,一轮把覆盖率抬到 $.343$,两轮到 $.347$,超过最好的监督 GRPO 臂($.321$),除了 SFT 的标签之外不再需要标签。迭代不是免费的:在 Web-A 上,第二轮降低覆盖率($.585\to.465$),尽管它的采集仍在预算内($.024$)。$\alpha$ 界控制的是有多少伪标签是错的,不是采集到的分布有多偏;对一个小的、单侧的池子再过一遍,会放大它的选择偏差,而 CAL 在 175 行上排不出轮次(附录 J)。因此,迁移起点和小池子只做一轮,迭代只在大池子上、在域内进行。在饱和的 Web-M 上,这一轮正确地毫无用处(表 4),正如方程 (7) 所预测。

8 结论

智能体评测的评判器,值得一个比一致率更好的回答:一张在任务聚类下仍然有效的证书,说明评判器能被证明接管多少评测工作。

局限

本文中的每一个数字都来自一次预先登记的运行:任务级划分由一颗种子固定,超参数在校准数据上选择,每种配置只读一次测试。协议防止选择效应,但不量化各次运行之间的方差;聚类自助法量化的是任务上的抽样不确定性,不是训练随机性上的。TaskBoot 的保证对任务簇个数是渐近的:我们用模拟把它验证到 20 个簇,并在每一份语料上做样本外审计,但它不是有限样本定理;朴素独立同分布证书的反保守性,是在高聚类、多次采样情形的一份真实语料上展示的,而不是普遍地展示。可证明性模型拟合在七份语料上,应被读成一条经验趋势。在我们的语料上,放行侧很少在实用预算下给出证书,因此部署的保证主要拿掉的是对失败的复核;带证书的自训练是一轮的建议。在小的单侧池子上迭代,即使污染界完好,也降低了覆盖率。

译注:参考文献与附录 A 至 L 见续篇《带证书的选择性自动评测(续):证明、审计与成本》。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误