Industry & PracticeResearch & Benchmarks
带 证书 的 选择 性 自动 评 测 (续): 证明、 审计 与 成本
续篇给出名次不变性证明、合成有效性网格、真实语料上的聚类基线、样本外审计、全部 GRPO 臂、语料与提示、CertHarvest 协议,以及复核小时的成本核算。

In this piece
译注:本文是《带证书的选择性自动评测:任务聚类会让独立同分布证书失真》的续篇,承接正文第 8 节与局限之后的参考文献和附录。
参考文献
Anastasios Angelopoulos、Stephen Bates、Adam Fisch、Lihua Lei 与 Tal Schuster。2024。共形风险控制(Conformal risk control)。收录于学习表征国际会议,2024 卷,第 55198–55218 页。正文用于选择性决策的成熟工具。
Anastasios N. Angelopoulos、Stephen Bates、Emmanuel J. Candès、Michael I. Jordan 与 Lihua Lei。2025。先学后测:把预测算法校准到风险受控(Learn then test: Calibrating predictive algorithms to achieve risk control)。《应用统计年刊》,19(2):1641–1662。正文用于固定决策规则的认证。
Ibragim Badertdinov、Alexander Golubev、Maksim Nekrashevich、Anton Shevtsov、Simon Karasik、Andrei Andriushchenko、Maria Trofimova、Daria Litvintseva 与 Boris Yangel。2025。SWE-rebench:面向软件工程智能体的任务收集与去污染评测的自动流水线(Swe-rebench)。收录于神经信息处理系统进展,第 38 卷,主会议。Curran Associates。附录 F 的 Code-O 来源。
Sher Badshah、Ali Emami 与 Hassan Sajjad。2026。Scope:选择性共形优化的成对大语言模型评判(Scope: Selective conformal optimized pairwise llm judging)。arXiv:2602.13110。正文用于假设可交换实例的评判器证书。
Shuai Bai、Yuxuan Cai、Ruizhe Chen、Keqin Chen、Xionghui Chen、Zesen Cheng、Lianghao Deng、Wei Ding、Chang Gao、Chunjiang Ge、Wenbin Ge、Zhifang Guo、Qidong Huang、Jie Huang、Fei Huang、Binyuan Hui、Shutong Jiang、Zhaohai Li、Mingsheng Li 等 45 人。2025。Qwen3-VL 技术报告(Qwen3-vl technical report)。预印本,arXiv:2511.21631。附录 H 中生成 Web-M 的视觉语言模型。
Rina Foygel Barber、Emmanuel J. Candès、Aaditya Ramdas 与 Ryan J. Tibshirani。2023。超出可交换性的共形预测(Conformal prediction beyond exchangeability)。《统计年刊》,51(2):816–845。正文用于知道聚类的共形方法。
Victor Barres、Honghua Dong、Soham Ray、Xujie Si 与 Karthik Narasimhan。2025。$\tau^{2}$-bench:在双控制环境中评测对话智能体(Evaluating conversational agents in a dual-control environment)。预印本,arXiv:2506.07982。附录 F 的 Tool 语料来源。
Stephen Bates、Anastasios Angelopoulos、Lihua Lei、Jitendra Malik 与 Michael Jordan。2021。无分布、风险受控的预测集(Distribution-free, risk-controlling prediction sets)。《美国计算机学会杂志》,68(6):1–34。正文用于风险控制预测集。
Léo Boisvert、Megh Thakkar、Maxime Gasse、Massimo Caccia、Thibault Le Sellier De Chezelles、Quentin Cappart、Nicolas Chapados、Alexandre Lacoste 与 Alexandre Drouin。2024。WorkArena++:走向基于组合规划与推理的常见知识工作任务。网址 https://arxiv.org/abs/2407.05291。Web-A 所含五个线上基准之一。
Pierre Boyeau、Anastasios N. Angelopoulos、Nir Yosef、Jitendra Malik 与 Michael I. Jordan。2024。把自动评测做对:用合成数据做模型评测(Autoeval done right: Using synthetic data for model evaluation)。arXiv:2403.07008。正文用于认证汇总指标而非逐条决策。
Hyungjoo Chae、Seonghwan Kim、Junhee Cho、Seungone Kim、Seungjun Moon、Gyeom Hwangbo、Dongha Lim、Minjin Kim、Yeonjun Hwang、Minju Gwak、Dongwook Choi、Minseok Kang、Gwanhoon Im、ByeongUng Cho、Hyojun Kim、Jun Han、Taeyoon Kwon、Minju Kim、Beong-woo Kwak 等。2025。Web-Shepherd:推进用于强化网页智能体的过程奖励模型(Web-shepherd: Advancing prms for reinforcing web agents)。收录于神经信息处理系统进展,第 38 卷,主会议,第 63314–63356 页。正文用于过程奖励模型。
Thibault Le Sellier De Chezelles、Maxime Gasse、Alexandre Drouin、Massimo Caccia、Léo Boisvert、Megh Thakkar、Tom Marty、Rim Assouel、Sahar Omidi Shayegan、Lawrence Keunho Jang、Xing Han Lù、Ori Yoran、Dehan Kong、Frank F. Xu、Siva Reddy、Quentin Cappart、Graham Neubig、Ruslan Salakhutdinov、Nicolas Chapados 与 Alexandre Lacoste。2025。面向网页智能体研究的 BrowserGym 生态系统(The browsergym ecosystem for web agent research)。预印本,arXiv:2412.05467。附录 F 中 Web-M 的生成环境。
C. J. Clopper 与 E. S. Pearson。1934。用二项分布说明置信限或信仰限的用法(The use of confidence or fiducial limits illustrated in the case of the binomial)。《生物计量学》,26(4):404–413。附录 A 中精确二项界的出处。
Alexandre Drouin、Maxime Gasse、Massimo Caccia、Issam H. Laradji、Manuel Del Verme、Tom Marty、Léo Boisvert、Megh Thakkar、Quentin Cappart、David Vazquez 等。2024。WorkArena:网页智能体解决常见知识工作任务的能力如何(Workarena)。arXiv:2403.07718。Web-A 所含线上基准之一。
Robin Dunn、Larry Wasserman 与 Aaditya Ramdas。2023。两层层次模型的无分布预测集(Distribution-free prediction sets for two-layer hierarchical models)。《美国统计协会杂志》,118(544):2491–2502。正文用于层次数据上的共形方法。
B. Efron。1979。自助法:对刀切法的另一种看法(Bootstrap Methods: Another Look at the Jackknife)。《统计年刊》,7(1):1–26。附录 A 中重抽样原理的出处。
Christopher A. Field 与 Alan H. Welsh。2007。对聚类数据做自助(Bootstrapping clustered data)。《皇家统计学会会刊 B 辑:统计方法论》,69(3):369–390。正文用于聚类错误比的自助分位。
Yonatan Geifman 与 Ran El-Yaniv。2017。深度神经网络的选择性分类(Selective classification for deep neural networks)。神经信息处理系统进展,第 30 卷。正文用于选择性分类。
Edward J. Hu、Yelong Shen、Phillip Wallis、Zeyuan Allen-Zhu、Yuanzhi Li、Shean Wang、Lu Wang 与 Weizhu Chen。2021。LoRA:大语言模型的低秩适配(Lora: Low-rank adaptation of large language models)。预印本,arXiv:2106.09685。附录 H 的微调方法。
Chengsong Huang、Wenhao Yu、Xiaoyang Wang、Hongming Zhang、Zongxia Li、Ruosen Li、Jiaxin Huang、Haitao Mi 与 Dong Yu。2026。R-Zero:从零数据自我演化的推理大语言模型(R-zero: Self-evolving reasoning llm from zero data)。收录于学习表征国际会议,2026 卷,第 130770–130790 页。正文用于伪标签准确率随迭代下降的记录。
Huipeng Huang、Wenbo Liao、Huajun Xi、Hao Zeng、Mengchen Zhao 与 Hongxin Wei。2025。带可证明统计保证的、与模型无关的选择性标注(Model-agnostic selective labeling with provable statistical guarantees)。arXiv:2510.14581。正文用于一次自动标注的错误发现率控制。
Carlos E. Jimenez、John Yang、Alexander Wettig、Shunyu Yao、Kexin Pei、Ofir Press 与 Karthik Narasimhan。2024。SWE-bench:语言模型能否解决真实的 GitHub 问题(Swe-bench: Can language models resolve real-world github issues?)。收录于学习表征国际会议,2024 卷,第 54107–54157 页。附录 F 中代码修复结果的测试集样式。
Jaehun Jung、Faeze Brahman 与 Yejin Choi。2025。信任还是升级:对人类一致带可证明保证的大语言模型评判器(Trust or escalate: Llm judges with provable guarantees for human agreement)。收录于学习表征国际会议,2025 卷,第 3101–3125 页。正文用于聊天回答评判器的独立同分布证书。
Saurav Kadavath、Tom Conerly、Amanda Askell、Tom Henighan、Dawn Drain、Ethan Perez、Nicholas Schiefer、Zac Hatfield-Dodds、Nova DasSarma、Eli Tran-Johnson 等。2022。语言模型大体知道自己知道什么(Language models (mostly) know what they know)。arXiv:2207.05221。正文用于对数概率校准。
Seungone Kim、Juyoung Suk、Shayne Longpre、Bill Yuchen Lin、Jamin Shin、Sean Welleck、Graham Neubig、Moontae Lee、Kyungjae Lee 与 Minjoon Seo。2024。Prometheus 2:一个专门评测其他语言模型的开源语言模型(Prometheus 2)。收录于 2024 年自然语言处理经验方法会议论文集,第 4334–4353 页。正文用于小评判器在域内比得上大评判器。
L. Kish。1965。调查抽样(Survey Sampling)。Wiley。正文用于设计效应校正。
Jing Yu Koh、Robert Lo、Lawrence Jang、Vikram Duvvur、Ming Lim、Po-Yu Huang、Graham Neubig、Shuyan Zhou、Russ Salakhutdinov 与 Daniel Fried。2024。VisualWebArena:在真实视觉网页任务上评测多模态智能体(Visualwebarena)。收录于计算语言学协会第 62 届年会论文集(长文第一卷),第 881–905 页。Web-A 所含线上基准之一。
Julian Lienen、Caglar Demir 与 Eyke Hüllermeier。2023。共形信条半监督学习(Conformal credal self-supervised learning)。收录于带应用的共形与概率预测,第 214–233 页。PMLR。正文用于经典半监督里的共形过滤器。
Evan Zheran Liu、Kelvin Guu、Panupong Pasupat、Tianlin Shi 与 Percy Liang。2018。用工作流引导的探索在网页界面上做强化学习(Reinforcement learning on web interfaces using workflow-guided exploration)。预印本,arXiv:1802.08802。附录 F 的 MiniWoB++ 来源。
Xing Han Lù、Amirhossein Kazemnejad、Nicholas Meade、Arkil Patel、Dongchan Shin、Alejandra Zambrano、Karolina Stańczak、Peter Shaw、Christopher J. Pal 与 Siva Reddy。2025。AgentRewardBench:评测对网页智能体轨迹的自动评测(Agentrewardbench)。arXiv:2504.08942。正文与附录 F 的 Web-A 来源。
Mike A. Merrill、Alexander G. Shaw、Nicholas Carlini、Boxuan Li、Harsh Raj、Ivan Bercovich、Lin Shi、Jeong Yeon Shin、Thomas Walshe、E. Kelly Buchanan、Junhong Shen、Guanghao Ye、Haowei Lin、Jason Poulos、Maoyu Wang、Marianna Nezhurina、Jenia Jitsev、Di Lu、Orfeas Menis Mastromichalakis 等 66 人。2026。Terminal-Bench:在命令行界面的困难、真实任务上给智能体做基准(Terminal-bench)。预印本,arXiv:2601.11868。附录 F 的 Term 语料来源。
Jiayi Pan、Yichi Zhang、Nicholas Tomlin、Yifei Zhou、Sergey Levine 与 Alane Suhr。2024。数字智能体的自主评测与改进(Autonomous evaluation and refinement of digital agents)。arXiv:2404.06474。正文用于轨迹评判器。
Zhihong Shao、Peiyi Wang、Qihao Zhu、Runxin Xu、Junxiao Song、Xiao Bi、Haowei Zhang、Mingchuan Zhang、Y. K. Li、Y. Wu 与 Daya Guo。2024。DeepSeekMath:把开放语言模型的数学推理推到极限(Deepseekmath)。预印本,arXiv:2402.03300。正文用于 GRPO 优化器。
Jafar Tanha、Negin Samadi、Yousef Abdi 与 Nazila Razzaghi-Asl。2022。CPSSDS:数据流上半监督分类的共形预测(Cpssds)。《信息科学》,584:212–234。正文用于半监督里的共形过滤器。
Katherine Tian、Eric Mitchell、Allan Zhou、Archit Sharma、Rafael Rafailov、Huaxiu Yao、Chelsea Finn 与 Christopher D. Manning。2023。直接要求校准:从经过人类反馈微调的语言模型引出已校准置信分数的策略(Just ask for calibration)。收录于 2023 年自然语言处理经验方法会议论文集,第 5433–5442 页。正文用于强化学习人类反馈之后的校准不良。
Tianlu Wang、Ilia Kulikov、Olga Golovneva、Ping Yu、Weizhe Yuan、Jane Dwivedi-Yu、Richard Yuanzhe Pang、Maryam Fazel-Zarandi、Jason Weston 与 Xian Li。2024。自学的评测器(Self-taught evaluators)。arXiv:2408.02666。正文用于用强化学习提高评判准确率。
Xingyao Wang、Boxuan Li、Yufan Song、Frank F. Xu、Xiangru Tang、Mingchen Zhuge、Jiayi Pan、Yueqi Song、Bowen Li、Jaskirat Singh、Hoang Tran、Fuqiang Li、Ren Ma、Mingzhang Zheng、Bill Qian、Daniel Shao、Niklas Muennighoff、Yizhe Zhang、Binyuan Hui 等。2025。OpenHands:面向作为通用智能体的人工智能软件开发者的开放平台(Openhands)。收录于学习表征国际会议,2025 卷,第 65882–65919 页。附录 F 的代码修复脚手架。
Chenxi Whitehouse、Tianlu Wang、Ping Yu、Xian Li、Jason E. Weston、Ilia Kulikov 与 Swarnadeep Saha。2026。J1:用强化学习激励把大语言模型当作评判器时的思考(J1: Incentivizing thinking in llm-as-a-judge via reinforcement learning)。收录于学习表征国际会议,2026 卷,第 10397–10420 页。正文用于评判器上的强化学习。
Tianhao Wu、Weizhe Yuan、Olga Golovneva、Jing Xu、Yuandong Tian、Jiantao Jiao、Jason E. Weston 与 Sainbayar Sukhbaatar。2025。元奖励语言模型:用大语言模型充当元评判器的自我改进对齐(Meta-rewarding language models)。收录于 2025 年自然语言处理经验方法会议论文集,第 11548–11565 页。正文用于自我改进模型。
Austin Xu、Yilun Zhou、Xuan-Phi Nguyen、Caiming Xiong 与 Shafiq Joty。2026。J4R:用等价初始状态的群体相对策略优化学习评判(J4r)。收录于计算语言学协会第 64 届年会论文集(长文第一卷),第 1492–1511 页。正文用于评判器上的强化学习。
Tianci Xue、Weijian Qi、Tianneng Shi、Chan Hee Song、Boyu Gou、Dawn Song、Huan Sun 与 Yu Su。2025。进步的幻觉?评估网页智能体的当前状态(An illusion of progress? assessing the current state of web agents)。arXiv:2504.01382。正文用于程序化检查器在真实网站上标错。
An Yang、Anfeng Li、Baosong Yang、Beichen Zhang、Binyuan Hui、Bo Zheng、Bowen Yu、Chang Gao、Chengen Huang、Chenxu Lv、Chujie Zheng、Dayiheng Liu、Fan Zhou、Fei Huang、Feng Hu、Hao Ge、Haoran Wei、Huan Lin、Jialong Tang 等 41 人。2025。Qwen3 技术报告(Qwen3 technical report)。预印本,arXiv:2505.09388。附录 H 的 40 亿参数基座模型。
Ori Yoran、Samuel Joseph Amouyal、Chaitanya Malaviya、Ben Bogin、Ofir Press 与 Jonathan Berant。2024。AssistantBench:网页智能体能解决真实且耗时的任务吗(Assistantbench)。收录于 2024 年自然语言处理经验方法会议论文集,第 8938–8968 页。Web-A 所含线上基准之一。
Weizhe Yuan、Richard Yuanzhe Pang、Kyunghyun Cho、Xian Li、Sainbayar Sukhbaatar、Jing Xu 与 Jason Weston。2024。自我奖励的语言模型(Self-rewarding language models)。arXiv:2401.10020。正文用于启发式地把关自生标签。
Daoguang Zan、Zhirong Huang、Wei Liu、Hanwu Chen、Shulin Xin、Linhao Zhang、Qi Liu、Li Aoyan、Lu Chen、Xiaojian Zhong、Siyao Liu、Yongsheng Xiao、Liangqiang Chen、Yuyu Zhang、Jing Su、Tianyu Liu、Rui Long、Ming Ding 与 Liang Xiang。2025。Multi-SWE-bench:面向问题修复的多语言基准(Multi-swe-bench)。收录于神经信息处理系统进展,第 38 卷,主会议。附录 F 的 Code-S 来源。
Jenny Zhang、Shengran Hu、Cong Lu、Robert Lange 与 Jeff Clune。2026。达尔文哥德尔机:自我改进智能体的开放式演化(Darwin gödel machine)。收录于学习表征国际会议,2026 卷,第 104223–104294 页。正文用于自我改进模型。
Andrew Zhao、Yiran Wu、Tong Wu、Quentin Xu、Yang Yue、Matthieu Lin、Shenzhi Wang、Qingyun Wu、Zilong Zheng 与 Gao Huang。2026。绝对零:用零数据做强化自我对弈推理(Absolute zero)。神经信息处理系统进展,38:105816–105879。正文用于自我改进模型。
Shuyan Zhou、Frank F. Xu、Hao Zhu、Xuhui Zhou、Robert Lo、Abishek Sridhar、Xianyi Cheng、Tianyue Ou、Yonatan Bisk、Daniel Fried 等。2024。WebArena:用于构建自主智能体的真实网页环境(Webarena)。收录于学习表征国际会议,2024 卷,第 15585–15606 页。Web-A 所含线上基准之一。
Lianghui Zhu、Xinggang Wang 与 Xinlong Wang。2025。JudgeLM:微调后的大语言模型是可扩展的评判器(Judgelm)。收录于学习表征国际会议,2025 卷,第 51257–51296 页。正文用于小评判器在域内比得上大评判器。
Mingchen Zhuge、Changsheng Zhao、Dylan Ashley、Wenyi Wang、Dmitrii Khizbullin、Yunyang Xiong、Zechun Liu、Ernie Chang、Raghuraman Krishnamoorthi、Yuandong Tian 等。2024。用智能体评判智能体(Agent-as-a-judge: Evaluate agents with agents)。arXiv:2410.10934。正文用于智能体式评判器,以及与人类一致率的度量。
附录 A 证书的名次不变性
命题 1 的证明。
令 $\phi:[0,1]\to[0,1]$ 严格递增,且 $\tilde{s}=\phi\circ s$。网格 $\Theta$ 由分数的经验分位组成,因此 $\tilde{\Theta}=\phi(\Theta)$ 逐元素成立,并且对每一个 $\theta\in\Theta$ 和每一条轨迹,$\tilde{s}(x)\leq\phi(\theta)\iff s(x)\leq\theta$。算法 1 中的全部量(每个任务的计数 $n_{g}(\theta),k_{g}(\theta)$、每一个自助比 $\widehat{\mathrm{err}}^{(b)}(\theta)$、分位检验,以及所选阈值的覆盖率)都只通过这类比较依赖分数,因此在 $\phi$ 下相同。同一论证适用于朴素证书和设计效应校正后的证书,它们的网格和计数以同样方式构造。Platt 缩放、温度缩放和保序回归(并列以一致方式打破)都是单调的,这就给出了正文中的陈述。
证毕。
两条实践推论。第一,表 3 里的前沿失败不能靠在我们的 175 条 CAL 标签上做事后校准来修补,多少条都一样;错的是排序本身。第二,评判器绝对概率的校准与认证无关;方程 (4) 必须做对的,是把失败排在成功之下,而这正是 SFT 和各支 GRPO 臂所改进的。全文中,精确二项界是 Clopper–Pearson(Clopper 与 Pearson,1934),重抽样原理是 Efron 的(Efron,1979),施加在簇的层面上(Field 与 Welsh,2007)。
附录 B 合成有效性研究
数据生成过程。
任务效应 $u_{g}\sim\mathcal{N}(0,\tau^{2})$;簇大小 $m_{g}\sim 1+\mathrm{Poisson}(7)$;标签 $y_{gj}\sim\mathrm{Bernoulli}\big(\sigma(b_{0}+u_{g})\big)$;分数 $s_{gj}=\sigma\big(d\,(2y_{gj}-1)+c\,u_{g}+\varepsilon_{gj}\big)$,$\varepsilon_{gj}\sim\mathcal{N}(0,1)$,$(b_{0},d,c)=(-0.8,\,2.2,\,0.9)$,$\tau$ 取 $\{0.9,2.6,5.0\}$,以打中标签组内相关 $\rho\approx\{0.1,0.5,0.8\}$。300 次试验的每一次都抽取 $G$ 个任务的校准集,跑全部五种程序($B{=}800$,$|\Theta|{=}40$,$\alpha{=}0.1$,$\delta{=}0.05$),并在新抽取的 $1.5\times 10^{5}$ 条轨迹上评估所选阈值的真实选择性错误。违反率等于真实错误 $>\alpha$ 的试验所占比例,只在程序确实给出了某种认证的试验中计算。
完整合成网格:违反率 / 平均带证书覆盖率。
| $G$ | $\rho$ | 朴素 CP | DEFF-CP | 每任务一条 | 任务 Hoeffding | TaskBoot |
|---|---|---|---|---|---|---|
| 20 | .1 | .00 / .65 | .00 / .16 | .00 / .00 | .00 / .00 | .00 / .68 |
| 20 | .5 | .00 / .53 | .00 / .00 | .00 / .00 | .00 / .00 | .01 / .61 |
| 20 | .8 | .00 / .47 | .00 / .00 | .00 / .00 | .00 / .00 | .01 / .56 |
| 50 | .1 | .00 / .69 | .00 / .67 | .00 / .00 | .00 / .00 | .00 / .69 |
| 50 | .5 | .00 / .61 | .00 / .03 | .00 / .00 | .00 / .00 | .00 / .62 |
| 50 | .8 | .00 / .57 | .00 / .00 | .00 / .00 | .00 / .00 | .00 / .57 |
| 100 | .1 | .00 / .70 | .00 / .69 | .00 / .29 | .00 / .00 | .00 / .70 |
| 100 | .5 | .00 / .62 | .00 / .58 | .03 / .06 | .00 / .00 | .00 / .63 |
| 100 | .8 | .00 / .58 | .00 / .23 | .00 / .00 | .00 / .00 | .00 / .58 |
| 500 | .1 | .00 / .71 | .00 / .71 | .00 / .69 | .00 / .66 | .00 / .71 |
| 500 | .5 | .00 / .64 | .00 / .63 | .00 / .62 | .00 / .56 | .00 / .64 |
| 500 | .8 | .00 / .60 | .00 / .58 | .00 / .58 | .00 / .00 | .00 / .59 |
上表逐格读作违反率对平均覆盖率。二十个任务、相关约零点一时,朴素为零对零点六五,设计效应校正为零对零点一六,每任务一条与任务霍夫丁都是零,TaskBoot 为零对零点六八。二十个任务、相关约零点五时,朴素为零对零点五三,其余三种有限样本方法仍是零,TaskBoot 为零点零一对零点六一。二十个任务、相关约零点八时,朴素为零对零点四七,TaskBoot 为零点零一对零点五六。五十个任务、相关约零点一时,朴素与 TaskBoot 都约为零对零点六九,设计效应校正为零对零点六七。五十个任务、相关约零点五时,朴素为零对零点六一,设计效应校正为零对零点零三,TaskBoot 为零对零点六二。五十个任务、相关约零点八时,朴素与 TaskBoot 都约为零对零点五七。一百个任务、相关约零点一时,每任务一条升到零对零点二九,朴素与 TaskBoot 约为零对零点七零。一百个任务、相关约零点五时,每任务一条为零点零三对零点零六,设计效应校正为零对零点五八,TaskBoot 为零对零点六三。一百个任务、相关约零点八时,设计效应校正为零对零点二三,TaskBoot 为零对零点五八。五百个任务时,五种程序的覆盖率才彼此靠近:相关约零点一时都在零点六六到零点七一之间,相关约零点五时在零点五六到零点六四之间,相关约零点八时任务霍夫丁仍是零,其余大约为零对零点五八到零点六零。
对抗设计。
另外三种设计瞄准审稿人会预期朴素证书在总体水平上被打破的情形:(i)参数对齐 Web-M($G{=}32$,$\rho{\approx}0.8$,近乎完美的区分度 $d{=}4.5$,低基础率);(ii)大小与结果相关,$u_{g}\leftarrow u_{g}-0.25\,(m_{g}-\bar{m})$,使大簇失败更多;(iii)重尾簇大小,$m_{g}\sim 1{+}\min(\lfloor 4\,\mathrm{Pareto}(1.3)\rfloor{+}1,60)$。朴素违反率分别为 $.003$、$.000$、$.000$(TaskBoot:三种都是 $.000$,覆盖率相等)。我们把这一点说成不利于自己的证据:被 Bonferroni 松弛保护的朴素证书,在我们诚实构造的每一种合成情形里都在总体上有效,它被展示出来的失败是真实高 $\rho$ 数据上的任务重抽样审计(附录 D)。两句陈述是相容的:审计度量的是在像观测到的语料那样的语料上,实际错误的离散程度,而这正是一次部署重跑会经历的量。合在一起,它们支持第 4 节那种一律安全的表述,而不是一句笼统的无效声明。
蒙特卡洛误差。
300 次试验下,真实违反率 $0.05$ 的标准误约为 $0.013$;TaskBoot 的估计值 $\leq 0.01$,与每一个格子里真实比率等于或低于预算相一致。
附录 C 真实语料上对聚类有效的基线
真实测试分数上、$\alpha{=}0.1$ 时的带证书拒绝覆盖率,五种程序。每任务一条使用一次预先登记的抽取(种子 42);任务 Hoeffding 检验的是被覆盖任务上、每任务错误率的均值(被估计的量:按任务加权的错误),全程 Bonferroni 为 $\delta/40$。
| 语料 | 评判器 | $G$ | $\rho$ | 朴素 | DEFF | 每任务一条 | Hoeffding | TaskBoot |
|---|---|---|---|---|---|---|---|---|
| Tool | 基座 | 84 | .25 | .000 | .000 | .000 | .000 | .000 |
| Tool | SFT | 84 | .25 | .325 | .000 | .000 | .000 | .325 |
| Tool | GRPOμ3 | 84 | .25 | .321 | .000 | .000 | .000 | .321 |
| Term | 基座 | 13 | .43 | .340 | .000 | .000 | .000 | .315 |
| Term | SFT | 13 | .43 | .379 | .000 | .000 | .000 | .379 |
| Term | GRPOμ5 | 13 | .43 | .369 | .000 | .000 | .000 | .369 |
| Web-A | 基座 | 68 | .49 | .465 | .000 | .000 | .000 | .510 |
| Web-A | SFT | 68 | .49 | .465 | .000 | .000 | .000 | .560 |
| Web-A | GRPOμ3 | 68 | .49 | .430 | .000 | .000 | .000 | .585 |
| Web-M | 基座 | 32 | .80 | .857 | .000 | .000 | .000 | .832 |
| Web-M | SFT | 32 | .80 | .859 | .000 | .000 | .000 | .789 |
| Web-F | 基座 | 32 | .81 | .707 | .000 | .000 | .000 | .707 |
| Web-F | SFT | 32 | .81 | .758 | .000 | .000 | .000 | .758 |
| Code-O | 基座 | 382 | .64 | .000 | .000 | .000 | .000 | .000 |
| Code-S | 基座 | 7 | .00 | .000 | .000 | .000 | .000 | .619 |
十五行里,工具使用的基座在八十四个任务、相关零点二五时五种程序都是零;监督微调与拒绝加权后,朴素和 TaskBoot 约为零点三二,设计效应、每任务一条和霍夫丁仍是零。终端十三项任务上,朴素与 TaskBoot 在零点三一到零点三八之间。网页 A 上 TaskBoot 从基座的零点五一零升到监督微调的零点五六零、再到拒绝加权的零点五八五。网页 M 与网页 F 上朴素和 TaskBoot 都在零点七到零点八六之间。代码 O 即使有三百八十二项任务也全是零。代码 S 只有七个簇,TaskBoot 名义上为零点六一九。两种有限样本有效的构造在全部十五行上都证明为零,包括有 $382$ 项任务的 Code-O(它的评判器太弱)和有 $84$ 项的 Tool(经 $\delta/40$ 校正的精确界需要更多)。Code-S 这一行说明正文里 $G<20$ 的保留:TaskBoot 名义上从七个簇证明 $.619$,落在我们的模拟所验证的区间之外,我们不在任何地方使用这个数字。
附录 D 证书审计
对朴素证书的任务重抽样审计。
对每一份语料和每一个评判器,朴素的独立同分布证书选出它的最大覆盖阈值;然后我们有放回地重抽样任务($3{,}000$ 次抽取),记录该阈值上的实际选择性错误超过 $\alpha$ 的频率。数值 $\leq\delta{=}.05$ 与所承诺的置信度一致:Web-M 的 SFT 为 $.069$($\alpha{=}.1$)、$.175$($\alpha{=}.2$);Web-M 基座为 $.017$、$.021$;其余所有语料与评判器的组合 $\leq.032$(Tool 的 SFT 为 $.004/.032$,GRPO 为 $.001/.017$;Web-A 全部 $\leq.004$;Term 的 SFT 为 $.000/.027$;Web-F $\leq.016$)。朴素证书的失败被限制在、并且在高 $\rho$ 的多次采样情形里很严重,而它在那里也声称得最多($\alpha{=}.2$ 时覆盖率 $.98$)。
TaskBoot 的 CAL 到 TEST 审计。
译注:原文标题在 HTML 转换中被写成 CAL→\toTEST,这里按原文含义记为 CAL→TEST。
阈值在 CAL 任务上校准,实际选择性错误在任务不交的 TEST 上度量一次,$\alpha=0.1$:Web-A 的 SFT 为 $.028$,GRPOμ3 为 $.027$,基座为 $.037$;Tool 的 SFT 为 $.012$,GRPOμ1 为 $.012$,GRPOμ3 为 $.011$;Web-M 的基座为 $.008$,SFT 为 $.015$,GRPOμ5 为 $.008$;Web-F 的基座为 $.016$,SFT 为 $.022$,GRPOμ3 为 $.016$。在 $\alpha=0.2$ 时,全部审计同样通过(最大实际错误 $.116$,出现在 Web-A 的 GRPOμ3 上)。文中每一个被部署的阈值都来自这套协议。
附录 E 完整结果表
全部 GRPO 臂,两份头条语料
下面这张表给出带证书拒绝覆盖率,$\alpha{=}0.1$;括号里是用于选择的、校准集上的带证书覆盖率。
| 语料 | SFT | 准确率($\lambda{=}\mu{=}1$) | 拒绝 $\mu{=}3$ | 拒绝 $\mu{=}5$ | 放行 $\lambda{=}5$ | CAL 的选择 |
|---|---|---|---|---|---|---|
| Tool | .293 | .297(.150) | .321(.149) | .295(.145) | .293 | $\mu{=}1$ |
| Web-A | .560 | .585(.514) | .585(.537) | .585(.514) | .585 | $\mu{=}3$ |
$\alpha=0.2$,拒绝侧(TaskBoot)
译注:原文标题在 HTML 转换中被双写成 α=0.2α=0.2,这里只保留一次。下面按语料列出拒绝侧在该预算下的覆盖率。
Web-A:基座 $.635$,SFT $.710$,GRPOμ1 $.735$,GRPOμ3 $.710$,GRPOμ5 $.715$;Tool:SFT $.422$,GRPOμ1(CAL 的选择)$.424$,GRPOμ3 $.391$,基座 $.120$;Web-M:基座 $.883$,SFT $.859$,GRPOμ5 $.885$;Web-F:基座 $.707$,SFT $.758$,GRPOμ3 $.758$;Term(灰色区间):基座 $.442$,SFT $.469$,GRPOμ5 $.423$。前沿模型在 Web-A 上、$\alpha{=}0.2$ 时:gpt-5.6-sol 的思维链 $.784$,sonnet-5 的思维链 $.675$,其余配置全部 $.000$;在 Tool 上:sonnet-5 的思维链 $.124$,gpt-5.6-sol 的思维链 $.000$。
放行侧。
放行预算在各处证明得都少得多:$\alpha{=}0.2$ 时唯一的非零格子在 Tool 上(SFT 为 $.27$),$\alpha{=}0.1$ 时没有任何语料给出证书。因此我们把双侧表述当作框架,并验证拒绝侧;要在现实预算下验证放行侧,需要比我们手头更多的、可证明的成功质量。
前沿模型的解析率。
带口头概率的思维链,在 Web-A 上解析出 $199/200$(gpt-5.6-sol)、$182/200$(gemini-2.5-pro)、$191/200$(sonnet-5);gpt-5.6-sol 与 sonnet-5 在 Tool 上为 $1194/1280$ 和 $741/1280$;SC-$k$ 解析出至少 $199/200$;gpt-5.2 的接口不返回词元对数概率,因此前沿对数概率这一行使用 gpt-4o($200/200$)。未解析的行从该评判器的分数里排除(不记到它的账上)。
附录 F 语料
全部语料共用一种模式(任务标识、渲染后的轨迹文本、二元结果)和一套划分程序:任务用一颗固定种子打乱,按 $40/30/15/15$ 的百分比分到 SFT/RL/CAL/TEST(MiniWoB 语料上测试比例提高到 $25\%$,以越过 $n_{\min}$);轨迹跟随自己的任务,因此四个划分在任务上不交,并由程序验证。渲染文本包含任务指令,以及逐步的动作和观察摘录,中间截断到固定的字符预算;奖励信号、评测器输出或环境裁决从不被渲染进去。
Tool($\tau^{2}$-bench;Barres 等,2025):航空、零售和电信领域上的工具使用对话;结果来自基准的数据库状态检查。$6{,}400$ 条轨迹,$421$ 项任务(TEST 中为 $1{,}280$ 条 / $84$ 项)。Term(Merrill 等,2026):带程序化目标检查的终端会话任务。Web-A:AgentRewardBench 的发布版本(Lù 等,2025),四个智能体模型在五个线上网页基准上的 $1{,}302$ 条轨迹(WebArena、VisualWebArena、AssistantBench、WorkArena、WorkArena++;Zhou 等,2024;Koh 等,2024;Yoran 等,2024;Drouin 等,2024;Boisvert 等,2024),每一条都经过专家标注;我们使用带有多数成功标签的 $1{,}289$ 条轨迹。簇等于一项网页任务,把尝试过它的智能体合在一起。Web-M:我们在 BrowserGym(Chezelles 等,2025)下、用两个弱智能体(一个 40 亿参数的视觉语言模型及其 SFT 变体)生成的 MiniWoB++ 轨迹(Liu 等,2018),覆盖全部 $125$ 项已注册任务,每项八颗种子,标签来自环境奖励;轨迹文本排除奖励。Web-F:同样的环境,轨迹来自两个前沿智能体(一个推理模型和一个快速的商业模型),种子数为六和二。Code-O:来自 SWE-rebench(Badertdinov 等,2025)、在 OpenHands 脚手架下(Wang 等,2025)的代码修复轨迹,其结果是 SWE-bench 样式的留出测试集(Jimenez 等,2024);Code-S:来自 Multi-SWE-bench 的一份小型多语言语料(Zan 等,2025)。完整出处、计数和渲染参数见表 1 与发布的脚本。
附录 G 评判器提示
基础打分、SFT 监督、GRPO 采样,以及全部训练后评判器的打分,逐字共用一条提示;训练和评测不能彼此漂开。
system:你是一名对人工智能智能体轨迹持怀疑态度的审计员。判断智能体是否真的完成了它的任务。智能体自己声称成功并不是证据;只根据轨迹所显示的内容来判断。
user:任务指令:
"""$\langle$任务$\rangle$"""
智能体轨迹(动作和观察摘录,可能被截断):
$\langle$渲染后的轨迹$\rangle$
智能体是否真正且完整地在这项任务上成功了?用一个词回答,SUCCESS 或 FAIL。
VERDICT:
分数(方程 4)读取 VERDICT: 之后的下一个词元分布;对我们的基座模型,两个裁决词都是单个词元。前沿思维链引出把「一个词」的指令换成逐步推理,结尾为 P_SUCCESS=<0 到 100 的整数>;SC-$k$ 保持一个词的形式,温度为 $1.0$。
附录 H 训练细节
评判器。
基座为 Qwen3.5-4B(Yang 等,2025),LoRA(Hu 等,2021)加在全部注意力和多层感知机投影上(可训练参数 $32.5$M,占 $0.77\%$),训练和测试时推理关闭。生成 Web-M 的智能体是 Qwen3-VL 模型(Bai 等,2025)。SFT:在该语料的 SFT 划分上一个轮次,学习率 $2\times 10^{-5}$,余弦,批大小 2,梯度累积 4,最大序列 $5{,}120$ 个词元,只对补全计算损失(那一个裁决词元)。GRPO:从 SFT 适配器初始化,奖励按方程 (5),每个提示 8 个样本,学习率 $2\times 10^{-6}$,最大补全 40 个词元,150 步优化器(Term 上为 40 步),每设备批大小 8,在 2–6 块 GPU 上做数据并行(不同的进程世界大小得到相同结果,对固定的全局批这是预期的)。RSI 轮次:在源数据加上采集到的伪标签上,使用相同的 SFT 配方。全部运行使用种子 42。硬件:一个节点,GPU 为 96 GB;一份语料的完整 SFT 加 GRPO 加认证过程花费 $1$–$3$ 个 GPU 小时;文中的每一张证书和每一项分析都在 CPU 上于数分钟内跑完。
附录 I 留一语料的迁移
迁移评判器在除被留出的那一份之外、全部语料的 SFT 划分合池后的一份平衡样本上做 SFT(至多 $2{,}600$ 行,每个来源基准相等),然后经由在 CAL 上校准的 TaskBoot,在被留出语料未被触碰的 TEST 上认证。Web-A 有两个变体:只排除 Web-A 本身(其他网页语料仍在;证明 $.575$,AUROC $.915$),以及排除全部网页语料的严格变体(证明 $.560$,AUROC $.902$),后者就是被引作「零网页暴露」的数字。反方向是诚实的负例:一个在除 $\tau^{2}$ 之外的一切上训练的评判器,迁移时 AUROC 为 $.794$,证明 $.045$;工具使用对话的格式特异,泛泛地阅读轨迹覆盖不了,而这恰恰是 CertHarvest 的门随后拒绝采集的情形。表 4 里 Web-M 的迁移行使用的是严格的、零网页暴露的评判器。
附录 J CertHarvest 协议,以及停止规则的负例
CertHarvest(一轮,拒绝侧)
协议。
池子等于目标语料的 SFT 加 RL 划分,标签被扣住(迁移起点),或等于它未见过的 RL 划分(域内起点);采集阈值来自 CAL 任务一半上的 TaskBoot(种子 42 的两半);第 $k$ 轮的训练集等于源数据加上当前采集;每一轮的认证做在未被触碰的另一半和 TEST 上。被采集轨迹的真实标签只用于报告污染,从不进入训练。
全部 CertHarvest 采集。全 CAL 试点那一行显示的是拆分 CAL 修正之前的协议;结果不被这次修正改变,所有被报告的数字都使用拆分 CAL 的协议。
| 目标 | 起点 | 采集 | 污染 | TEST 上 $\alpha{=}.1$ 的证书 |
|---|---|---|---|---|
| Web-A | 迁移,第 1 轮(全 CAL 试点) | 437/914 | .041 | .585 |
| Web-A | 迁移,第 1 轮(拆分 CAL) | 262/914 | .008 | .585 |
| Web-A | 迁移,第 2 轮 | 336/914 | .024 | .465 |
| Tool | 域内,第 1 轮 | 296/2200 | .000 | .343 |
| Tool | 域内,第 2 轮 | 338/2200 | .003 | .347 |
| Web-M | 迁移,第 1 轮 | 837/1296 | .002 | .820 |
| Tool | 迁移 | 门关上:CAL 什么也不证明 |
全部采集。
表 7 列出每一次采集,包括拆分 CAL 的卫生修正之前的全 CAL 试点运行。
为什么不是一条停止规则。
一条自然的迭代规则(当 CAL 上的带证书覆盖率还在改进时就继续)在经验上失败:在 Web-A 上,CAL 对第 $0/1/2$ 轮证明 $.514/.389/.486$,而 TEST 移动为 $.575/.585/.465$;175 行的 CAL 排不出靠得这么近的模型(与 Tool 上选择臂时的同一个分辨极限)。因此我们建议第 7 节的固定策略,而不是一条校准数据支撑不起的自适应规则。
附录 K 可证明性模型:验证
表 8 报告方程 (6) 及其消融形式的留一语料验证(目标:每份语料最好的带证书覆盖率)。
可证明性模型的验证:方程 (6) 及其消融形式的样本内拟合与留一语料拟合。
| 形式 | 样本内 $R^{2}$ | 留一 $R^{2}$ | 留一平均绝对误差 |
|---|---|---|---|
| $(1-\pi)(2A_{0}-1)$(方程 6) | .977 | .964 | .039 |
| $(1-\pi)(2A_{0}-1)(1-e^{-n_{\mathrm{eff}}/K})$,$K{=}30$ | .835 | .707 | .124 |
| 同上,$K$ 由留一交叉验证调节($K{=}10$) | .977 | .967 | .039 |
| 只用 $(2A_{0}-1)$ | .913 | .471 | .132 |
| $(2A_{0}-1)(1-e^{-n_{\mathrm{eff}}/30})$(没有 $\pi$) | .656 | .382 | .196 |
饱和因子在 $K$ 被调节之后什么也不增加,固定时则有害;基础率因子是承重的。正文里陈述的保留在此适用:$n{=}7$ 份语料,零覆盖的语料锚定拟合的低端。
附录 L 成本核算
带证书覆盖率线性地换成被拿掉的复核时间:每条轨迹的人工复核为 $t$ 分钟时,带证书覆盖率为 $c$ 的语料在每千条轨迹上节省 $1000\,c\,t/60$ 个复核小时,被拿掉的部分上残余风险以 $\alpha$ 为界。$t{=}6$ 时:Tool 为 $29.7$ 小时,Web-A 为 $58.5$ 小时,Web-M 为 $83.6$ 小时,Web-F 为每千条 $75.8$ 小时。评判器一侧的边际成本是每条轨迹对一个 40 亿参数模型做一次前向传播(成批时,一块 GPU 在我们的序列长度下维持大约每秒 $10$ 条轨迹);最强的前沿配置每条轨迹花费大约 $10^{3}$ 个推理词元,按接口价格计,这是第 5 节里大约 $100$ 倍那个数字的依据。我们把所有美元数字留在脚注里,因为它们继承本地价格;小时数字则不继承。
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.