推理 时 算 力 如何 改写 前沿 模型 评 测: 固定 预算 会 低估 新 模型
英国 AI Security Institute 在七个基准上比较最多 12 个前沿模型。更大的 token 预算、上下文压缩和反复提交表明:FrontierMath 与 HLE 在通常预算外仍有约 12 个百分点余量,软件工程基准余量很小,跨代进步主要来自触及范围和可靠性,而不是 token 效率。

本文目录
推理时算力如何塑造前沿大语言模型评测
Jessica McFadyen 单位:AI Security Institute,英国伦敦 通信作者:jessica.mcfadyen@dsit.gov.uk
Ole Jorgensen 单位:AI Security Institute,英国伦敦;牛津大学,英国牛津
Harry Coppock 单位:AI Security Institute,英国伦敦
Kevin Wei 单位:AI Security Institute,英国伦敦;哈佛大学,美国马萨诸塞州剑桥
Cozmin Ududec 单位:AI Security Institute,英国伦敦
摘要
人工智能评测正在转向更难的任务。这类任务受益于更长的轨迹,轨迹里包含工具使用和反复求解。因此,成绩越来越取决于测试时允许使用多少计算、以及这些计算如何分配。这里把测试时可用的计算称为推理时算力(inference compute)。可是许多评测仍只在一个偏紧的预算上报告成绩。低分反映的可能是评测设置,而不是模型做不到。
为检验这一点,本文在七个有难度的基准上评测最多 12 个前沿语言模型。领域覆盖软件工程、数学、医学和网络安全。实验设置是受控的,并把三种简单的推理扩展手段合在一起:更大的 token 预算、上下文压缩(context compaction,把较早轮次换成模型生成的摘要,以便轨迹超过名义上下文窗口后还能继续),以及反复提交。反复提交由模型自己引导,或由最低限度的正确性反馈引导。
主要结果有三条。第一,更大的 token 预算能明显提高多个领域的成绩,包括网络安全、FrontierMath、Humanity’s Last Exam 和 TerminalBench。第二,固定预算评测会越来越低估前沿能力,而且模型越新,这种低估越明显。新模型在大预算上达到更高成绩:它们能解开更难的任务,并且解得更稳。第三,不同基准从不同的推理扩展方法里获益:反复提交普遍提高成绩,但更大 token 预算、外部反馈和并行尝试的价值因基准而异。
总的来说,基准分数依赖协议。因此本文主张:评测应把能力写成推理时算力的函数;明确写出协议选择;在比较各代模型时,使用同一大段共享算力区间,并在对齐的预算上比较。这在安全或政策相关的场景里尤其重要。
1 引言
前沿人工智能基准趋于饱和之后,评测转向更难、时间跨度更长的任务。这类任务受益于加长的轨迹、多步规划、工具使用,以及与复杂环境的交互(Phan 等,2025;Glazer 等,2024;Folkerts 等,2026;Merrill 等,2026;Deng 等,2025;Kapoor 等,2026)。这些任务上的成绩越来越取决于评测允许多少推理时算力(Ord,2025;Bengio 等,2025)。然而许多评测仍使用不大的 token 预算,只给模型一次提交机会,并报告一个依赖于协议的单一分数。这相当于在很紧的时间压力下评测人类专家。失败可能只是推理预算用完了,而不是模型解不出任务。这样就有低估模型能力的风险。
本文在统一实验框架里系统研究成绩如何随推理时算力扩展(下文称推理扩展,inference scaling)。我们评测六个前沿语言模型,发布时间从 2025 年 5 月到 2026 年 3 月,覆盖多代。五个有难度的基准分布在软件工程、数学和医学。另外采用英国 AI Security Institute 两项密切相关的网络安全评测,模型集合与上述有重叠,共 10 个模型(UK AI Security Institute,2026b;Folkerts 等,2026;UK AI Security Institute,2026a)。这些设置使用同一套推理扩展协议:把总 token 预算扩大到已发表基准默认值的 10 倍到 1000 倍,做上下文压缩,并且允许无限次提交,可以带或不带最低限度的正确性反馈。这些技术故意保持简单,用来给出一个下界:简单、通用、可复现的推理扩展方法能够引出(elicit)多少能力,而不是用针对每个基准的脚手架把每个模型的能力引到最大。
图 1:前沿模型在七个基准上的推理扩展曲线和平台位置。(A) 累计成绩随已用总 token 变化(不含大语言模型裁判的 token)。每个基准上,每条曲线对应一个(模型,基准,条件)。实线是先知分数反馈,虚线是无反馈。每个条件、每个任务有 5 条独立轨迹。两个网络安全基准使用此前收集的数据,协议与先知评分非常接近,每个任务 5 条轨迹,图中只有实线。纵轴是累计平均分:HealthBench 为 \[0,1\] 上的连续分数;The Last Ones 用 32 步中已完成比例表示部分进度;其余为二元的 0/1 任务成功。图例在每个提供方内部按发布时间排序。竖直虚线标出该基准通常发表的 token 预算(两条线表示一个常见区间);竖直实线标出本次评测施加的 token 上限。(B) 每条推理扩展曲线进入平台时的 token 预算,相对通常发表预算和本次测试范围分桶:早于通常值(Before typical)、处于通常区间(In typical,仅当通常值本身是一个区间)、晚于通常值(After typical,位于通常预算和本次测试上限之间)、或超出测试范围(Beyond tested,在测试预算内没有平台)。点代表模型。五个主基准上,实心点是先知分数反馈,空心点是无反馈。两个网络安全基准只贡献先知分数反馈的点。横线把上方的 Anthropic 模型和下方的 OpenAI 模型分开。
我们发现三种主要形态:
- 推理扩展幅度大,但高度依赖基准。有些基准在通常发表的 token 预算之外仍继续提高,包括 FrontierMath、TerminalBench 和 Humanity’s Last Exam(HLE)。另一些基准在我们的协议下边际增益较弱。
- 更新的模型代通常在大预算上取得更高成绩。它们能解开更难的任务,并且解得更可靠。因此,低预算评测可能跟不上「把额外推理时算力变成成绩」这一能力的进步,也可能引不出只在更大预算上才看得见的能力。固定预算分数不能完整描述更宽推理时预算下能够达到的成绩前沿,而且随着模型进步,这一遗漏可能变大。
- 推理扩展的增益并不来自某一种万能干预。基准分数部分取决于协议:模型能否、以及如何对解答做迭代;算力是投给一条很深的轨迹(串行扩展,serial scaling),还是摊到多条较浅的轨迹上(并行扩展,parallel scaling)。反复提交在所有基准上都实质提高成绩。关于提交是否正确的反馈,在它能够引导继续搜索的地方最重要(HLE 和 SWE-Bench Pro)。并行扩展在无状态基准上最强(HealthBench 和 HLE,不涉及持久的交互环境),在有状态基准上最弱。这些结果说明,不同任务对推理时算力的分配方式反应不同,引出能力在一定程度上依赖协议。
综合来看,前沿能力不能由单一推理时协议下的单一基准分数完全刻画。观察到的成绩不仅取决于模型,还取决于给了它多少推理时算力、以及这些算力如何分配。因此评测应当:(i)把能力报告为推理时算力的函数,而不是一个固定预算数字;(ii)把协议选择当作评测设计的一部分并明确报告;(iii)在跨代比较能力时控制算力区间和协议,尤其是在安全关键或政策相关的语境中(Cerruti,2026)。
背景
已有证据表明,额外的推理时算力可以提高困难评测上的成绩,包括网络安全(Folkerts 等,2026;Meta Superintelligence Labs,2026)、软件工程(Ma 等,2025;Ding 和 Zhang,2026;Epoch AI 与 METR,2026)、数学(Muennighoff 等,2025;Wu 等,2024)、医学(Huang 等,2025;Byun 等,2026),以及其他交互任务(Anthropic,2026a;Wei 等,2025)。推理扩展可以用累计成功曲线来刻画:成绩是已消耗 token 的函数,而不是某一个固定预算上的一个点。这种曲线显示,随着分配更多推理时算力,成功是否还在提高(Cerruti,2026)。前沿模型之间的差别往往在高算力处更清楚(Folkerts 等,2026)。如果成绩在整个测试范围内仍在上升,那么该评测只测到了该协议下可达到成绩的一部分,而不是全部上限(Folkerts 等,2026;Epoch AI 与 METR,2026)。这对跨代比较尤其重要,因为固定预算评测可能漏掉新模型在如何使用额外推理时算力上的改进(UK AI Security Institute,2026a)。
推理扩展弱,或者看不到推理扩展,可能有两种意思:额外推理算力在该设置里确实没有帮助,或者表面上的上限是评测协议造成的。更长的轨迹可能损害成绩(Gema 等,2025;Laban 等,2025),有些领域本身对额外推理算力不太敏感(Sprague 等,2024)。但弱扩展也可能来自预算太紧、轮数上限、超时、上下文管理差,或迭代改进的机会有限(Jurkovic,2026;Merrill 等,2026;Sun 等,2025)。这些协议选择同时限制一条轨迹内部的串行深度,以及多条独立轨迹之间的并行广度(Wang 等,2023;Snell 等,2024)。累计成功曲线看起来相似的评测,实际允许的搜索、恢复或改进机会可能很不一样。曲线上 aparente 的平台,也可能反映的是轮数上限或超时,而不是生产性推理时算力的真正极限。因此,一次评测是否观察到推理扩展,不能不看协议允许哪些推理时机会就加以解释。要评估额外推理时算力让模型做到了什么,可能需要对算力如何分配、以及协议实际允许哪些搜索、交互或改进做更分解的分析(Marchand 等,2026)。
现有证据有两个缺口。第一,现有研究很少在足够宽的推理算力区间上刻画成绩。这样做很贵,但要把接近饱和和继续提高区分开,就有必要。曲线两端都重要:高算力尾部说明资源充足的行动者能做到什么;低算力区间说明可及性,以及资源较少时的误用。第二,评测者很少在单一框架里,对多个基准或多代模型使用足够可比的设置。这样就难以把模型与任务造成的差别,和脚手架、工具、协议造成的差别分开。可比性并不保证充分引出:即使框架共享,弱扩展仍可能反映真实的能力上限,也可能反映协议没有引出模型在另一种推理时算力分配下能够表现出来的能力。
2 方法
主实验是全交叉设计。六个前沿模型(表 1)在五个非网络安全基准上、两种反馈条件下接受评测。脚手架是共享的 ReAct 风格脚手架(Yao 等,2023;ReAct 指交替进行推理和行动的循环),用 Inspect AI 实现(UK AI Security Institute,2024a)。每个(基准,模型,条件)格子里的每个任务,跑 5 条独立轨迹。各基准的数据加载、沙箱配置、评分细节和其他协议细节见附录 A.1.1、A.1.4 和 A.1.3。
另外两项此前收集的网络安全基准(UK AI Security Institute,2026b;Folkerts 等,2026;UK AI Security Institute,2026a)只进入推理扩展分析。它们不属于全交叉主设计,覆盖的模型集合不同,但发布时间范围相近(表 1)。它们按每个任务 5 条独立轨迹运行,协议与下文第 2.2 节描述的高预算协议几乎相同。
2.1 模型
主基准套件评测六个前沿模型,跨三代(2025 年 5 月至 2026 年 3 月),来自两个模型家族(表 1)。每个家族内的三次连续发布(Opus 4 → 4.5 → 4.6,以及 GPT-5 → 5.2 → 5.4)使跨代比较可以受控:脚手架、提示和推理时算力预算保持不变。所有模型以高推理力度运行(Anthropic 为 xhigh,OpenAI 为 high),每次生成调用的推理 token 预算为 16,000。这是 Humanity’s Last Exam 准确率据报告达到峰值的预算(Center for AI Safety 等,2026)。该推理 token 预算与每条轨迹的总预算分开,管的是每一次模型调用。
两个网络安全基准的数据覆盖另一组模型:夺旗(CTF,capture-the-flag)套件 10 个模型(2025 年 4 月至 2026 年 4 月),The Last Ones 为 5 个模型(2025 年 9 月至 2026 年 4 月)。两者都包括 Mythos Preview。这是 Anthropic 提供给英国 AI Security Institute(AISI)做评测的一个前沿模型检查点(Anthropic,2026a)。AISI 测试了两个这样的检查点。本文评测的是较新的一个,晚于 AISI 最初的 Mythos Preview 评测中的检查点(UK AI Security Institute,2026b),并与较新的报告一致:该较新检查点是第一个把 AISI 两个网络靶场都端到端解完的模型(UK AI Security Institute,2026c)。
| 模型 | 发布时间 | TB | SBP | FM | HB | HLE | CTF | TLO |
|---|---|---|---|---|---|---|---|---|
| o3 | 2025-04 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | ✗ |
| Opus 4 | 2025-05 | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | ✗ |
| GPT-5 | 2025-08 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ |
| Sonnet 4.5 | 2025-09 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ |
| Opus 4.5 | 2025-11 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ |
| GPT-5.1 Codex | 2025-11 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ |
| GPT-5.2 | 2025-12 | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | ✗ |
| GPT-5.2 Codex | 2025-12 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | ✗ |
| Opus 4.6 | 2026-02 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| GPT-5.3 Codex | 2026-02 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | ✗ |
| GPT-5.4 | 2026-03 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Mythos Preview | 2026-04 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ |
表 1:七个基准上的模型覆盖。对勾表示我们评测了该(模型,基准)格子。模型按发布日期排序。五个主基准(TB:TerminalBench;SBP:SWE-Bench Pro;FM:FrontierMath;HB:HealthBench;HLE:Humanity’s Last Exam)进入全部下游分析。两个网络安全基准(CTF:Capture the Flag;TLO:The Last Ones)只进入推理扩展分析。表中前五列属于主基准套件,后两列属于网络安全基准。
2.2 推理扩展技术
我们在每一个(基准,模型,条件)格子上统一使用三种故意简单的推理扩展技术:
- 扩大的总 token 预算:每条轨迹 500 万到 3000 万 token(表 2),按任务复杂度设定,比典型基准默认值高 1 到 3 个数量级。
- 上下文压缩:用模型生成的摘要替换较早轮次,使串行扩展能够超过名义上下文窗口。我们采用 Inspect AI 默认的基于摘要的策略(UK AI Security Institute,2024a)。当运行中的上下文超过 13 万 token 时触发,约为各模型中最小的 20 万上下文窗口的 65%。
- 迭代重新提交:每条轨迹硬上限 999 次提交。模型可以改进上一个答案,也可以在两次提交之间换一种差别很大的做法。为减少几乎相同的提交空转,我们还使用一个轻量的重复守卫:当另一个大语言模型裁判判定连续三次或更多次提交在语义上等价时,终止该轨迹(附录 A.1.3)。
这些技术都在单条轨迹内运作,针对的是串行推理扩展。并行推理扩展在第 3.3.2 节单独研究:把同一批轨迹按不同的固定总预算分配重新分析。
2.3 反馈条件
模型能否有效使用很大的 token 预算,强烈取决于轨迹中可用的反馈(Balachandran 等,2025)。因此每个(模型,基准)对都跑两种条件:
- 无反馈。每次提交后,模型只收到一句含糊的确认(“Your answer has been saved”,你的答案已保存),不告知对错。轨迹继续,直到预算耗尽或重复守卫触发。这把模型自己判断「任务是否已经解开」的能力分离出来。
- 先知分数反馈(oracle score feedback)。模型被告知每次提交是否正确;对 HealthBench,则给出部分得分。轨迹在第一次完全正确的提交处终止,因为此后模型知道自己已经解开任务。
两种条件共享一条自适应的继续提示,邀请智能体改进上一个答案,或尝试差别很大的另一种做法。完整提示文本和各基准的反馈变体见附录 A.1.4。每个(基准,模型,任务)格子在每种条件下有 5 条轨迹,合计 10 条。
除非另有说明,token 预算对目标模型是全包含的,覆盖输入、输出和推理 token。大语言模型裁判的 token 不计入这些预算,也不计入扩展图中的 token 数,但我们会说明何时使用了裁判。每一次模型生成调用有 90 分钟超时。碰到该超时的轨迹都重新跑过,因此最终数据集里没有受此影响的轨迹。
网络安全基准在非常接近的先知反馈协议下运行:模型被告知是否成功完成任务,没有任何部分进度信号。
2.4 基准与评分
我们选择五个对当前前沿模型仍然困难、且领域和任务结构多样的基准(表 2)。三个是有状态基准,多轮工具使用期间环境状态要保持:TerminalBench 2.0(Merrill 等,2026)、SWE-Bench Pro(Deng 等,2025)和 FrontierMath(Glazer 等,2024)。两个是无状态的知识与推理基准:HealthBench(Hard)(Arora 等,2025),以及滤掉选择题之后的 Humanity’s Last Exam(HLE)(Phan 等,2025)。它们合在一起测量基于终端的任务执行、真实软件工程、专家级数学、临床推理和跨学科专家知识。我们另外复用两个网络安全基准的数据:Cyber CTFs(71 个夺旗任务)和 The Last Ones(一个长程网络靶场,用通向最终目标的 32 个里程碑计分)。这些数据不是在主实验的受控框架下收集的,因此只用于推理扩展曲线,不进入提交行为和反馈的分析。各基准的加载、评分、沙箱配置以及网络安全数据的收集协议见附录 A.1.1。
有状态基准配备 bash 和 python 工具;FrontierMath 的代码提交使用定制的 submit_answer 工具。无状态基准没有工具,通过通用的 submit 工具提交。评分方式:TerminalBench 用随任务打包的单元测试做程序化验证,SWE-Bench Pro 用随任务打包的测试工具,FrontierMath 在沙箱里对照每题参考实现执行代码,Cyber CTFs 以是否取得旗标计分,The Last Ones 以里程碑进度计分。HLE 和 HealthBench 由单独的大语言模型裁判评分(GPT-4o-mini,温度 0)。除 HealthBench 按每段对话的医师设计评分细则连续计分外,所有基准都使用二元分数。每个基准使用一组最多 100 个任务的规范任务集,在所有运行中确定性地固定。再加上扩大预算的协议,这种子采样意味着非网络安全基准上的绝对分数不能直接与已发表的基准结果比较。
2.5 通常预算参照点
为量化从通常发表预算到我们扩大预算的提升(表 3),我们为每个基准定义一个「什么算通常停止点」的参照。已发表评测用不同单位表达限制(输出 token、轮数上限或墙钟时间)。我们把它们换成近似的、每条轨迹总 token 预算,放在同一尺度上。HLE、HealthBench 和 FrontierMath 使用公开报告的 token 限制,分别为 6.4 万、1.6 万和 100 万总 token。TerminalBench 和 SWE-Bench Pro 不直接报告 token 预算。我们用自己的轨迹估计 token 等价停止点:测量在已发表的墙钟或轮数限制本应生效的那一点上,累计消耗了多少 token。这些换算值只用作描述性参照,用来在图 1A 中标出通常发表预算,并在表 3 中量化提升。完整来源、换算和估计见附录 A.1.2。
| 基准 | 领域 | 任务类型 | 评分 | 任务数 | token 上限 |
|---|---|---|---|---|---|
| TerminalBench | 软件工程 | 有状态 | 单元测试(二元) | 86 | 1000 万 |
| SWE-Bench Pro | 软件工程 | 有状态 | 单元测试(二元) | 100 | 3000 万 |
| FrontierMath | 数学 | 有状态 | 代码验证(二元) | 12 | 1000 万 |
| HealthBench | 医学 | 无状态问答 | 评分细则(连续) | 100 | 1000 万 |
| HLE | 专家知识 | 无状态问答 | 大语言模型评分(二元) | 100 | 500 万 |
| Cyber CTFs | 网络安全 | 有状态 | 取得旗标(二元) | 71 | 5000 万 |
| The Last Ones | 网络安全 | 有状态 | 32 个里程碑(连续) | 1 | 1 亿 |
表 2:基准特征与规格。token 上限指目标模型每条轨迹的总 token 预算(输入、输出和推理 token),不含大语言模型裁判的 token。
3 结果
结果围绕三条主要发现组织:
- 第 3.1 节,推理扩展曲线:随 token 预算增大而扩展的幅度很大,但在基准之间差异尖锐。我们刻画累计曲线在哪里进入平台。
- 第 3.2 节,机制分解:这些曲线上可见的跨代增益,主要来自更大的任务触及范围和可靠性,而不是更高的效率。我们用任务级分解来确立这一点。
- 第 3.3 节,反馈与迭代:这些增益并不来自任何单一干预。基准对「带反馈的反复提交」以及对「把固定算力预算做串行还是并行分配」的反应不同。
下文中,某个基准上的弱扩展应读成我们这一协议的性质。它不排除在不同脚手架、工具或算力分配下会有更大增益。
3.1 推理扩展幅度大,但随基准变化
为考察成绩如何随消耗的总 token 变化(不含大语言模型裁判 token),我们按下面的方式计算推理扩展曲线。对轨迹 i,记 s_i 为其最终计入的分数:二元基准上,若任一提交正确则为 1,否则为 0;HealthBench 取最高提交分。
在无反馈条件的一项次要分析中,若按第一次或最后一次提交给轨迹打分(这可能更接近真实使用),多数基准上的解开率会下降。下降在 HealthBench 上最强(模型先到达正确答案,随后退步),在 SWE-Bench Pro 上完全没有下降(模型收敛到正确答案并停在那里)。下面的串行与并行扩展结果在三种评分规则下都不变。此外,一个小规模试点表明,大语言模型的 best-of-n 选择器能在部分基准上补回这一差距的很大一部分。
记 κ_i 为轨迹 i 第一次达到 s_i 时的总 token 数。轨迹推理曲线 S_i(t) 在第一次达到 s_i 之前为 0,此后等于 s_i:
S_i(t) := s_i * 1(κ_i ≤ t) (1)
当 s_i = 0 时,S_i(t) ≡ 0。聚合推理曲线是指定轨迹集合上 S_i(t) 的平均:
S_agg(t) := N^(−1) * Σ_i S_i(t) (2)
图 1A 画出由此得到的推理扩展曲线,无反馈和先知分数反馈分开。本小节的定量摘要把两种反馈条件、以及各任务上的轨迹合在一起,刻画的是完整评测协议下的总体成绩,而不是某一种反馈设置。
#### 3.1.1 通常预算可能漏掉可观的额外增益
##### 软件工程基准在通常预算之外的余量很小
两个软件工程基准已经常常在相对大的预算上评测,再往上延,改进有限(表 3)。SWE-Bench Pro 通常评测到大约 1600 万总 token(相当于 250 轮)。把预算近乎加倍到我们的 3000 万上限,跨模型只增加 +0.3±0.3 个百分点。TerminalBench 通常评测到大约 730 万总 token(3.3 小时限制),延到 1000 万只增加 +1.3±1.0 个百分点。这一形态表明,对这些基准,通常发表的预算区间已经相当大,再延长只以可观的单次运行算力成本换来有限的额外成绩(SWE-Bench Pro 额外 1400 万 token,TerminalBench 额外 200 万)。这应解释为:这里测试的特定串行扩展干预反应有限,而不是证据表明推理算力的其他分配方式也必然只有这么小的增益。
##### FrontierMath 和 HLE 在通常预算之外有可观余量
相反,一些通常预算较小的基准,额外算力的效应更大。FrontierMath 常用预算是 100 万总 token(Burnham,2025),这本身已比更早的 10 万 token 脚手架(Glazer 等,2024)高一个数量级;从 100 万延到 1000 万,平均再增加 +11.7±11.0 个百分点。HLE 在其通常的 6.4 万输出 token 预算之外仍继续提高,直到我们的 500 万上限,增益为 +11.9±10.4 分。这一提升在先知反馈下更大(+15.5±12.3 分),在无反馈下较小(+8.3±7.5),与第 3.3.1 节报告的 HLE 上更强的提交反馈效应一致。
##### HealthBench 尽管通常预算很小,余量仍然很小
例外是 HealthBench。同样的比较下变化很小:从通常的 1.6 万输出 token 预算到我们大得多的 1000 万上限,只有 +0.3±0.4 分。在我们的脚手架和评分设置下,该基准对这里测试的串行推理扩展干预、在观察到的范围内敏感度有限。这不排除在不同脚手架、停止规则或宽度—深度分配下会有更大增益。
| 基准 | 通常发表预算 | 本次评测预算 | 条件 | 平均成绩增益 |
|---|---|---|---|---|
| TerminalBench | 93.2 万–730 万总 token | 1000 万总 token | 合并 | +1.26±0.99 个百分点 |
| TerminalBench | 同上 | 同上 | 先知反馈 | +1.20±0.54 个百分点 |
| TerminalBench | 同上 | 同上 | 无反馈 | +1.32±1.36 个百分点 |
| SWE-Bench Pro | 47.3 万–1600 万总 token | 3000 万总 token | 合并 | +0.27±0.31 个百分点 |
| SWE-Bench Pro | 同上 | 同上 | 先知反馈 | +0.27±0.30 个百分点 |
| SWE-Bench Pro | 同上 | 同上 | 无反馈 | +0.27±0.35 个百分点 |
| FrontierMath | 100 万总 token | 1000 万总 token | 合并 | +11.67±10.99 个百分点 |
| FrontierMath | 同上 | 同上 | 先知反馈 | +11.94±10.08 个百分点 |
| FrontierMath | 同上 | 同上 | 无反馈 | +11.39±12.80 个百分点 |
| HLE | 6.4 万总 token | 500 万总 token | 合并 | +11.87±10.40 个百分点 |
| HLE | 同上 | 同上 | 先知反馈 | +15.47±12.26 个百分点 |
| HLE | 同上 | 同上 | 无反馈 | +8.27±7.51 个百分点 |
| HealthBench | 1.6 万总 token | 1000 万总 token | 合并 | +0.32±0.42 分 |
| HealthBench | 同上 | 同上 | 先知反馈 | +0.54±0.51 分 |
| HealthBench | 同上 | 同上 | 无反馈 | +0.11±0.17 分 |
表 3:从各基准通常发表预算到本研究评测预算的成绩增益,分别给出合并轨迹、先知分数反馈轨迹和无反馈轨迹。增益跨模型平均。若发表预算是一个区间(TerminalBench、SWE-Bench Pro),我们同时报告下界和上界,增益从上界算起。数值以百分点计,HealthBench 使用该基准原生的分数尺度。
放在一起看,这些比较说明:有些通常发表预算已经捕获了我们协议下可见增益的大部分,另一些则留下大量尚未实现的成绩。
#### 3.1.2 是否出现平台,因基准而异
图 1A 的累计曲线表明,有些基准—模型—条件曲线在测试范围内开始进入平台,另一些在我们评测的最大预算上仍在提高。全文中,「收益递减」是描述性用语,指在对数 x 轴上、测试范围右端出现局部平台或剩余增长很弱。为概括这一形态,我们用上限处的局部改进率:
g_cap = (y(cap) − y(cap/2)) / log10(2) (3)
单位是:总 token 每增加 10 倍,提高多少个百分点。作为描述性约定,「剩余增长很弱」指 g_cap < 1,即每 10 倍增加不到 1 个百分点。在这一定义下,我们观察到三种宽泛形态(图 1B)。
##### TerminalBench 和网络安全基准在全部或多数被测模型上继续增长
三个基准在观察范围内对多数被测模型继续上升:TerminalBench(六个模型在 1000 万上限处都高于阈值)、Cyber CTFs(十个模型全部)和 The Last Ones(五个模型中的三个)。TerminalBench 和 Cyber CTFs 是最清楚的例子:测试范围看起来仍不足以揭示算力饱和后的成绩。在 The Last Ones 上,最老和最新的模型——Sonnet 4.5 和 Mythos Preview——在测试范围内进入平台,原因很可能相反:Sonnet 4.5 像是碰到了能力下限,而 Mythos Preview 在很高(但不是最大)的平均里程碑完成度上进入平台。
##### FrontierMath、HLE 和 SWE-Bench Pro 的平台证据是混合的
三个基准有混合的平台迹象,模型之间的形态不同。FrontierMath 的代际形态最清楚:两个最老的模型(Opus 4、GPT-5)更早进入平台,较晚的模型一般继续改进到更大预算。这一分裂在无反馈条件下稍弱(图 1B)。HLE 相对其通常预算,平台来得一致地晚:两种条件下都没有模型在通常的 6.4 万预算之前进入平台。无反馈时,六个模型中有五个在通常预算和测试上限之间进入平台,只有 Opus 4.6 在上限处仍在改进。先知分数反馈把 Opus 家族的平台位置往后推:Opus 4 和 Opus 4.6 仍超出测试范围,三个 GPT 家族模型和 Opus 4.5 则在通常预算之后、测试范围之内进入平台。SWE-Bench Pro 的形态最没有结构:GPT-5 和 GPT-5.2 是仅有的、在两种反馈条件下都高于阈值的 OpenAI 模型(不过目视检查表明,它们的曲线很可能在测试范围稍外就变平);Anthropic 的 Opus 4.5 只在无反馈下高于阈值,Opus 4.6 只在先知反馈下高于阈值(图 1A)。
##### HealthBench 在所有被测模型上接近收益递减
HealthBench 是唯一一个六个被测模型都在通常 token 预算(1.6 万总 token)之内进入平台的基准。这表明,在我们的脚手架和评分设置下,该基准在所测协议下接近收益递减,而且远在一个通常评测预算之内。
总体而言,即使在受控、共享的推理扩展协议下,额外推理时算力的收益递减也在基准之间差很多。这些推理扩展曲线是否在测试范围内进入平台,还取决于模型家族、模型代和反馈条件。附录 A.2.1 的额外曲线级摘要显示同一宽泛形态:较新的模型成绩更高,在更低的 token 预算上开始成功,并且——HealthBench 除外——在起点之后成绩上升更快。
3.2 代际增益主要来自触及范围和可靠性,而不是效率
上面的聚合曲线不能说明:较晚的代是解开了新任务,还是用更少 token 解开同一批任务,还是只是把已经能解的任务在重复轨迹上解得更一致。为分开这些可能,我们把任务级改进分解成三个成分:
- 触及范围(reach):模型可靠解开的任务比例。可靠解开指该任务在至少两条独立轨迹中的某一点被解开,从而排除侥幸的一次性成功。
- 效率(efficiency):解开已解锁任务需要多少输出 token。
- 可靠性(reliability):每个已解锁任务上,找到解的轨迹所占比例。
分析覆盖五个主基准加上 Cyber CTFs。The Last Ones 被排除,因为它只有一个长程任务。任务难度定义为该任务在各模型上解开率的中位数(越高越容易)。二元基准上,若至少一次提交得分为 1,则该轨迹解开任务。HealthBench 先把提交分按全局中位数 0.38 二分(这是全部轨迹所达到分数的中位数)。每个成分在每个基准上用回归量化:结果变量分别是触及范围的解锁指示(线性概率模型)、效率的对数「解开所用 token」,以及可靠性的解开率;预测变量是模型代、任务难度,以及二者的交互。完整模型规格见附录 A.3.1。
效率和可靠性只在给定模型解锁了的任务上评估,而不是在所有模型共享的同一任务集上。因此这些分析描述的是以触及范围为条件的表现:模型在自己至少能解一次的任务上如何表现。较新的模型常常解锁比较早模型更难的任务,而更难的任务可能需要更多 token,所以跨代的效率比较可能低估 token 效率的真实增益。为此,我们做了一项敏感性分析,限制在所有模型都解锁的平衡面板上,定性形态不变。这说明这种构成效应不是主结果的驱动因素(附录 A.3.3)。
图 2:代际增益的任务级分解。(A) 触及范围增加,较新的模型解锁更难的任务。每点一个任务。横轴:最早解锁该任务的模型的发布日期(5 次尝试中至少解开 2 次)。纵轴:每任务难度(1 减去任务 t 的跨模型中位解开率;越高越难)。前沿下方的阴影按难度着色,绿色为易,红色为难,表示截至每个发布日期已经解锁的任务难度空间。虚线阶梯跟踪随时间推进的、已解锁任务难度的运行最大值,也就是截至每个发布日期、任一模型解开过的最难任务。(B) 效率增益依赖基准。已解锁的(模型,任务)格子上,每次解开所用的输出 token 对模型发布日期。线条是混合效应回归在连续任务难度上拟合后的简单斜率预测(见附录 A.3.1),在基准内中位数分割处取值以便可视化(较易的一半为绿,较难的一半为红);因此它们不是对图中分箱中位数的直接拟合。阴影带为标准误。点是已解锁任务上「解开所用 token」的观察(模型,箱)中位数,误差线为第 25 与第 75 百分位。(C) 可靠性增益更普遍。每个基准一张热图,格内是该模型在已解锁任务上的平均解开率。行:基准内五个任务难度分位箱(最难在上,最易在下)。列:按发布顺序的模型。该模型在该难度箱没有已解锁任务的格子画成灰色。
| 基准 | 触及 β_gen | 触及 β_int | 效率 β_gen | 效率 β_int | 可靠 β_gen | 可靠 β_int |
|---|---|---|---|---|---|---|
| Cyber CTFs | +0.488*** | −0.760*** | −0.599*** | +0.766* | +0.218*** | −0.977*** |
| TerminalBench | +0.248*** | −0.383* | −0.174*** | −0.352 | +0.146*** | −0.435 |
| SWE-Bench Pro | +0.035** | −0.042 | −0.092** | −0.432 | +0.102*** | −0.138 |
| FrontierMath | +0.631*** | −0.779* | −0.165 | +1.323 | +0.605*** | −1.424** |
| HLE | +0.188*** | +0.000 | +0.030 | −0.358 | +0.223*** | −0.194 |
| HealthBench | +0.097* | +0.051 | −0.294*** | +0.203 | +0.009 | +0.199* |
表 4:任务级代际效应摘要。对每个成分,β_gen 是模型代的主效应,β_int 是它与任务难度的交互,按基准估计。完整规格见附录 A.3.1。触及范围系数来自「模型是否解锁任务」的线性概率模型,因此正的 β_gen 表示较晚的模型解锁更多任务。对效率,负的 β_gen 表示较晚的模型用更少输出 token 解开已解锁任务。对可靠性,正的 β_gen 表示较晚的模型在各轨迹上更一致地解开已解锁任务。更高的难度值表示更容易的任务,因此触及范围和可靠性分析中负的 β_int 表示增益集中在更难的任务上。\* p<0.05,\\ p<0.01,\\\* p<0.001。
#### 3.2.1 触及范围随模型代增加,且常常在更难的任务上更明显
每个基准上,较晚的模型代解锁更大比例的任务。六个基准上,模型代对解锁概率都有正的、显著的主效应(表 4),FrontierMath 和 Cyber CTFs 上效应最大。在任务级,较新模型最先解锁的任务也倾向于更难(图 2A)。代与难度的交互为负——表示触及范围的增益集中在更难的任务上——六个基准中有四个如此,并且在 Cyber CTFs、FrontierMath 和 TerminalBench 上显著。HealthBench 和 HLE 是例外,没有这种集中。
#### 3.2.2 效率增益在基准间不均,并且以触及范围为条件
较新的模型在六个基准中的四个上,用更少输出 token 解开已解锁任务。模型代的主效应为负且显著,Cyber CTFs 和 HealthBench 上最大,TerminalBench 和 SWE-Bench Pro 上较小但仍然显著(表 4;图 2B)。FrontierMath 和 HLE 的效率没有显著的代效应。合在一起,这些结果表明 token 效率的改进存在,但在基准间不均。
因为效率是在已解锁的(模型,任务)格子上估计的,它应解释为以触及范围为条件,而不是在固定的共同任务集上。只在所有模型都解锁的任务上重新拟合,Cyber CTFs、TerminalBench、SWE-Bench Pro 和 HealthBench 上的代效应相似,但代与难度的交互更不稳定(附录 A.3.1)。因此,代际改进更一致地扩大了可解任务集合,而不是更一致地降低已经在触及范围内的任务的 token 成本。
#### 3.2.3 可靠性增益更普遍
可靠性比效率改进得更一致。除 HealthBench 外,所有基准上较新的模型都更经常在重复轨迹中解开已解锁任务(表 4;图 2C)。在 Cyber CTFs、FrontierMath 和 TerminalBench 上,这些增益更强地集中在更难的任务上。HLE 的增益在难度上更均匀。SWE-Bench Pro 有一个同方向的弱负交互,但没有清楚的、按难度集中的形态。HealthBench 是主要例外,没有清楚的总体可靠性增益。模型代与任务难度的显著交互表明,可靠性随代发生的那一点变化,发生在较易而不是较难的任务上。
总之,这些结果说明较新的代不仅提高触及范围,也提高可达任务上的可靠性。这些增益是否集中在更难的任务上,取决于基准。
3.3 协议选择塑造推理扩展的增益
上面的结果表明,推理扩展的增益随基准变化,并且主要由更大的触及范围和可靠性驱动。因此我们考察本设置中可能塑造这些增益的两个协议维度:不同反馈条件下的反复提交(第 3.3.1 节),以及固定总预算是集中在一条深轨迹里,还是摊到几条较浅的轨迹上(第 3.3.2 节)。
图 3:无反馈与先知分数反馈下的串行扩展。(A) 累计解开率对提交序号 k,在每个基准—条件格子内对模型等权合并。色带:跨模型 ±1 标准误。灰色虚线:无反馈;海军蓝实线:先知分数反馈。(B) 迭代提升 Δ 对模型发布日期。点是模型;线是按条件的 Theil–Sen 拟合(附录 A.4.2)。每个小图顶部标注发布日期与 Δ 的 Kendall τ(灰色:无反馈;海军蓝:先知分数反馈)。
#### 3.3.1 当反馈能让搜索继续时,反复提交帮助最大
在更长程的任务上,额外串行推理算力的回报,可能取决于模型是否被允许在轨迹内重新提交答案,以及提交后收到什么反馈。为检验这一点,我们比较方法中定义的两种条件:无反馈(含糊确认)和先知分数反馈(简单的对错信号)。两个网络安全基准被排除,因为它们只在一种反馈条件下收集。为了跨基准可比,这些分析使用二元轨迹结果。HealthBench 原生是连续评分,我们取每条轨迹内得分最高的提交,再用中位数分割二元化(中位数分数 = 0.38)。
##### 反复提交在所有基准上提高成绩
允许反复提交,提高了全部五个被评测基准上的累计成绩(图 3A;表 5)。对条件取平均,从第一次提交到所达到的最高累计水平,累计成绩在 FrontierMath 上上升 +6.4 分,TerminalBench 上 +10.4,HealthBench 上 +14.2,SWE-Bench Pro 上 +14.4,HLE 上 +17.3。对应的提升倍数从 FrontierMath 的 1.11 倍到 HLE 的 1.71 倍。
| 基准 | 迭代增益 | 总提升倍数 | 无反馈倍数 | 先知反馈倍数 | 无反馈 k_90 | 先知反馈 k_90 |
|---|---|---|---|---|---|---|
| FrontierMath | +6.39% | 1.11× | 1.10× | 1.13× | 3 | 3 |
| HLE | +17.29% | 1.71× | 1.39× | 2.03× | 12 | 13 |
| HealthBench | +14.17% | 1.40× | 1.35× | 1.45× | 3 | 3 |
| SWE-Bench Pro | +14.36% | 1.27× | 1.24× | 1.30× | 4 | 3 |
| TerminalBench | +10.42% | 1.19× | 1.15× | 1.23× | 14 | 5 |
表 5:反复提交增益的描述性摘要。迭代增益是累计成绩从第一次提交到观察到的最高累计水平的增加,以百分点计。提升倍数分别给出总体、无反馈和先知分数反馈。k_90 是实现该增益 90% 所需的提交次数。
##### 先知反馈在它能支持继续搜索的地方,最能增加迭代增益
在任务内比较无反馈与先知反馈轨迹的回归分析(附录 A.4.3)表明,先知反馈显著提高 HLE 上的最终成功:迭代在先知反馈下增加 +25.2 分,在无反馈下增加 +9.3 分(2.71 倍)。先知反馈也显著提高 SWE-Bench Pro 上的最终成功,但描述性提升较小(+16.0 对 +12.7;1.26 倍)。相比之下,FrontierMath、TerminalBench 和 HealthBench 没有显著的、基准级的先知反馈成功效应,尽管先知反馈下有不大的描述性提升:FrontierMath 为 +7.5 对 +5.3(1.42 倍),TerminalBench 为 +12.4 对 +8.4(1.48 倍),HealthBench 为 +15.7 对 +12.7(1.24 倍)。在 HealthBench 上,这一反复提交增益与第 3.1 节报告的、随消耗总 token 的弱推理扩展并存。这说明在我们的协议下,即使更长的 token 轨迹没有帮助,迭代改进仍然可能有帮助。
##### 有些基准只从少数额外尝试中受益,另一些则支持更长的串行搜索
这些增益的形状因基准而异。FrontierMath 和 HealthBench 在两种条件下都在三次提交内实现总迭代增益的 90%,SWE-Bench Pro 在三到四次内实现。这表明反复提交有用,但在这些设置里比较浅。与此一致,这些基准上多数未解开的轨迹,是在模型开始重复语义相近的答案之后结束,而不是耗尽 token 预算(这三个基准上,未解开轨迹的 92%–100%;表 6)。这表明模型通常在少量不同尝试之后就收敛,而不是维持长时间的生产性搜索。相反,HLE 继续改进到 12–13 次提交,表明搜索过程更长,主要由许多短的答题尝试组成。TerminalBench 也从更长的搜索中受益,并且对反馈的依赖最强:先知反馈下到第 5 次提交就达到总迭代增益的 90%,无反馈下最多需要 14 次提交。这与它高得多的预算耗尽率相符(无反馈下 34%,先知反馈下非正确轨迹的 39%;表 6),与更长、交互更重的尝试一致:正确性反馈帮助模型更早决定何时停止、修改或更换做法。与这一解释一致的是,在最终成功的轨迹中,先知反馈并不可靠地减少到达第一次正确答案的提交次数;在 HLE 和 SWE-Bench Pro 上,成功的先知反馈轨迹平均使用略多的提交(附录 A.4.3)。这说明反馈可以促成有生产性的继续搜索,而不只是加快收敛。
| 基准 | 条件 | 正确 | 重复答案 | token 预算耗尽 |
|---|---|---|---|---|
| FrontierMath | 无反馈 | — | 94.2% | 5.8% |
| FrontierMath | 先知反馈 | 64.7% | 30.3% | 5.0% |
| HealthBench | 无反馈 | — | 100.0% | 0.0% |
| HealthBench | 先知反馈 | —\* | 99.5% | 0.5% |
| HLE | 无反馈 | — | 98.1% | 1.9% |
| HLE | 先知反馈 | 49.5% | 46.2% | 4.2% |
| SWE-Bench Pro | 无反馈 | — | 92.1% | 7.9% |
| SWE-Bench Pro | 先知反馈 | 68.7% | 31.0% | 0.3% |
| TerminalBench | 无反馈 | — | 65.5% | 34.5% |
| TerminalBench | 先知反馈 | 65.8% | 21.0% | 13.2% |
表 6:按基准和反馈条件的轨迹终止结果。百分比是每个(基准,条件)格子内的轨迹占比。在先知分数反馈下,正确轨迹在第一次完全正确的提交处立即终止,因此「重复相近答案」和「预算耗尽」的对比,在同一反馈条件内部、而不是跨反馈条件,才最可比。\* 在先知反馈下,HealthBench 只有连续分数达到完美的 1.0 才把轨迹计为「正确」,本次评测中从未发生。
##### 自我引导的迭代对较新模型往往没那么重要
我们还问:反复提交的价值是否随模型代变化。对每个(基准,模型,条件)格子,迭代提升定义为累计成功从第一次提交到此后达到的最高水平的增加,并用 Kendall 秩相关把它和模型发布日期联系起来(τ;图 3B;附录表 11)。这些相关只是描述性的,因为每个(基准,条件)格子只有六个模型。在这一保留下,宽泛形态是:较新的模型在 HLE 和 TerminalBench 上倾向于觉得反复提交帮助更小,与较新模型在第一次提交就解开更多任务、留下的改进空间更小相一致。在 HealthBench 上,较新模型似乎受益稍多(两种条件下 τ 都为正)。SWE-Bench Pro 基本上没有代际效应(两种条件下 τ = +0.07)。FrontierMath 可以说也没有:两种反馈条件指向相反,而且估计只基于 12 个任务。
图 4:并行扩展:宽度对深度,以及跨代提升。(A) 每个基准,横轴是总 token 预算 B(对数尺度);纵轴是总预算 B 下的 pass@k。pass@k 指 k 次尝试中至少成功一次的比例。预算被分成 k 条轨迹,每条 B/k 个 token。线表示 k = 1(浅灰)、2、5 和 10(海军蓝)。色带:跨模型 ±1 标准误。(B) 每个基准,横轴是模型发布日期;纵轴是 Δ_parallel = pass@10(B\) − pass@1(B\)。每个模型一个标记。线是 Theil–Sen 趋势拟合(附录 A.5.1);插图给出 Kendall τ。
#### 3.3.2 固定总算力的串行分配与并行分配
到目前为止的干预,都是把更多算力分给单条轨迹,也就是串行扩展。同样的总算力也可以拆到多条独立轨迹上。这对评测重要,因为固定预算的单轨迹协议可能低估能力:要么让单次运行深度不够,要么没有捕获独立重开带来的增益。我们在固定总预算 B 上比较 pass@k,把 B 拆到 k ∈ {1, 2, 5, 10} 条独立轨迹上。精确估计量、合并细节,以及我们为什么选 pass@k 而不是基于共识的聚合,见附录 A.5.1。
| 基准 | pass@1 | pass@10 | Δ_parallel | τ_gen |
|---|---|---|---|---|
| FrontierMath | 0.625 | 0.653 | +0.028 | −0.60 |
| HLE | 0.417 | 0.606 | +0.189 | −0.47 |
| HealthBench | 0.501 | 0.784 | +0.283 | −0.47 |
| SWE-Bench Pro | 0.673 | 0.701 | +0.028 | −0.33 |
| TerminalBench | 0.657 | 0.720 | +0.063 | −0.73 |
表 7:在各基准 token 上限处的并行采样增益。pass@1 和 pass@10 跨模型平均。Δ_parallel 是该基准 token 上限处 pass@10 减去 pass@1。τ_gen 是每个模型的 Δ_parallel 与发布日期的 Kendall 秩相关。
##### 基准从并行扩展中受益的程度不同
在每个基准的 token 上限处,把总 token 预算从一条深轨迹分到十条较浅轨迹,五个基准的平均成绩都提高,但幅度不同:FrontierMath 从 0.625 到 0.653(Δ_parallel = +0.028),HLE 从 0.417 到 0.606(+0.189),HealthBench 从 0.501 到 0.784(+0.283),SWE-Bench Pro 从 0.673 到 0.701(+0.028),TerminalBench 从 0.657 到 0.720(+0.063)(表 7;图 4A)。因此并行采样对 HLE 和 HealthBench 相当重要,对 FrontierMath、TerminalBench 和 SWE-Bench Pro 则小得多。我们另行验证:大语言模型评分基准(HLE 和 HealthBench)上较大的增益,不是由裁判不可靠驱动的(附录 A.5.2)。
##### 并行采样的收益取决于预算
为判断宽度何时变得比深度更可取,我们看总预算 B 在何处使 pass@10 超过 pass@1(图 4A)。这一交叉在 HealthBench 上很早发生(大约从 2.3 万总 token 起),在 HLE 上大约从 21.9 万起,但在 FrontierMath(900 万–1000 万)、TerminalBench(500 万–1000 万)和 SWE-Bench Pro(2300 万–3000 万)上只在接近上限时发生。这些形态表明:只有每条分支都得到足够算力、能在该轨迹内取得进展时,并行采样才有帮助;而且各基准在「额外宽度变得有用之前,每次独立尝试需要多深」上差别很大。
##### 较新的模型通常从并行采样中受益更少
五个基准上,并行采样的增益都随模型发布日期下降(表 7;图 4B):TerminalBench(τ = −0.73),FrontierMath(−0.60),HealthBench(−0.47),HLE(−0.47),最弱的是 SWE-Bench Pro(τ = −0.33)。对最新的模型,并行采样有时完全没有帮助:在 FrontierMath 上,GPT-5.2、Opus 4.6 和 GPT-5.4 在上限处的 pass@10 都低于 pass@1;Opus 4.6 在 TerminalBench 上同样如此。因此较新的模型往往从单条长轨迹中提取更多价值,独立重开的边际收益下降。
4 讨论
4.1 摘要
在七个有难度的基准上,前沿模型的成绩随额外推理时算力提高。然而这些增益的大小和形状在不同设置间差别很大。在我们的协议下,通常发表预算在 FrontierMath、HLE 和网络安全评测上留下有意义的额外成绩没有实现,但在 HealthBench 和两个软件工程基准上增益小得多。更大预算上的跨代改进主要来自更大的触及范围和可靠性,而不是持续更好的 token 效率。测得的成绩也对协议选择敏感:反复提交提高主套件全部五个基准的成绩;先知反馈在它促成继续搜索的地方帮助最大;并行采样的价值强烈取决于任务结构和预算区间。合在一起,这些结果说明基准分数不仅反映被评测的模型,也反映用来引出其成绩的推理时预算和协议。
4.2 解释
一个中心问题是:为什么对这里测试的推理扩展干预的反应,在基准之间差这么多。这些差别应解释为我们协议下观察到的聚合成绩曲线的性质,而不是任何基准在本质上已经算力饱和的证据。表面上的变平,仍可能在更大预算、其他脚手架或不同的推理时算力分配下藏着余量;基准级曲线也可能掩盖任务之间的大量异质性。
一种说得通的解释是:关键区别不只是领域,而是基准是否给模型机会,通过延长的搜索、修改、工具使用或自我验证,去有生产性地使用额外算力(Brown 等,2024;Snell 等,2024;Balachandran 等,2025)。这一看法与我们观察到的情况一致:FrontierMath 和网络安全任务上扩展更强,TerminalBench 上增益较温和但还在继续,SWE-Bench Pro 上增益更小,HealthBench 在我们的脚手架下扩展很弱。HLE 看起来居中:虽然无状态,它仍从反复提交中受益不少,尤其是在有正确性反馈时。更广地看,这一视角可能有助于解释,为什么近期工作在有些设置里发现强推理扩展(Folkerts 等,2026;Muennighoff 等,2025;Wu 等,2024;Ma 等,2025;Epoch AI 与 METR,2026),在另一些设置里发现弱扩展或没有扩展(Gema 等,2025;Jurkovic,2026;Merrill 等,2026)。
我们的跨代结果说明,近期的模型进步提高了在允许这样做的任务上、有生产性地使用推理时算力的能力。较晚的模型通常在大预算上成绩更高,并且常常在 token 配额中更早开始成功,但这些增益主要来自触及范围和可靠性的增加,而不是 token 效率的大幅改进。这一形态与近期的时间期限分析一致:前沿模型的进步主要归因于更高的可靠性,以及处理更长或更难任务的能力(Kwa 等,2025;METR,2026)。它也意味着,固定预算评测所捕获的内容可能越来越不均衡,在那些受益于延长搜索、验证或反复尝试的任务上,最容易低估进步。
提交协议和并行采样的结果强化同一条更广的结论。反复提交提高了全部五个主基准的成绩;先知反馈在支持继续搜索的地方帮助最大;当任务允许多个可行的独立尝试时,并行采样帮助最大。这与先前关于宽度—深度权衡、外部验证,以及大语言模型评测与引出中的反复搜索的工作大体一致(Brown 等,2024;Snell 等,2024;Huang 等,2024;Stechly 等,2025;Balachandran 等,2025)。更一般地说,推理时算力、反馈条件、提交规则和宽度—深度分配,应被当作测量定义的一部分,而不是附带的实现细节。
4.3 建议
##### 在一段推理时算力区间上报告能力,而不是只在单一预算上报告
单一固定预算分数,既可能相当好地逼近高预算成绩,也可能漏掉可观的额外增益,这取决于基准。把成绩报告为推理时算力的函数,有助于区分接近饱和的评测和被预算截断的下界,并说清额外算力何时仍在买到可测量的成绩。当评测用来刻画资源充足的行动者能做到什么、而不只是限制性默认设置下能够触及什么时,这一点尤其重要(Cerruti,2026)。在可能的地方,评测者还应区分增益来自解开新任务、更可靠地解开同一批任务,还是用更少算力解开已经可达的任务,因为聚合扩展曲线会掩盖这些差别。
##### 把协议选择当作评测设计的一部分,并清楚记录
在本研究中,反复提交、提交后的反馈,以及把算力分配到串行深度或并行宽度,都在至少某些基准上有意义地改变了测得成绩。因此这些选择应明确报告,并相对于评测目标、部署设置,或评测想要刻画的行动者情景加以说明。先知正确性反馈在外部验证器已经存在的地方生态效度最高,例如代码执行、形式证明或有根据的工具输出;对开放式的专家推理任务则没那么高。同样,有些基准从并行采样中受益比其他基准大得多,这意味着同样的总算力,因分配方式不同,可以引出有意义地不同的成绩水平。
##### 做趋势跟踪时,在一大段共享算力区间内、于对齐的预算上比较模型
较新的模型往往只在更大预算上达到更高成绩,而且它们使用额外推理时算力的方式并不总是与更早的代相同。在我们的任务级分析中,代际增益主要来自更大的触及范围和可靠性,而不是持续改进的 token 效率。用于趋势跟踪、长程成绩估计或安全阈值的评测,因此应在同一协议、同一宽算力区间上比较模型,或明确计入这些选择上的差别。否则,随着模型改进,固定预算比较可能越来越有误导性,尤其是在成绩强烈依赖于延长搜索、验证或反复尝试的任务上。
4.4 限制
第一,我们只研究一种 ReAct 风格的脚手架。定制脚手架和引出努力可以在同一基准、同一模型上大幅移动测得能力(METR,2024;UK AI Security Institute,2024b;Jurkovic,2026;Sun 等,2025)。因此我们观察到的某些基准差异可能依赖脚手架,而不是任务固有的。HealthBench 上的弱扩展尤其可能反映知识上界、裁判饱和、脚手架不匹配,或这些因素的某种组合(Ravichandran 等,2025)。
第二,我们的协议故意简单:更大的 token 预算、上下文压缩和迭代重新提交的一般组合,而不是更精细的策略,例如自适应分支、由验证器引导的搜索,或轨迹之内与轨迹之间的串行—并行混合分配。这类方法可能实质改变绝对成绩,而且在不同领域可能不同。因此我们的结果应解释为:广泛可复现的推理扩展所能达到的保守下界,而不是更优化的引出下的上界。
第三,FrontierMath 在我们的子集里只有 12 个任务,降低了任务级分析的检验力,也使基准级形态对单个题目敏感;较新的模型还可能与公开集合有训练重叠(Burnham,2025)。
第四,重复守卫依赖一个大语言模型裁判。它检测语义等价的可靠性可能随基准变化,使守卫的有效严格程度在领域之间不均匀。
Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec,How Inference Compute Shapes Frontier LLM Evaluation,2026-07-16,https://arxiv.org/abs/2606.17930,CC BY 4.0
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。