OpenQA

Industry & PracticeResearch & Benchmarks

生产环境中的高效基准评测:一项关于持续演进的大语言模型智能体的研究

智测团队 · OpenQA(openqa.cn)24 min read

生产环境中的大语言模型智能体在持续演进中会被反复评测,但完整的智能体基准每次重跑代价很高。我们研究一种服务于每月数万活跃用户的生产分析智能体的高效重复评测,并报告一手部署经验。我们使用该生产基准的 574 次历史运行,按时间顺序划分为标定期

In this piece

生产环境中的高效基准评测:一项关于持续演进的大语言模型智能体的研究

翻译说明:本文是 arXiv 论文 Efficient Benchmarking in Production: A Study of an Evolving LLM Agent(arXiv:2609.21267)的中文全译,由智测团队翻译。原作者:Yining She、Lei Lin。原文以 CC BY 4.0 许可发布。译文保留原文全部章节、数据与结论;参考文献列表从略。

arXiv:2609.21267v1 [cs.AI],2026 年 9 月 18 日。

Yining She(注:工作完成于其在 Meta 任职期间。单位:卡内基梅隆大学。邮箱:yiningsh@andrew.cmu.edu)

Lei Lin(单位:Meta。邮箱:llin22@meta.com)

摘要

生产环境中的大语言模型智能体在持续演进中会被反复评测,但完整的智能体基准每次重跑代价很高。我们研究一种服务于每月数万活跃用户的生产分析智能体的高效重复评测,并报告一手部署经验。我们使用该生产基准的 574 次历史运行,按时间顺序划分为标定期与留出期,比较随机抽样、历史缓存、固定代表性子集,以及基于项目反应理论(IRT)的自适应测试。结果表明,多维双参数逻辑斯蒂(2PL)自适应测试的总体分数保真度最好:执行 200 道题目,即完整运行的 38.5%,通过率的平均绝对误差(MAE)为 1.03 个百分点。尽管如此,我们出于操作上的简便,实际部署的是按难度分层的固定子集,并表明这些子集无需重新标定即可迁移到另外五个智能体家族,且在短至一天的标定窗口上仍保持稳定。基于这一部署经验,我们给出面向重复生产智能体评测的实践建议。

1 引言

图 1:本研究概览。(a)某生产分析智能体的历史评测运行,按时间划分为标定运行与留出测试运行。(b)所比较的四种部分评测方法:每种方法执行一个子集 \(S\subseteq\mathcal{Q}\),并报告对完整运行通过率 \(s\) 的估计 \(\hat{s}\)。(c)在 287 次留出运行上的测试:相对完整运行的通过率 MAE(越低越好),以及 Spearman 与 Kendall 秩相关(越高越好)。

生产环境中的大语言模型智能体,随着其模型、提示词、工具以及外围系统的演进,需要反复评测。每一道基准题目都可能涉及多步轨迹,其中包括反复的模型调用、工具使用、有状态交互,以及针对任务的评分;随机性还可能要求重复试验(Kapoor 等,2026;Yao 等,2024;Jimenez 等,2024)。我们的工作源于这一挑战:所开发的是一个已部署的分析智能体,服务于每月数万活跃用户。其开发与监控会产生数以万计的评测运行。基准评测是这一工作量的主要组成部分。一套核心的 519 题基准,每次运行大约需要三小时。因此,对持续开发而言,在成本与时间上都高效的测量十分重要。

已有工作通过子集选择、分数重构与自适应测试来降低大语言模型评测成本(Vivek 等,2024;Polo 等,2024;Perlitz 等,2024;Kipnis 等,2025;Yuan 等,2025;Truong 等,2025)。这些方法主要是在公开基准上、针对不同模型的作答来标定的。对于持续演进的生产智能体的重复评测,已有了解较少;在这种设定下,更早运行中按时间排列的结果,可以用来指导后续评测。

因此我们要问:在智能体持续开发的全过程中,部分评测能在多大程度上忠实地替代完整基准。我们沿两条轴来看:分数保真度,即所执行题目数量与完整基准分数估计误差之间的权衡;以及排序保真度,即各方法在多大程度上保留评测运行之间的排序。

我们将随机抽样与三种对历史评测数据的用法进行比较:缓存复用稳定的结果,固定子集执行有代表性的题目,自适应测试则根据当前运行中的作答选择下一题(Polo 等,2024;Truong 等,2025)。我们使用生产智能体的真实历史数据:在 52 天内收集的 574 次基准运行,划分为 287 次标定运行与 287 次留出测试运行(图 1)。

我们的结果表明,部分评测可以用少得多的执行次数,紧密恢复完整基准上的表现。多维 2PL 自适应测试提供了最强的分数保真度:执行 519 题中的 200 题(完整运行的 38.5%),通过率 MAE 为 1.03 个百分点(pp)。部分评测也能保留排序:在 300 题时,最好的自适应配置与完整基准排序的 Spearman 相关达到 0.992。按难度分层的固定子集给出了最强的非自适应结果;我们因其操作简便而予以部署。我们还通过跨智能体迁移与标定窗口敏感性,进一步验证了这一选择。

我们的贡献如下:

  1. 我们使用 574 次历史基准运行以及按时间留出的协议,研究持续演进的生产智能体的重复评测。
  2. 我们比较随机抽样、历史缓存、固定子集与自适应测试在分数保真度与排序保真度上的权衡。
  3. 我们分析方法设计上的选择,并通过向五个智能体家族的迁移以及对标定历史的敏感性,验证按难度分层的固定子集。
  4. 我们从这些结果以及生产评测流程中的部署经验,得出实践建议。

2 问题设定

2.1 生产智能体的重复评测

随着生产智能体的模型、提示词、工具与外围系统发生变化,开发者需要在人工整理的基准上反复评测其配置。每道题目得到二元的通过/失败裁决,再汇总为运行级通过率,用于比较不同配置。

设完整基准包含 \(N\) 道题目,\(\mathcal{Q}=\{q_{1},\ldots,q_{N}\}\)。对评测运行 \(r\),令 \(y_{ri}\in\{0,1\}\) 表示题目 \(q_{i}\) 上的裁决,其中 1 表示通过。题目级裁决的完整向量为

\[ \mathbf{y}_{r}=(y_{r1},\ldots,y_{rN}), \tag{1} \]

完整评测的通过率为

\[ s_{r}=\frac{1}{N}\sum_{i=1}^{N}y_{ri}. \tag{2} \]

我们将 \(s_{r}\) 视为高效评测应当恢复的参考分数。

2.2 部分评测

为降低计算成本与时延,高效评测方法 \(m\) 执行一个子集 \(S_{r}^{(m)}\subseteq\mathcal{Q}\),并将完整通过率估计为 \(\hat{s}_{r}^{(m)}\)。令 \(\mathcal{H}_{r}\) 表示来自更早运行、可用的题目级裁决。估计器为

\[ \hat{s}_{r}^{(m)}=f_{m}\!\left(\{y_{ri}:q_{i}\in S_{r}^{(m)}\},\mathcal{H}_{r}\right), \tag{3} \]

其中 \(f_{m}\) 可以使用当前运行的裁决以及历史。不同方法可以选择不同题目,并以不同方式计算其所报告的通过率。第 3 节给出每种方法的选择规则与估计器。

我们用所执行基准题目的比例来衡量效率:

\[ \operatorname{ExecutionFraction}_{r}^{(m)}=|S_{r}^{(m)}|~/~{N}. \tag{4} \]

2.3 评测目标

第一个目标是分数保真度:高效评测所报告的通过率应接近完整评测。对评测运行集合 \(\mathcal{R}\),我们用下式汇总分数误差:

\[ \operatorname{MAE}^{(m)}=\frac{1}{|\mathcal{R}|}\sum_{r\in\mathcal{R}}\left|\hat{s}_{r}^{(m)}-s_{r}\right|. \tag{5} \]

第二个目标是排序保真度。开发者用运行排序来比较候选改动并排查回归,因此部分评测应当保留完整评测的顺序。我们用 Spearman 相关与 Kendall 的 Tau,衡量 \(\{\hat{s}_{r}^{(m)}\}_{r\in\mathcal{R}}\) 与 \(\{s_{r}\}_{r\in\mathcal{R}}\) 之间的一致性。

3 方法

我们比较随机抽样、历史缓存、固定子集与自适应测试。每种方法都定义一个被执行的集合 \(S_{r}^{(m)}\),以及完整通过率的一个估计器。

3.1 随机抽样

随机抽样无放回地均匀抽取 \(k\) 道题目,并报告其未加权通过率:

\[ \hat{s}_{r}^{\mathrm{rand}}=\frac{1}{k}\sum_{q_{i}\in S_{r}^{\mathrm{rand}}}y_{ri}. \tag{6} \]

3.2 历史结果缓存

在近期运行中始终通过或始终失败的题目,在智能体做了适度更新之后,其结果发生变化的可能性更低。历史缓存利用这种稳定性:对选定题目复用其期望裁决,而不再执行它们。根据可用历史 \(\mathcal{H}_{r}\),我们选取一个回看窗口 \(\mathcal{W}_{r}\),并计算每道题目 \(q_{i}\) 的历史通过率:

\[ \bar{y}_{ri}=\frac{1}{|\mathcal{W}_{r}|}\sum_{u\in\mathcal{W}_{r}}y_{ui}. \tag{7} \]

当满足下式时,题目具备缓存资格:

\[ \min(\bar{y}_{ri},1-\bar{y}_{ri})\leq\epsilon, \tag{8} \]

其中 \(\epsilon\in[0,0.5]\) 控制所要求的稳定性。具备资格的题目取其近期多数裁决 \(\tilde{y}_{ri}=\mathbf{1}[\bar{y}_{ri}\geq 0.5]\),其余题目则予以执行。若 \(K_{r}\) 为被缓存的集合,则该方法执行 \(S_{r}=\mathcal{Q}\setminus K_{r}\),并报告

\[ \hat{s}_{r}^{\mathrm{cache}}=\frac{1}{N}\left(\sum_{q_{i}\in S_{r}}y_{ri}+\sum_{q_{i}\in K_{r}}\tilde{y}_{ri}\right). \tag{9} \]

3.3 固定子集评测

受 Polo 等(2024)启发,固定子集评测利用历史结果选出一个有代表性的集合,并在后续运行中重复使用。我们比较三种选择策略与两种分数估计器,以便把子集构造与分数重构分开。

#### 3.3.1 IRT 模型

若干选择器与估计器使用拟合于历史作答矩阵的项目反应理论(IRT)模型。多维双参数逻辑斯蒂(2PL)模型为每次运行赋予能力向量 \(\boldsymbol{\theta}_{r}\),为每道题目赋予区分度向量 \(\boldsymbol{\alpha}_{i}\) 以及标量难度 \(\beta_{i}\)。该模型将通过概率预测为

\[ p_{ri}=\Pr(y_{ri}=1\mid\boldsymbol{\theta}_{r},\boldsymbol{\alpha}_{i},\beta_{i})=\sigma(\boldsymbol{\alpha}_{i}^{\top}\boldsymbol{\theta}_{r}-\beta_{i}), \tag{10} \]

其中 \(\sigma\) 为逻辑斯蒂 sigmoid。我们根据历史裁决,以带高斯先验的最大后验估计来估计参数。Rasch 模型,即单参数逻辑斯蒂(1PL)模型,是 \(\alpha_{i}=1\) 时的单维特例:

\[ p_{ri}=\sigma(\theta_{r}-\beta_{i}). \tag{11} \]

#### 3.3.2 子集选择

我们把难度分层作为一种直接、可解释的构造:它在估计难度的整个范围内选取题目。作为对照,我们还评测历史作答聚类与 IRT 特征聚类,改编自 Polo 等(2024)的两种聚类选择器。

难度分层。

我们在标定运行上拟合 Rasch 模型(式 11),按难度 \(\beta_{i}\) 对题目排序,并将其划分为 \(k\) 个大致相等的层。从每一层中,我们选取最接近该层难度中位数的题目,并按其占基准的比例赋予权重。

历史作答聚类。

我们用一个向量表示每道题目,记录其在各次历史运行中的通过/失败结果,并做 \(k\) 个簇的 K 均值聚类。选取最接近每个簇质心的题目,其权重为该簇中基准题目所占的比例。

IRT 特征聚类。

我们改为用拟合得到的 2PL 题目参数 \([\boldsymbol{\alpha}_{i};\beta_{i}]\) 表示每道题目,并采用同样的 K 均值选择与加权。

#### 3.3.3 分数估计

沿用 Polo 等(2024),我们对每种选择器评测两种分数估计器。加权子集估计器只使用被选中的题目,而广义 p-IRT 估计器(gp-IRT)则用拟合好的 IRT 模型重构未被观测的题目。

加权子集估计器。

该估计器把每道被选中的题目视为其所在组的代表。对固定子集 \(S\),令 \(w_{i}\) 为题目 \(q_{i}\) 的簇权重或层权重,且 \(\sum_{q_{i}\in S}w_{i}=1\)。加权估计为

\[ \hat{s}_{r}^{\mathrm{weighted}}=\sum_{q_{i}\in S}w_{i}y_{ri}. \tag{12} \]

广义 p-IRT 估计器。

gp-IRT 估计器把加权子集估计与基于 IRT 的整套基准重构结合起来,在抽样变异与已拟合 IRT 模型的误差之间取得平衡。基于 IRT 的重构称为 p-IRT。它首先根据当前运行在 \(S\) 上的作答估计其能力 \(\hat{\boldsymbol{\theta}}_{r}\),并保持已拟合的题目参数不变,然后把每个未被观测的裁决替换为其预测通过概率:

\[ \hat{s}_{r}^{\mathrm{pIRT}}=\frac{1}{N}\left(\sum_{q_{i}\in S}y_{ri}+\sum_{q_{i}\notin S}p_{i}(\hat{\boldsymbol{\theta}}_{r})\right). \tag{13} \]

在我们的实验中,难度分层在选择与重构时使用 Rasch 参数,而各聚类变体使用拟合好的多维 2PL 模型。

gp-IRT 估计器将加权估计与 p-IRT 估计混合:

\[ \hat{s}_{r}^{\mathrm{gpIRT}}=\lambda\hat{s}_{r}^{\mathrm{weighted}}+(1-\lambda)\hat{s}_{r}^{\mathrm{pIRT}}, \tag{14} \]

其中混合权重 \(\lambda\) 为:

\[ \lambda=\frac{\hat{b}^{2}}{\hat{\sigma}^{2}/(4|S|)+\hat{b}^{2}}. \tag{15} \]

当估计的 IRT 重构偏差 \(\hat{b}^{2}\) 相对于加权估计器方差 \(\hat{\sigma}^{2}/(4|S|)\) 较大时,该权重更偏向直接估计。我们通过在历史运行上对运行内题目结果方差取平均来估计 \(\hat{\sigma}^{2}\),并把 \(\hat{b}^{2}\) 取为在留出的历史运行上 IRT 重构 MAE 的平方。沿用 Polo 等(2024)默认的锚估计器调整,我们将 \(\hat{\sigma}^{2}\) 除以四,这等价于把估计的标准差减半。

3.4 基于 IRT 的自适应测试

自适应测试利用当前运行中已观测到的作答来选择下一题。其直觉是:始终挑选对当前评测信息量最大的题目。我们改编 Truong 等(2025)的 Rasch/费舍尔信息流程,并额外评测一种采用 D 最优选择的多维 2PL 扩展。

我们首先根据历史运行标定题目难度 \(\{\beta_{i}\}_{i=1}^{N}\),并把新运行的能力初始化为 \(\hat{\theta}_{r}^{(0)}=0\)。在第 \(t\) 步,每道尚未观测题目的预测通过概率为

\[ p_{i}^{(t)}=\sigma(\hat{\theta}_{r}^{(t)}-\beta_{i}). \tag{16} \]

在 Rasch 模型下,题目 \(q_{i}\) 所提供的费舍尔信息为

\[ \mathcal{I}_{i}(\hat{\theta}_{r}^{(t)})=p_{i}^{(t)}(1-p_{i}^{(t)}). \tag{17} \]

每一步,该方法执行信息量最大的尚未观测题目,并根据全部已观测裁决重新估计 \(\hat{\theta}_{r}\),在 \(k\) 道题目之后停止。

多维 2PL 变体估计能力向量 \(\hat{\boldsymbol{\theta}}_{r}\),并用 D 最优性来降低其各坐标上的不确定性。给定累积的费舍尔信息矩阵 \(\mathbf{I}_{t}\),它选择使 \(p_{i}^{(t)}(1-p_{i}^{(t)})\boldsymbol{\alpha}_{i}^{\top}\mathbf{I}_{t}^{-1}\boldsymbol{\alpha}_{i}\) 最大的题目,然后根据全部已观测裁决更新能力向量与信息矩阵。

由于费舍尔选择针对的是信息量大的题目,而不是有代表性的题目,被选题目的原始通过率不必近似完整基准的通过率。因此我们用上文定义的 p-IRT 重构(式 13)来估计完整通过率。

4 实验设置

4.1 生产评测数据

所评测的系统是一个生产分析智能体,用于回答关于数据的自然语言问题。它把语言模型推理与用于检索和分析信息的工具结合起来,并在其模型、提示词、工具与外围系统发生变化时被反复评测。

该基准由内部分析师撰写的、关于数据的人工整理题目组成;题目与所记录的评测结果均不含用户数据或个人信息。每条记录结果都是由自动评分器产生的二元通过/失败裁决。我们保留那些对基准中至少 80% 的题目具有有效结果的评测运行,并在其有效结果上计算每次运行的参考通过率。由此得到第 1 天至第 28 天的 287 次标定运行,以及第 29 天至第 52 天的 287 次测试运行(图 1)。

4.2 时间协议与方法配置

随机抽样。

我们评测 \(k\in\{10,20,30,50,75,100,150,200,250,300,350,400\}\),并在 20 个随机种子上对结果取平均。

历史缓存。

缓存使用先前常规运行的滚动七日窗口,要求每道具备资格的题目至少有五次历史试验,并且每日重建,以供当日评测复用。我们以 0.01 为步长,将 \(\epsilon\) 从 0.00 扫到 0.30;当式 8 成立时缓存该题。

固定子集评测。

我们用全部标定运行,按与随机抽样相同的计算预算 \(k\),一次性构造每个子集,并原样用于每一次测试运行。用于选择与 p-IRT 重构的 IRT 模型也在全部标定运行上拟合。为估计 gp-IRT 的偏差项 \(\hat{b}^{2}\),我们把标定运行对半划分,在前一半上拟合一个辅助 IRT 模型,并在后一半上通过揭示每次运行中一半的可用结果来测量重构误差。对每一次多维 2PL 拟合,我们在已观测标定单元格的固定 15% 样本上,按对数似然从 \(d\in\{2,5,10,15\}\) 中选择维度。

自适应测试。

我们在相同的 \(k\) 上评测自适应测试。题目参数在全部标定运行上拟合,并在每次测试运行的选题过程中保持固定。我们比较 Rasch 自适应测试与多维 2PL 变体,以评估对多种潜在能力建模是否改善精度与执行量之间的权衡。

5 结果

5.1 分数保真度

图 2 在 287 次留出运行上,比较历史缓存、带加权估计与 gp-IRT 估计的难度分层固定子集,以及 Rasch 自适应测试。[^1] 我们在第 5.3 节考察每个方法族内部其余的设计选择。

图 2:通过率 MAE 对执行比例。固定预算方法使用 \(k/519\)。缓存各点报告的是各缓存阈值上的平均执行比例。

在按固定计算预算 \(k\) 评测的方法中,难度分层子集在小预算上领先:在 \(k=100\)(基准的 19.3%)时,gp-IRT 的 MAE 为 2.65 个百分点,而随机抽样为 2.94,自适应测试为 2.92。自适应测试从 \(k=200\)(38.5%)起领先,此时其 MAE 为 1.37 个百分点,固定子集 gp-IRT 为 1.40,随机抽样为 1.79。在 \(k=300\)(57.8%)时,三者的误差分别为 0.79、0.99 与 1.18 个百分点。在这些预算上,加权子集估计与 gp-IRT 子集估计相近。

缓存由其资格阈值决定执行量,平均执行比例从 20.3% 到 81.6%,MAE 从 7.36 到 0.81 个百分点。更激进的缓存会减少执行量,但增大误差,其曲线在与其他方法共享的范围内位于上方。例如,缓存在 69.1% 的执行比例上得到 1.54 个百分点的 MAE,而自适应测试、固定子集 gp-IRT 与随机抽样在 \(k=350\)(67.4%)时分别为 0.60、0.73 与 0.93 个百分点。

要点。

难度分层固定子集在小预算上表现最好,而自适应测试从 \(k=200\) 起取得最低的 MAE。在可比的执行水平上,历史缓存不如其他方法准确。

5.2 排序保真度

图 3 报告同一批配置的排序保真度。两种相关都随计算预算增加而上升,但方法之间的差异在 Kendall 的 Tau 上更为明显。在 \(k=100\)(19.3%)时,固定子集 gp-IRT 得到 0.930 的 Spearman 相关与 0.770 的 Kendall 相关,自适应测试为 0.923 与 0.760,随机抽样为 0.911 与 0.751。

(a)Spearman 相关

(b)Kendall 的 Tau

图 3:287 次留出运行上,排序保真度对执行比例。越高越好。

随着计算预算增加,自适应测试变得更强。在 \(k=200\)(38.5%)时,自适应测试与固定子集 gp-IRT 的 Spearman 相关打平(0.972),而自适应测试的 Kendall 相关更高(0.873 对 0.859)。在 \(k=300\)(57.8%)时,自适应测试达到 0.986 的 Spearman 相关与 0.920 的 Kendall 相关,而固定子集 gp-IRT 为 0.981 与 0.887,随机抽样在各预算上为 0.975 与 0.875。

缓存对排序的保留,远好于其分数 MAE 所暗示的程度。在 20.3% 的执行比例上,它得到 0.905 的 Spearman 相关与 0.733 的 Kendall 相关。在 79.0% 时,它达到 0.996 与 0.967,而自适应测试在 \(k=400\)(77.1%)时为 0.995 与 0.962。

要点。

难度分层子集在小预算上给出最强的排序保真度,而自适应测试在更大预算上领先。历史缓存对运行排序的保留,明显好于仅凭其分数估计误差所能预期的程度。

5.3 方法族内部的设计选择

第 5.1 节与第 5.2 节中的分数保真度与排序保真度比较,得到相近的方法排序。因此在其余分析中我们聚焦 MAE,并把秩相关放在附录中报告。

#### 5.3.1 固定子集的选择与估计

图 4 把子集选择的效应与分数估计分开。难度分层在大多数预算上 MAE 最低,并且从 \(k=150\)(28.9%)起在两种估计器下都领先。在 gp-IRT 下,历史作答 K 均值从 \(k=30\)(5.8%)到 \(k=100\)(19.3%)领先,并且总体上优于 IRT 特征 K 均值。从 \(k=200\)(38.5%)起,两种聚类选择器在任一估计器下都不如随机抽样,而难度分层仍然更好。

图 4:287 次留出运行上的固定子集 MAE。

gp-IRT 对聚类选择器的益处大于对难度分层的益处;后者的加权估计与 gp-IRT 估计始终相近。排序相关结果大体上与 MAE 一致(图 8 与图 9)。

IRT 特征 K 均值表现较弱,这与 Polo 等(2024)的发现形成对照;该文发现基于 IRT 的选择始终有效。实验设定上的两点差异或许可以解释这一冲突。第一,我们的标定数据来自同一个生产智能体的重复配置,其中不同的作答模式可能少于 Polo 等(2024)所使用的多样大语言模型群体,因而多维题目参数较不可靠,簇的代表性也较弱。难度分层只需要一个标量难度排序,并直接保持对该范围的覆盖。第二,我们的子集占基准的比例大得多:\(k=100\)(19.3%),而 Polo 等(2024)是在大约 14,000 道 MMLU 题目中取 100 道。在这些更大的抽样比例上,随机抽样变得更准确,聚类相对它的改进空间更小。

要点。

难度分层总体表现最好,而更复杂的选择器并不能带来稳定增益,并在中等计算预算上落到随机抽样之下。

#### 5.3.2 自适应 IRT 模型

图 5 比较 Rasch 与多维 2PL 自适应测试。多维 2PL 自适应测试在每一个 \(k\) 上的 MAE 都低于 Rasch 与随机抽样,其最大优势出现在 \(k=100\)(19.3%):分别为 1.97 个百分点,对比 2.92 与 2.94 个百分点。随着执行量增加,其优势收窄。Spearman 与 Kendall 呈现同样的排序(图 10)。

图 5:留出运行上的自适应测试 MAE。

Rasch 把每次运行表示在单一能力轴上,而多维 2PL 允许题目结果通过其区分度向量依赖于不同的能力坐标。因此,D 最优选择可以挑选那些能为尚未被已执行题目充分覆盖的能力坐标提供信息的题目。这一好处在小计算预算上最大。随着执行量增加,p-IRT 用观测替换更多预测,模型之间的差异随之减小。

要点。

表达能力更强的 IRT 模型可以显著改进自适应测试。

6 固定子集的实践验证

前述比较表明,按难度分层的固定子集提供了较强的分数保真度与排序保真度。尽管多维自适应测试的误差更低,难度分层在操作上更简单:子集只需构造一次,既不需要顺序选择,也不需要针对每次运行更新能力。每次运行执行同一批题目,也便于在生产智能体演进过程中做直接的题目级比较与诊断。这些性质促使我们在生产流程中采用它。

因此,我们仅针对按难度分层的固定子集,验证对重复评测很重要的两个性质:在一个智能体上标定的子集能否迁移到其他智能体家族,以及其保真度如何随标定窗口变化。

6.1 跨智能体迁移

我们把在原始智能体上标定的难度分层子集以及 Rasch 与 gp-IRT 参数,不做重新标定,应用到另外五个智能体家族的 299 次运行上。这些不同的系统在智能体框架、执行环境、工具集与模型配置上各不相同。这些家族的任何结果都未用于选题或拟合估计器。我们在相同计算预算上与均匀随机抽样比较,并对 20 个种子取平均。

在合并后的迁移运行上,gp-IRT 在 12 个预算中的 11 个上 MAE 低于随机抽样(图 6)。在 \(k=200\)(38.5%)时,随机抽样、加权估计与 gp-IRT 的 MAE 分别为 1.86、1.49 与 1.47 个百分点;gp-IRT 也仍然接近其在原始 287 次留出运行上的 1.40 个百分点 MAE。两种固定子集估计器在每一个预算上的 Spearman 与 Kendall 相关也都超过随机抽样(图 11)。

图 6:原始智能体的 287 次运行,以及来自五个家族的 299 次迁移运行上的 MAE。子集与估计器只使用原始智能体的标定数据。

这一优势在每一个家族与每一个计算预算上并不均匀。尽管如此,在每个家族内部的多数预算上,gp-IRT 的 MAE 都低于随机抽样。附录报告完整的合并结果与分家族结果。

这种迁移表明,IRT 模型捕捉到了题目难度中可跨智能体系统泛化的内在方面,即使标定只在单一智能体上完成。

要点。

无需重新标定,难度分层子集在合并后的迁移运行上、于 12 个预算中的 11 个上优于随机抽样,并保持接近其在原始智能体上的保真度,尽管增益因家族而异。

6.2 标定窗口敏感性

接下来我们考察标定数据的数量与时间跨度如何影响固定子集。我们把标定结束日固定在第 28 天,并将其起始日从第 1 天到第 28 天以三天为步长前移,得到十个嵌套窗口,其中包含 287 次到 14 次运行(表 12)。对每个窗口,我们重新拟合 Rasch 与 gp-IRT,为 \(k\in\{100,200,300,400\}\) 重建难度分层子集,并在同样的 287 次留出运行上评测。

随着标定窗口缩短,MAE 并非单调上升(图 7)。变化在 \(k=100\) 时最大。在 \(k=200\) 时,gp-IRT 的 MAE 范围为 1.35–1.59 个百分点:一天窗口(14 次运行)得到 1.41 个百分点,而完整的四周窗口为 1.40 个百分点。加权估计与 gp-IRT 估计仍然相近,Spearman 与 Kendall 也呈现同样的非单调形态(图 15(a) 与图 15(b))。

图 7:287 次留出运行上,不同标定窗口的 MAE。

这种稳定性或许反映了该智能体处于相对成熟的开发阶段,并且在研究期间日与日之间的变化有限。因此,近期运行可能就足以估计用于分层的难度排序,并且可能更好地匹配紧随其后的测试期,而更早的运行所增加的新信息有限。

要点。

固定子集的保真度在所研究的各标定窗口上是稳定的,保留全部 4 周历史并没有一致的好处。

7 实践建议

生产部署在统计保真度之外,还需要考虑操作性质。历史缓存保留全部题目集合,但需要近期结果,并需要监控过时的裁决。固定子集提供可预期的执行量,以及各次运行之间共用的题目。自适应测试可以把选择裁剪到每一次运行,但需要顺序编排、针对运行的状态,以及反复的能力更新。这些操作上的差异,使合适的方法取决于周围的评测流程。

对我们的生产流程,我们部署了 \(k\in\{100,200,300,400\}\) 的难度分层固定子集,让用户自行选择执行量与保真度的权衡。固定子集在执行之前就揭示工作量,并保留题目级比较,以便诊断行为变化。它们也避免在一个设计为并行执行题目的评测系统中增加额外的顺序服务逻辑。该子集无需重新标定即迁移到另外五个智能体家族,并且在各标定窗口上没有表现出保真度的单调损失。这些结果支持在所研究的系统与时期内复用。

随着智能体演进,我们建议在其模型、提示词、工具或执行系统发生实质性变化之后,或者在题目级结果出现持续偏移之后,重新标定。开发者还应定期运行完整基准,并将其通过率与固定子集估计相比较,以度量持续监控期间引入的误差。

8 相关工作

高效评测。

已有工作通过从题目子集估计完整基准结果来降低评测成本。固定形式的方法使用跨模型相关、IRT、聚类或基准级优化(Vivek 等,2024;Polo 等,2024;Perlitz 等,2024;Kipnis 等,2025;Fogliato 等,2024)。另一些方法把子集裁剪到目标模型、优化排序保留,或联合选择被观测题目并预测未被观测的结果(Yuan 等,2025;Saranathan 等,2025;Li 等,2025)。自适应评测建立在计算机化自适应测试(Lord,1980)之上,按题目对当前系统的期望信息量来选题(Truong 等,2025)。这些方法通常在不同语言模型的作答矩阵上标定。我们则在一个持续演进的生产智能体的、按时间排列的评测上,比较历史缓存、可复用的固定子集与自适应测试。

评测大语言模型智能体。

智能体评测尤其昂贵,因为每一项都可能需要完整轨迹,涉及与代码仓库的交互、浏览、工具调用或多轮交互(Jimenez 等,2024;Mialon 等,2024;Yao 等,2024)。这类工作开发用于比较智能体的基准与基础设施,而我们的设定关注的是:随着同一个智能体演进而产生的重复评测。

持续演进系统的连续评测。

我们的设定也与针对演进软件的回归测试最小化、选择与优先级排序有关(Rothermel 与 Harrold,1997;Yoo 与 Harman,2012)。持续集成方法利用代码变更与历史执行来分配测试资源(Kim 与 Porter,2002;Elbaum 等,2014;Machalica 等,2019),而非确定性的智能体结果则类似于不稳定测试(Luo 等,2014)。传统回归测试借助覆盖率或变更影响等信号来寻找故障,但大语言模型智能体的变更并不能直接指出受影响的基准题目。因此我们使用历史的题目级结果以及当前运行的一部分,来估计完整基准分数与运行排序。

局限性

我们的数据来自一个组织与一套生产基准。尽管难度分层子集迁移到了另外五个智能体家族,这一证据只覆盖固定子集,并不能确立向其他基准、历史缓存或自适应测试的泛化。未来工作应使用来自更多样智能体的数据来扩展分析。

我们评测通过率 MAE,并用 Spearman 与 Kendall 相关评测总体排序保真度;这些指标并不直接度量在操作阈值上的回归检测或发布门禁决策。未来工作应增加基于阈值的分析,以度量漏检的回归、误报,以及与基于完整基准的决策之间的一致性。

我们不发布基准题目、题目级结果矩阵或实现。我们所比较的方法在第 3 节中有完整说明,并且可以在任何记录了逐题结果的基准上复现。

参考文献

参考文献列表从略。

附录说明

源文目录列出附录 A「补充结果」,其中包括结果导读、方法总体比较、固定子集设计结果、自适应模型设计结果、跨智能体迁移结果与标定窗口敏感性。所给源文正文在「局限性」结束,未包含附录表格与其中的数值。为避免编造,此处不补写附录数据。正文对附录中图 8、图 9、图 10、图 11、图 15 与表 12 的引用均按原文保留。

[^1]: 附录以表格报告完整数值。

署名与许可

  • 原文:Yining She、Lei Lin,Efficient Benchmarking in Production: A Study of an Evolving LLM Agent,arXiv:2609.21267
  • 许可:原文以 CC BY 4.0 许可发布
  • 译者:智测团队

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction