智测 OpenQA

行业与实践研究与基准测试

干净分数、被埋没的证据与自信的错误:对前沿智能体问答的回执式审计

智测团队 · OpenQA(openqa.cn)阅读约 41 分钟

前沿模型在浅层文档/图表阅读任务上得分很高。在一次受控的数据室审计中,把证据移入埋没条件后,准确率下降,强制声明增加,工具调用增加,每个正确答案的成本也增加。置信度与基准校准并不能完全抓住错误答案;一起有记录的生产事故表明,捏造的结构性主张

本文目录

干净分数、被埋没的证据与自信的错误:对前沿智能体问答的回执式审计(中文全译)

翻译说明:本文是 arXiv 论文 Clean Scores, Buried Evidence, and Confident Wrong: A Receipt-Based Audit of Frontier Agentic QA(arXiv:2609.15319)的中文全译,由智测团队翻译。原作者:Luis M. Sánchez。原文以 CC BY 4.0 许可发布。译文保留原文全部章节、数据与结论;参考文献列表从略。

Luis M. Sánchez

单位:Toryx Inc.

邮箱:luis.m.sanchez@toryx.ai

arXiv:2609.15319v1 [cs.IR] 2026 年 9 月 14 日

许可:CC BY 4.0

摘要

前沿模型在浅层文档/图表阅读任务上得分很高。在一次受控的数据室审计中,把证据移入埋没条件后,准确率下降,强制声明增加,工具调用增加,每个正确答案的成本也增加。置信度与基准校准并不能完全抓住错误答案;一起有记录的生产事故表明,捏造的结构性主张可以与准确的数值表格混在一起。智能体评测需要主张级回执(语句级出处,而不是答案级分数)、条件感知的评分,以及人对抗式核验——这是一套审计纪律,而不是一张排行榜。本文报告的准确率由冻结的包含式评分器给出,而不是精确匹配评分器;对该评分器所做的结构化审计(含盲态人工复核)发现,若干结论对其敏感。我们在全文中写明哪些结论经得起这一敏感性、哪些经不起。我们测量的场景是金融尽职调查;下一步要构建的场景是国防参谋工作,其中出现同样的证据埋没形态。在这两种场景里,模型都不是后果的当事方;签字的人才是。用白话说:在我们所考察的有记录案例中,智能体可以把准确的数字与自信的捏造解释配在一起,因此举证责任必须从模型转移到证据链上。这些发现促使我们去评测完整的“证据到答案”流水线,而不是只评测阅读器本身。一个核心的开放问题是:显式的、与来源相链接的证据结构,以及对经审计任务轨迹的训练,能否在匹配的资源预算下改善证据交付与答案准确率,包括对开放权重模型。本研究为该项调查建立基线与审计要求;它并不评测那些干预。

1. 引言

大语言模型正越来越多地被部署为智能体:给定一个文档文件夹和一组工具,人们要求它们像初级分析师那样查找、组合并报告事实。然而,基准通常交给模型一份干净、经过策展的上下文——相当于只把含有答案的文件交给分析师。真实工作不是这样。证据埋在噪声之中,找到它是有真实成本的。

这种工作形态在受监管场景中是一样的。一名信贷助理被问及某只基金是否可以加仓,必须找到会议当日有效的委托书版本、其中的集中度条款,以及月末报告中的当前资产净值(NAV)——三份文件,彼此都不点名对方。一名合同官被问及投标人的供应链是否干净,必须从标书中抽出一级至三级供应商,逐一对照第 889 条(Section 889)、维吾尔强迫劳动预防法(UFLPA)与外国资产控制办公室(OFAC)清单,把所有权追溯到实际受益人,并为每一项标记引用起控制作用的条目。在这两种情形中,答案的好坏只取决于它背后的链条;在这两种情形中,签字的人对这条链条负责。

这种不对称正是本文的理由。一名核准目标清单的军法官、一名其评估会进入国家安全决策的分析师、一名为养老基金买入证券的投资组合经理——每个人都签字,每个人都为自己所签的内容负责。如果答案背后的链条是由一个模型组装的,而该模型在深度五上大约只有三分之一到三分之二的时间是对的(表 4:埋没条件下 d5 准确率在整个面板上从 38% 到 71%,我们尚未测量更深),并且无论对错都以同样的置信度陈述(第 6 节),那么这个签名就是一次押注。模型不是这场押注的当事方。它不会面对军事法庭、执法行动或信义索赔;人会。这就是本文坚持回执而非置信度的原因:回执是签字人在签字前能够核对的那一件事,也是把“我是否信任这个模型?”变成“我能否核验这条链条?”的那一件事。

本文测量第一种场景;第 9 节描述同一套工具如何被带到第二种场景。

本文提出一个简单问题:当证据被埋没时,前沿智能体会发生什么?我们构建一个合成的金融与保险“数据室”——一个防火墙隔离的文档文件夹(申报式印本、信贷备忘录、委员会会议纪要、委托书、市场事件通知),由我们撰写,使每一条事实都有已知出处——并在两种条件下运行六家领先实验室各一个旗舰模型(OpenAI、Anthropic、智谱、阿里巴巴、Google、Meta):干净(只挂载承载答案的文档)与埋没(完整数据室,含噪声)。我们测量准确率、已承诺错误率、强制声明、工具使用与成本——一种多指标、成本感知的视角,精神上接近整体评测 [1] 以及近期的每基准成本核算 [2]。现有智能体基准在开放网页或软件任务上给任务完成度打分 [3, 4, 5];多跳问答数据集在开放语料上测试组合 [6, 7];长上下文研究则表明检索会随证据所在位置而退化 [8, 9]。没有任何一项把封闭的、出处已知的语料与主张级审计结合起来,而这正是本工具所填补的缺口。

因为模型可以给出一个自信、格式良好却错误的答案——甚至把准确数字与捏造解释配在一起 [10, 11]——我们把每一条主张都视为需要一张回执:追溯到支撑它的具体证据。回执是解释的最小可核验形式——它不说明模型为何这样答,只说明依据是什么,而这正是审计者能够核对的性质;它是可信人工智能文献中可审计性要求 [12, 13] 被还原到其可核对内核之后的形态。我们报告该面板做了什么、没做什么,并明确写出我们不主张什么。

埋没证据下的一个错误答案,其本身并不能指认失效的组件。智能体可能没有检索到充分证据,可能检索到了却没有把相关段落送入其可用上下文,可能误解或错误组合证据,也可能未能履行答案格式契约。评测器也可能拒绝一个实质上有效的答案。区分这些情形之所以重要,是因为它们意味着不同的补救:改进检索、改变证据呈现、训练阅读器、修正接口,或修复评测工具本身。本文推动这一分解并为之提供工具;它并不确定哪一个组件占主导。

2. 范围与非主张

本报告呈现的是对智能体问答的一次受控审计,而不是一张通用排行榜。我们从六家领先实验室各选取一个旗舰模型——OpenAI、Anthropic、智谱、阿里巴巴、Google 与 Meta——即主要的封闭前沿实验室(领先的开放权重发布被排除,因其属于不同类别;Grok-4.6 出现在浅层测验表 1b 以及第一波附录表 A.1 中;Nemotron-3-Ultra-550B 仅作为表 A.1 中一次被排除的运行出现;二者都在面板之外)。自此以后,表格与图同时给出实验室与实际运行的模型(实验室 · 模型);正文指称实验室,各实验室背后的模型见表 1。该面板是一种设计选择(每家实验室一个旗舰),而不是关于哪些模型最好的主张。

表 1. 六实验室面板:每家实验室一个旗舰模型,以及本文自行测得的 room02 准确率(来自表 2)。

实验室旗舰模型(实际运行)room02 干净准确率room02 埋没准确率
OpenAIGPT-5.6-sol82.9%78.9%
AnthropicFable 589.4%77.9%
智谱GLM-5.389.4%80.5%
阿里巴巴Qwen3.8-Max187.0%74.0%
GoogleGemini-3.1-Pro85.2%67.5%
MetaMuse-Spark 1.282.9%74.0%

表 1 注释。 所报告或传闻的参数量、上下文窗口,以及本次运行的有效每百万 token 美元费率(干净臂支出 ÷ 干净臂 token 数,而非标价),记录在冻结的定价快照(configs/openrouter_pricing_2026-09-04.json)中,此处故意不转载,因为它们未经独立核验。准确率列是本文自行测得的基准(表 2),已经核验并冻结——我们不公布我们未曾复现的外部基准分数。¹

¹ Qwen3.8-Max 按 OpenRouter 公布的每 token 费率计价;实践中作者是通过阿里巴巴云编码计划(固定费率)订阅访问该模型的。凡出现 Qwen3.8-Max 成本之处(表 3 与表 3b),均适用同一约定。

在本文中,多跳标签被报告为“声明跳数”,而不是已被证明的组合深度。提示词审计(附录 A)发现,41 条 room02 提示词中有 0 条枚举子步骤或把分解交给模型;因此跳数标签仍然是语料所声明的任务复杂度,并附有如下保留:深度是从语料设计推断出来的。涉及 Fable 5 的一起有记录的捏造案例(框 1)被严格作为 n=1 的生产观察纳入;它不被用来估计一般的模型级捏造率。

3. 工具与回执

“数据室”是一个防火墙隔离的文档文件夹,以只读方式挂载给模型。模型充当分析师智能体——对冲基金或精品投行中初级分析师或高级助理的工作,覆盖信贷、股票与大宗商品——并配备 shell 工具(bash、python、read、grep)。检索由智能体自己的工具调用完成,而不是像检索增强生成那样由固定检索器完成 [14]。room02 是我们的第二代数据室:一个合成的金融与保险文档语料——申报式季报与年报印本、信贷备忘录、投资委员会会议纪要、委托文件,以及市场事件通知(制裁、评级、指数变动、要约收购)——为本项目撰写,使每一条事实都有已知出处,语料中不使用任何真实世界的专有材料(不同于由公开申报文件构建的金融问答集 [15]);模型工具输出日志(stdout_head)可能回显公开的美国证券交易委员会(SEC)申报文本,因此原始日志被排除在计划中的公开存档之外(附录 D.4)。

room02 数据室基准

主要工具是 room02 数据室基准,由 41 个合成条目组成。这些条目由人类专家设计并策展,以反映这些金融场景中遇到的真实情形。条目的声明跳数从 2 到 5,分布如下:d2=8,d3=9,d4=17,d5=7。该基准在每个模型—条件上运行 3 个种子。

评测套件在 /work/documents 挂载一个只读数据室,并向模型提供工具访问,具体为 bash、python、read_file、grep 与 find。评测两种条件:“干净”条件只挂载金标准文档;“埋没”条件挂载完整数据室,包括噪声。干净与埋没的差别在于所挂载的数据室内容;各条件的输入 token 上限也不同,但并未成为约束(观察到的最大输入低于两个上限),因此没有任何实验臂被其上限截断。

答案通过强制声明的 JSON 模式引出,要求给出答案、0 到 100 的置信度分数,以及证据文件列表。模型在准确率、自信错误率、强制声明、工具调用、API 支出,以及每个正确答案的成本上接受评测。

浅层图表阅读工具(图像输入)

多模态工具。受监管的工作并不只有文本。保险理算员的智能体阅读行车记录仪与碰撞视频;目标选定小组阅读卫星与红外图像;信贷分析师阅读粘贴进董事会演示文稿的图表,或收听一份从未被转写的路演录音。room02 数据室故意把文本情形隔离出来,但本文在其旁携带一个多模态工具:一场浅层图表与表格测验,其中每一项都是图像(渲染为终端截图的图表,或报纸扫描件),模型必须先从画面上读出一个数值,再据此推理。它故意只有 1 跳与 2 跳,以便测量的是阅读而不是组合。它已经显示出两件事:大多数具备图像能力的模型在一跳上得 100%,在两跳上略低;Google 是例外,分别为 67.6% 与 92.6%(表 1b)。并非每一位面板成员都接受了这一工具——GLM-5.3 在基于文本的文档实验中运行过,但这里没有,因为我们所测试的配置不接受图像输入——因此该测验覆盖六家面板实验室中的五家,两套工具不应被读成一对匹配的对照。多模态情形是作者预期证据埋没效应最大的地方,因为证据不仅埋在文件夹里,而且编码在模型读得最差的模态之中;它是即将开展的工作的主题(第 9 节)。

为在该工具上建立商品级基线,模型按如下方式在测验上接受评测。冻结的第一波文件 chart_v2_main.jsonl(612 行)含有六个模型字符串,其中只有三个属于 room02 面板(OpenAI、Anthropic、Google);阿里巴巴与 Meta 的旗舰是在 2026 年 9 月 10 日的第二波增补运行中加入的,使用相同条目、变体与种子(chart_v2_main_wave2.jsonl,204 条已评分行,连同其自身清单一起冻结;附录 D.3),智谱旗舰未在该工具上运行,因为我们所测试的配置不接受图像输入。表 1b 按 make_table2_quiz_baseline.py 中的规则报告旗舰、闭源权重子集(第一波生成器;第二波脚本 make_table2_quiz_baseline_wave2.py 继承其规则;附录 D.2):它去掉 Gemini 2.5 Pro(并非 Google 旗舰)与 Qwen3.8-27B(开放权重,仅供内部摸底);它们的行保留在冻结文件中,但不予报告。Grok-4.6 出现,尽管它在面板之外。该工具故意做得很浅(1 跳与 2 跳);更深的链条(3–5 跳)在 room02 数据室中测量(表 4),不在这里。六家接受图像测试的实验室中有五家在一跳上得 100%,在两跳上损失 4–9 个百分点(91.2–95.6%);能够参加测验的五家面板实验室中,四家得 100%,Google 是例外,一跳为 67.6%,两跳为 92.6%。该工具包含 34 道底层问题,每道以三种变体运行,得到 34 条一跳已评分行与 68 条两跳已评分行:每个模型在种子 0 上共 102 行。

表 1b. 浅层图表阅读测验(图像输入):按跳数与合计的准确率。34 道底层问题,每道以三种变体运行:34 条一跳已评分行与 68 条两跳已评分行,每个模型在种子 0 上共 102 行。room02 六家面板实验室中的五家,外加面板之外的补充模型 Grok-4.6。GLM-5.3 在基于文本的文档实验中接受了评测,但未参加这一图像输入测验,因为所测试的配置不支持图像。Fable 5、GPT-5.6-sol、Grok-4.6 与 Gemini-3.1-Pro 的行是冻结的第一波运行;Qwen3.8-Max 与 Muse-Spark 1.2 是第二波增补(附录 D.3)。

实验室模型1 跳准确率2 跳准确率总体准确率平均陈述置信度
AnthropicFable 5100.0%95.6%97.1%89.3
OpenAIGPT-5.6-sol100.0%95.6%97.1%97.9
阿里巴巴Qwen3.8-Max100.0%94.1%96.1%89.9
MetaMuse-Spark 1.2100.0%92.6%95.1%93.6
xAIGrok-4.6100.0%91.2%94.1%88.7
GoogleGemini-3.1-Pro67.6%92.6%84.3%97.8

回执

本次审计依靠回执来核验模型行为。埋没数据室条件在摩擦之下测试检索。主张级回执把每一条主张追溯到一个源文件。其意图是可信人工智能意义上的可追溯性:持有冻结包、且无法访问模型的第三方,应当能够重构哪一份文档支撑了哪一条陈述。

4. 主要结果:room02 干净对埋没

在受控的数据室智能体基准中,把证据从干净条件移到埋没条件,会改变准确率、强制行为、工具调用量与成本。

如何阅读准确率列。 本表及后续各表中的每一个准确率数字,都是覆盖全部 41 个条目的冻结历史分数,由结果冻结当时生效的基于包含关系的评分器产生。它们不是精确匹配分数,第 8 节描述对该评分器的审计发现了什么。第 8 节中的统计比较使用受限的 39 条目总体,其中两个条目已被裁定相对于其自身源文档为缺陷条目;该总体只在那里使用,下面的表格不予重述。

表 2. room02 准确率与置信度(干净对埋没)。

实验室模型条件准确率 %自信错误 %强制 %已答准确率(0–1)强制准确率(0–1)
OpenAIGPT-5.6-sol干净82.9%17.1%0%0.829—
OpenAIGPT-5.6-sol埋没78.9%9.8%20%0.8780.440
AnthropicFable 5干净89.4%10.6%0%0.894—
AnthropicFable 5埋没77.9%5.7%55%0.8700.716
智谱GLM-5.3干净89.4%9.8%2%0.9000.667
智谱GLM-5.3埋没80.5%19.5%0%0.805—
阿里巴巴Qwen3.8-Max干净87.0%13.0%0%0.870—
阿里巴巴Qwen3.8-Max埋没74.0%26.0%0%0.740—
GoogleGemini-3.1-Pro干净85.2%14.8%0%0.852—
GoogleGemini-3.1-Pro埋没67.5%32.5%0%0.675—
MetaMuse-Spark 1.2干净82.9%17.1%0%0.829—
MetaMuse-Spark 1.2埋没74.0%25.2%3%0.7400.750

表 2 注释。 准确率 = 已评分行中正确者所占份额。每个实验臂计划 123 个条目—种子(41 个条目 × 3 个种子);已评分 n 对 Anthropic 埋没为 122,对 Google 干净为 122,对 Meta 干净为 117,其余为 123(排除情况见表 4 注释)。Anthropic 埋没包含一行不正确的 budget_exhausted:它计入准确率,但不计入任一条件准确率,也不计入自信错误。自信错误 % = 已承诺错误:自由作答且错误的行,除以全部已评分行。强制 = 在封闭搜索预算下作答的行所占份额(按常规评分,因此强制准确率非零)。已答准确率/强制准确率 = 限制在每一行类别上的准确率,以分数(0–1)报告;准确率、自信错误与强制为百分数。

表 3. room02 成本与努力(干净对埋没)。

实验室模型条件美元每正确美元每错误美元平均工具调用
OpenAIGPT-5.6-sol干净$5.63$0.055$0.2685.8
OpenAIGPT-5.6-sol埋没$36.09$0.372$1.38818.4
AnthropicFable 5干净$12.94$0.118$0.9957.0
AnthropicFable 5埋没$77.97$0.821$2.88816.1
智谱GLM-5.3干净$11.92$0.108$0.9179.2
智谱GLM-5.3埋没$58.43$0.590$2.43425.7
阿里巴巴Qwen3.8-Max1干净$17.71$0.166$1.10711.7
阿里巴巴Qwen3.8-Max1埋没$70.74$0.777$2.21125.3
GoogleGemini-3.1-Pro干净$18.81$0.181$1.0459.8
GoogleGemini-3.1-Pro埋没$99.31$1.197$2.48322.9
MetaMuse-Spark 1.2干净$38.31$0.395$1.91512.6
MetaMuse-Spark 1.2埋没$55.71$0.612$1.74119.9

表 3 注释。 美元 = 该实验臂的总支出;每正确美元与每错误美元 = 支出除以正确/错误答案数(答错会耗费真实的检索努力)。平均工具调用 = 每个条目的平均工具调用次数。每百万 token 美元价格为截至 2026 年 8 月的通行市场费率。见脚注 1。

表 3b. 各实验室从干净到埋没的差值(来自表 2 与表 3)。

实验室模型Δ 准确率(个百分点)Δ 已承诺错误(个百分点)Δ 强制(个百分点)工具调用(倍)每正确美元(倍)
OpenAIGPT-5.6-sol-4.1-7.3+20.33.2×6.7×
AnthropicFable 5-11.6-4.8+54.92.3×7.0×
智谱GLM-5.3-8.9+9.7-2.42.8×5.4×
阿里巴巴Qwen3.8-Max1-13.0+13.0+0.02.2×4.7×
GoogleGemini-3.1-Pro-17.8+17.8+0.02.3×6.6×
MetaMuse-Spark 1.2-8.9+8.1+3.21.6×1.6×

图 1 与图 2 绘制表 2 至表 3b:准确率对每个正确答案的成本,以及强制声明对工具调用,并画出每一家实验室从干净到埋没的转变。

表 3b 注释。 每个值是表 2/表 3 中埋没臂与干净臂的算术差(个百分点)或比值(倍),由 make_table_deltas.py 产生(只读取 table3_room02_main.csv)。见脚注 1。

图 1. 准确率对每个正确答案的成本,干净对埋没。六家实验室都有干净与埋没两臂(已冻结),因此每一家都显示从干净到埋没的转变。

图 2. 强制声明与平均工具调用,干净对埋没。

5. 声明跳数结果

准确率大体上随声明跳数下降:d2 在每一个实验臂上都处于或接近天花板(六家实验室的干净 d2 均为 100%;埋没 d2 范围为 91.7–100%),而 d4/d5 是最弱的格子。下降在每一个实验臂上并不严格单调——Fable 埋没的 d5(71.4%)高于其 d4(68.0%),GLM 干净的 d5(85.7%)高于其 d4(82.3%)。对 41 个 room02 条目的提示词审计确认,41 条提示词中有 0 条匹配任何一种模式:枚举子步骤、要求中间结果,或交出文档定位符。提示词的开头词没有重复的模板先验,使用了 19 个不同的首 token。因为提示词并不枚举步骤,我们使用“声明跳数”这一用语,并保留如下保留意见:深度是从语料设计推断出来的。

表 4. 按声明跳数的准确率。

实验室模型条件d2 n/准确率d3 n/准确率d4 n/准确率d5 n/准确率
OpenAIGPT-5.6-sol干净24 / 100%27 / 92.6%51 / 76.5%21 / 66.7%
OpenAIGPT-5.6-sol埋没24 / 100%27 / 77.8%51 / 74.5%21 / 66.7%
AnthropicFable 5干净24 / 100%27 / 96.3%51 / 90.2%21 / 66.7%
AnthropicFable 5埋没24 / 100%27 / 81.5%50 / 68.0%21 / 71.4%
智谱GLM-5.3干净24 / 100%27 / 96.3%51 / 82.3%21 / 85.7%
智谱GLM-5.3埋没24 / 95.8%27 / 88.9%51 / 74.5%21 / 66.7%
阿里巴巴Qwen3.8-Max干净24 / 100%27 / 96.3%51 / 84.3%21 / 66.7%
阿里巴巴Qwen3.8-Max埋没24 / 95.8%27 / 85.2%51 / 66.7%21 / 52.4%
GoogleGemini-3.1-Pro干净24 / 100%27 / 88.9%50 / 88.0%21 / 57.1%
GoogleGemini-3.1-Pro埋没24 / 91.7%27 / 70.4%51 / 66.7%21 / 38.1%
MetaMuse-Spark 1.2干净23 / 100%26 / 84.6%48 / 85.4%20 / 55.0%
MetaMuse-Spark 1.2埋没24 / 100%27 / 74.1%51 / 72.5%21 / 47.6%

用白话说,“声明跳数”是语料设计分配给一个问题的相链接查找次数。它是一个设计标签,而不是已被证明的最小值:我们并未表明一个 k 跳条目不能从更少的文档中得到回答。带上这一保留,该表显示准确率在短链上保持,但随着链条变长而下降,而当证据埋在噪声中时下降得更厉害。

表 4 注释。 d2–d5 = 条目的声明跳数(语料元数据;见第 2 节的用语规则)。每个格子读作“n / 准确率”:n = 该跳数上的条目—种子数,准确率 = 其中的准确率。当某一原始行是不完整或重试产物、因而未予评分时,n 低于设计计数(24/27/51/21):Fable 5 埋没(123 中评了 122)、Gemini-3.1-Pro 干净(123 中评了 122)以及 Muse-Spark 1.2 干净(123 中评了 117);见附录 D.3。图 3 绘制表 4 的声明跳数准确率。

图 3. 按声明跳数的准确率,干净对埋没;表 4 的声明跳数准确率,绘出。

全面板效率与多跳指数

图 4 在一条轴上显示全部六家实验室从干净到埋没的准确率下降;图 5 显示埋没臂中一个错误答案的成本;图 6 与图 7 由表 4 的埋没深度 4/5 格子构建多跳指数。

图 4. 从干净(圆)到埋没(方)的准确率,全部六家实验室。当证据被埋没时,每一家实验室都损失准确率。

图 5. 答对与答错的成本,埋没。对每一家实验室,每个错误答案的成本与每个正确答案的成本相当或更高——答错不是免费的;它耗费同样的检索努力,却一无所获。

图 6. 常规(干净)指数对我们的多跳指数,全部 41 个条目。在六家前沿实验室中,干净指数被压缩进 6.5 个百分点的范围(标准差 3.0 个百分点),而埋没深度 4/5 指数把同样这些实验室摊开到 13.9 个百分点(标准差 5.6 个百分点)。我们报告的是这一散布差异,此外别无其他。我们故意不报告两个指数之间的相关:在可辩护的评分与总体选择上重新计算,它的范围从 -0.47 到 +0.77,因此本文没有任何论证依赖于它。我们也不把两个指数之间的重新排序当作一项发现——产生它的成对差距落在抽样噪声之内(第 8 节)。

干净臂压缩了面板

常规的干净指数把六个前沿模型压缩进 6.5 个百分点的范围(标准差 3.0 个百分点)。它并不是一个更浅的任务:干净臂与埋没臂提出的是同样的 41 个多跳条目,因此只挂载承载答案的文档缩小了搜索空间,却并没有去掉一个条目所要求的组合。干净臂去掉的是在噪声中定位证据的成本,而仅仅去掉这一点就足以把面板压缩到接近天花板的分数。受监管场景中的真实工作——一边是信贷、保险、法律、医疗、合规;另一边是采购、对外披露、作战法与监察长参谋工作——很少是“找到那一个数字”;它是“从非结构化、相互冲突、专有的文档中组合若干独立检索到的事实,并为这条链条辩护”。签字人是在投资委员会备忘录上署名的分析师,或是旅级及以上在一份裁定上署名的参谋军官;无论哪种,责任都是个人的,链条必须可引用。埋没多跳指数是我们测量这一场景的尝试,它把同样六个模型摊开到将近两倍宽(标准差 5.6 个百分点,范围 13.9 个百分点)——这是本样本内分辨率上的差异,还不是它能预测现场结果的证明。这一工具是为非结构化、低可核验性的文档工作而建的,我们对它在具有无歧义真值、且子目标可干净分解的领域中会显示什么不作主张,例如编程、数学或形式验证。我们没有测量那些领域,浅层基准在那里是否够用,超出了本实验所能说的范围。

我们承诺把该指数从深度 5 延伸到 6 跳及以上,我们相信剩余的“阿尔法”就在那里——当前模型还不能串联起来的那些组合。在金融与保险一侧:跨文档交易信号、风险投资融资链推断、知识产权实施自由、多方诉讼、药物发现中从靶点到试验的链接;商业车队(货运)保险——把汽车承运人的联邦汽车运输安全管理局(FMCSA)安全记录、驾驶员名册、远程信息处理摘要,以及保单的列入车辆批单,与理赔档案对照,以决定承保与代位求偿;以及通过各保单版本的损失发展三角形追溯再保险合约起赔点。在国防一侧:多层供应链与外国所有权、控制或影响(FOCI)禁令审计,对照双边豁免清单与国防联邦采购补充条例(DFARS)/国际武器贸易条例(ITAR)条款审查技术数据包发布,对目标清单作交战规则与战争法审查,以及综合一份调查记录并给每一处矛盾注明来源。在这些场景中,一条跨越相互冲突来源的 6 跳链条,就是商品级答案与专有答案之间的差别。

图 7. 按具体模型的埋没深度 4/5 准确率,从高到低绘制。这一排序是描述性的且不确定:它是一个冻结的历史点估计,成对差距落在抽样噪声之内,而且该顺序在不同评分工具之间并不稳定(第 8 节)。本文不报告模型排名。

请注意,两个指数对六个模型的排序并不相同。我们由此不得出结论。所涉及的几乎每一个成对差距都落在抽样噪声之内,而且排序在不同评分工具之间并不稳定(第 8 节);因此本文不报告模型排名。可辩护的观察更窄——一次干净的、只挂载承载答案文档的挂载,把这六个模型压向天花板,而在声明深度 4–5 上的埋没挂载则不会。

6. 校准与自信的错误

校准 [16, 17, 18] 与言语化置信度 [19, 20, 21, 22] 并不能消除自信的错误。我们在 0–100 的尺度上询问每个模型对其答案有多自信;模型惯常报告 90–100% 的自信,然而事实证明它们正确的频率远低于此——因此所陈述的置信度不可信。GPT-5.6-sol 几乎把所有答案都放进 90–100 置信度桶,而 Fable 5 表现出更多的桶间分离。因此表 5 把这两家实验室作为范例——面板中最单一桶的成员,以及分离得最好的成员;全部六家实验室的同样分桶见附录 B(表 B1),图 8 绘制全部六家实验室在埋没臂中错误答案的陈述置信度。

表 5. 两家范例实验室(Fable 5 与 GPT-5.6-sol)的置信度桶校准;全部六家实验室见附录 B 表 B1。

实验室模型条件桶n准确率平均置信度
AnthropicFable 5干净0–5911.00040.0
AnthropicFable 5干净60–7950.80071.2
AnthropicFable 5干净80–89200.65086.2
AnthropicFable 5干净90–100970.94894.5
AnthropicFable 5埋没0–5960.16742.5
AnthropicFable 5埋没60–7951.00072.0
AnthropicFable 5埋没80–89260.65485.4
AnthropicFable 5埋没90–100810.88993.5
OpenAIGPT-5.6-sol干净90–1001230.82998.5
OpenAIGPT-5.6-sol埋没60–7920.00075.0
OpenAIGPT-5.6-sol埋没80–8930.33386.0
OpenAIGPT-5.6-sol埋没90–1001180.81498.4

表 5 注释。 桶 = 模型自我陈述置信度(0–100)的区间。n = 桶内具有可解析置信度的行数(Fable 埋没:122 条已评分行中的 118 条;没有数值置信度的行被排除,并列于附录 B)。准确率 = 桶内的经验准确率。平均置信度 = 桶内的平均陈述置信度;校准是对照平均置信度来读的,而不是对照桶的中点。图 8 采取互补视角:埋没臂中每一个错误答案的陈述置信度,覆盖全部六家实验室。在六家实验室中,72% 的错误答案被陈述为 80 或以上,9% 低于 50;没有任何模型弃答(弃答不是一个被评分的结果;关于选择性作答以及表达不确定性的效应,见 [23, 24])。

过度自信指数(直观尺度)。 对占主导的 90–100 置信度桶,我们报告平均置信度 − 100 × 准确率(以百分点计;准确率是表 5 与表 B1 中印出的 0–1 分数):正值 = 过度自信,接近零 = 已校准。Anthropic:干净 -0.3,埋没 +4.6。OpenAI:干净 +15.6,埋没 +17.0。因此 OpenAI 陈述约 98 的置信度,而正确的时间大约只有 82%——一个大而稳定的过度自信差距;Anthropic 在干净条件下接近校准,在埋没条件下轻度过度自信。

图 8. 模型在答错时有多自信?埋没臂,全部六家实验室。每一行的标签给出该实验室已评分行中的错误答案数;每个错误答案一个点,放在模型所陈述的置信度(0–100)上;条形为均值。红色带:陈述 ≥ 80(“自信地错”);绿色带:陈述 < 50(有所保留)。80 与 50 这两个截断是作者的选择;每一个点都被绘出,以便读者可以改用别的截断。右缘:各实验室错误答案中陈述为 ≥ 80 者所占份额。没有数值置信度的错误答案被排除在图与百分数之外(Google 9,Anthropic 4,智谱 1)。在六家实验室中,167 个错误答案中有 120 个(72%)被陈述为 ≥ 80,15 个(9%)低于 50。没有任何模型弃答或拒绝回答;在本协议中弃答不是一个被评分的结果,当模型不知道时它仍然作答。十四个错误答案缺少数值置信度,未予绘制。在第 8 节的暂定裁决评分下,错误答案总体缩小,≥80 的份额下降到大约 50%;在我们计算过的每一种评分下都成立的是,高置信度的错误答案以可观数量持续存在;精确份额则并不成立,两个数字都不应在不指明其评分与总体的情况下被引用。

框 1 — 现场案例:Fable 5 的生产捏造

“表格是真的;捏造是我的。”

我们并非出发去测量捏造。机会是在撰写本文时自己出现的,当时担任审阅智能体的正是被研究的同一个模型(Fable 5)。

作者在 Anthropic 的 Fable 5 模型协助下准备本文时,2026 年 9 月 3 日的一次 Claude Code 会话中发生了一次有记录的交互(会话 ID 36bfdfa1-b04f-4c78-8ea7-27d5c2d597de;支撑记录保存在冻结证据文件夹 paper_freeze_v1/fabrication_case/ 中,处于哈希清单之下;它不是计划中的 Zenodo 存档的一部分,可应审稿人请求提供)。在若干回复中,模型呈现了从实验的结果文件中抽出的准确量化表格,同时又对论文作出三条没有支撑的结构性主张。它错误地描述了 rebuild_paper1a_strong.py 的目的,声称论文没有深跳工具,并在一个它并未核验的面板结构基础上构建了一份敌意审稿人分析。作者通过质疑模型对实验设计的叙述中的不一致,发现了这个问题。在作者核对源文档——不信任 Fable 5 的保证——之后,Fable 5 承认了它所做的事:“表格是真的;捏造是我的。”

这次有记录的交互的意义很窄,但很重要:准确的数值报告与捏造的结构性解释出现在同一次交流中,语气或置信度上没有明显差别。这一不一致是通过人工审视识别的,而不是从回复本身识别的。这是一次单独的有记录观察;它不被用来估计任何模型的捏造率。该案例促使我们采用主张级回执,把个别陈述——而不仅仅是一个答案或整个模型——连接到支撑它们的具体证据。附录 C 用其文字记录定位符概括这三条捏造主张,并逐字转载该承认;原始段落保留在受限的文字记录包中。

产物定位符(冻结包):会话文字记录摘录与承认摘录;现场实例记录:记忆文件 feedback_read_the_doc_before_describing_design.md。

7. 讨论

7.1 干净基准低估了智能体负担

当证据被埋没时,工作变得更难、也更贵,六家配对实验室全部如此。准确率下降的范围从 -4.1 个百分点(OpenAI)到 -17.8 个百分点(Google),Meta 为 -8.9 个百分点;平均工具调用上升 1.6–3.2 倍(例如 Google 从 9.8 到 22.9,智谱从 9.2 到 25.7,Meta 较温和,从 12.6 到 19.9);除 Meta 以外的五家面板实验室,每个正确答案的成本上升 4.7–7.0 倍(Google 从 $0.181 到 $1.197),Meta 仅为 1.6 倍(从 $0.395 到 $0.612)。各实验室的反应不同:Anthropic 与 OpenAI 把埋没转化为强制声明(55%/20%),而智谱、阿里巴巴、Google 与 Meta 则提高其已承诺错误率(+9.7/+13.0/+17.8/+8.1 个百分点)。因此干净基准低估了智能体检索的真实运营成本。然而,从干净到埋没的差异并不是对推理退化的测量:埋没改变了搜索问题、到达阅读器可用上下文的内容、证据一旦到达后如何被使用,以及套件在更大语料下如何表现,而本设计并不分离这些贡献(第 1 节)。超出这些实验臂的推广留待未来工作。

7.2 置信度不是回执

基准校准并没有阻止一次生产捏造,置信度分数也没有消除自信的错误答案。在干净条件下,GPT-5.6-sol 把 123 个答案中的 123 个放进 90–100 置信度桶,导致 17.1% 的自信错误率。尽管 Fable 5 表现出更好的桶间分离,并在埋没条件下取得较低的已承诺错误率(自信错误 %)5.7%,它仍然产生了自信的错误输出。这一有记录的现场实例进一步说明,模型可以在输出准确数值表格的同时输出捏造的结构性主张,并以高置信度交付。因此,自我报告的置信度不能代替主张级回执。换一种说法:一个答案可以是对的,却不是因为正确的理由而对;评测必须能够把这两者区分开。

引用也不是回执。引用是模型所断言的一个指针;回执是第三方能够对照冻结文件加以核验的指针。因此,一个被营销为“有引用支撑”的系统,完全可以携带框 1 中记录的那种失败——一份自信、格式良好、带引用、却是捏造的解释——因为引用字符串本身没有任何东西证明该陈述是从被引文本中得出的。这就是本文中的每一个数字都落到一个文件和一个定位符(附录 D),而不是落到一条引用上的原因。

7.3 深度主张要求未被污染的提示词

跳数只有在提示词没有把模型自己的分解交给它时才有意义。如果一个问题枚举其步骤(“识别 X,然后回答 Y”),跳数测量的是查找遵从,而不是组合。我们的提示词审计发现,41 条 room02 提示词中有 0 条这样做,这就是我们能够报告声明跳数的原因。该审计是必要条件,而不是充分条件:表明一条提示词没有枚举其子步骤,并不表明语料所声明的每一跳对于到达答案都确实是必需的,也不表明不存在更短的路径。因此在本文中,深度始终是语料所声明的——声明的跳,而不是已核验的跳——我们把它当作设计上的任务复杂度,而不是已被证明的组合推理,直到该审计在操作者的最终阅读中得到人工核验。

7.4 作为审计界面的回执

本文没有任何地方要求模型解释它自己。回执纪律反而是一种审计界面:每一个发表的数字都映射到一个冻结文件和定位符(附录 D),每一行校准要么被分桶,要么连同原因被列为排除(附录 B),每一个跳数标签都有提示词审计和一份由人工核验者签字的金标准链清单作为支撑(附录 A),而那一次现场事件被作为未经编辑的产物包保存(附录 C)。评分故意是多指标的——单靠准确率就会隐藏表 2 至表 3b 中的强制声明与成本效应——因为单一的头条分数根本无法显示强制与成本效应。我们认为,如果智能体评测要在受监管场景中充当证据,它就需要这种形态:不是主张某个模型值得信任,而是一份让别人能够核对的记录。

7.5 读者无法顺着走的回执不是回执

上面的一切都隐含着两个条件,值得写明,因为它们决定一张回执是可用的,还是仅仅存在。第一,被引文档必须是读者能够独立调取的:一个指向读者无法访问的语料的定位符是主张,不是回执。第二,产生该回执的技术栈必须是读者能够运行的:银行模型风险职能中的评测者,或政府测试活动中的评测者,不能部署一个其许可禁止商业或政府使用的检索器、嵌入器或语料,无论其基准分数多么强——我们为本项目评测过的已发表最先进嵌入器采用非商业许可,并因此被排除。两个条件都有利于公共记录语料、许可宽松的组件,以及读者自己控制的硬件。

7.6 冗余不是独立

部署来自若干供应商的模型,正越来越多地被提议为对冲单一供应商风险的办法。这预设不同模型在不同输入上失败——这是集成要胜过其成员所需的经典多样性条件 [25, 26]。我们的六实验室面板在埋没证据下对照金标准答案评分,使我们能够检验这一假设——而答案以一种值得明白说出的方式取决于评分器。在冻结评分器下,正确性模式呈正相关(15 对实验室上的平均成对 φ = 0.43,n = 41 个条目),并且在至少有一家实验室答错的条目中,47% 被多数(6 家中 ≥4 家)共同失败。在第 8 节所述的暂定裁决评分下,同样这两个量下降到 φ = 0.21 与 14%。方向是稳定的——失败呈正相关,而不是独立——但幅度并不稳定,两对数字都不应被读成效应量。留下来的是观察本身:在这六家实验室上,在两种评分下,正确性模式是正相关的,而不是独立的。我们不把这一点转化成关于集成有效性的主张,也不转化成关于一个面板所交付的独立性比其构成所暗示的少多少的主张——若没有一个关于“所预期的独立性”的已定义基线,二者都不成立,而本设计并未建立该基线。事先固定评分契约并定义这一比较,留待未来工作。

图 9 显示实验室之间成对的错误相关。

图 9. 埋没面板上的跨实验室错误相关(φ);当某个条目的三个种子中有多数正确时,该条目对该实验室计为正确;非对角线平均 φ = 0.43,n = 41。高值标出在相同条目上同对或同错的实验室。

8. 局限

room02 数据室基准包含 41 个条目。面板是六家封闭前沿实验室各一个旗舰;六家都有配对的干净+埋没实验臂;Grok-4.6(附录 A.1)与浅层测验实验臂在面板之外。除非提示词审计证明并非如此,跳数标签是语料所声明的。捏造案例是一次 n=1 观察。41 个条目中有两个被排除出每一个实验臂和每一种条件,因为它们相对于其自身源文档是缺陷的,剩下 39 个;下面的统计比较使用该总体,而冻结的表格与图仍然是 41 条目的历史记录。本文不报告模型排名:在我们计算过的每一种评分工具下,多跳指数上得分最低的实验室与下一名之间的差距都落在抽样噪声之内。所报告的成本是条件特定且运行特定的。不主张宽泛的跨实验室排行榜。

测验覆盖。 图表阅读测验(表 1b)并不是 room02 面板的匹配伴侣:它覆盖六家面板实验室中的五家,外加面板之外的 Grok-4.6。在其六条已评分行中,四条第一波的行冻结在 paper_freeze_v1 中;Qwen3.8-Max 与 Muse-Spark 1.2 于 2026 年 9 月 10 日作为第二波增补运行,使用相同的 34 个条目、三种变体与种子,冻结在 paper_freeze_v1_addendum_wave2/ 中,并有其自身清单(附录 D.3)。GLM-5.3 在基于文本的文档实验中接受了评测,但未参加这一图像输入测验,因为所测试的配置不支持图像;这是我们所运行的配置的性质,而不是关于该模型家族的主张。

评分工具,以及它不是什么。 本文中的每一个准确率数字,都由结果冻结当时生效的答案评分器产生。该评分器按归一化包含关系匹配,而不是按相等匹配:当答案包含金标准或其声明的表层替代表述之一时,字符串条目计为正确;当答案中的任一数字在若干数量级因子之一下落在金标准的容差之内时,数值条目计为正确。因此它不是精确匹配评测器,这里报告的分数不应被读成精确匹配分数。

在这些数字冻结之后对该工具所做的审计发现,其主导失效模式是单向的:以未列入清单的表层形式写出的语义正确答案被判为错误。有记录的类别包括:缺少 ISO/拼写日期等价、未匹配的数量级缩写(金标准为 $8.4 million 时写成 $8.4M)、缺少股票代码到法定名称的别名,以及子串包含所固有的词序敏感性。应用一个只增加这些等价关系的严格扩展匹配器,在十二个面板实验臂上翻转了 46 次试验,跨越 10 个条目,每一次都是从错到对。这一单向结果是匹配器的性质,而不是关于评分器的发现:一个只增加可接受等价关系的匹配器,不能把一次试验从正确翻转到不正确,而它所增加的每一种等价关系也是错误答案得以通过的一条新途径。它是一个诊断指针,而不是一组修正。

对该工具的结构化人工复核发现了什么。 我们审计了评分器,而不是断言其健全。一个由 84 个不同答案组成的分层样本,是在选择之前就固定并做了哈希的抽样计划下抽出的,由作者在对模型、条件以及机器自身裁决均盲态的情况下复核,同时还有对争议条目的三项初始裁定、关于解释的三项后续澄清裁定,以及四项有针对性的后续检查——共计 94 项记录在案的决定(84 + 3 + 3 + 4)。有四项结果重要。

第一,评分器的一致在所抽样的层内是健全的。在它判为通过的 25 个答案、以及它判为失败且自动再裁决与之相符的 14 个答案中,人工复核确认了全部 39 个。没有迹象表明存在大的假阳性问题——不过在 748 个抽样单元中的 25 个上,高达大约 13% 的比率仍与观察到零个相一致,因此这是给该问题划界,而不是排除它。

第二,在自动再裁决提出一个冻结评分器曾判为失败的裁决之处,人工复核判定这 34 次上提中有 4 次没有根据,而且每一次都是因为再裁决过于宽松,从不过于严格。对另外 24 个以等价措辞为由被接受的答案所做的、由智能体执行的针对性再检查,没有发现额外错误;这 24 个并未逐一经过人工复核。

第三,41 个条目中有两个被裁定相对于其自身源文档为缺陷,并被排除出每一个实验臂和每一种条件;第 8 节的比较使用由此得到的 39 条目总体,而冻结的表格与图仍然是 41 条目的历史记录。

第四,也最有教益的是,第三个条目携带了一项其问题从未要求的金标准要求——而这一缺陷正在制造实验室之间的差异。在冻结评分器下,该条目 36 次试验中有 12 次正确,而这十二次全部来自其答案碰巧主动提供了未被要求的成分的三家实验室;另外三家实验室在两种条件下得分均为零。修复它会给三家实验室增加试验,给另外三家不增加。

我们带向前的是这个一般论点。一份评分契约可以是确定性的、可复现的、在重新运行时逐字节相同的,却仍然以会改变哪个模型看起来更好的方式是错的。可复现性核验的是转录,而不是评分语义。一份报告分数、却没有关于这些分数如何产生的可审计记录——以及当它们被检查时人工发现了什么——的智能体评测,并不给读者判断其哪些比较能够成立的手段。

三层证据,彼此分开。 本文报告三种数字,并不把它们混在一起。

冻结的历史分数。每一张表和每一幅图都是冻结当时生效的评分器在全部 41 个条目上的输出,从冻结结果逐字节相同地再生。这些是本文的测量,没有任何一项被重述。

经人工复核的修正。上面记录在案的 94 项决定,包括三项条目裁定。凡本文说某项主张失败或收窄之处,该发现就建立在这些决定之上。

智能体暂定的敏感性分析。由自动裁决产生的重新评分,报告它们只是为了显示一项结论在一种可辩护的替代评分下会移动多远。它们不是修正后的分数,本文没有任何表或图把其中之一报告为准确率结果。它们只作为正文中的范围出现,并始终标明为暂定。

我们故意没有重述、重命名或默默修正冻结的数字。它们是历史测量,其有效性界限应当记在它们旁边的记录上,而不是折进它们里面。

统计精度。 每个实验臂有 41 个条目 × 3 个种子,一个实验臂准确率上的 Wilson 95% 区间大约为 ±7–8 个百分点(例如,OpenAI 埋没 78.9% [70.8, 85.1])。因为同一条目的种子并非独立,差异的不确定性由条目级自助法计算(对 41 个条目重抽样,20,000 次抽取;docs/paper1a_draft/uncertainty_check.py,输出在 verification/)。在全部 41 个条目上,从干净到埋没的下降对六家实验室中的四家排除了零(Anthropic -11.6 个百分点 [-22.8, -0.9];智谱 -8.9 [-17.1, -1.6];阿里巴巴 -13.0 [-24.4, -1.6];Google -17.8 [-29.0, -7.9]),对 OpenAI 或 Meta 则没有。这个“六家中的四家”并不在去掉两个缺陷条目后仍然成立,我们不把它当作结论来携带。在 39 条目总体上,在同一个原始评分器下,下降对两家实验室清楚地排除了零(阿里巴巴 -13.7 个百分点 [-25.6, -1.7];Google -17.9 [-29.1, -7.7]),智谱恰好在边界上(-7.7 [-15.4, 0.0]),其余三家稳稳落在区间之内。这一变化是由去掉后来被发现为缺陷的条目引起的,而不是由评分器的任何改变引起的——原始评分器本身就给出更窄的结果——并且在诊断评分与暂定裁决评分下,计数都是六家中的两家。在埋没臂中的实验室之间,本质上每一个成对排序都落在抽样噪声之内。这就是本文不报告排行榜、也不报告模型排名的定量理由:在我们计算过的每一种评分工具下,多跳指数上得分最低的实验室与下一名之间的差距都包含零。这些区间只描述抽样不确定性;它们并不携带上面所述的评分器不确定性,而后者作用于点估计本身。

9. 下一阶段:对证据到答案流水线的干预

下一阶段将把这一工具从诊断延伸到干预。使用金融与国防文档集合,我们将评测一个与来源相链接的知识管理层能否改善交付给智能体的证据,并从而改善其答案的准确率。该评测将区分检索覆盖、答案正确性、格式遵从与运行失败。

为把阅读器的贡献与知识管理层的贡献分开,该研究将比较同一个开放权重阅读器在有该层与没有该层时的表现。随后的训练比较将在两种条件下评测原版阅读器与经任务适配的阅读器。本文所研究的六模型前沿面板,将在有记录的语料访问与资源预算下提供一个普通工具基线。

成功与失败的开发轨迹将支持错误分析与候选训练数据集。相关案例将在开发、训练与留出评测之间分开,留出的答案与轨迹不会用于调参。开放权重模型借助结构化检索取得有竞争力的表现,是一个有待检验的假设,而不是设计所假定的结果。

用于该比较的文档集合,是接下来描述的两个数据室。room02——第二代金融数据室——是本项目中两个数据室的第一个。第二个,room03,把同一套套件、同一套强制声明模式和同一套回执纪律带到一个国防语料。其设计约束直接来自第 7.5 节:每一份文档必须是处于公有领域的美国政府作品(《美国法典》第 17 编第 105 条——联邦采购条例/国防联邦采购补充条例、OFAC 与实体清单、政府问责局决定、国防部发行文件与《战争法手册》、国会研究处与监察长报告、美国陆军工程兵团手册),或者明确采用宽松许可,并按来源记录权利依据,任何带有分发限制标识的材料都在记录上被排除。条目瞄准一个陆军小组从金融工作流中评为拉伸程度最低的任务——采购供应链/FOCI 审计、对外披露审查、作战法审查、监察长记录综合,以及限于带引用算术的文档综合的后勤——声明深度为五到七跳,并采用与附录 A 相同的提示词审计与金标准链清单。这些都还没有运行;本文中的金融结果是证据,表明该测量机制对证据埋没和声明跳数深度是敏感的,而 room03 是我们尚未拥有的迁移证据。在 room03 之外,同一套套件正被扩展到证据并非文本的数据室:图表与幻灯片、扫描申报件、录制音频与影像,以便回执纪律——一个指向冻结文件的定位符——能够像适用于一行文本那样,适用于一帧、一个页面区域或一个时间戳。

本研究中的一项发现塑造了下一步。我们出发去测量阅读器在证据被埋没时如何表现,却发现若不先审计评分器,就无法解释这一测量——一次审计移动了某些结论,而让另一些结论原样留下。因此下一阶段把评分契约当作装置的一部分,而不是当作给定:上面的证据到答案比较将预先登记其答案契约,从一开始就在该契约下评分,并把检索覆盖与答案正确性作为分开的量来报告,从而使交付给阅读器的证据发生的变化,不会与其答案如何被评分的变化相混淆。

组织该阶段的问题是:一条明确可审计的证据流水线——以及由其观察到的失败所告知的训练——能否让一个更小、可控制的模型,在高要求的文档工作上与前沿智能体竞争?本文中没有任何内容回答它。本文所提供的,是可以据以回答它的基线,以及没有它答案就不可核对的那套审计纪律。

10. 可复现性与核验

所有发表的数字都由一个冻结的证据文件夹生成,遵循 [27] 的可复现性清单实践;每一行台账都已经过机械再核验——被引单元格与冻结表格相符,并且每一张表都从冻结结果逐字节相同地再生——报告的哈希见附录 D.1;这些行的独立人工签核仍在待定。一份主张台账把每一条数值主张映射到一个具体文件和定位符。正文不携带行内来源标签;每一个定位符都活在主张台账(paper_claim_ledger.csv)中,它把每一个句子和表格单元格映射到一个冻结文件和行。捏造案例链接到保存下来的文字记录产物。

人工智能协助披露

本项目期间使用了人工智能助手,以支持软件开发、实验分析、文稿起草与修订;所使用的助手是 Anthropic 的 Claude Opus 5 与 Claude Fable 5。人工智能生成的建议与输出被当作暂定的,并在适当情况下对照源文档、代码或实验产物加以检查。作者对研究设计、解释与最终文稿负责。机械可复现性检查以及独立人工核验的状态在第 10 节与附录 D 中描述;该状态是部分的,本披露不应被读成如下主张:论文中的每一条陈述都已获得独立的人工签核。框 1 中有记录的人工智能协助交互被作为分析对象纳入,而不是作为对本文主张的独立验证。

源文提取本止于上述披露。目录中出现的附录标题(金标准链清单、排除行、附录 C 的出处与三条捏造主张及逐字承认、附录 D 的主张台账、表格生成与冻结文件清单等)在所提供的源文正文中没有对应附录全文,故译文不编造这些附录的内容。正文中对附录 A、B、C、D 的引用均按原文保留。参考文献列表从略。

署名与许可

本文为 Luis M. Sánchez 所著论文的中文全译。原文标题:Clean Scores, Buried Evidence, and Confident Wrong: A Receipt-Based Audit of Frontier Agentic QA。论文链接:https://arxiv.org/abs/2609.15319。原文以 CC BY 4.0 许可发布。译者:智测团队。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误