智测 OpenQA

行业与实践研究与基准测试

当智能体指标所度量的并非同一事物:对 Praxa AI 流水线的证据锚定审计

智测团队 · OpenQA(openqa.cn)阅读约 41 分钟

智能体评测在数值上可以是正确的,同时所度量的构念却不同于其标签所暗示的构念。我们对选定的 Praxa AI 实现文件、历史评测产物与运行记录做了一项回顾性度量审计。一份含 139 个用例的离线路由报告有 112 次通过、27 次失败,尽管门

本文目录

当智能体指标所度量的并非同一事物:对 Praxa AI 流水线的证据锚定审计(中文全译)

翻译说明:本文是 arXiv 论文 When Agent Metrics Measure Different Things: An Evidence-Grounded Audit of the Praxa AI Pipeline(arXiv:2609.12017)的中文全译,由智测团队翻译。原作者:Stefan G. Creadore、Peyton Woakz。原文以 CC BY 4.0 许可发布。译文保留原文全部章节、数据与结论;参考文献列表从略。

Stefan G. Creadore

通讯作者:Stefan@praxa.io。ORCID:0000-0003-2268-053X。单位:美国佛罗里达州坦帕。

Peyton Woakz

2026 年 9 月 10 日

arXiv:2609.12017v1 [cs.SE] 2026 年 9 月 10 日

许可:CC BY 4.0

praxa.io | github.com/praxa-labs/

摘要

智能体评测在数值上可以是正确的,同时所度量的构念却不同于其标签所暗示的构念。我们对选定的 Praxa AI 实现文件、历史评测产物与运行记录做了一项回顾性度量审计。一份含 139 个用例的离线路由报告有 112 次通过、27 次失败,尽管门禁失败为零,原因是已知缺口被明确豁免于门禁之外。一次无标识符导出代表 8,843 行工具尝试:其中 8,395 行记录了时长,448 行为缺失值。在这些时长中,有 121 个等于有符号 32 位整数最大值,并带有已放弃客户端标签;所检查的数据库代码会把已流逝的生命周期年龄钳制到上限。汇集后、有记录的第 99 百分位数为 2,147,483,647 ms,而在服务端观测到的已完成调用中为 38,118.31 ms。这是分层对照,不是处理效应。在一项有文档记录的单轨迹压缩试点中,所报告的后续调用输入降幅为 94.39%,但把触发调用与后续调用合在一起计算时,降幅为 46.54%。我们复现了这些描述性计算,用另一套加权有理数算术实现核验了 91 项计时统计,并执行了 13 项评分函数测试与 12 项分析验证器测试。有限补全界表明,缺失时长如何限制针对全部行的计时陈述,且无需对数值做插补。本文的贡献是一项与来源相链接的案例研究,以及一套可复用的验证包,用以把门禁策略、生命周期计时和请求级记账,与更宽泛的智能体性能论断区分开来。历史提供方运行以及当前完整流水线并未被独立复现;一般能力优越性与总体层面的统计显著性均未确立。

1 引言

一个智能体可能选出了合适的工具、取得了终态工具状态,却仍然没有完成用户的任务。反过来,一个请求可能在等待某个人,或在主动执行早已停止之后很久仍未解决。有用的评测必须说明它度量的是这些事件中的哪一种。更多的观察并不能消解所记录变量与科学问题之间的错配。

已有工作指出了智能体评测中的弱点,包括成本记账不完整、留出集不充分,以及把模型开发者与应用开发者的需求混为一谈 [1]。面向任务的基准(如 τ-bench)所评测的对象不同于软件门禁:它们把最终数据库状态与带标注的任务目标相比较,并考察重复试验中的可靠性 [2]。这些区分促使本研究提出一个较窄的问题:现有的 Praxa 度量实际上确立了什么?

Praxa 是所检查仓库中被命名的系统 [3]。我们并不假定其架构提供了某种新的学习能力,而是把选定的定量论断追溯到其度量实现、来源产物与分母。审计得到三个具体案例。一个通过的开发门禁与失败的验收用例并存。一个时延列包含已放弃客户端调用的已流逝年龄。一项很大的后续调用 token 降幅,在计入其触发调用后变小。每一个案例之所以有信息量,恰恰是因为其算术可以正确,而更宽泛的解释却得不到支持。

本文的贡献是一项可复现的度量案例研究,分为三部分。C1:度量边界证据。我们把门禁豁免、被截断的生命周期年龄字段,以及选择性的 token 记账,连接到显式的来源产物与有限分母。C2:计算验证。我们提供经过散列的计时多重集、对原始评分函数的可执行测试,以及一套独立的加权算术验证器;派生的比较合计与图共享同一来源输入。C3:对缺失记录的有界解释。我们表明,所观测到的缺失如何限制针对全部行的有限阈值陈述,且无需插补时长。这些是证据与可复现应用方面的贡献,并不是声称发明了门禁区分、部分识别界或度量科学。

我们还提出一项字段级度量契约,以及若干受控的后续研究。它们的运行有效性尚未被评估。本文不声称提出新的学习算法、达到最先进的任务性能,或相对检索增强生成确立了实验上的优势。

2 范围、研究问题与证据标准

2.1 检查了什么

仓库审查固定在 main 提交 83d29cf51137d57ad11e5ad54ec2aea6f243b90d,时间戳为 2026 年 9 月 9 日 22:27:05 UTC(E01)。我们检查了选定的路由评测代码、评分契约、基准文档,以及架构/可观测性文档。历史路由报告标识的是另一个基线修订,e66dc504f5207d6174626f89270e6d1677927ef3(E02)。报告中记录的基线修订,本身并不能证明生成它的工作树是干净的。数据库过程元数据是独立检查的;其状态并未被证明与任一 Git 修订相匹配。

最初的只读数据库查询返回了运行汇总量与评测表计数。本次追加的稿件审查复用这些带日期的抽取结果;它并不悄悄刷新运行总体。在本会话中,经过连接器发现尝试之后,无法直接访问 Langfuse 追踪与 Cloudflare 运行 API。改为审查了它们的仓库集成文档。仓库搜索与选定表检查并不能确立该组织实验的穷尽清单。尤其是,一条不可用的追踪或一张空的选定表,并不是某项研究从未发生的证据。

我们没有运行完整应用、历史上的 139 用例路由框架、现场提供方基准,或已部署的任务完成测试。没有修改任何生产数据;没有调用清扫、终结、部署,或外部购买/消息功能。最初的审计执行的是只读抽取、描述性再分析,以及隔离的软件符合性测试。本修订增加了精确的载荷到表对账、一套单独实现的算术检查、额外的软件测试,以及缺失敏感性计算。这些是对所保留证据的新检查,不是新的智能体轨迹。

2.2 研究问题

RQ1:是什么把用例正确性与开发门禁区分开?我们考察历史用例总数、类别总数、已知缺口豁免,以及已实现的分母是否一致。这是一个有限产物的一致性问题,而不是对总体成功概率的检验。

RQ2:所记录的时延度量的是哪一个事件?我们检查缺失、饱和、报告权威方、终态,以及相关数据库逻辑。我们检验如下描述性命题:所保留的频数数据能够复现被查询的计数与分位数。我们不把权威方/状态分组当作随机化的臂。我们还追问:当部分已记录时长缺失时,哪些针对全部行的有限阈值陈述仍然可能成立。

RQ3:有文档记录的压缩比较对其记账边界有多敏感?我们重新计算仅后续调用的输入消耗,与两次所报告调用之和之间的差异。这些数值输入是历史文献证据,不是独立重跑的提供方测量。

RQ4:哪些更强的论断仍然未解决?我们识别出为评估当前路径的工具准入、经核实的完成、持久效应以及压缩效率,还需要哪些额外控制。这些问题界定的是前瞻性工作,而不是回溯性地为并未运行的实验制造假设。

对于 RQ1–RQ3,并不定义关于抽样总体的原假设与备择假设:分析针对的是所观测到的有限产物。统计检验需要一种抽样模型,而所保留的证据并不提供这种模型。未来比较的显式假设与控制见第 8 节。

2.3 证据类别与论断纪律

证据标识符 E01–E15 把本稿与补充登记册联系起来。我们区分所观测的来源事实、新执行的测量、历史上由来源报告的结果,以及所提议的实验。一项论断可以作为计算被核验,而其来源实验并未被独立复现。例如,由两个有文档记录的计数算出的 token 降幅,其算术是可复现的,但仍以这些计数的准确性与含义为条件。

随附的论断台账使用 VERIFIED(已核验)、SUPPORTED(有支持)、PRELIMINARY(初步)、HYPOTHESIS(假设)、NOT ESTABLISHED(未确立)与 REJECTED(已拒绝)作为可接受的分类。此处的主要结论限于已核验的描述性计算,以及明确加以限定、由来源支持的解释。“未确立”描述的是本审计的限度;它并不是一项“某能力不可能或不存在”的发现。

3 系统背景与相关工作

3.1 相关实现边界

架构文档描述了一个 Expo 应用、经路由的 Cloudflare Workers、Supabase 持久化,以及其他状态/后台执行表面(E11)。这是文献背景,不是对已部署拓扑的认证。实证分析聚焦于表 1 中更小的边界,对这些边界,所检索到的证据可以被精确说明。

表 1:选定的系统边界及其证据范围。 有文档记录或由代码定义的接口,并不是经过实验验证的能力。

边界所检索的证据它能够确立什么
路由与准入离线报告、指标实现、运行器摘录(E02–E03)被断言的模型前路由/作用域行为,以及指标定义
工具尝试持久化频数汇总量、状态/权威方诊断、SQL 摘录(E06–E08)所记录的尝试值,以及选定的生命周期语义
提供方搜索/压缩历史试点文档(E04)所报告的局部比较、有条件的算术,以及所陈述的注意事项
效应核验Frontier 评分器与契约(E10)已声明的评分要求;不是已部署的符合性
可观测性Langfuse 集成文档(E12)意图中的追踪字段与提示块边界;不是现场追踪结果

离线路由框架特别容易被过度解释。其文档规定没有模型或网络调用、面向名称的准入测试,以及一条 V2 之前的评测路径(E02–E03)。在所审计修订上的标志文档把普通聊天描述为 V2,并称其原先的选择器标志已过时(E11)。因此,这份历史报告不能被提升为对该修订上提供方可见工具集的基准。后续用例也不会仅仅因为其类别名含有 “follow-up”,就确立完整的对话历史处理。

分层的 Frontier 评分器区分证据类别与强制层。其原始契约有 16 个强制层,而候选版本增加了一个显式的任务图层。所检查的基线评分器把 candidateCompletionEligible 设为 false(E10)。这是基线量规与候选级证明之间一种有用的分离;清点被命名的层,并不能表明一项现场任务满足了这些层。

3.2 相对已有工作的位置

我们的分析关注的是度量效度,而不是下游基准排名。Kapoor 等人促使人们同时关注成本、准确率与评测设计 [1]。τ-bench 基于状态的结局检查说明了为什么终态工具标签与经核实的用户目标应当是分开的变量 [2]。AgentRewardBench 研究自动轨迹评测的可靠性;当评分标签被误认为独立的结局证据时,这一点是相关的 [4]。我们不把这些论文中的任何定量结果转移到 Praxa。与那些基准研究不同,我们的分析单元是一件被保留的度量产物或一个被记录的字段,而不是一项新执行的智能体任务。

近期的框架研究提供了有用的方法学比较。HarnessDev 把框架创建与演化分开,并测试留出能力、效率,以及对执行模型的依赖 [5]。Repo-To-Skill 在骨干、框架与下游预算保持固定的条件下,评估可复用的操作知识 [6]。AutoResearch 在接受实验结论之前包含基于证据的审查 [7]。这些研究表明,受控的框架评测与证据审查已经有大量在先工作。我们既不声称开创了这些想法,也不声称复现了它们的评测。

其他近期参考文献处理的是不同构念。《AI 可以学会科学品味》(AI Can Learn Scientific Taste)研究习得的科学判断与构想,包括超出训练条件的泛化 [8]。异构智能体协同强化学习关注训练期间共享的、经核实的推演,以及独立的推理 [9]。全向交互智能体(Omni Interaction Agent)报告了一种流式多模态架构,以及跨越交互维度与智能体维度的评测 [10]。它们是背景性参考文献,不是对 Praxa 结局的支持证据,也不是与此处所审计产物相匹配的基线。本研究没有测量科学品味、协同训练或多模态交互能力。

4 方法与可复现性设计

4.1 历史汇总量抽取

对于验收报告,我们保留了其完整的检索摘要、九个类别摘要、显式的比率分母、生成时间、历史基线 SHA,以及来源 blob 标识。我们没有从这些汇总量重建缺失的单个用例。CSV 中的整数比率分子由每一项所报告的比率及其显式分母导出,并对照总体合计加以核对。经四舍五入的类别均值按所报告的值保留,不展开成虚构的逐用例观察。

对于提供方试点,我们保留了文档中的各臂取值、所报告的软件版本、样本量,以及所陈述的再注入/成本限制。发现百分位数是来源所报告的、每臂两次执行的摘要;原始执行计时未被恢复。因此,我们不从中推断单次运行取值、百分位约定、标准差或置信区间。

账本中断比较同样是文献性的。我们保留其被命名的基线、未提交的候选指定、七个夹具的分母,以及所报告的 Wilson 区间。只有区间算术被复现。缺少不可变的候选代码与原始夹具来源,使环境一致的重放无法进行。限制推断性解释的,是缺少经核实的抽样或随机化设计,而不是算术本身。

4.2 无标识符的运行数据抽取

计时抽取按报告权威方、终态以及精确整数 latency_ms 对 agent_tool_call_attempts 分组,保留每个取值的频数。空值占据显式的缺失值箱。它包含抽取时该表返回的全部行,没有只保留成功的过滤,也没有剔除慢观察。其行创建时间戳跨越 2026 年 7 月 21 日至 9 月 9 日;这并不能证明历史覆盖是完整的,也不能把生产流量与每一种可能的测试/回填来源区分开(E06–E07)。

频数载荷是在 9 月 9 日 23:02:45.811561 至 23:11:54.839382 UTC 之间,以多次分开的只读查询检索的。每一份紧凑载荷带有 PostgreSQL 返回的 MD5 摘要;本地副本复现了该摘要。在本修订中,每一个被解析的非空“取值–频数”单元格还对照分析 CSV 加以核对,而不仅仅对照一个合计。这些检查确立的是所保留字符串与用于绘图的表之间的同一性,而不是对源数据库的独立证明。这些抽取并不是单一的可重复读事务。它们的合计与分位数与另行查询的摘要相一致,但这种一致并不能证明原子快照一致性。

发布候选中不包含对话文本、所有者标识符、工具调用标识符或原始账户内容。频数聚合保留单变量描述统计所需的多重集,同时去掉事件顺序与单元关联。它不保留用户/任务簇、重复实验配对,或估计任务完成所需的证据。仅移除标识符并不构成隐私保证。

4.3 统计与分母

设 \(f_{g}(v)\) 为分层 \(g\) 中数值时长 \(v\) 的保留计数。所观测时长的个数及其均值为

\[ n_{g}=\sum_{v}f_{g}(v),\qquad\bar{x}_{g}=\frac{\sum_{v}vf_{g}(v)}{n_{g}}. \]

补充材料中报告的样本方差使用

\[ s_{g}^{2}=\frac{\sum_{v}f_{g}(v)(v-\bar{x}_{g})^{2}}{n_{g}-1}. \]

“样本方差”这一术语标识的是分母约定;它并不断言独立抽样。分位数在有序观察之间使用线性插值,与 PostgreSQL percentile_cont 的插值定义相匹配 [11]。对于分位数水平 \(p\),令 \(h=(n-1)p\),\(j=\lfloor h\rfloor\),以及 \(a=h-j\)。在从零起计的有序观察下,

\[ Q(p)=(1-a)x_{(j)}+ax_{(\min(j+1,n-1))}. \]

补充表包含均值、中位数、样本标准差、方差、最小值、最大值、四分位数、四分位距,以及 p50/p90/p95/p99。空值被计数,但从不被插补为零。饱和值与所观测到的零保留在主分析中。对等于整数上限的取值做二次删除,明确地是一项敏感性计算,而不是经过校正的执行时延估计量。

验收率保留其已实现的分母。用例通过率计数的是用例。必需工具召回计数的是必需工具名断言。禁止准入率计数的是被明确禁止的工具名断言。快速路径准确率只包括带有显式快速路径期望的用例。这些分母不可互换,它们的计数也不是相互独立的额外智能体试验。

第二套实现在不展开频数表的情况下读取它。它对加权均值、样本方差与线性分位数使用整数求和与 Python 有理数算术,然后把主实现的浮点输出核对到相对容差 \(10^{-12}\) 与绝对容差 \(10^{-6}\)(以所报告的单位计)。平方根作为浮点标量加以核对。这使计算路径多样化;两套实现仍然依赖于同一份所保留的来源证据。

为在不假设随机缺失的情况下描述缺失,设 \(n\) 为所观测时长的个数,\(m\) 为缺失个数,\(c(t)\) 为不大于阈值 \(t\) 的所观测时长个数。在把低于/高于阈值的分类以一切方式指派给缺失行时,补全后表格的比例满足

\[ \frac{c(t)}{n+m}\leq F_{\mathrm{complete}}(t)\leq\frac{c(t)+m}{n+m}. \]

两个端点分别通过把全部缺失行放在 \(t\) 之上,或放在 \(t\) 处/之下而达到。这个初等界是一项有限敏感性计算,不是置信区间、不是插补,也不是对“每一个缺失时长都可恢复或有良好定义”的证明。1、5、30 与 60 秒这些阈值是说明性的分析选择,不是预先规定的服务目标。附录 D 报告全部选定阈值。

4.4 新执行的评分测试

我们复制了原始的 computeAgenticMetrics 源码,并核验了其 Git blob SHA:01bf2308619a9c9b4a84f7ce5b6803d3942b6498。一个隔离的 Node 22.16.0 框架用 TypeScript 5.8.3 对其进行转译,并执行了 13 个有意构造的软件夹具(E13)。一个依赖桩会在无状态工具注册表被使用时抛出异常;它从未被调用。因此,该测试行使的是原始指标函数,而没有悄悄替换其评分逻辑。

这一设置并不是仓库的完整构建。尤其是,仓库所声明的 TypeScript 要求不同于本次隔离测试所用的转译器,并且既没有做项目类型检查,也没有运行完整的 Bun 路由运行器。回执记录了精确的环境、来源散列、夹具与结局。另一套验证器执行 12 个有意构造的测试,覆盖重复检测、空值处理、分位数插值、上限保留与界端点(E15)。被有意改动的测试输入仅限于验证器测试;所保留的经验文件未被改动。这些确定性夹具不适用随机种子,也没有调用任何模型。

5 结果

5.1 离线路由:门禁不是用例分母

历史报告包含 139 个用例,其中 112 个通过、27 个失败:用例通过率为 80.58%。它还报告门禁失败为零。全部 27 次失败都是已知缺口失败,被豁免于开发门禁之外,但仍保留在指标分母中(E02–E03)。这两个结果与所记录的策略一致。若只把门禁报告为完美的评测分数,就会改变该结果的含义。

表 2:历史验收类别(E02;再分析 E14)。 百分比描述的是这一经过编排的语料,不是抽样的用户任务。最后一行是遗留类别的补集,并不是一项独立基准。

类别通过总计失败通过率(%)
legacy(遗留)63630100.00
no tool(无工具)1217570.59
single tool(单工具)1316381.25
ambiguous family(歧义族)613746.15
tool search(工具搜索)660100.00
multi tool(多工具)56183.33
tool name mention(工具名提及)47357.14
follow up(后续)15420.00
multi intent(多意图)26433.33
All cases(全部用例)1121392780.58
Nonlegacy only(仅非遗留)49762764.47

图 1: 来自历史离线报告的类别级验收计数与比率。分母标在每一根柱旁。本评测中不发生模型或网络执行;不主张基于抽样的误差线。

遗留用例贡献语料的 63/139,即 45.32%,并通过 63/63。其余用例通过 49/76,即 64.47%。汇集通过率与非遗留通过率之间 16.10 个百分点的差异是一个构成恒等式,不是测得的改进。最小的类别结果,例如后续 1/5,不应被排序为一般能力估计。

其他总体取值可重建为:实现的 noToolPrecision 为 33/40,必需工具召回为 135/155,禁止工具准入为 16/216,快速路径准确率为 6/7。第一个标签并不表示常规的预测精确率:其分母明确是带有禁止断言的无工具用例。未被禁止的发现/界面工具不被记为违规。平均暴露工具数报告为 11.73,平均模式 token 估计报告为 561.64。后者省略了未解析的定义;其所称的 “floor”(下界)针对的是部分模式估计器,而不是对计费提供方 token 的、经独立验证的下界(E02–E03)。

该报告列出 3 个路由失败事件与 36 个作用域失败事件,预算事件为零。这 39 个事件并不是 39 个失败用例;用例可以有多条失败断言。我们保留两个分母,而不是强行让它们一致。

5.2 隔离的评分符合性

原始指标函数上的全部 13 项测试均通过。它们确立的是表 3 中有限的性质,而不是整条流水线的正确性,或任何真实世界任务完成率。

表 3:新执行的软件符合性测试(E13)。 这些是有意构造的测试输入,不是收集到的智能体轨迹。模型调用:零;无状态注册表调用:零。

测试所行使的契约结局
SC01空的比率分母返回 null,而不是完美分数通过
SC02没有禁止断言的无工具夹具被排除在其比率之外通过
SC03已知缺口失败仍留在用例分母与工具召回分母中通过
SC04始终开启且未被禁止的发现工具不产生作用域违规通过
SC05必需名称与禁止名称有分开的、显式加权的分母通过
SC06快速路径准确率只计数被显式钉住的夹具通过
SC07所报告的均值使用两位小数四舍五入通过
SC08一个通过的用例若保留缺口标注,仍计为已知缺口通过
SC09一个被准入的禁止名称伴有作用域失败时,会降低无工具清洁率通过
SC10非作用域失败不会变成禁止准入失败通过
SC11置换用例后各项汇总量保持不变通过
SC12必需工具召回按断言加权,而不是对用例召回取平均通过
SC13重复相同的夹具输入会使计数加倍,但比率与均值不变通过

单独实现的验证器在七个所报告的选取上、对 91 个描述性计时统计单元格取得一致,并对全部八项压缩比较取得一致。全部 12 项验证器测试通过。这些计数度量的是软件检查,不是独立的实验观察。精确的载荷到 CSV 同一性对每一个非空频数条目也成立(E15)。

5.3 运行时延:外形像执行时延的字段中的生命周期年龄

该导出代表 8,843 行尝试。其中 8,395 行有数值时长,448 行为空,缺失比例为 5.07%。有 409 个记录为零的值,没有负的已记录时长。另行的时间戳查询报告没有负的开始/结束区间。主分析保留全部非空值,包括零与饱和值(E06–E07)。

表 4:按权威方/状态划分的已记录时延(E06;再分析 E14)。 全部时长列的单位为毫秒。“N”计非空且非负的时长,不是经独立核实的执行计时。汇集行并不是对共同任务或模型工作负载的摘要。

分层N空值p50(ms)p95(ms)p99(ms)
汇集8,3954481,765.0036,250.102,147,483,647.00
服务端 / 已完成7,0684371,645.5022,751.9538,118.31
服务端 / 失败69711986.0021,207.6032,108.16
服务端 / 对账350657,672.00881,293.00890,877.36
客户端 / 已完成24003,195.0022,612.6043,708.48
客户端 / 失败3550456,744,052.002,147,483,647.002,147,483,647.00

图 2: 已记录时长的经验累积分布。所选分层说明不同的报告语义;全部五个分层都包含在表 4 与补充 CSV 中。水平刻度在零附近为线性,其后为对数,从而保留零值记录与很大的饱和尾部。

汇集均值为 43,538,604.60 ms,而中位数为 1,765 ms。其第 99 百分位数等于 2,147,483,647 ms,即有符号 32 位整数最大值。恰好有 121 个值达到这一上限,占非空记录的 1.44%。汇集诊断把全部 121 个放在客户端报告、失败、client_never_reported 组中。它们共享的行创建时间戳为 2026 年 8 月 6 日 15:15:25.168218 UTC(E07)。行创建并不必然是工具开始执行的时间。

所检查的当前终结器计算终结时刻与该调用所记录开始时刻之间的已流逝时间,将其向下取整到毫秒,并钳制到整数上限。一项被保留的迁移定义了一次清扫:把被放弃的 client_pending/client_reported 调用终结为失败,代码为 client_never_reported(E08)。这 121 条饱和记录未经钳制的时间戳区间范围为 2,149,762,173.161 至 4,097,646,570.161 ms。这一组合支持生命周期年龄解释,而不是“提供方主动执行了约 24.86 天”的论断。

在 355 次客户端报告的失败中,有 298 个 client_never_reported 标签,其中包括全部饱和值。仅仅删除这 121 条被封顶的记录并不能隔离执行计时:剩余的汇集 p99 为 453,532,616.08 ms。表 5 说明为何去除饱和是不充分的校正。

表 5:仅删除饱和值的敏感性(E06;E14)。 这不是架构比较。缺失值仍被排除在数值摘要之外;所有其他生命周期年龄仍然保留。

选取数值 N均值(ms)p50(ms)p99(ms)
全部已记录值8,39543,538,604.601,765.002,147,483,647.00
仅排除上限8,27412,770,251.911,722.00453,532,616.08

在服务端观测到的已完成记录内部,中位数为 1,645.5 ms,p99 为 38,118.31 ms。这是一个定义更窄的描述性分层,不是对总体面向用户时延的估计。其 437 个缺失值、389 个零、工作负载混合、潜在的测试/回填记录,以及未被观测的模型版本,仍然相关。它与汇集 p99 的对照,并不是可归因于某项工程变更的加速。

缺失在该分层内部仍然重要:7,505 行服务端观测到的已完成行中,有 437 行缺少时长。在说明性的 30 秒阈值上,7,068 个所观测时长中有 6,967 个处于或低于该阈值(98.57%)。在对 437 个缺失阈值分类的每一种补全上,全行比例的范围是 6,967/7,505 至 7,404/7,505(92.83%–98.65%;E15)。没有插补任何值,两个端点也都不是总体置信限。这一计算针对的是所记录的字段,不是经核实的主动执行,也不是服务水平目标。

最后,有 130 行的已记录时延与所查询的开始/结束区间之差超过一秒;其中 121 行是饱和行。另外 9 个差异无法由所保留的汇总量解决。我们既不悄悄纠正它们,也不指派原因。全部 8,843 个所检查的所有者/调用键组合都是互异的,但这并不能排除使用不同键的重试、重复的逻辑任务,或用户内依赖。

5.4 压缩:后续调用节省与两次调用记账

历史压缩文档描述了一条配对轨迹,含 25 个历史回合。它报告模型标识符为 gpt-5.6,ai 为 7.0.59,其 @ai-sdk/openai 适配器为 4.0.37;从所检索的证据中,并未确立不可变的提供方模型快照、温度、种子与硬件描述(E04)。该文档所报告的观察见表 6。

表 6:有文档记录的压缩试点取值与派生合计(E04;E14)。 只有一条配对轨迹,不是总体样本。正的相对变化表示原生侧数值更大。两个时长之和是算术结果,并非独立测得的端到端墙钟时间。

量应用侧原生侧变化(%)
触发输入(token)10,61010,790+1.70
后续输入(token)10,695600-94.39
两次调用输入之和(token)21,30511,390-46.54
触发 TTFT(ms)1,1792,016+70.99
后续 TTFT(ms)922974+5.64
触发完整回合(ms)1,6482,474+50.12
后续完整回合(ms)1,2541,230-1.91
两次调用时长之和(ms)2,9023,704+27.64

图 3: 历史压缩报告中所暴露的两次调用的输入 token 记账。计入触发调用会改变比较的分母;它并不估计完整的提供方计费,或全部 25 个回合的轨迹成本。

后续输入计数从 10,695 降到 600,降幅 94.39%。计入触发调用后,得到应用侧输入 token 21,305 与原生侧输入 token 11,390,降幅 46.54%。作为算术,两个结果都不是假的。较小的那个值回答的是另一个更宽的问题,但它仍然排除了任何未报告的、仅压缩的用量,以及轨迹的其余部分。总节省成本并未确立。

原生触发有 10,790 个输入 token,比所报告的、配置为 8,192 token 的限制高出 2,598。来源把这归因于其 bytes/4 估计器的低估,并明确陈述:该次运行并不使请求封套强制执行获得资格(E04)。这一由来源报告的资格失败必须保持可见。它并不是在声称提供方的模型上下文硬上限被超过了;所配置的应用限制与提供方上限是不同的量。

图 4: 试点中所报告的触发与后续完整回合时长之和。即便其后续时长略小,原生侧之和仍然更大。没有重复运行的不确定性,也没有总工作流时长。

后续完整回合时长从 1,254 ms 变为 1,230 ms,而触发从 1,648 ms 变为 2,474 ms。它们的和分别为 2,902 ms 与 3,704 ms:增加 27.64%。求和并不能确立实际的工作流墙钟时长,因为并未提供编排边界与额外工作。它确实排除了把仅后续调用的计时当作完整的两次调用记账。

据报告,两臂都通过了三项普通事实检查与两项安全状态检查。预算信息与两个安全状态由应用再注入;在没有该再注入的情况下,只有两项原生上下文事实被独立探测。因此,这些检查并不能隔离“原生压缩机制保留了全部被断言事实”。该文档还报告了持久化/重新加载行为,但没有提供测得的数据库或对象存储开销。这些限制被保留下来,而不是被折进一项一般的记忆质量论断。

5.5 次要历史证据与缺失的比较

发现试点使用一个天气任务,每臂两次执行。初始模式大小报告为 1,112 与 1,108 字节,字节除以四的估计为 278 与 277 个 token。所报告的答案 TTFT 的 p50 为 3,008 与 3,264 ms;p95 为 3,115 与 4,082 ms。必需读取与必需事实检查在两臂中均为 2/2 通过。在这一有限的文献样本且没有原始计时的情况下,优越性、等价性与尾部时延论断均未确立。完整的所报告发现摘要保留在 CSV 中,包括完整回合百分位数,以及作为配置说明的、观测到的缓存读取计数为零(E04)。

一份七工具的确定性账本中断产物报告:尽管持久声明失败,基线夹具中 7/7 仍执行了变更,候选夹具中为 0/7。候选被明确命名为未提交,并且该产物把产品级比较标记为未测试(E05)。重新计算的 Wilson 端点与所报告的值一致,但区间计算并不是“这些经过编排的夹具构成对未来失败条件的独立抽取”的证据。我们不附加配对显著性论断:夹具选择、配对来源,以及抽样或随机化设计均未被核验。仅有端点计数并不能为外推到生产安全提供正当理由。

所选定的数据库清单中,platform_experiments 有零行,有四行标记为通过的已部署评测行,另外两张选定的预测/评测表各自为零行。回合评分来源计数为 1,173 个 turn_judge、61 个 verifier 与 77 个 critique(E09)。这些是记录标签,不是经独立裁定的成功计数。该清单并不能正当化“别处不存在 A/B 测试”的声明,也不提供受控的当前流水线比较。

6 统计解释与尝试性证伪

主要结果是关于有限保留产物的精确描述性陈述。其主要不确定性是证据性的与语义性的,而不是随机样本均值周围的置信区间。经过编排的路由语料没有得到证明的随机抽样机制;同一用例内的工具名断言共享上下文。运行记录可能共享用户、任务、提供方、部署或重试。压缩试点只有一条轨迹,并把记忆与显式再注入混合在一起。若将这些对象重抽样为独立试验,就会加入证据无法支持的假设。

因此,主要结果不含 p 值、标准化处理效应量或总体置信区间。相对变化与百分点差异均作为算术对照完整报告。统计显著性论断并未确立。反之,缺少显著性结果也不是等价或零效应的证据。对未来配对试验的数值功效要求,需要预先规定的有意义效应、不一致结局率或轨迹级方差、依赖结构,以及错误率目标。这些都没有作为本数据集的观测性质被提供。

我们主动检查了其他解释。第一,表面上完美的开发门禁由已知缺口策略解释;它并不要求用例分母被数错。第二,饱和计时值由当前钳制逻辑与已放弃调用标签所印证,而不是被当作未指明的离群值丢弃。第三,仅去掉上限后仍留下极端的生命周期年龄,从而削弱了“少数损坏数值是唯一问题”这一假设。第四,token 节省在两个可见的报告边界上都被重新计算。第五,再注入的事实不被计为压缩保留的隔离证据。第六,单独的加权算术实现核对了展开数组上的计算。第七,全部选定的缺失阈值都被报告,包括那些削弱完整个案读法的界。通过验证器的拒绝测试支持分析代码中的错误检测;它不能替代独立的来源证明或外部同行评审。

若干证伪尝试仍然不完整。我们未能确立每一条运行行都来自仅生产流量,未能重建历史过程部署,未能识别任务级重复,未能测量超出试点所报告计数的提供方缓存效应,也未能对照不可变的提供方快照核验历史模型标识符。这些缺口约束了结论。本审计是反对无支持解释的证据,而不是证明每一项不利观察都反映智能体本身的缺陷。

7 讨论:一项提议的度量契约

这三个案例共享一种结构:一个局部运行指标在不保留其边界的情况下,被提升为更宽泛的科学构念。门禁状态关乎发布策略,并不必然关乎用例正确性。一个已流逝年龄列关乎所记录事件之间的区间,并不必然关乎主动执行。一个后续输入计数关乎一次提供方请求,而不是计费完整的工作流。这些数据说明了上述区分;它们并不确立同样的问题在其他系统中发生的频率。

一种有用的纠正,是在聚合之前使度量单元与事件语义显式化。我们提议一份契约,包含:分析单元、资格规则、模型/提示/评分器/部署修订、开始与结束事件、时钟来源、报告权威方、终态、删失状态、独立的结局证据、逐调用用量,以及任务/轨迹分组。补充 JSON 给出字段级提议。它并不是在声称生产环境当前实现了这份契约,或采用它已被实验表明能提高可靠性。

对于时间度量,执行、排队、审批等待、对账与放弃年龄应当是不同的事件类型。宽数值存储与显式饱和标志保留“很大的观测区间”与“被截断的值”之间的差别。一次已完成的工具调用不应意味着经核实的任务结局。一次对账事件不应被悄悄改标为任务失败或主动执行时间。

对于验收报告,用例结局、强制门禁结局与断言级比率应当一起发布。豁免可以是正当的工程策略,但它们在科学分母中应当保持可见。先前开发的夹具与新增加的类别应当被识别出来;它们的混合不应被误认为处理效应。

对于压缩,主要记账边界应当在检查结果之前陈述。面向计费的端点需要全部相关的提供方回执,包括输入、输出、缓存、重试,以及在被暴露之处单独记账的压缩。面向时延的端点需要测得的从开始到终态的边界,而不是选择性的调用时长。保留检查应当识别哪些事实仍在原生上下文中,哪些是有意重新引入的。再注入可以是可取的系统设计;它只是回答了另一个机制问题。

这些建议与已有的评测及证据审查想法相重叠 [1, 7]。本文的贡献是以可复现、与来源相链接的方式,表明它们对一个系统的相关性。所提议契约的有效性仍然是一个有待前瞻性检验的假设。本修订为所提供的频数产物增加了一个可执行验证器,而不是该契约的生产实现。应用及其数据库模式都未被更改。

8 受控后续研究:未运行

附属的 operator_coverage 目录提供 27 个族中的 264 份提议场景契约、40 个故障叠加,以及一个 36 用例的冒烟选取。全部场景均标记为 NOT_RUN。这一前瞻性目录没有为本审计贡献任何已执行的任务结局或性能估计。

下列研究对于更强的论断是必要的。它们是未来执行的规格,不是已完成的实验、预注册研究,或编造的样本量承诺。不相交的校准集与预先规定的效应标准,必须在打开评测集之前决定样本量。任务、轨迹或故障矩阵单元必须是所声明的分析单元;单个事实断言与重复的软件检查不能把它膨胀。无效的基础设施运行需要预先规定的规则;不成功的智能体结局不能被简单剔除。

P0:在沙箱中核验计时语义。在受控时钟下行使即时完成、提供方延迟、审批等待、已放弃客户端的终结、对账,以及整数存储边界附近的值。把每一个所报告字段与独立保留的事件区间相比较。原假设是:所提议的修订后仪器相对冻结的当前实现,并不减少语义误分类;备择假设是在锁定的事件矩阵上有所减少。先确立确定性的事件符合性,再用盲法标签评估任何运行误分类率。在固定矩阵与计划重复次数处停止,而不是在出现有利子集之后停止。

P1:消融当前路径的工具准入。用同一冻结的执行模型、提供方、提示、任务、工具实现、重试策略、超时与资源预算,把当前的动态准入机制与静态工具基线相比较。应当不同的只有准入机制。保留任务配对,并对执行顺序做抵消平衡。主要结局应当是经独立核实的任务完成;被准入的模式大小、提供方 token、虚假成功报告、安全违规,以及测得的面向用户时长是次要结局。对于预先规定的目标任务分布,原假设是配对完成差异为零;有方向的备择假设只有在评测前承诺才合适。任务簇重抽样或配对分类检验必须反映实际的重复试验设计。对预先声明的次要检验族做校正,而不是挑选哪一个指标有改善。

P2:评估全轨迹压缩。使用配对历史,具有锁定的视野分布,以及相同的模型、提示、再注入、工具与预算策略。把原生上下文回忆、应用恢复的状态、安全决策与经核实的下游结局分开。主要估计量应当是在预先规定的质量要求条件下的、预先规定的效率度量,或一项联合的质量/成本比较;边际必须在评测前选定。成本降低论断的原假设是:在该质量要求下,计费完整的轨迹成本没有降低。记录全部提供方回执与墙钟边界。把轨迹作为簇来分析,而不是作为单个事实检查或回合。保持质量的效率结论需要两部分的证据,而不是仅有显著的 token 差异。

P3:在故障下核验持久效应。同时冻结基线修订与候选修订。执行一个独立的故障矩阵,覆盖持久声明失败、重复请求、提交后丢失的响应、被撤销的权限,以及在既定边界处的中断。使用提供方模拟器或明确授权的沙箱,绝不使用未经批准的生产变更。独立读取外部状态,并计数缺失、重复、被禁止与被授权的效应。关于失败即关闭的准入减少被禁止效应的论断,其原假设是在所指定的故障分布上没有减少。确定性矩阵覆盖与随机重复应当分开报告,并保留全部结局与重试。

P4:取得经独立核实的任务结局。锁定一份由现实任务构成的留出语料,并发布纳入标准、模型/工具可用性、验证器规则与评分器修订。防止使用留出失败来选择候选。对照匹配的常规循环或机制关闭的基线进行比较,而不是对照无关的排行榜条目。把任何自动评判器对照盲法的人类裁定或基于状态的裁定加以校准,并保留分歧。主要假设关乎经核实的完成,而不是状态字段写着 completed 的记录计数。在打开留出集之前选定最终候选;报告每一个计划臂与运行。

不对这些研究作出数值功效声明或最小样本量保证。它们所需的观察、控制、停止规则与统计选择,取决于当前材料包中并不存在的目标总体与校准证据。

9 局限性与效度威胁

内部效度。 本审计把抽取期间所检查的数据库代码与历史运行记录联系起来,但并不重建每一次历史部署。匹配的标签、时间戳与钳制行为支持生命周期解释,但并未证明完整的因果历史。提供方试点改变了压缩行为并包含再注入;其较小的所报告比较并不能隔离每一种机制。产物选择是回顾性的,并聚焦于可及的证据,并非独立于正在形成的论点而抽样。

构念效度。 路由准入不是任务执行;已完成的尝试状态不是经核实的用户目标完成;一个被命名的验证器来源不是独立裁定。模式 token 下界是一个部分估计器。时延字段度量的是带有混合事件语义的存储区间。我们把论断收窄到这些构念,而不是换成听起来更好的标签。

统计结论效度。 独立性、抽样覆盖、任务簇以及完整的重复运行分布都不可得。单条压缩轨迹不能支持对目标总体的方差估计。历史上的七夹具区间计算并不能解决依赖或选择问题。因此我们避免推断性结论,而不是呈现误导性的确定性。额外的缺失界只约束有限表的可能补全;它们并不修复工作负载选择,不区分主动执行与等待,也不恢复缺失的任务簇。

外部效度。 一个私有智能体系统与选定的内部产物,并不能确立跨框架、提供方、模型或任务总体的普遍程度。离线路由报告早于当前有文档记录的路径。没有独立复现标准化的任务性能分数或公平的外部系统比较。我们不对企业可靠性、世界模型学习、自适应预测、多智能体优越性或自主科学发现作推广。

可复现性效度。 频数多重集与派生图形可以离线复现,但源数据库是可变的,其抽取是非原子的。两套数值实现共享这些相同输入,因此一致性能抓住实现差异,但不能抓住共同的来源错误。完整的历史提供方回执与验收用例记录并未打包。原始仓库访问仍然是私有的,隔离的 TypeScript 符合性测试也不是环境一致的应用重跑。来源散列是文件同一性的有用证据;它不是公开可访问性或执行来源的证明。

10 可复现性、伦理与可得性

配套归档包含证据登记册、论断台账、实验登记册、可追溯性图、精确的时延频数与紧凑载荷摘要、来源于历史的汇总量、未经修改的指标函数源码、符合性测试、分析/绘图脚本、SQL 查询模板、环境回执、第二套算术验证器,以及缺失界。主要命令为:

python analysis/reanalyse.py
node analysis/scoring_conformance.cjs
python analysis/review_validation.py

Node 命令需要所记录的 TypeScript 依赖;README 说明了如何解析。历史提供方命令与完整路由命令被另行记录为未在此处执行。对更晚的数据库状态重跑只读 SQL,是一次新的抽取,而不是对所保留快照窗口的复现。离线复现应当从打包数据与校验和验证开始。校验和保护的是文件同一性,不是事实正确性或匿名性。面向投稿的源码包包括支持研究的数据与代码、可编辑的稿件源、执行回执,以及在其附属目录中单独标注的前瞻性操作者覆盖目录。

不包含受保护的提示词、凭据、原始账户标识符或对话内容。聚合降低了直接的标识符暴露,但并不证明匿名性。附属文件保留精确的运行频数信息与选定的来源摘录;它们并不披露完整的私有应用仓库。

本稿及其本地分析代码是在人工智能辅助下准备并审查的。额外轮次是同一准备工作流内的计算与编辑核验,不是独立人类科学家的评审。人类作者对本稿及其论断负责。所提议的实验必须对潜在破坏性效应使用隔离环境,并保持审批/租户边界。我们不把这些回顾性观察当作削弱这些控制的授权。

11 结论

现有的 Praxa 证据支持的是一项度量案例研究,而不是一般优越性论断。一个历史路由门禁的门禁失败为零,而 139 个用例中有 27 个失败。一个运行时长字段包含已放弃客户端调用的被封顶年龄,使其汇集尾部不适合作为关于主动执行时延的论断。一项有文档记录的压缩试点,其 token 降幅从后续边界上的 94.39% 变为两次可见调用合计的 46.54%,且并未确立总节省成本。

这些发现伴随着可复现的汇总量计算、13 项通过的隔离评分函数测试,以及 12 项通过的验证器测试。另一套加权算术实现确认了 91 个计时统计单元格以及全部八项所报告的压缩比较;有限缺失界保留了仍然未解决的部分。它们的价值在于精确识别每一项结果度量的是什么,以及要更宽泛地解释它还需要哪些额外证据。一篇更强的、关于当前流水线能力的论文,仍然取决于冻结的、受控的、经独立核实的任务实验。本材料包使这一边界显式化,并提供质疑其更窄结论所需的数据与程序。

附录 A 证据同一性与来源覆盖

CSV 登记册是权威的完整映射。除非另行声明了历史修订,仓库源路径按 E01 解释。下列标识支持核心实现与历史产物:

  • E02。 evals/acceptance/agentic-baseline-2026-09-07.json。Git blob:9925e82a6e45855af2670b43adb20c9a10c97d3e。
  • E03。 src/lib/eval/agentic-metrics.ts。Git blob:01bf2308619a9c9b4a84f7ce5b6803d3942b6498。
  • E04。 docs/benchmarks/native-quality-pilot-2026-09-06.md。Git blob:075810098d19906b75d75bc3723591f18c3817a9。
  • E05。 artifacts/frontier/comparison-results.json。Git blob:fa12523278918db48764b9b21b573f99e9a02aee。
  • E10。 evals/scoring/frontier-outcome-scorer.ts。Git blob:15e390c206d094a775b71ba2dd95e60014113f78。
  • E10。 evals/frontier/contracts.ts。Git blob:4eb2bef13c0c8c3795e0642e994e92cd7f3cda13。

数据库元数据有独立标识。所检查的 finalize_agent_tool_call 源由 PostgreSQL 报告为 4,979 个字符,MD5 为 5ce45a9ba6e845bde047f7e1d9ac6120;客户端终结器为 763 个字符,MD5 为 ce7c0b30c2e14f004b65b2cc04b0dbd3。这些是完整源字符串的返回标识,不是所选摘录文件的散列。所检查的相关表达式为:

measured_latency := least(
 2147483647::numeric,
 greatest(
 0::numeric,
 floor(extract(epoch from
 (finished_time - current_call.started_at)) * 1000)
 )
)::integer;

相关联的迁移元数据标识版本 20260806140000,名为 sweep_abandoned_client_tool_calls。其源规定默认陈旧时限为 86,400 秒,默认限制为 200。我们阅读了该定义,但并未调用它。历史部署关联仍未解决。

附录 B 透明计算与区间状态

摘要与核心表格背后的算术为:

\[ \begin{aligned} \text{用例通过率} &= 112/139 = 0.8057554,\\ \text{非遗留通过率} &= (112-63)/(139-63) = 49/76,\\ \text{缺失比例} &= 448/8843 = 0.0506615,\\ \text{后续降幅} &= 1-600/10695 = 0.9438990,\\ \text{两次调用输入降幅} &= 1-(10790+600)/(10610+10695)\\ &= 0.4653837,\\ \text{时长之和变化} &= (2474+1230)/(1648+1254)-1\\ &= 0.2763611. \end{aligned} \]

历史账本产物的 Wilson 区间可以代数复现。对于 \(\hat{p}=k/n\) 与 \(z=1.959963984540054\),其中心与半宽为

\[ c=\frac{\hat{p}+z^{2}/(2n)}{1+z^{2}/n},\qquad w=\frac{z\sqrt{\hat{p}(1-\hat{p})/n+z^{2}/(4n^{2})}}{1+z^{2}/n}. \]

对于 \(k=n=7\),端点约为 \([0.64567, 1]\);对于 \(k=0,n=7\),端点为 \([0, 0.35433]\)。这复现的是来源的区间计算,而不是其推断适用性。常规的二项解释需要若干条件,而这些条件对所选的确定性夹具并未确立。因此正文不把这些区间用作关于生产安全的置信陈述。

附录 C 实验设置与缺失字段

表 7:可复现性设置与未解决字段。 被省略的字段不用常规默认值填补。产物所报告的模型名并不是经独立核实的提供方元数据。

分析所记录的设置缺失或未确立
历史路由139 个经过编排的用例;来源生成时间与基线 SHA;无模型/网络完整的原始用例包、干净的历史树、环境一致的重放
评分符合性原始来源散列;Node 22.16.0;TypeScript 5.8.3;13 项测试完整的项目类型检查与端到端路由执行
运行计时精确的权威方/状态频数;抽取窗口;空值计数原子快照、任务簇、模型版本、工作负载资格与完整保留
原生试点所报告模型 gpt-5.6;ai 7.0.59;@ai-sdk/openai 4.0.37;有文档记录的任务计数不可变模型快照、原始回执、种子、温度、硬件与完整计费
账本中断每臂七个夹具;被命名的历史基线;候选标记为未提交候选 SHA、配对的原始用例、产品路径重放

数据字典标识每一份 CSV 的单元,以及它包含的是检索值还是派生计算。尤其是,latency_frequencies.csv 是压缩多重集,而不是每次调用一行;acceptance_categories.csv 包含汇集类别,而不是独立试验;试点 CSV 转录的是历史报告,而不是编码新实验。验证回执把新执行的测试与描述性检查,同全部未运行的后续工作区分开。

附录 D 有限缺失敏感性与核验

下表报告完整的说明性阈值集合。“仅观测”是把处于或低于阈值的观测计数除以非空计数。补全范围则把全部行保留在分母中,并变动每一种缺失阈值分类。汇集选取有 8,395 个观测时长与 448 个缺失时长;服务端/已完成选取有 7,068 个观测与 437 个缺失。取值为百分比。主分析中没有把任何缺失值设为零。

表 8:已记录时长阈值的有限补全界(E06;E15)。 这些不是置信区间、生产 SLO 估计,或对主动执行的测量。阈值是为描述性敏感性分析而选择的,不是在数据采集之前选定的。精确分子与有理端点见 missingness_sensitivity_bounds.csv。

选取阈值(s)观测计数仅观测(%)补全范围(%)
汇集13,01635.9334.11–39.17
汇集56,77280.6776.58–81.65
汇集307,93694.5389.74–94.81
汇集608,03095.6590.81–95.87
服务端/已完成12,63837.3235.15–40.97
服务端/已完成56,01085.0380.08–85.90
服务端/已完成306,96798.5792.83–98.65
服务端/已完成607,03799.5693.76–99.59

验证器直接由有序的互异取值与频数计算加权分位数。其均值使用整数和 \(S_{1}=\sum_{v}vf(v)\);其方差使用 \([nS_{2}-S_{1}^{2}]/[n(n-1)]\),其中 \(S_{2}=\sum_{v}v^{2}f(v)\)。有理数算术在为比较而转换之前避免累积误差。验证器不导入 NumPy,不调用模型,也不访问源数据库。十二项构造测试包含一种总和相同但分布不同的损坏,这种损坏必须被拒绝:仅总和一致无法检出该错误。所提供的源数据从未被这些测试修改。

validation/second_pass_validation.json 记录精确的有理数检查、测试结局与执行环境。上传评审的重跑回执另行保留在 validation/upload_review_2026-09-10/ 之下。新的检查计数或重新生成的执行时间戳,都不会构成另一项经验性智能体观察。

参考文献

参考文献列表从略。正文引用编号 [1]–[11] 予以保留,不补写条目。

署名与许可

本文译自 Stefan G. Creadore、Peyton Woakz,When Agent Metrics Measure Different Things: An Evidence-Grounded Audit of the Praxa AI Pipeline,arXiv:2609.12017。原文以 CC BY 4.0 许可发布。译者:智测团队。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误