Industry & PracticeTechniques & Tutorials
Transect: 让 长 程 大 语言 模型 智能 体 评 测 仍然 可 观测
英国 AISI 的开源包 Transect 把长程智能体轨迹对齐到同一条回合时间线上。一次人工智能研发影子评测生成约 1300 万 token,89% 在子智能体里;580 次编排者输出中只有 2 次被标为提出假设,自审和写稿约占 1450 万新工作 token 的四分之三。
In this piece
Transect:让长程大语言模型智能体评测仍然可观测
Toby D. Pilditch(通讯作者:toby.pilditch@dist.gov.uk)、Konstantinos Voudouris、Cozmin Ududec,英国人工智能安全研究所(UK AI Security Institute,AISI)。Alexandra Abbas,Meridian Labs。许可证:CC BY 4.0。arXiv:2610.08364v1,2026 年 10 月 6 日。
关键词:大语言模型评测;轨迹分析(transcript analysis,阅读智能体整段运行记录);可观测性;人工智能安全;智能体评测;专家采集(expert elicitation,向领域专家结构化地询问缺失信息)。
摘要
前沿人工智能评测越来越多地使用开放式、智能体式、长程任务。这类任务的轨迹可以长达数百页,来自复杂多智能体网络的输出和动作。可观测包络(observability envelope,评测者能够可靠推断出的智能体行为范围)因此在变窄。语言模型助手能帮助分类和解释智能体行为,但也给人类评测者很大的分析自由度,威胁基于语言模型的轨迹分析是否可复现、可否审计。Transect 是建在 Inspect Scout 上的开源软件包,用来帮助评测者看懂一次长运行是怎样展开的,找出值得调查的行为,并把解释核对回轨迹原文。用户在可复用的评测族配置里写明任务上下文和行为词表;评判模型和分析设置另行提供。Transect 的可导航报告把记录到的事件、token 用量、子智能体活动和模型生成的行为标签,对齐到同一条按回合(turn,一次智能体输出)计的时间线上。审阅者可以很快抓住一次运行的叙事,把任一标签或事件追到源回合,并导出底层数据表做跨运行分析。我们在一次人工智能研发评测上演示这一流程。该评测生成了将近 1300 万 token。我们把智能体的工作分成与研究技能分类对齐的行为阶段,并同时看子智能体委派与交互、以及 token 用量。合在一起的视图显示:工作集中在操作事务和文稿生产,几乎看不到持续的假设生成阶段。而持续的假设生成,可以说是高质量科学产出的必要部分。Transect 灵活、可定制的轨迹分析流水线,让评测者能跟上更长、更复杂、更频繁的人工智能评测,同时支持科学严格性、透明和可复现。
1 引言
三件事正在重塑前沿人工智能评测。第一,静态基准继续饱和,越来越难靠它们区分前沿人工智能系统的能力 [1]。此后我们这样用词:人工智能模型指静态的网络权重;人工智能智能体指能使用一组工具、在环境里采取行动的模型;人工智能系统指围绕并包括该智能体的一般基础设施,包括同步监控器、动作分类器和多智能体支架(harness,包在模型外面、负责工具、权限和子智能体的程序)。评测因此转向开放式、智能体式、长程任务:人工智能智能体规划、使用工具、委派给子智能体,并朝一个目标走很多步,沿途产生数百万、有时数十亿 token [2, 3, 4]。第二,能力更强的智能体出现得更频繁,在下一个系统出现之前用来细看每一个系统的时间更少,而且智能体能力可以在模型版本之间大幅提高 [5]。第三,测到的表现可以在很大程度上取决于 token 预算,以及它有没有机会修改自己的工作 [6, 7]。评测因此变得更长、更频繁、更吃算力,给盯着前沿进展的人类评测者加上越来越重的负担。
我们把评测者能够可靠看见或推断出的属性范围,称为这次评测的可观测包络。它包括:在评测条件下智能体能做什么,它做得多稳,它在哪里、怎样失败,以及它表现出什么倾向。包络取决于整套评测装置:轨迹、被评人工智能系统的细节(例如支架设计)、轨迹分析方法,以及解释评测证据的人。至少有四种压力在挤压这个包络,使评测者更可能从轨迹里得出站不住的结论。
第一,运行内部不透明:一个最终分数概括了长程任务上的表现,却盖住被丢弃的策略、中途修正、恢复、意外行为,以及试图钻评测空子的尝试 [8]。第二,人类注意力瓶颈:审阅数百或数千页智能体活动,需要稀缺的领域专长,还要能把轨迹里相距很远的复杂事件连起来一起解释 [9]。审阅者的时间无法按轨迹体积和模型发布节奏同比例增长 [10, 11]。第三,统计功效不足:长智能体评测在时间和资源上都很贵,所以每种智能体、每种设置负担得起的重复次数相对少。只靠最终分数的测量,容易受任务方差、随机性和孤立的定性轶事影响 [12, 13]。第四,设置归因不确定:观察到的表现同时由模型和它所嵌入的系统决定 [14, 15]。如果不观察智能体的整条行为轨迹,就很难评估评测的构念效度(construct validity,评测测到的是打算测的能力,而不是仪器或任务设置造成的假象)[16]。
多智能体评测进一步加重这些压力。并行跑智能体可以在同样的时间预算里增加轨迹体积,留下更多活动要审。智能体之间以及共享资源上的交互,使评测过程更难跟上。如果一次评测用掉更多总算力,在固定算力预算里负担得起的重复次数就更少。关于多智能体委派和协调的额外选择,也会让模型和评测设置的效应更难分开。
评测社区知道这些压力,并且一直在做工具,以维持并加宽可观测包络。Inspect AI 和 Inspect Scout 提供记录、扫描和查询评测痕迹的基本件,包括使用大语言模型来做 [17, 18]。Docent 这类平台支持在智能体轨迹上交互式探索行为模式 [19]。另一种突出做法,是用带自定义评判量规的语言模型助手来辅助轨迹分析 [20]。可是这些做法引入大量研究者自由度(researcher degrees of freedom,分析者可以改、而且改了会改变结论的那些选择),例如评判模型、量规、分析单位(工具调用、思维链、一串动作),以及叠在这些判断上面的统计分析。分析者因此要穿过一条分叉小径的花园:看起来都站得住的决定,累积成可能无法复现的发现 [21, 22, 23]。模型辅助分析也可能让评测更不透明而不是更透明:评判者又产生更多要解释的 token,可能夸大把握,而且它的错误很难核对 [24, 25]。如果关于智能体行为的发现要被信任,这些方法必须可复现,任意分析选择的影响必须被测量。否则,本意要加宽可观测包络的工具,有可能把它收得更窄,用无法核对的断言替换没人读的轨迹。
我们提出 Transect,一个轨迹分析软件包,针对运行内部不透明和人类注意力瓶颈。它那份共享的、链回源头的记述,帮助评测者理解一次运行如何展开,找出值得调查的行为,并把解释核对回轨迹。审阅者也可以用这份记述调查设置归因不确定,尽管要把模型和评测设置的效应分开,还需要进一步证据。它的结构化输出也支持跨运行比较,但当独立评测次数太少时,它并不能解决统计功效不足。
分析者提供一份评测族的可复用配置,写明他们需要抽取的信息,以及帮助他们抽取的大语言模型评判量规和模型规格。Transect 建在 Inspect Scout 上 [18],分析 Inspect 评测日志 [17],或受支持的 OpenClaw 导出 [26]。它抽出记录到的事件,并用选定的评判者给活动分类,产出一份沿共享时间线组织的报告,以及供进一步分析的结构化表。审阅者可以跟上评测过程,把活动与 token 用量、子智能体部署放在一起看,并把标签和事件直接追回轨迹里的源头,而不必自己把各扫描器的输出拼起来。这就把一次评测的总体记述,连接到调查意外行为、可能的安全事件,或评测设置所施加约束时需要的细节。
可复现的分析要求保留:源轨迹、运行选择、族配置、评判设置、自定义分析代码和已存储结果,并在可得时记录软件和模型版本(附录 A.7;本篇因正文体积上限未收入附录,技术细节以原文附录和代码为准)。独立评测者可以不再调用评判者就重看已存储结果,尽管重新跑评判者可能得到不同标签。共享的评判机制记录评判者身份和决定;在评判制度支持时,还记录模型内部稳定性或模型之间的一致。当然,仅有这些信息并不能确立标签是否正确。这些记录和检查支持 Transect 的目标:负责任地扩展监督,增加分析能力,同时保留评估其发现的手段。
论文其余部分描述 Transect 的流水线和设计原则(第 2 节),然后在一次长程人工智能研发影子评测上说明工作流,该评测有大量子智能体活动(第 3 节)。案例考察研究活动和 token 支出,用自定义扫描器追踪智能体之间对共享文件的访问,并把扫描器输出合成额外的报告视图。完整技术参考在附录 A。实现公开在 https://github.com/AI-Safety-Institute/transect 。
2 Transect
Transect 把一份评测轨迹变成对智能体活动的可导航记述,并直接链到源头。我们描述流水线(第 2.1 节)和指导其配置与解释的原则(第 2.2 节),然后用一次人工智能研发运行说明审阅者如何使用报告(第 3 节)。
2.1 流水线
Transect 建立在 Inspect Scout 的轨迹和扫描器基本件上 [18](附录 A)。流水线从一份已完成的运行轨迹和一份 Spec 开始。Spec 是一个评测族的可复用配置(例如一个网络安全靶场,或一次人工智能研发评测)。每个评测族都用 Spec,无论分析是否调用语言模型。它可以包含任务上下文、活动定义、相关时的子智能体角色类别,以及自定义分析的用户定义内容。内容随任务和用户的问题而变:例如只有在给子智能体角色分类时,才需要子智能体类别。软件包包含给编程助手用的技能,用来指导 Spec 的编写和打磨。用户从评测简报和设置材料出发,找出缺失信息,并向评测设计者或领域专家寻求澄清。做分类时,用户提供类别和定义,语言模型扫描器用它们给轨迹打标签。用户还可以加自定义结构扫描器来抽取已记录的信息,以及自定义评判扫描器来给行为分类(第 A.6 节)。
更宽的流水线配置还包括另行提供的分析设置,例如评判模型,以及它们是否、如何互动(见第 A.1 节)。Transect 支持单模型走一遍(solo)、该模型重复多遍(k-roll,同一模型对同一段独立判 k 次),或一组模型各自做判断(第 A.5 节)。这些选择规定如何分析这次运行,而 Spec 描述评测内容和上下文。Transect 把提供的评判设置留在已存储的扫描器配置里,并连同评判制度和结果的记录,供以后检查(第 A.7 节)。Transect 返回一个 TransectResults 对象,里面是数据框,也就是可导航报告底下的结构化表(第 A.3 节)。
报告帮助审阅者定位值得检查的片段,比较各活动的 token 用量,并调查记录到的事件与行为变化如何相关。例如,审阅者可以看活动转变是否发生在一次上下文压缩(context compaction,把过长上下文压短以便继续跑)附近,并把两者都追回轨迹。这些功能针对人类注意力瓶颈和运行内部不透明,并帮助调查评测设置如何塑造了一次运行(第 1 节)。
图 1 显示五个阶段。摄入(Ingest)把这次运行放到共享的回合轴上,每次智能体输出一个回合,使后来的信号在不同源格式上用同一个索引。轴记录的是输出顺序;两次输出之间经过的时间可以不同。选择(Select)选出要分析的样本和一个或多个轮次(epoch)。样本(sample)是带指定提示和评测设置的一个任务实例;轮次是对该样本的一次尝试。扫描(Scan)运行扫描器。存储(Store)把它们的结果组装进 Transect 的数据框。渲染(Render)产出报告,把扫描器输出链到轨迹里的源回合。用户可以导出返回的数据框,并跨轮次合并,做自己的分析。
扫描器从轨迹里抽取信息或给行为分类。在图 1 中,结构扫描器抽取已记录的信息,例如上下文压缩、操作者消息和每回合 token 用量,而不调用语言模型。评判扫描器调用为这次分析选定的语言模型,对被评智能体的行为做分类、评分或注释。下面的人工智能研发分析,把记录到的操作者消息和上下文压缩,与一个自定义评判扫描器给出的研究活动标签合在一起(图 2)。
内置评判扫描器在提供了评判模型、以及所需 Spec 词表时运行。decision_phases 扫描器用 Spec 上预先登记的封闭词表,把运行分成连续阶段并打标签,可在同一族的样本和轮次上复用。subagent_classification 扫描器根据委派指令给子智能体打标签:编排者要求它们做什么。这可能不同于它们实际做了什么。
用户可以加自定义结构扫描器或评判扫描器,以处理进一步的评测问题。对专门的分类问题,公开的 cohort_llm_scanner 辅助函数让自定义扫描器使用与内置扫描器相同的评判机制:在重复判断或多个评判者上投票,并为每次判断留下来源记录,标明评判者、各自的答案,以及任何核验者改动。在 solo 和 k-roll 制度下,核验模型可以在可选的第二轮里审阅被选中的分类并修改标签。选择依据是低置信、低一致触发,以及随机抽查。尽管如此,这些输出仍然是会错的模型判断。视评判制度而定,它们带着模型自述的置信、模型内部稳定性,或模型之间的一致(第 A.5 节)。稳定和一致有助于评估一个判断或分类可不可靠,但并不确立效度,因为效度需要对照地面真值(通常是经过校验的人类专家判断)。最终仍由审阅者负责判断证据支持什么。
图 1 里灰虚线框是输入和配置。Spec 来自评测材料和必要时的专家输入。结构扫描器不调用模型就抽取已记录信息;评判扫描器调用为分析选定的模型。两处扩展点是:自定义扫描器把结构信号或评判信号加进数据框;自定义报告层用这些数据框给报告加时间线层或界面元素,而不改上游分析。输入适配器接受 .eval、OpenClaw 等格式。
图 1:Transect 流水线:摄入、选择、扫描、存储、渲染。数据框用来生成可导航报告,也可以用于下游的跨运行分析。灰虚线框表示输入和配置;Spec 来自评测材料,并在需要时来自专家输入。结构扫描器不调用模型就抽取已记录信息;评判扫描器调用为这次分析选定的模型。红色虚线标出两个扩展点。自定义扫描器把结构信号或评判信号加进数据框。自定义报告层用这些数据框给报告加时间线层或界面元素,而不改变上游分析。
2.2 设计原则
三条设计原则指导分析如何配置、解释和扩展。第一条是按评测族配置分析。每个族的 Spec 可以定义用来解释其运行的行为词表,以及任何相关的子智能体类别,材料来自评测文档,需要时来自领域专长。
第二条是结构化专家采集 [27, 28]。用户可以请编程助手在软件包技能的引导下,标出缺失的任务上下文或不清楚的类别定义,并帮助准备向领域专家(SME)提的问题。专家随后可以补充评测材料里没有的信息,例如关心的结果,并审阅提议的分类量规。Transect 记录其内置评判扫描器使用的类别标签和定义。这些记录让用户检查实际用过的量规,并比较各次分析之间的修订。
第三条是自动化。软件包的技能和工作示例引导编程助手运行分析,并添加扫描器或报告视图。它们旨在减少评测任务变化时改编流水线所需的工作。对新的族,用户可以换一份 Spec 并加上分析,同时对受支持的轨迹格式复用现有流水线。诊断技能帮助用户检查分歧、核对已记录的评判设置,并在保持定义不变的情况下测试对 Spec 类别名称的敏感度。
自定义报告层用同一批数据框增加新视图(附录 A)。一项设计要求是:报告视图保留评判输出可得的诊断和来源。报告显示可得的置信和一致诊断,并标出潜在的可靠性问题。来源信息帮助审阅者理解扫描器判断从哪来,可靠性信息帮助他们评估这些判断能支持什么结论。
2.3 相关工作
Transect 用 Inspect AI 做评测日志访问和评判模型接口,用 Inspect Scout 做轨迹表示、扫描器执行和已存储结果 [17, 29, 18]。Inspect Viz 提供报告里的交互图表(https://meridianlabs-ai.github.io/inspect_viz/)。Transect 把这些组件组织在一个评测族周围,并让多个扫描器的输出能在共享时间线上一起解释。
Docent 是另一个突出的轨迹分析工具,用语言模型助手帮助用户交互式地在轨迹里导航 [30]。Transect 则提供可复用的分析和报告流水线:用户可以把族 Spec 和自选的评判设置用到各样本和各轮次上。软件包的编程助手技能帮助用户为新问题增加分析或视图,同时复用共享的表和报告界面。LangSmith、Langfuse、Arize Phoenix、Weights & Biases Weave 和 AgentOps 等平台支持痕迹检查、调试和应用监控;LangSmith 和 Langfuse 也支持离线实验和在线评测(https://docs.langchain.com/langsmith/evaluation ;https://langfuse.com/docs/evaluation/overview ;https://arize.com/docs/phoenix ;https://docs.wandb.ai/weave ;https://docs.agentops.ai/)。
Transect 把族定义的活动标签、记录到的事件和 token 用量放在一条交互式的回合级时间线上,使审阅者能检查这些信号在一次运行里如何相关,并追到源轨迹。Transect 的贡献,是把可改编的分析、交互式证据审阅和可检查的模型判断,合成一条用于长程评测的可复用工作流。统计分析和评测设计的方法与之互补 [12, 31],因为 Transect 为这类分析整理运行内部证据,但并不使稀疏观测在统计上变得充分。
3 案例:用 Transect 阅读一次人工智能研发评测
人工智能研发是前沿智能体上开放式、长程任务的典型例子。人工智能研发评测测量当前智能体能否做可能加速人工智能发展的机器学习研究,包括所谓的递归自我改进 [32, 33, 34, 35]。这类评测正是维持对智能体行为可观测性的困难所在。一个智能体可能自主运行数天或数周,生成数十亿 token,执行数千次工具调用,并把工作委派给数百个子智能体 [36]。成功的行为长什么样也不清楚,因为“做好科学”是一个模糊构念 [37, 38, 39, 40],而最终产物是一篇写成的论文或报告,其质量可能掩盖构造过程中的许多问题,包括编造数据、幻觉引用,以及深层的概念误解 [41, 42, 43]。
我们在 CRUX 计划的影子评测的一个样本上说明 Transect [44]。在这些评测里,智能体收到一份基于完整但尚未发表的、人类所写机器学习研究论文的研究简报,并被要求产出一篇完成的文稿。人类操作者可以通过 Telegram 聊天界面解决操作问题,但不指导研究过程本身。
这个样本的简报提出表格先验拟合网络(PFN,prior-fitted network,用上下文学习而不是针对任务再训练来给表格数据分类的变换器)上的一个方法问题。研究智能体被问到:部署时的检测器能否识别有害的分布偏移(会降低模型准确率的变化),同时不错误标记良性偏移,并且在推断时不能看到标签。给智能体的简报要求一个方法,它要超过一组预先指定的经典偏移检测基线,并通过预先登记的证伪检验。智能体必须写出并提交一篇它已审过、并认为值得被机器学习会议接收的文稿,以及一份可复现分析和结果的代码包。
得到的 OpenClaw 轨迹 [26] 里,一个 Claude-Opus-4.7 智能体 [45] 产生大约 554 次编排者工具调用和 79 次子智能体部署,收到 57 条操作者消息,经历 8 次上下文压缩。评测期间生成 1300 万 token,其中 89% 在被委派的子智能体工作里。
我们的目的不是对这个智能体的人工智能研发能力做完整评估,那一点请读者看 Kirgis 等 [44]。我们改问审阅这次运行的人会想回答的四个问题:研究过程如何展开(第 3.1 节),测试时算力花在哪里(第 3.2 节),被委派的智能体如何协调(第 3.3 节),以及把扫描器输出放在一起解释还能问什么(第 3.4 节)。每一小节报告一项观察,讨论说得通的解释,并说明 Transect 如何产出它。第 3.5 节再讨论这个案例确立了什么、没有确立什么。
3.1 研究过程如何展开?
图 2 在共享的编排者回合轴上放了六层。一个回合对应一次编排者输出,因此各层可以对照着读。软件包的共享模型回合轴给每个记录到的编排者模型输出一个索引(第 A.2 节)。下面几层来自结构扫描器,它们读轨迹里已经记录的事实,不再调用另一个模型(自下而上):编排者的上下文如何跨压缩变化,操作者何时发了 Telegram 消息,子智能体何时被启动并返回,以及一个自定义扫描器在哪里首次识别出 arXiv 标识、DOI 和启发式匹配的标题。子智能体标记用内置的 subagent_classification 扫描器标注,它描述编排者要求每个子智能体做什么,不一定是它最终做的工作。上面两条带来自自定义评判扫描器,给该轮次的 580 次编排者输出各赋一个主标签,或一个剩余类“其他”,包括只有工具调用的输出。研究活动带用十个命名类别,意图抓住人工智能研发任务的典型结构:提出假设、文献落地、实验设计、分析设计、证伪、研究工程、调试、证据解释、反思、撰写。论文特定带使用该族 Spec 里为 decision_phases 定义的封闭词表,它跟着任务的具体研究问题和交付物走:从 PFN 问题框定和 PFN 方案构思,经过基准构建、PFN 模型评测和证伪检验,到文稿撰写、自审和代码可复现,并单独跟踪与研究无关的工程。类别定义在第 A.4 节。
图 2:TabPFN 轮次在编排者回合轴上:论文特定活动、研究活动、累计参考文献、子智能体部署、操作者消息,以及上下文窗口大小。灰色条显示五次评判滚动里每一回合的成对标签分歧;颜色越深,分歧越大。
时间线的价值来自把这些独立产出的层放在一起读。轮次以很长一段操作事务为主的区间开始,除调试外几乎没有被判为研究活动的内容。这也与频繁的操作者消息重合,大多是在帮模型为各种工具建立权限。检查这些回合可以看到,智能体在建立环境的权限、资源和可用工具。最初的大量文献接触发生在这段操作期之后。轮次中段在基准构建、模型评测和证伪之间交替,若干被委派的子智能体支持这些活动。最后一段集中在文稿起草和自审,并用写作、引用和审稿子智能体把这项工作并行化。有些上下文压缩也发生在子智能体部署附近,露出一种可以进一步调查的关系,而不是只在读原始轨迹时注意到。
合在一起的视图也让缺失变得显眼。在当前分析里,580 次编排者输出中只有 2 次被标为提出假设,相比之下有 56 次被标为反思,27 次被标为证据解释。出人意料的是,分析设计一次都没有出现。两次提出假设的标签,出现在编排者计划为它已经提出的检测器推导新的理论结果时,并且两次都把这项工作委派给子智能体。这个模式至少有两种可能解释:智能体可能几乎没有形成假设,或者扫描器在只赋一个主标签时,对分散的或次要的活动检测不足。因此,缺一个标签只是行为不存在的弱证据。即便有这个限制,时间线仍把“智能体好像很少构思”这种印象,变成一条可复现的观察,链到具体回合、一份明确量规、一个可靠性指标,以及供审阅的竞争性解释。
两条活动带都在 k-roll 制度下产出:Claude Opus 4.7 对每次输出分类 k=5 次,读目标的全文和工具参数,以及最多前后各三次输出。带子显示众数标签,并把相邻的相同标签合并,论文特定活动形成 129 个连续阶段。每条带下面的灰条显示十对评判滚动里给出不同标签的比例:580 次输出中有 474 次(81.7%)得到全体一致的研究活动标签,476 次(82.1%)得到全体一致的论文特定标签;反思和证据解释相对不稳定。群组制度可以改为调用多个评判模型,以暴露模型之间的一致。单次运行只让一个模型判一次,因此更便宜,但没有经验上的稳定性估计。已存储的扫描结果保留每个标签背后的提示、输入和模型回应,以便透明检查。判断上的变异帮助找出需要谨慎或需要打磨量规的标签,但变异低并不确立标签有效。那需要独立收集的人类标签,或其他合适的外部参照,来计算假阳性和假阴性率(第 A.5 节)。
3.2 测试时算力花在哪里?
同一套回合级分解支持第二个问题:测试时算力如何分配?token 遥测、活动标签和子智能体事件共用同一分段,因此 token 支出可以归到活动和负责它的子智能体。图 3 把三种归属并排显示。
图 3:归到论文特定活动、研究活动和子智能体类别的新工作 token。在活动面板里,实心段是编排者自己的支出,较浅的段是在该单元内启动的子智能体的支出。研究活动面板排除没有被赋研究技能的工作,子智能体面板排除编排者自己的活动。token 计数不应跨面板相加。
在当前分析里,自审和文稿撰写大约占全部新工作 token 的四分之三:分别为 780 万和 290 万,分母是 1450 万。这笔支出几乎全部被委派,反映编排者在最后阶段使用引用、写作和审稿子智能体。与研究无关的工程是第三大类,大约 220 万 token,其中很多与解决权限、以及确定评测环境的范围有关。
相比之下,方案构思只占大约 2.2 万 token。一些相关工作可能被标在反思、研究工程或证据解释下面,这几类的支出大得多。尽管如此,这一分配与原评测的观察一致:智能体“产出的是带有极其彻底的阴性发现的论文,而不是带有新想法的论文” [44, 第 16 页]。引用子智能体消耗大约 500 万 token,但这项工作很多发生在文稿起草和自审期间,而不是早期的假设发展。因此一种说得通的读法是:文献检索主要支撑打磨和坐实文稿,而不是产生新的科学方向。
这些发现也关系到支架和设置不确定。与研究无关的操作占轮次的很大一部分,而且大多数操作者消息发生在这些阶段,常常是提供权限、资源或凭据,以越过基础设施上的死结。观察到的分配可能反映:智能体偏好好做的操作和写作工作;支架对科学工作支持不足;或者科学推理没有暴露在已记录的轨迹里。Transect 自己不能区分这些解释。但它把它们说得足够精确,从而推动干预:评测者可以改变初始权限,提供不同的工具集,改研究简报,或加上进度门,然后跨轮次比较得到的阶段分布和 token 分布。
token 分配也提供一条途径,把能力作为测试时算力的函数来研究。两个系统可能交出评分相近的最终产物,用算力的方式却不同:一个可能暴力尝试许多弱实验,另一个可能做更少、动机更好的检验。同样,表面上的改进可能集中在研究工程或文稿生产,而不是与能力预测相关的科学活动,例如方案构思、实验设计或证伪。一份轨迹不能确立这些差别,但导出的数据框使同样的分解可以跨智能体、预算、支架和重复轮次使用。
3.3 被委派的智能体如何协调?
多智能体评测造成一种很难从原始日志重建的交互结构:哪些共享文件被哪些智能体写过、读过,顺序如何,这些交换属于什么类型。为了跨智能体边界跟上工作,我们用一个针对共享文件访问的自定义结构扫描器,以及一个针对其可能目的的可选评判扫描器来扩展报告,并把它们的输出合在图 4 里。
图 4:一次 TabPFN 轮次的多智能体分析。A:按源日志顺序,131 个智能体会话和四条共享文件轨道上的活动。弧把较早的写入(空心符号)连到较晚的跨智能体读取(实心符号);颜色和形状表示上下文类型。B:按资源路径的全部 922 条访问记录。C:推断的目的,复合标签计入每一个类别。访问并不确立对方真的采用了内容。
结构扫描器把记录到的文件访问事件,接到其他单独记录的智能体对话或任务(会话)更早的写入上,并在数据框里保留会话标识、资源路径、源位置和证据类型。它在 131 个参与会话上产出 922 条访问记录,其中 346 条把一个被委派的子智能体连到另一个。会话包括被委派的子智能体、由支架调度器触发的任务,以及支架的主上下文和 Telegram 聊天上下文。数据框保留写者到读者的方向。
图 4 的 A 面板跟着研究计划、基线代码、实验一节的草稿,以及第三份盲审文档,穿过已记录的工作流。这四条轨道代表涉及 39 个会话的 159 条访问记录;活动条保留全部 131 个参与者。每条弧把一条记录的第一次合格读取,连到具名写者最近的前一次写入。智能体条从第一次记录到的活动画到最后一次;文件轨道从第一次记录到的写入画到最后一次记录到的读或写。轴遵循源文件顺序:这些跨度既不确立经过的时间,也不确立智能体持续活动或文件持续存在。
访问集中在文稿工作区:922 条记录中有 614 条(66.6%)涉及 paper/ 下的路径,包括草稿、审阅和构建文件。仅实验一节的草稿就占 102 条记录,在其轨道上表现为反复的连接。连同第 3.2 节的 token 归属,这把文稿工作区标成优先检查被委派贡献如何被组装起来的地方。审阅者可以顺着一份共享文档找到记录到的写者和读者,再检查他们的指令和随后的编辑。
目的分类帮助审阅者跟上具体交换。例如,轨迹记录一个子智能体在收到指令后打开第三份盲审文档,指令是处理五项主要和四项次要的呈现发现,并重建文稿。全部五次评判滚动都把这次访问分类为回应评估。这把 A 面板里的审阅轨道,连到一份修订简报和一次记录到的读取,给审阅者一条可以调查的具体踪迹。检查随后的编辑,才能确立哪些发现被处理了、如何处理的。
这仍是一个原型,但它的来源、覆盖和可重复诊断把限制说清楚了。整份轨迹上,150 条记录得到实质性的规则赋值标签,214 条得到评判者赋值标签,558 条仍然不清楚。在评判者标注的记录里,166 条(77.6%)在五次 Opus 4.7 滚动上得到全体一致的标签。这测量的是模型内部的可重复性;目的是否有效、内容是否被采用,需要进一步证据。覆盖缺口提示具体改进:解析被漏掉的 shell 命令和直接消息会捕获更多交换;支架若记录读取结果、文件版本和子智能体返回载荷,将帮助审阅者追踪贡献并核对推断的目的。
3.4 关于人工智能研发还能知道什么?
一旦阶段标签、记录到的事件和参考文献记录共享一种表示,否则需要专门轨迹处理的问题就变得便宜、可以提出并检验。我们在这里问三个:工作流有没有反复出现的结构;行为转变是否聚集在操作者消息或上下文压缩附近;智能体的文献覆盖与人类作者相比如何。图 5 给出这三个问题的描述性分析。
图 5:TabPFN 轮次的描述性分析。左上:去掉与研究无关的工程阶段、并合并连续重复之后,论文特定阶段之间观察到的转移,边的宽度与转移次数成正比。右上:在 3 次或 10 次编排者工具调用之内,操作者消息和上下文压缩之后开始新阶段的次数,以及压缩之后当前阶段继续的次数;这些是共现计数,不是效应。左下:把智能体所写文稿和人类所写文稿中的参考文献,对照 OpenAlex [46]、Crossref [47] 和 arXiv [48] 做登记核验。右下:合并后的引用网络,节点大小表示全球被引次数,边表示合并书目中作品之间的引用。
阶段转移图显示论文特定研究活动之间的转移,排除与研究无关的工程。可以看到两种体制:一条经过基准构建、模型评测、消融和证伪的构建与检验环;以及文稿撰写和自审之间的写与审振荡,并有一些来自理论构建、代码可复现和运行消融的输入。
这张阶段转移图(图 5 左上)说明:任务特定阶段标签的有序序列,使活动之间的转移可以直接计算。
这张图的结构也可以指导对评测设置的调查。文稿起草和审阅之间的反复循环,促使去检验设置是否鼓励在写成的产物上迭代。构建与检验环不那么占主导,也没有显示出同样强的、更早的“生成、选择并检验备选想法”的循环。评测和支架设计者可以把这张图当作干预目标,例如引入明确的构思门,或在开始起草文稿之前要求比较若干候选方法。在其他方面可比的原始设置和修改设置下比较重复轮次,有助于评估干预对行为和最终分数的影响。
事件邻近面板(图 5 右上)显示新阶段是否在操作者干预或上下文压缩附近开始。在当前分析里,57 条操作者消息中有 18 条在三个索引步之内开始新阶段,有 28 条在十步之内开始新阶段。3 次压缩在 3 个索引步之内开始新阶段,另有 1 次压缩在 10 步之内开始新阶段。这些是原始共现计数,不是因果效应:操作者消息可能是在回应已经出现的转变,压缩也可能发生在智能体反正要改变方向的点上。尽管如此,两条事件流都部分由评测设置决定,所以它们与行为转变的邻近,为受控的后续工作标出一个具体的设置不确定来源。
最后两个面板用了影子评测设计的一个特点:智能体所写的文稿,可以与简报所依据的、尚未发表的人类所写论文比较。我们先把被引参考文献对照 OpenAlex [46]、Crossref [47] 和 arXiv [48] 核验。智能体引用的 46 条参考文献中,有 20 条在至少一个登记处得到核验,另有 8 条有标题匹配但没有挂上 DOI,留下 18 条未确认。相比之下,人类论文的 69 条参考文献中,有 60 条在至少一个登记处得到核验,另有 5 条有标题匹配,只留下 4 条未确认。登记处对不上并不证明编造,但这一差别标出:智能体所写文稿上的引用核验负担大得多。
引用网络提供一个互补视图。两份文稿共享 13 条参考文献,但人类论文依托的文献更大、内部连接更密,这由其所引作品之间引用链接的密度标出。这与一种可能一致:智能体的检索没有恢复到与人类研究者相同的科学背景。它也提示一项后续干预:评测者可以把人类书目作为支架的一部分提供,并检验拿到同一文献是否改变智能体的假设、实验选择或最终主张。
软件包支持把这类分析与时间线和 token 分配一起,显示为自定义报告元素(图 1,第 A.6 节)。把它们的摘要链到阶段和源回合,需要匹配轨迹身份,以及兼容的回合或工具调用索引。
3.5 这个案例确立了什么
这一分析确立该智能体行为的一些有意思的特征:它以很长的操作开场开始,没有多少假设生成。大多数 token 由做文稿写作和审阅的子智能体花掉,智能体在这些阶段上迭代了好几次。
然而,这一分析是描述性的,不是确证性的。它并不牢固地确立该智能体的人工智能研发能力、被判标签的效度,或操作者消息、压缩、支架的因果效应。那些主张需要:同一评测族上多个样本的多个轮次、为评判扫描器独立收集的专家标签,以及一个用于跨运行趋势的明确统计模型(第 A.3 节)。Transect 提供一个连贯框架,在开放式、长程评测上做这种严格的、确证性的分析,同时维持可复现和透明。
4 结论
开放式、长程智能体评测正在收窄可观测包络,也就是一次评测能可靠告诉我们关于一个智能体的事情,因为它们正在变长、变复杂、变得更并行。一个自然的办法是用语言模型协助轨迹分析,但这会带来显著的研究者自由度。我们提出 Transect 来处理这两个问题:让运行内部的行为可以被看清,同时支持可靠性检查和可复现分析。Transect 把一次运行放上共享回合轴,选择要读的样本和轮次,用结构扫描器和评判扫描器读轨迹,并把每个信号写进同一套数据框,这套数据框可以被消化成人类可读的报告。这是 Transect 价值主张的核心:它让评测者既能方便地看到“更宽的画面”,又能很快识别并分析智能体轨迹里的关键时刻,无论这些时刻指示的是智能体能力、安全事件、支架约束,还是这一分解所暴露的其他研究问题。我们认为,这幅人类能够进入的、连贯的画面,对于越来越长、越来越复杂的评测轨迹维持有效监督是关键的。
语言模型对轨迹分析越来越重要,但必须谨慎使用。基于大语言模型的扫描器可能夸大把握、藏起不确定,并最终被人类审阅者过度解释 [24, 49]。语言模型作为许多分类任务的评判者能力在提高,但可靠性并不确立效度 [25]。Transect 记录可得的可靠性诊断,并标出潜在问题供审阅。评估效度需要单独的证据,例如与独立收集的专家注释比较。
专家采集在风险分析里早已确立 [27],可以通过书面材料或有针对性的问题来校准 Transect,这些材料决定一个评测族应当露出哪些信号。审阅者可以把分类与智能体已记录的推理、工具使用和支架事件放在一起看。这些信号不必相互独立,但放在一起读,可以露出值得检查的缺口或不一致。来源记录显示一个分类如何产生、从哪些源回合导出。这个视图也可以帮助评测者调查支架如何塑造智能体行为,以及它的记录在哪里不完整。例如,如果轨迹没有记录一次工具失败,把该事件加进以后的日志,就能让审阅者把随后的行为与这次失败放在一起看。软件包的编程助手技能和工作示例,旨在减少配置新评测族并扩展其分析所需的工作。它们引导编程助手添加扫描器或报告视图,检查评判记录和诊断,并测试对类别名称的敏感度。这些来源和可靠性纪律支持可复现,并应伴随分析的每一次扩展。
Transect 把长评测轨迹变成链回源头的报告和可复用的分析表。案例说明这些输出如何把行为分类、编排者与子智能体上的 token 用量、多智能体交互和支架事件,放进同一条可导航、可审计、可复现的审阅工作流。
致谢
我们感谢 CRUX 影子评测的作者 [44] 提供本文案例所用的数据。我们也感谢 Peter Kirgis、Sayash Kapoor、Andrew Schwartz、Stephan Rabanser、Viet Nguyen、Arvind Narayanan、Michael Schmatz、Giorgi Giglemiani、Jessica Wang、Pawan Mudigonda、Magda Dubois、Auss Abbood、Orazio Angelini 和 Ole Jorgensen 在 Transect 开发过程中的讨论。最后感谢 Meridian Labs [50] 在软件包开发上的密切合作。
参考文献
参考文献按原文编号保留书目要点。附录 A 的操作步骤、词表全文和表未收入本篇。
- [1] L. Zhou, L. Pacchiardi, F. Martínez-Plumed, K. M. Collins, Y. Moros-Daval, S. Zhang, Q. Zhao, Y. Huang, L. Sun, J. E. Prunty, et al. (2026) General scales unlock AI evaluation with explanatory and predictive power. Nature 652 (8108), pp. 58–67.
- [2] S. Kapoor, P. Kirgis, A. Schwartz, S. Rabanser, J. J. Allaire, R. Bommasani, H. Coppock, M. Dubois, G. K. Hadfield, A. B. Hall, S. Hooker, S. Lazar, et al. (2026) Open-world evaluations for measuring frontier AI capabilities. arXiv preprint arXiv:2605.20520.
- [3] A. Yehudai, L. Eden, A. Li, G. Uziel, Y. Zhao, R. Bar-Haim, et al. (2025) Survey on evaluation of LLM-based agents. arXiv preprint arXiv:2503.16416.
- [4] M. Mohammadi, Y. Li, J. Lo, and W. Yip (2025) Evaluation and benchmarking of LLM agents: a survey. arXiv preprint arXiv:2507.21504.
- [5] L. Folkerts, W. Payne, S. Inman, P. Giavridis, J. Skinner, S. Deverett, J. Aung, et al. (2026) Measuring AI agents’ progress on multi-step cyber attack scenarios. arXiv preprint arXiv:2603.11214.
- [6] J. McFadyen, O. Jorgensen, H. Coppock, K. Wei, and C. Ududec (2026) How inference compute shapes frontier LLM evaluation.
- [7] UK AI Security Institute (2026) More compute, more capability: why AI agent evaluations need to account for test-time compute. AISI blog (Science of Evaluations team)
- [8] UK AI Security Institute (2026) Cheating behaviour in frontier model evaluations. AISI blog
- [9] UK AI Security Institute (2026) Security Incident INC-2026-07-28-01. Technical Report INC-2026-07-28-01, UK AI Security Institute.
- [10] P. Reizinger and W. Brendel (2026) Skills, benchmarks, and verification are what AI-assisted research needs. In International Conference on Learning Representations (ICLR),
- [11] J. Liu, J. Pei, J. Huang, C. Si, A. Qu, X. Tang, et al. (2026) The last human-written paper: agent-native research artifacts. arXiv preprint arXiv:2604.24658.
- [12] L. Luettgau, H. Coppock, M. Dubois, C. Summerfield, and C. Ududec (2025) HiBayES: a hierarchical Bayesian modeling framework for AI evaluation statistics. arXiv preprint arXiv:2505.05602.
- [13] A. Keller, K. Kwegyir-Aggrey, R. Steed, A. Rao, J. Sharp, and A. Bergman (2026) Expanding the AI evaluation toolbox with statistical models. NIST Trustworthy and Responsible AI
- [14] Y. Zhang, J. Wang, Y. Ge, W. Xu, J. Hamm, and C. K. Reddy (2026) Stop comparing LLM agents without disclosing the harness.
- [15] Y. Yao, X. Tan, C. Liu, Y. Li, Z. Wang, W. Yu, Z. Tan, Y. Tian, G. Zhao, L. Sun, X. Zhang, and T. Yang (2026) Harness-Bench: measuring harness effects across models in realistic agent workflows.
- [16] L. J. Cronbach and P. E. Meehl (1955) Construct validity in psychological tests.. Psychological Bulletin 52 (4), pp. 281–302.
- [17] UK AI Security Institute (2026) Inspect AI: a framework for large language model evaluations. https://inspect.aisi.org.uk/Accessed 2026
- [18] Meridian Labs (2026) Inspect Scout: a transcript-analysis library. https://meridianlabs-ai.github.io/inspect_scout/Accessed 2026
- [19] Transluce (2026) Docent: a behaviour-analysis platform for AI agents. https://docs.transluce.org/introductionAccessed 2026-07-01
- [20] METR (2026) Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident. https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/26 August. Contributors: Ryan Greenblatt, Ajeya Cotra, and Hjalmar Wijk.
- [21] A. Gelman and E. Loken (2016) The statistical crisis in science. In The Best Writing on Mathematics 2015,
- [22] S. Steegen, F. Tuerlinckx, A. Gelman, and W. Vanpaemel (2016) Increasing transparency through a multiverse analysis. Perspectives on Psychological Science 11 (5), pp. 702–712.
- [23] R. Silberzahn, E. L. Uhlmann, D. P. Martin, P. Anselmi, F. Aust, E. Awtrey, Š. Bahník, F. Bai, C. Bannard, E. Bonnier, et al. (2018) Many analysts, one data set: making transparent how variations in analytic choices affect results. Advances in Methods and Practices in Psychological Science 1 (3), pp. 337–356.
- [24] A. Bavaresco, R. Bernardi, L. Bertolazzi, D. Elliott, R. Fernández, A. Gatt, E. Ghaleb, M. Giulianelli, M. Hanna, A. Koller, et al. (2025) LLMs instead of human judges? A large scale empirical study across 20 NLP evaluation tasks. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers),
- [25] J. D. Norman, M. U. Rivera, and D. A. Hughes (2026) Reliability without validity: a systematic, large-scale evaluation of LLM-as-a-judge models across agreement, consistency, and bias. arXiv preprint arXiv:2606.19544.
- [26] OpenClaw Contributors (2026) OpenClaw: your assistant, on your devices, in your chats. GitHub repositoryMIT licence. Accessed 2026-08-18
- [27] A. M. Hanea, M. F. McBride, M. A. Burgman, B. C. Wintle, F. Fidler, L. Flander, C. R. Twardy, B. Manning, and S. Mascaro (2017) Investigate discuss estimate aggregate for structured expert judgement. International Journal of Forecasting 33 (1), pp. 267–279.
- [28] A. O’Hagan, C. E. Buck, A. Daneshkhah, J. R. Eiser, P. H. Garthwaite, D. J. Jenkinson, J. E. Oakley, and T. Rakow (2006) Uncertain judgements: eliciting experts’ probabilities. Statistics in Practice, John Wiley & Sons.
- [29] M. Dubois, E. Zorer, M. Hamin, J. Skinner, A. Souly, J. Wynne, H. Coppock, L. Sato, S. Kapoor, et al. (2026) Seven simple steps for log analysis in AI systems. arXiv preprint arXiv:2604.09563.
- [30] Transluce (2026) Analysis plans. https://docs.transluce.org/analysis/analysis-plansAccessed 2026-09-23
- [31] T. D. Pilditch (2026) Knowing when to stop: bayesian optimal stopping for LLM evaluations. §2.3.
- [32] H. Wijk, T. Lin, J. Becker, S. Jawhar, N. Parikh, T. Broadley, L. Chan, M. Chen, J. Clymer, J. Dhyani, E. Ericheva, K. Garcia, B. Goodrich, N. Jurkovic, H. Karnofsky, M. Kinniment, A. Lajko, S. Nix, L. Sato, W. Saunders, M. Taran, B. West, and E. Barnes (2024) RE-Bench: evaluating frontier AI R&D capabilities of language model agents against human experts. arXiv preprint arXiv:2411.15114.
- [33] S. Field, R. Douglas, and D. Krueger (2026) AI researchers’ views on automating AI R&D and intelligence explosions. Document,
- [34] The Anthropic Institute (2026) When AI builds itself. AnthropicAccessed 2026-08-18
- [35] M. Chen, L. Wang, and B. Qu (2026) Recursive self-improvement in AI: from bounded self-refinement to autonomous research loops. Document,
- [36] OpenAI (2026) Finite time blowup for Navier–Stokes. Technical report
- [37] A. Bowkis, M. D. Buhl, J. Pfau, and G. Irving (2026) Automated alignment is harder than you think. arXiv preprint arXiv:2605.06390.
- [38] P. Feyerabend (1975) Against method: outline of an anarchistic theory of knowledge. New Left Books.
- [39] L. Laudan (1983) The demise of the demarcation problem. In Physics, philosophy and psychoanalysis: Essays in honour of Adolf Grünbaum,
- [40] M. Polanyi (1958) Personal knowledge: towards a post-critical philosophy. University of Chicago Press.
- [41] H. Chen, M. Xiong, Y. Lu, W. Han, A. Deng, Y. He, J. Wu, Y. Li, Y. Liu, and B. Hooi (2025) MLR-Bench: evaluating AI agents on open-ended machine learning research. In Advances in Neural Information Processing Systems 38 (NeurIPS 2025), Datasets and Benchmarks Track,
- [42] M. S. Ansari (2026) Compound deception in elite peer review: a failure mode taxonomy of 100 fabricated citations at NeurIPS 2025. Document,
- [43] A. Bienz, C. Pearson, and S. G. de Gonzalo (2026) The case of the mysterious citations. Document,
- [44] P. Kirgis, S. Kapoor, A. Schwartz, S. Rabanser, D. Africa, K. Voudouris, V. Nguyen, T. Pilditch, M. Dubois, H. Coppock, et al. (2026) Can AI agents conduct open-ended AI research? Early evidence from two case studies. arXiv preprint arXiv:2607.27191.
- [45] Anthropic (2026) Claude Opus 4.7 system card. AnthropicPublished 16 April 2026. PDF: https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf. Accessed 2026-08-18
- [46] J. Priem, H. Piwowar, and R. Orr (2022) OpenAlex: a fully-open index of scholarly works, authors, venues, institutions, and concepts. arXiv preprint arXiv:2205.01833.
- [47] Crossref (2026) Crossref documentation. CrossrefAccessed 2026-08-18
- [48] arXiv (2026) arXiv.org e-print archive. arXivAccessed 2026-08-18
- [49] G. Romeo and D. Conti (2026) Exploring automation bias in human–AI collaboration: a review and implications for explainable AI. AI & Society 41 (1), pp. 259–278.
- [50] Meridian Labs (2026) Meridian Labs.
- [51] C. Si, D. Yang, and T. Hashimoto (2025) Can LLMs generate novel research ideas? A large-scale human study with 100+ NLP researchers. In International Conference on Learning Representations,
- [52] H. A. Simon (1989) The scientist as problem solver. In Complex Information Processing: The Impact of Herbert A. Simon, D. Klahr and K. Kotovsky (Eds.),
- [53] C. S. Peirce (1934) Collected papers of Charles Sanders Peirce. Vol. 5, Harvard University Press.
- [54] M. D. Skarlinski, S. Cox, J. M. Laurent, J. D. Braza, M. Hinks, M. J. Hammerling, M. Ponnapati, S. G. Rodriques, and A. D. White (2024) Language agents achieve superhuman synthesis of scientific knowledge. arXiv preprint arXiv:2409.13740.
- [55] R. A. Fisher (1966) The design of experiments. 8th edition, Oliver and Boyd, Edinburgh.
- [56] T. C. Chamberlin (1890) The method of multiple working hypotheses. Science 15 (366), pp. 92–96.
- [57] D. G. Mayo (1996) Error and the growth of experimental knowledge. University of Chicago Press.
- [58] J. R. Platt (1964) Strong inference: certain systematic methods of scientific thinking may produce much more rapid progress than others.. Science 146 (3642), pp. 347–353.
- [59] J. S. Chan, N. Chowdhury, O. Jaffe, J. Aung, D. Sherburn, E. Mays, G. Starace, K. Liu, L. Maksin, T. Patwardhan, et al. (2025) MLE-Bench: Evaluating machine learning agents on machine learning engineering. In International Conference on Learning Representations,
- [60] G. Starace, O. Jaffe, D. Sherburn, J. Aung, J. S. Chan, L. Maksin, R. Dias, E. Mays, B. Kinsella, W. Thompson, J. Heidecke, A. Glaese, and T. Patwardhan (2025) PaperBench: evaluating AI’s ability to replicate AI research. arXiv preprint arXiv:2504.01848.
- [61] R. Tian, Y. Ye, Y. Qin, X. Cong, Y. Lin, Y. Pan, Y. Wu, H. Haotian, L. Weichuan, Z. Liu, et al. (2024) DebugBench: Evaluating debugging capability of large language models. In Findings of the Association for Computational Linguistics: ACL 2024,
- [62] C. A. Chinn and W. F. Brewer (1993) The role of anomalous data in knowledge acquisition: a theoretical framework and implications for science instruction. Review of Educational Research 63 (1), pp. 1–49.
- [63] D. Kulkarni and H. A. Simon (1988) The processes of scientific discovery: the strategy of experimentation. Cognitive Science 12 (2), pp. 139–175.
- [64] K. N. Dunbar (1994) How scientists really reason: scientific reasoning in real-world laboratories. In The Nature of Insight,
出处:Toby D. Pilditch,Konstantinos Voudouris,Alexandra Abbas,Cozmin Ududec,Transect: Retaining Observability for Long-Horizon LLM Agent Evaluations,2026-10-06,https://arxiv.org/abs/2610.08364,CC BY 4.0。
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.