Industry & PracticeResearch & Benchmarks
先 检查 只有 8.1 %: 字 节 TraceDance 用 部署 轨迹 评 下 一回 合
252557 个会话做成 107 个基准。九模型在 4065 条上的平均通过率 26.7%,最高是 Claude Opus 4.8 的 33.5%。先检查只有 8.1%。第二到第五名的名次区间重叠。

In this piece
先检查只有 8.1%:字节 TraceDance 用部署轨迹评下一回合
字节跳动 ByteDance Inc., USA 与伊利诺伊大学芝加哥分校的预印本 TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces。arXiv 为 2609.33295v1,提交日 2026 年 9 月 27 日。许可证是 arXiv.org perpetual non-exclusive license。作者以 Dehai Min 起,通讯联系人是 Dehai Min(dmin10@uic.edu)。TraceDance 是一套从真实部署轨迹里抽决策点、再按行为量表打分的基准构造系统。它评的是模型在已记录上下文上的下一回合,不回放环境,也没有参考答案。
252557 个会话,建成 107 个基准
轨迹来自两套已部署的 Agent 脚手架,采集窗口六周,共 252557 个会话。Claude Code 做仓库级编码,75076 个;OpenClaw 做通信、检索、日程和自动化,177481 个。每种设置各留 10000 个会话做行为发现,不进构造。构造集因此是 Claude Code 65076、OpenClaw 167481。会话在分析、标注和构造之前都做了去标识和清洗。轨迹主要来自前沿模型,尤其是豆包 Seed 2.0 家族。论文不发布这些轨迹,公开数据无法原样重建这些基准。
会话均值:Claude Code 的工具调用 52.4、Agent 回合 23.7、输入回合 7.8,其中用户写的 5.8、脚手架生成的 2.0,末轮上下文 62309 token。OpenClaw 是 22.2、13.4、10.7、3.3、7.4、43020。用户写的输入回合占 Claude Code 输入回合的 74.8%,只占 OpenClaw 的 30.8%。role 为 user 的消息不都是人写的。
目录里留下 28 个预定义行为族:动作帧 13 个、失败帧 10 个、声称帧 5 个。分数 0 到 5,低分是出现了指定的不良行为,高分是回应得当。三名裁判是 GPT-5.6-Sol、Gemini-3.5-Flash 和 Claude Opus 4.8。通过条件是三名均分至少 4,不四舍五入。每个基准内的通过率是该模型下一回合通过的实例比例。跨模型平均时,先在基准间等权,再在模型间等权。源模型的推理块会删掉,避免把思路暴露给被测模型。
测试查询 139 条。预期要建成的 107 条:预定义 98 条,自定义 9 条。预期应拒绝的 32 条:对抗查询 27 条,缺数值参数、需要追问的预定义查询 5 条。默认每个基准至少 5 条、至多 50 条实例。系统建成 102/107,即 95.3%,并拒绝全部 32 条。102 条成功查询产出 107 个基准、4125 个实例:97 条查询各出一个基准,5 条 OR 查询各出两个。100 条被标注的查询里,系统解释被判准确的 78%,部分正确的 17%。两名标注者在「要不要先追问」上对 96/100 条一致。
成功查询的工作量:可编程锚点平均扫 128297 个会话,不调用 LLM;交给快速模型复核的候选平均 706 条;最终平均 40.4 个实例。全程 LLM 调用均值 552 次。拒绝对抗查询平均只要 1.3 次调用。
主表是 4065 条,最高 33.5%
比较九个模型时只用九家都有有效回复的实例。4125 条里有 60 条至少缺一家,主表因此是 107 个基准、4065 条。表 2 的通过率越高越好。CC 是 Claude Code,OC 是 OpenClaw。
| 模型 | 总通过率 | 动作 | 失败 | 声称 | CC | OC |
|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 33.5 | 31.5 | 37.3 | 30.6 | 36.1 | 27.6 |
| DeepSeek-V4-Pro | 29.3 | 30.8 | 32.1 | 21.2 | 31.8 | 23.6 |
| GLM-5.2 | 28.6 | 30.0 | 32.1 | 19.3 | 29.8 | 25.8 |
| DeepSeek-V4-Flash | 28.5 | 29.0 | 32.1 | 21.9 | 30.8 | 23.4 |
| GPT-5.6-Sol | 27.2 | 27.8 | 23.2 | 32.3 | 30.2 | 20.5 |
| Doubao-Seed-2.1-Pro | 23.5 | 26.5 | 25.5 | 14.5 | 24.3 | 21.6 |
| MiniMax-M3 | 23.3 | 25.5 | 25.8 | 15.1 | 23.8 | 22.4 |
| Kimi-K3 | 23.3 | 26.5 | 25.3 | 14.0 | 24.6 | 20.4 |
| Qwen3.7-Max | 22.9 | 24.9 | 26.3 | 13.4 | 23.9 | 20.6 |
| 九模型均值 | 26.7 | 28.0 | 28.9 | 20.3 | 28.3 | 22.9 |
九模型均值 26.7%。Opus 的 33.5 最高,但声称帧 30.6 低于 GPT-5.6-Sol 的 32.3,失败帧 37.3 仍是这列最高。GPT-5.6-Sol 总通过率 27.2,排在两档 DeepSeek 和 GLM-5.2 后面。论文用这个对照说明:任务完成榜上 GPT-5.6-Sol 高于 DeepSeek-V4-Pro 和 GLM-5.2 的报告分,不能直接搬到这套行为基准。CC 的模型均值 28.3,高于 OC 的 22.9。
行为组用 102 个基准、3966 条,去掉测两种行为的 5 个 AND 基准。默认规则下,合法调用 67.9%,处理失败 33.5%,诚实声称 28.9%,先检查 8.1%。合法调用减去先检查是 59.8 个百分点。阈值放到均分至少 3.5,四组变成 77.7、42.8、38.9、14.2,差距 63.6。放到至少 3,变成 88.9、62.2、55.1、26.8,差距 62.1。三名裁判都至少 4:60.1、28.3、20.6、7.7,差距 52.4。至少两名至少 4:79.5、42.2、41.2、15.1,差距 64.4。每种规则下顺序都是合法调用最高、先检查最低,Opus 总排名仍是第一。绝对通过率随阈值变,组间顺序不变。
单独用一名裁判、4 分算过,通过率高于三人面板。GPT 和 Opus 保持面板的四组顺序。Gemini-3.5-Flash 把诚实声称打到 53.8%,略高于处理失败的 51.5%。三名裁判各自的两组差距在 49.3 到 65.0 个百分点。
族级结果用目录规格做成的 87 个单行为基准、3444 条。通过率是「均分至少 4」的比例,不是不良行为出现的频率。命令有效 72.0(4 个基准、193 条),参数有效 65.1(3 个、149 条)。密钥保护 6.9(3 个、145 条),提交卫生 0.9(3 个、150 条),失败日志检查 0.6(2 个、98 条),送达补救 2.4(3 个、142 条)。总排名会盖住族内反转:Opus 总通过率比 Kimi-K3 高 10 个百分点以上,但在「按报错里写明的改法去改」上,Kimi-K3 是 57.8%,Opus 是 27.8%。GPT-5.6-Sol 总排名第五,却在 28 个族里的 8 个上领先,其中测试声称要有测试依据是 60.2%,其他模型至多 39.5%。
首动作是关联,不是因果。同一批实例上,有的模型先做这个动作、有的不做,裁判打的是整条回复。TodoWrite 开头的比较用 259 条:通过率 4.6%,同一批上其他首动作平均 30.8%,差 26.2 个百分点,九个模型都是这个方向。EnterPlanMode 和先调用技能也更低。先改文件、先起子 Agent、或先向用户要信息,则高于同批其他首动作。
第一名稳,第二到第五不稳
对 107 个基准做 5000 次有放回重抽样。Opus 33.5,95% 区间 [28.7, 38.2],名次区间 1–1,99.9% 的重抽样排第一,领先第二名 4.2 个百分点,区间 [1.7, 6.6]。DeepSeek-V4-Pro 29.3 [24.8, 34.0],名次 2,区间 2–4。GLM-5.2 28.6 [24.2, 33.2],名次 3,区间 2–5。DeepSeek-V4-Flash 28.5 [24.3, 32.8],名次 4,区间 2–5。GPT-5.6-Sol 27.2 [23.4, 31.1],名次 5,区间 2–5。Doubao-Seed-2.1-Pro 23.5 [19.5, 27.7],名次 6,区间 6–9。MiniMax-M3 23.3 [19.3, 27.7],名次 7,区间 6–9。Kimi-K3 23.3 [19.2, 27.8],名次 8,区间 6–9。Qwen3.7-Max 22.9 [19.1, 26.9],名次 9,区间 6–9。组内相邻模型的差不显著。GPT-5.6-Sol 高于 Doubao-Seed-2.1-Pro 3.7 个百分点,区间 [0.9, 6.4],这道组间的缝是显著的。
人和裁判只对过 84 条
两名标注者独立看 100 条行为查询和 100 条分层抽到的实例,实例各配一个被测模型的回复。他们看不到自动分数,也不知道是哪个模型。两人同时确认源轨迹里有目标行为的是 84/100。量表质量至少 4/5 的占 90%,均值 4.75/5。标注者点名最多的问题是相邻分数界限不清,21 次;措辞含糊 5 次,和定义对不上 5 次,够不着的分数档 4 次。
表 14 只在这 84 条上比。通过仍是至少 4 分。人类标注者均分 1.68,两人之间一致率 81.0%,Cohen's κ 0.31,精确率 42.9,召回率 42.9,分数完全相同 46.4%,差 1 分以内 72.6%。GPT-5.6-Sol 均分 2.02,一致率 79.8%,κ 0.31,精确率 40.6,召回率 46.4,完全相同 33.9%,差 1 分以内 63.7%。Opus 均分 2.46,一致率 76.2%,κ 0.35,精确率 38.0,召回率 67.9,完全相同 32.1%,差 1 分以内 70.2%。Gemini-3.5-Flash 均分 2.90,一致率 65.5%,κ 0.22,精确率 28.6,召回率 71.4,完全相同 26.8%,差 1 分以内 54.8%。三人面板均分 2.46,与人类的一致率 81.0%,κ 0.40,精确率 44.7,召回率 60.7。面板分数是小数,表里不报完全相同。人类只把 16.7% 的回复判过,所以全判不过也能和人类对上 83.3%。κ 0.40 高于两名标注者之间的 0.31,说明扣掉碰巧之后,面板并不比人更差。但三名裁判的均分都高于人(2.02 到 2.90,人对 1.68)。人把 39.3% 的回复打成 0 分,面板只有 11.9%。过不过对得上,分数本身更松。
GPT-5.6-Sol 和 Opus 既当裁判又当被测模型。自偏好用 102 个基准、3945 条。GPT 给自己的回复相对其他模型高 0.22 分(0–5 分),实例区间 [0.19, 0.25],基准区间 [0.17, 0.27],都不含 0。Opus 的差是 -0.01,两个区间都含 0。去掉该模型自己的裁判后,Opus 仍是第 1,GPT 仍是第 5:三人面板上分别是 32.4 和 27.0;去掉 GPT 裁判后是 42.1 和 32.8;去掉 Opus 裁判后是 35.7 和 29.5。这列不是表 2 的 4065 条。
来源家族用同一批 3966 条:豆包 Seed 2717 条,其他来源 1249 条。其他来源的具体构成论文标为商业机密。偏移是「该回复过没过」减去其余八个模型在同一条上的平均通过率。Doubao-Seed-2.1-Pro 在豆包来源上的偏移低 0.9 个百分点,区间含 0,和 GLM-5.2、Qwen3.7-Max、MiniMax-M3 接近。九个模型的区间都能排除大约 3 个百分点以上的家族专属劣势,排除不了更小的差。其中豆包 Seed 2.0 占 2454/3966,是 2.1-Pro 的前代。只拿这 2454 条当豆包来源、并把更早的 263 条两边都去掉之后,2.1-Pro 的差变成九家里最低的 -1.2,实例区间 [-3.3, +0.9],仍含 0。
这些数不能被读成什么
26.7% 和 33.5% 是均分至少 4 的通过率,不是任务做完的比例,也不是不良行为的出现率。先检查的 8.1% 会在阈值降到 3 时升到 26.8%,组间顺序不变,绝对数不能脱离这条规则。主表 4065 条已经丢掉 60 条缺回复的实例。族级、行为组、自偏好和来源分析的分母分别是 3444、3966、3945、3966,不能和主表横比。第二到第五名的名次区间重叠。TodoWrite 的 4.6% 对 30.8% 是同一批实例上的关联。人类一致性只覆盖 84 条,而且全判失败就能对上 83.3%。裁判更松。轨迹不公开,基准不能从公开数据重建。脚手架、六周窗口和豆包来源占 2717/3966,换一批轨迹就会换题。预印本许可证是 arXiv.org perpetual non-exclusive license。这篇只复述评测协议和表内数字。
出处:字节跳动,Dehai Min 等,TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces,2026-09-27,https://arxiv.org/abs/2609.33295
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.