CodexQA

行业与实践研究与基准测试

总分会把「本来就会」算成遵守:字节 Harness-IF 把规则和默认行为拆开

CodexQA 团队阅读约 6 分钟

字节 Seed 的 Harness-IF 按单条规则打分。12 个模型的总分都高于「和默认行为相反」的那一档,平均高出 5.81 分。86.8% 的判定经过 GPT-5.2 裁判,换裁判后一致率只有 62.1%。

本文目录

总分会把「本来就会」算成遵守:字节 Harness-IF 把规则和默认行为拆开

字节跳动 Seed 在 2026 年 8 月 12 日把 Harness-IF 挂到 arXiv(2608.11727v1)。手稿页自标日期是 2026 年 7 月 15 日。Seed 论文列表同一天用的标题是 Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents。Harness-IF 是一套编码 Agent 评测:不看整道题做成没有,而是看每一条操作规则有没有被执行证据证实。

现有基准分不清「遵守」和「本来就会」

编码 Agent 同时读一整叠说明:系统提示、工具说明、技能说明、项目文件(例如 CLAUDE.md)和用户当轮指令。指令遵循基准大多把规则塞在用户那一轮;编码基准又只看任务最终成不成功。两边都答不了:长流程里,Agent 到底跟了哪一条规则。

论文把两件事拆开。指令层级问的是冲突时谁该赢;指令面问的是同一条规则换一个投放位置,Agent 还跟不跟。主实验按规则适不适合放在某个面上来分配。另有一个对照实验 E0,把规则含义固定,只挪投放面。

图 1 里的操作栈有六层。Harness default(HD)是固定的运行时前言,不参与挪动。其余五层可配置:系统提示(SP)、工具说明(TD)、技能说明(SD)、项目文件(PF)、用户指令(UI)。一次运行留下轨迹、diff、测试和输出,再给每条适用规则一个判定,而不是给整题一个分。

规则库 642 条。60 道多轮编码题来自 80 题工作集,经过质量和区分度筛选,放上了其中 302 条,实际打出判定的是 256 条。非编码扩展另有 40 个案例,用的是按案例汇总的通过率,不和编码主表混加。

四个分,只有 AP-Acc 扣掉了默认行为

主表四个都是二元通过率,分母是同一批合格判定,所以差值不是两种算法口径:

  • Acc:全部合格判定上的通过率。
  • F-Acc:去掉在这批评测模型里分不出高低的题–规则对。换一批模型,这个分会变。
  • DW-Acc:按规则对模型总分的区分度加权。区分度不是正数或算不出来的规则,权重记 0。同样随评测队列变化。
  • AP-Acc(Against-Prior Accuracy):只统计被标成「和默认行为相反」的规则。默认行为来自不注入该规则的零注入探针;探针盖不住的,用人工标注的先验。它不是在声称模型训练时见过什么。

零注入探针用了九套构建。论文写明,AP-Acc 低于 Acc 的差距不能当成常数消掉,各模型差 3.6 到 7.4 分,大约差一倍。

12 个模型:第一名没变,相邻名次换了三对

主面板是 12 个模型、60 题、每题 3 轮,共 2,160 次运行、40,104 行规则判定。确定性检查(正则、语法树、跨文件、命令输出)只覆盖合格判定的 13.3%。GPT-5.2 做裁判,三条投票取多数,并裁定混合检查,所以 86.8% 的行经过裁判。同口径二元分析用了 37,616 条合格判定,其中 19,449 条是 against-prior。

表 2 按未四舍五入的 Acc 排序。MiniMax-M2.7 和 Seed-2.0-Pro 的 Acc 都显示成 73.6,未四舍五入只差 0.03。数字是 Acc / F-Acc / DW-Acc / AP-Acc,最后是 Acc 减 AP-Acc。

  • Claude-Opus-4.7:85.9 / 79.3 / 88.5 / 78.6,+7.3
  • GPT-5.5:83.1 / 75.5 / 81.2 / 77.0,+6.1
  • Claude-Sonnet-4.6:82.5 / 73.9 / 82.2 / 78.5,+4.0
  • Claude-Haiku-4.5:79.0 / 69.4 / 75.9 / 71.9,+7.2
  • GLM-5.1:78.8 / 67.9 / 75.6 / 75.2,+3.6
  • Qwen-3.6-Max:76.7 / 65.9 / 70.5 / 71.7,+5.1
  • Hy3:76.2 / 65.2 / 69.7 / 70.8,+5.4
  • Kimi-K2.6:76.1 / 65.0 / 70.3 / 70.0,+6.1
  • Gemini-3.1-Pro:75.4 / 64.0 / 70.0 / 69.8,+5.6
  • MiniMax-M2.7:73.6 / 61.2 / 65.1 / 67.7,+5.9
  • Seed-2.0-Pro:73.6 / 61.1 / 63.2 / 66.1,+7.4
  • StepFun-3.5:72.1 / 59.1 / 62.5 / 66.2,+5.9

12 个模型的 AP-Acc 全都低于 Acc。平均差 5.81 分。Claude-Opus-4.7 四列都最高,所以扣掉默认行为之后第一名不变,但第 2–3、4–5、11–12 这三对相邻名次对调。Acc 极差 13.7 分,标准差 4.2 分。

更严的共同支持分析保留了 3,342 个(题、轮、规则)键里的 2,430 个,占 72.7%,要求每个模型都给出干净的过或不过。按题目聚类的 95% 区间里,12 个模型的差距仍然都是正的。相邻模型的区间却都分不开,所以表上的名次只是点估计,论文把结论放在「和默认行为相反时更差」以及失败形态上,不放在紧挨着的两名谁高谁低。

242 条每个模型都做过的规则上,各模型的逐规则通过率向量和队列均值的相关是 0.57 到 0.89,均值 0.80。难的规则大家大致认同一套。

失败多半是没做要求的事,不是做多了

8,440 次失败里,77.1% 是「该做没做到或没达到下限」,20.8% 是「做了禁止的事或超过上限」,2.1% 是软偏好。这主要是暴露量不同,不是两种错的倾向差很多:短板类实例 27,306 条,越界类 8,443 条,失败率分别是 23.8% 和 20.8%。只抓「输出太多」的检查,大约只能盖住失败量的五分之一。

按模态,命令式规则最难,通过率 76.0%;数值边界 79.4%,条件规则 79.7%,偏好 90.6%。偏好容易和本来就会做的事重合,命令常常要求离开默认行为。

按规则族,量化限制 82.6%,工具使用 81.6%,条件 80.9%,代码风格 79.2%,工作流 76.0%,输出控制 70.9%。输出控制比量化限制低 11.7 分,12 个模型里有 11 个在这一族上最低,没有一个在这一族超过 79%。

冲突时,后写的用户指令并没有压过系统提示

E0 用九套更早的模型、四组合成冲突、只做确定性打分,不并进 12 模型主表。916 次运行,两个方向各 458 次,889 次分出胜负。系统提示、项目文件、用户指令的模型级名次和都是 20,平均 20/9,也就是约 2.22,三者并列最靠前。工具说明 3.78,技能说明 4.56。名次越低表示冲突里越优先。

「越靠上下文末尾越赢」解释不通:用户指令只是并列第一,没有单独压过系统提示和项目文件。交叉自助法 10,000 次里有 9,652 次保住完整顺序,但 9 个模型各自拟合时只有 6 个完全复现。论文把它写成这批构建上的总体倾向,不是普遍层级。27 次错误用四种保守归法,顺序仍在。主面板是按规则适合放哪一层来分配,不能当成同一条规则换层的配对实验。

裁判一换,绝对分就不稳

全确定性子集上,Acc 和 AP-Acc 的差对 12 个模型仍全是正的,5,013 条合格判定上平均 13.09 分,比全表的 5.81 分更大,因为这个子集更偏模式检查和命令检查。模型间重测 ICC 是 0.725,Agent–题目单元是 0.599。更早的人工对照用的是五票而不是后来发布的三票,919 行上一致率 69.0%,κ = 0.515。

把裁判从 GPT-5.2 换成 Claude-Opus-4.7 之后,116 对干净判定的一致率只有 62.1%,κ = 0.163。86.8% 的判定行经过裁判,这是测量里最大的不确定来源。65 个共同非错误样本上,Claude 和 GPT 四分类一致的 κ = 0.4717,这不是人工校验。

非编码扩展:同一 12 个模型、40 个案例、五个领域、1,428 条有效轨迹。按案例汇总的通过率从 65.8% 到 84.8%,领头的是 GPT-5.5,不是编码主表的 Claude-Opus-4.7。指标和总体都不同,不能和编码分加在一起。

这些数不能被读成什么

60 题只覆盖规则库 642 条里打出分的 256 条。专业写作规则只在非编码扩展里出现。AP-Acc 不是训练数据溯源。F-Acc 和 DW-Acc 会随对照模型名单变化。相邻名次的区间分不开。E0 的顺序不是每家模型都成立,也不是主表的通过率。复现已发表数字不需要再跑模型:2,160 条判定记录和脚本可以离线重算。评一个新模型则还要编码 Agent 的 Harness,以及被测模型和裁判的接口。项目软件准备按 Apache-2.0 放,基准文本、数据和脱敏结果准备按 CC-BY-4.0 放;供应商原始输出和运行工作区不随包分发。预印本写明,发布位置留到后续版本,这篇里没有给出已上线的数据包地址。

出处:字节跳动 Seed,Zining Huang、Haoran Que、Hong Zeng 等,Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents,2026-08-12,https://arxiv.org/abs/2608.11727

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误