研究与基准测试/2026-08-12/9 分钟总分会把「本来就会」算成遵守:字节 Harness-IF 把规则和默认行为拆开字节 Seed 的 Harness-IF 按单条规则打分。12 个模型的总分都高于「和默认行为相反」的那一档,平均高出 5.81 分。86.8% 的判定经过 GPT-5.2 裁判,换裁判后一致率只有 62.1%。