研究与基准测试/2026-08-12/9 分钟总分会把「本来就会」算成遵守:字节 Harness-IF 把规则和默认行为拆开字节 Seed 的 Harness-IF 按单条规则打分。12 个模型的总分都高于「和默认行为相反」的那一档,平均高出 5.81 分。86.8% 的判定经过 GPT-5.2 裁判,换裁判后一致率只有 62.1%。
研究与基准测试/2026-08-06/10 分钟看得见局部、拼不起全局:字节 GST-Bench 测视频里的全局空间22 个 VLM 的零样本最高分是 Gemini-3-Pro 的 42.68,人类在每个子任务 20 个样本上是 79.08。目标在查询视角里不可见。Qwen3-VL-8B 经 GST-Train 微调后到 53.52,仍补不上人类。