CodexQA

Industry & PracticeResearch & Benchmarks

看得见局部、拼不起全局:字节 GST-Bench 测视频里的全局空间

CodexQA 团队7 min read

22 个 VLM 的零样本最高分是 Gemini-3-Pro 的 42.68,人类在每个子任务 20 个样本上是 79.08。目标在查询视角里不可见。Qwen3-VL-8B 经 GST-Train 微调后到 53.52,仍补不上人类。

In this piece

看得见局部、拼不起全局:字节 GST-Bench 测视频里的全局空间

字节跳动 Seed 的预印本 GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? 在 arXiv 的版本戳记是 2026 年 8 月 6 日(2608.05747v1)。PDF 里的 Date 行写的是 August 7, 2026。通讯作者是 Wei Li(liwei.85@bytedance.com),工作在 ByteDance Seed 完成,合作单位还有浙江大学和新加坡国立大学。GST-Bench(Global-Spatial-Temporal Benchmark)是一套视频问答评测:不看单张图能不能认物体,而是看模型能不能把一段第一人称探索视频收成全局空间,再从视频轨迹之外的新视角回答。

单帧能答的题被故意拿掉

现有空间评测多半停在单张图,或两三张图,问的是大小、相对深度、左右前后。视频评测开始碰房间尺度,但论文指出三处空档:没有把「一张关键帧就能答」和「必须跨帧」分开;方向常常只判左/右、前/后,不给精确角度;也很少拿一张俯视图,去对第一人称画面和全局场景是不是同一处。

GST-Bench 用四条约束堵这些空档。目标物体在查询视角里必须看不见。单帧就能答的题(例如物体大小)排除。答案按距离、角度这类数值打分,不靠粗分类。查询视角从探索轨迹之外另采,不能靠和某一帧对上图蒙混。

评测围绕三个问题,拆成 12 个子任务、2,762 道人工核过的题。配套视频按题目累计 6,790 分钟,是仿真生成的,不是真实家庭录像。

  • 我在哪(self localization):全局朝向、全局位置。
  • 目标在哪(object localization):自我中心方向、自我中心距离、俯视图上的位置。每项再分语义和视觉两种指代。语义用类别名,视觉用探索视频里的红框。
  • 场景长什么样(scene structure understanding):三档俯视图选择(易、中、难),再加轨迹选择。

输入有五种。探索视频是走完整场的第一人称长视频。物体标注视频是在目标出现的帧上套红框。短轨迹视频从另一条轨迹上切下来,用来对俯视图上的四条候选轨迹。俯视图分三档:易是去掉天花板的照片级鸟瞰,中是只留物体和墙脚印的占据图,难是只留墙的平面图。当前视角是轨迹外的新图;做物体定位时,目标必须不在这张图里。

50 个室内场景,答案从几何里直接算

数据从 OmniGibson 仿真和 BEHAVIOR-1K 资产生成,管线覆盖 50 个室内场景。每场在可走区域上采样视点,连成多条起点和扰动都不同的探索轨迹,渲染第一人称 RGB。查询视角不从视频里抽帧,而是在轨迹外另采朝向,并且必须和探索视频有足够重叠,人还定位得回去。物体定位再加一条:目标在查询图里不可见,但在探索视频里出现过。

因为在仿真里,相机位姿、物体位姿、可见性、距离、角度和俯视投影都是已知的。问答用模板生成,答案从几何直接算,不靠模型标。自动过滤丢掉投影无效、可见性含糊、查询重叠不够、选项退化,以及违反「目标不可见」的样本。

GST-Bench 的每一道评测题再人工看两件事:目标在视频里认不认得出;轨迹外的当前视角和视频的重叠够不够、人能不能定位。不过的丢掉,剩下 2,762 题。

训练集 GST-Train 用同一套管线,场景来自 BEHAVIOR-1K、ArtVIP、HyperSim 和内部仿真。评测场景从训练集里拿开,避免同一场泄漏。论文没有给出 GST-Train 的条数。

四个题型,总分是 12 项的算术平均

22 个 VLM 全部零样本,用各自官方推荐的提示模板,解码是贪心,不做按题微调。闭源:Gemini-2.5-Pro、Gemini-3-Pro、GPT-5、GPT-4o、Seed1.8。开源:LLaVA-OneVision-1.5 的 4B/8B,Qwen3-VL 的 2B/4B/8B/32B,InternVL3.5 的 2B/4B/8B/38B,NVILA 的 8B/15B。具身理解:Cosmos-Reason2 的 2B/8B,RoboBrain2.5-8B,Robix 的 7B/32B。另有一个用 GST-Train 微调的 Qwen3-VL-8B,不放进零样本排名。

距离用平均相对准确率(MRA),阈值集合是 0.50、0.55,一直到 0.95:相对误差小于 1 减阈值才算过,再对阈值取平均。角度误差走圆周距离,容差 15°、30°、45°,三项准确率再平均。点预测是像素欧氏距离,阈值 100、150、200、250、300 像素。选择题就是准确率。总分是 12 个子任务分数的算术平均,不是按题数加权。

表 1 的 Avg. 如下。随机猜测 20.01。人类基线标的是每个子任务 20 个样本,不是 2,762 题全做,总分 79.08。

闭源:Gemini-3-Pro 42.68,Gemini-2.5-Pro 40.95,GPT-5 40.85,Seed1.8 34.04,GPT-4o 30.33。

开源:InternVL3.5-38B 30.71,Qwen3-VL-32B 30.43,Qwen3-VL-8B 25.89,Qwen3-VL-4B 23.96,NVILA-8B 23.64,InternVL3.5-8B 22.99,Qwen3-VL-2B 22.64,LLaVA-OV-1.5-4B 21.10,NVILA-15B 21.10,InternVL3.5-4B 19.83,InternVL3.5-2B 19.72,LLaVA-OV-1.5-8B 19.58。

具身:Robix-32B 29.26,Robix-7B 29.06,RoboBrain2.5-8B 24.61,Cosmos-Reason2-8B 21.64,Cosmos-Reason2-2B 19.99。

微调:Qwen3-VL-8B 53.52。

第一名离人类还差 36.4 分

人类 79.08,零样本最高的 Gemini-3-Pro 是 42.68,差 36.4 分,不到人类的 55%(42.68/79.08)。12 个子任务上的单项最高,都落在闭源模型。闭源前三名大约高出最好的开源模型 10 到 12 分:InternVL3.5-38B 是 30.71。

这个差距不是均匀的。论文点名方向估计 21.52 对人类 85.00,这是 Gemini-2.5-Pro 的 Ori;Gemini-3-Pro 的 Ori 更低,只有 16.89。俯视图上的物体位置,Gemini-3-Pro 的 GPv 是 42.23,人类 93.00。自我中心距离是例外:人类自己的 EDistv 也只有 41.50,Gemini-2.5-Pro 是 42.00,几乎打平。论文把这写成绝对米制距离对人和模型都难,不是模型忽然变强。

开源的领先主要来自俯视图选择的易档和中档。InternVL3.5-38B 和 Qwen3-VL-32B 的总分在 30 上下,其余十项离随机不远。四个模型低于随机 20.01:LLaVA-OV-1.5-8B 19.58,InternVL3.5-2B 19.72,InternVL3.5-4B 19.83,Cosmos-Reason2-2B 19.99。17 个开源和具身模型里,有 9 个落在随机上下 3 分以内。

易档俯视图选择把闭源模型的场景辨认抬得很高:Gemini-2.5-Pro 97.69,Gemini-3-Pro 98.15,GPT-5 97.69,Seed1.8 99.07,GPT-4o 掉到 81.02。难档只留墙,Gemini-3-Pro 还剩 52.25,Gemini-2.5-Pro 41.01,多数开源回到二十多分到三十多分。人类这三档是 100.00、95.00、85.00。

具身后训练没有补上这个洞。8B 上,RoboBrain2.5-8B 24.61、Cosmos-Reason2-8B 21.64,都低于通用的 Qwen3-VL-8B 25.89。Robix-32B 29.26,和 Qwen3-VL-32B 的 30.43 差不多。论文的猜想是:现有具身后训练更练局部可供性和空间关系,不练长程空间记忆和跨视角对齐。

把目标放回画面里,闭源涨、开源不一定涨

为了分开「看不见局部」和「拼不起全局」,论文只改自我中心方向和距离的语义题,空间问题本身不变。

  • Global:目标不在当前视角,必须看探索视频。
  • Local-Video:换成能看见目标的当前视角,探索视频还在,但逻辑上已经多余。
  • Local-Image:再拿掉探索视频,只剩这一张图。

方向(EDs),Global / Local-Video / Local-Image,括号是相对 Global 的绝对增减:

  • Gemini-2.5-Pro:23.08 / 41.62(+18.54) / 66.49(+43.41)
  • Gemini-3-Pro:22.11 / 46.38(+24.27) / 61.20(+39.09)
  • GPT-5:31.09 / 60.32(+29.23) / 65.61(+34.52)
  • GPT-4o:13.46 / 13.33(−0.13) / 7.05(−6.41)
  • Qwen3-VL-2B:16.19 / 11.29(−4.90) / 11.64(−4.55)
  • Qwen3-VL-8B:12.50 / 2.82(−9.68) / 13.40(+0.90)
  • InternVL3.5-2B:18.11 / 32.80(+14.69) / 25.40(+7.29)
  • InternVL3.5-8B:16.67 / 12.35(−4.32) / 8.64(−8.03)

距离(EDists):

  • Gemini-2.5-Pro:35.40 / 46.94(+11.54) / 53.39(+17.99)
  • Gemini-3-Pro:27.39 / 48.58(+21.19) / 55.79(+28.40)
  • GPT-5:27.39 / 26.01(−1.38) / 31.04(+3.65)
  • GPT-4o:10.13 / 23.66(+13.53) / 22.68(+12.55)
  • Qwen3-VL-2B:6.55 / 17.98(+11.43) / 14.48(+7.93)
  • Qwen3-VL-8B:11.59 / 17.10(+5.51) / 26.12(+14.53)
  • InternVL3.5-2B:4.56 / 7.32(+2.76) / 7.92(+3.36)
  • InternVL3.5-8B:8.36 / 28.42(+20.06) / 25.79(+17.43)

前三名闭源在方向上,拿掉跨帧要求之后能涨 34 到 43 分。Gemini-3-Pro 从 22.11 到 61.20,论文说接近变成三倍。距离上两个 Gemini 涨 18 到 28 分。GPT-5 的距离 Local-Video 是 −1.38:视频已经多余,留下来反而干扰。GPT-4o 不跟这个模式,方向的单图设定掉到 7.05。

开源不是「题变容易就涨」。方向上四个里有两个更差,InternVL3.5-8B 的单图是 −8.03,Qwen3-VL-8B 的 Local-Video 掉到 2.82。距离上这四个都涨,但绝对分仍低:InternVL3.5-2B 的方向单图只有 25.40,Gemini-2.5-Pro 是 66.49。论文的分法是:闭源主要死在跨帧整合;开源局部感知和跨帧整合都差,局部更急。这张对照表没有覆盖全部 22 个模型,也没有覆盖视觉指代和场景结构题。

同一套管线微调,能超过零样本第一名,补不上人类

Qwen3-VL-8B 在 GST-Train 上做监督微调,并混入通用多模态指令数据,免得只会做这套空间题。总分从 25.89 到 53.52,加 27.63,超过文中所有零样本模型,包括 Gemini-3-Pro 的 42.68。分项:视觉方向 18.75 到 53.72,视觉距离 5.57 到 39.70,视觉全局位置 17.35 到 48.97,语义方向 12.50 到 49.36,语义距离 11.59 到 31.95,语义全局位置 13.01 到 57.64,自身位置 24.81 到 40.55,朝向 17.64 到 44.39,俯视易 96.76 到 99.07,俯视中 42.27 到 88.18,俯视难 25.28 到 37.08,轨迹 25.12 到 51.66。难档俯视图仍然远低于人类的 85.00。论文写明,这是缩小差距,不是做完这道题。

这些数不能被读成什么

视频是仿真室内,不是真实家庭。50 场只覆盖评测管线,不能外推到户外或动态行人。人类 79.08 是每个子任务 20 个样本,不是全量 2,762 题,也没有写标注者人数和一致性。总分是 12 项等权平均,易档俯视图接近满分,会把「认不出场景」和「量不出角度」混在一个数里。随机基线 20.01 不是每项都等于 25% 或 0,因为距离、角度、点预测的随机方式和选择题不同。本地对照不能代表全部任务。GST-Train 和评测场景不重叠,但是同一套管线,而且混了通用指令数据;论文没给训练集规模、训练步数和是否多次抽样。微调分不能当成零样本能力。预印本许可证是 arXiv.org perpetual non-exclusive license,作者保留版权;这篇只复述评测做法和表内数字。项目页是 https://qwerirwq.github.io/GST-Bench/ ,预印本正文没有给出数据包的发布许可证。

出处:字节跳动 Seed,Qifeng Zhang、Kaixiang Huang、Heng Dong 等,GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?,2026-08-06,https://arxiv.org/abs/2608.05747

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction