CodexQA

Industry & PracticeResearch & Benchmarks

长视频 85.1% 大约 5.1 万 token:百度按问题现查,不先建全片索引

CodexQA 团队5 min read

百度 VideoXAgent 在 Video-MME-Long 上 85.1%,52 帧、约 51k 上下文。MINERVA 公开集 1357 题上,纯文本调度 GLM-5.2 到 65.4%,Claude-Opus-4.6 到 65.7%,上下文 33.7k 和 37.1k。37.1k 约是 1024 帧对照 262.1k 的 14%。

In this piece

长视频 85.1% 大约 5.1 万 token:百度按问题现查,不先建全片索引

百度的 VideoXAgent(从原始视频文件和用户问题出发,按需调用工具、再把多路观察合到一个答案上的在线长视频评测框架),论文日期 2026-09-14,arXiv v1 戳记 2026-09-11(2609.12818)。作者单位是 Baidu Inc.。项目页 https://go-agent-x.github.io/video_agent_harness/ 。许可证是 CC BY-SA 4.0。

它不先把整段视频做成和问题无关的索引。工具按能力分类来接,包括脚本、视觉语言模型,以及检测、OCR、语音识别、人脸等专用模型。文中写当前暴露 60 个以上原子工具、14 类后端。调度默认最多 125 步,在预算的 65%、80%、90% 给出警告,再放不下工具调用就强制作答。

主结果的调度模型是 Claude-Opus-4.6,视觉工具是 Gemini-3.1-Pro-preview。这和后面 MINERVA 表里用 Qwen3.6-35B-A3B 当视觉工具不是同一套。上下文指的是调度模型看到的最大上下文,不是全部调用的 token 总和。效率一节自己写了:量的是取回的帧和调度模型的最大上下文,不是总 token 花费。

四套主结果

表 1。Video-MME-Long、LongVideoBench-Long、LVBench 用官方全量。Video-MME-v2 只用分层子集,118 个视频、472 题,不是全量 3200 题。LVBench 原数据没有字幕,这一列关掉了字幕、语音识别和其他音频工具,只用画面。对照里的大模型在 LVBench 上可能用了原生音频,脚注写明,不能和这一列直接比成同一条件。

系统Video-MME-LongLongVideoBench-LongLVBenchVideo-MME-v2 子集
Doubao-Seed-2.0-pro85.5%,约 112k未报76.4%,约 96k57.63%,非线性分 40.26,49.1k
Gemini-3.1-Pro-preview86.2%,约 179k未报未报59.96%,非线性分 38.47,43.2k
DVD未报68.6%,2816 帧74.2%,8074 帧未报
VideoSeek81.2%,15.9 帧73.5%,29.6 帧68.4%,92.3 帧未报
HAVEN82.8%,1645 帧78.2%,943.5 帧71.7%,2702 帧未报
VideoXAgent85.1%,52.0 帧 / 51k78.1%,116.7 帧 / 55.3k76.5%,60.8 帧 / 55k61.28%,非线性分 40.74,53.5k

分母:Video-MME-Long 是 300 个视频、900 题,平均时长 2466 秒。LongVideoBench 的长子集是 188 个视频、564 题,时长 900 到 3600 秒。LVBench 是 103 个视频、约 117 小时、1549 道人工题,平均 4101 秒。HAVEN 在 LVBench 的 71.7% 是论文里的纯视觉消融,不是它带字幕的主行。DVD、HAVEN、VideoSeek 的 Agent 上下文原文没报。

Video-MME-Long 上,85.1% 靠近 Seed 的 85.5% 和 Gemini 的 86.2%,上下文是 51k 对大约 112k 和 179k。LongVideoBench 上 78.1% 比 DVD 的 68.6% 高,和 HAVEN 的 78.2% 差 0.1 个百分点,帧数是 116.7 对 943.5。LVBench 上 76.5% 高于 DVD 的 74.2% 和 HAVEN 纯视觉的 71.7%,和 Seed 的 76.4% 接近,但 Seed 那一格可能含音频。

Video-MME-v2 这一列双方都在同一 472 题子集上,作者写这是定位,不是官方全量榜。准确率 61.28% 高于 Gemini 的 59.96% 和 Seed 的 57.63%。非线性分 40.74,Seed 是 40.26,Gemini 是 38.47。图 6 里另有一套总分:Gemini 调度加 Gemini 工具 41.6,Opus 调度加 Gemini 工具 40.7。那是图上的总分,不是表 1 的 61.28%,不要并成一个数。

MINERVA:弱视觉调度也能到同一档

MINERVA 测的是多步视频推理。公开的 Neptune 发布集是 1357 题(表 2)。原论文那两行带 dagger 的是 1515 题、带语音识别,和 1357 不是同一个分母。Gemini-3-Pro-preview 的 65.0% 引自 Seed 1.8 的论文,没有上下文。

系统调度视觉工具准确率上下文(最小到最大)平均步数
Gemini-2.5-Pro-Thinking无无64.7%65.5k(256 帧)不测
Gemini-2.5-Pro-Thinking无无66.2%262.1k(1024 帧)不测
Gemini-3-Pro-preview无无65.0%未报不测
Doubao-Seed-1.8无无62.4%未报不测
Doubao-Seed-2.0-pro无无66.5%未报不测
VideoXAgentGLM-5.2(纯文本)Qwen3.6-35B-A3B65.4%33.7k(17.7k 到 189.9k)35.6
VideoXAgentClaude-Opus-4.6Qwen3.6-35B-A3B65.7%37.1k(25.0k 到 97.6k)27.5

65.7% 和 65.4% 落在对照的 62.4% 到 66.5% 里,没有超过 Seed-2.0-pro 的 66.5%,也没有超过 1024 帧那一行的 66.2%。37.1k 除以 262.1k 大约是 14%。摘要写的 about 15% 对得上这一对比,对不上表 1 里 51k 到 55k 那几格。摘要里「大约 5 万 token」指的是小时级视频上的 Agent 上下文,表 1 是 51k、55.3k、55k、53.5k。MINERVA 这两行更低,不能说四套都是 5 万。

消融不是主表那一套

表 3 是 LongVideoBench 长子集里按题型抽的 150 题,调度是 Kimi-K2.6 配 Qwen3.6,不是表 1 的 Claude 加 Gemini。不能拿 75.33% 去减全量的 78.1%。

改动准确率上下文
工具齐全,Kimi 思考模式75.33%32.2k
同上,不思考74.67%30.9k
调度换成 Gemini-3.1-Pro80.67%50.1k
视觉工具换成 Doubao-Seed74.67%29.4k
调度换成 Gemma4-31B69.33%26.8k
调度换成 DeepSeek-V4-Flash71.33%42.2k
去掉序列级视觉工具68.67%35.3k
去掉单帧视觉工具70.00%30.4k
去掉检测、分割等视觉专家72.00%25.4k
去掉音频和字幕68.67%37.4k
去掉客观证据规则72.60%31.6k

去掉序列级视觉工具或去掉音频,都从 75.33% 掉到 68.67%。去掉视觉专家少 3.33 个百分点,上下文从 32.2k 降到 25.4k。省 token 和涨准确率不是同一方向。Gemini 调度准确率最高,上下文也最大。作者写这张表找不出一个普遍更优的底座。

步数上限和警告

不终止的情况取决于调度模型。Claude-Opus-4.6 在五个基准上没有不终止的运行。Gemini-3.1-Pro 当调度时,有一部分题不返回答案,工具调用拿不到有用证据,一直转到上下文耗尽。作者把 Video-MME、Video-MME-v2、MINERVA、LVBench、LongVideoBench 上这些无答案题收成 217 题的压力集。这个集是按 Gemini 的失败挑的,不是随机样本。下面的消融改用 Kimi-K2.6 加 Qwen3.6,所以挑选和被测模型不是同一个。单次运行,配成对自助 95% 区间。

表 4,警告开着,不终止率每个上限都是 0%。

步数上限准确率95% 区间平均 token
7541.9%[35.5%, 48.4%]37.5k
10042.9%[36.4%, 49.3%]37.8k
12543.8%[37.3%, 50.2%]42.0k
15042.9%[36.4%, 49.3%]44.7k

125 步最高,150 步是 42.9%,四个区间重叠。token 从 37.5k 增到 44.7k,论文写大约 +19%。默认仍用 125。

表 5 把警告拿掉,固定 125 步。无警告时 14.7%(32/217)不回答,其中 29 次是预算耗尽,3 次是工具错误,端到端准确率 35.0%,平均 47.5k。有警告时 0/217 不回答,准确率 43.8%,平均 42.0k。差 +8.8 个百分点,区间 [+2.3, +15.2]。已经能答完的 185 题上,无警告准确率是 41.1%,靠近有警告的 43.8%。token 从 47.5k 到 42.0k,大约少 12%。这是压力集,不是五个基准的平均风险。

限制

工具分类只从 MINERVA 的人工推理轨迹里挖,可能带这个数据集的分布,也可能漏掉别的域才重要的能力。成本不是总 token,也没有线上时延或费用。表 1 的 Video-MME-v2 是 472 题子集。MINERVA 的 64.7% 和 66.2% 来自 1515 题的原论文,其余行是 1357 题。LVBench 上大模型对照可能用了音频。压力集的区间互相重叠,125 步并没有在统计上和其他上限分开。

百度,Sen Yang、Boqiang Duan、Jing Yang、Weihao Bo、Jie Liu、Boyuan Tong、Ze Feng、Wenkang Zhang、Jingdong Wang、Hua Wu,Online Video Agent Harness for Long Video Understanding,2026-09-14,https://arxiv.org/abs/2609.12818

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction