Industry & PracticeResearch & Benchmarks
长 视频 85.1 % 大约 5.1 万 token: 百度 按 问题 现 查, 不 先 建 全 片 索引
百度 VideoXAgent 在 Video-MME-Long 上 85.1%,52 帧、约 51k 上下文。MINERVA 公开集 1357 题上,纯文本调度 GLM-5.2 到 65.4%,Claude-Opus-4.6 到 65.7%,上下文 33.7k 和 37.1k。37.1k 约是 1024 帧对照 262.1k 的 14%。

In this piece
长视频 85.1% 大约 5.1 万 token:百度按问题现查,不先建全片索引
百度的 VideoXAgent(从原始视频文件和用户问题出发,按需调用工具、再把多路观察合到一个答案上的在线长视频评测框架),论文日期 2026-09-14,arXiv v1 戳记 2026-09-11(2609.12818)。作者单位是 Baidu Inc.。项目页 https://go-agent-x.github.io/video_agent_harness/ 。许可证是 CC BY-SA 4.0。
它不先把整段视频做成和问题无关的索引。工具按能力分类来接,包括脚本、视觉语言模型,以及检测、OCR、语音识别、人脸等专用模型。文中写当前暴露 60 个以上原子工具、14 类后端。调度默认最多 125 步,在预算的 65%、80%、90% 给出警告,再放不下工具调用就强制作答。
主结果的调度模型是 Claude-Opus-4.6,视觉工具是 Gemini-3.1-Pro-preview。这和后面 MINERVA 表里用 Qwen3.6-35B-A3B 当视觉工具不是同一套。上下文指的是调度模型看到的最大上下文,不是全部调用的 token 总和。效率一节自己写了:量的是取回的帧和调度模型的最大上下文,不是总 token 花费。
四套主结果
表 1。Video-MME-Long、LongVideoBench-Long、LVBench 用官方全量。Video-MME-v2 只用分层子集,118 个视频、472 题,不是全量 3200 题。LVBench 原数据没有字幕,这一列关掉了字幕、语音识别和其他音频工具,只用画面。对照里的大模型在 LVBench 上可能用了原生音频,脚注写明,不能和这一列直接比成同一条件。
| 系统 | Video-MME-Long | LongVideoBench-Long | LVBench | Video-MME-v2 子集 |
|---|---|---|---|---|
| Doubao-Seed-2.0-pro | 85.5%,约 112k | 未报 | 76.4%,约 96k | 57.63%,非线性分 40.26,49.1k |
| Gemini-3.1-Pro-preview | 86.2%,约 179k | 未报 | 未报 | 59.96%,非线性分 38.47,43.2k |
| DVD | 未报 | 68.6%,2816 帧 | 74.2%,8074 帧 | 未报 |
| VideoSeek | 81.2%,15.9 帧 | 73.5%,29.6 帧 | 68.4%,92.3 帧 | 未报 |
| HAVEN | 82.8%,1645 帧 | 78.2%,943.5 帧 | 71.7%,2702 帧 | 未报 |
| VideoXAgent | 85.1%,52.0 帧 / 51k | 78.1%,116.7 帧 / 55.3k | 76.5%,60.8 帧 / 55k | 61.28%,非线性分 40.74,53.5k |
分母:Video-MME-Long 是 300 个视频、900 题,平均时长 2466 秒。LongVideoBench 的长子集是 188 个视频、564 题,时长 900 到 3600 秒。LVBench 是 103 个视频、约 117 小时、1549 道人工题,平均 4101 秒。HAVEN 在 LVBench 的 71.7% 是论文里的纯视觉消融,不是它带字幕的主行。DVD、HAVEN、VideoSeek 的 Agent 上下文原文没报。
Video-MME-Long 上,85.1% 靠近 Seed 的 85.5% 和 Gemini 的 86.2%,上下文是 51k 对大约 112k 和 179k。LongVideoBench 上 78.1% 比 DVD 的 68.6% 高,和 HAVEN 的 78.2% 差 0.1 个百分点,帧数是 116.7 对 943.5。LVBench 上 76.5% 高于 DVD 的 74.2% 和 HAVEN 纯视觉的 71.7%,和 Seed 的 76.4% 接近,但 Seed 那一格可能含音频。
Video-MME-v2 这一列双方都在同一 472 题子集上,作者写这是定位,不是官方全量榜。准确率 61.28% 高于 Gemini 的 59.96% 和 Seed 的 57.63%。非线性分 40.74,Seed 是 40.26,Gemini 是 38.47。图 6 里另有一套总分:Gemini 调度加 Gemini 工具 41.6,Opus 调度加 Gemini 工具 40.7。那是图上的总分,不是表 1 的 61.28%,不要并成一个数。
MINERVA:弱视觉调度也能到同一档
MINERVA 测的是多步视频推理。公开的 Neptune 发布集是 1357 题(表 2)。原论文那两行带 dagger 的是 1515 题、带语音识别,和 1357 不是同一个分母。Gemini-3-Pro-preview 的 65.0% 引自 Seed 1.8 的论文,没有上下文。
| 系统 | 调度 | 视觉工具 | 准确率 | 上下文(最小到最大) | 平均步数 |
|---|---|---|---|---|---|
| Gemini-2.5-Pro-Thinking | 无 | 无 | 64.7% | 65.5k(256 帧) | 不测 |
| Gemini-2.5-Pro-Thinking | 无 | 无 | 66.2% | 262.1k(1024 帧) | 不测 |
| Gemini-3-Pro-preview | 无 | 无 | 65.0% | 未报 | 不测 |
| Doubao-Seed-1.8 | 无 | 无 | 62.4% | 未报 | 不测 |
| Doubao-Seed-2.0-pro | 无 | 无 | 66.5% | 未报 | 不测 |
| VideoXAgent | GLM-5.2(纯文本) | Qwen3.6-35B-A3B | 65.4% | 33.7k(17.7k 到 189.9k) | 35.6 |
| VideoXAgent | Claude-Opus-4.6 | Qwen3.6-35B-A3B | 65.7% | 37.1k(25.0k 到 97.6k) | 27.5 |
65.7% 和 65.4% 落在对照的 62.4% 到 66.5% 里,没有超过 Seed-2.0-pro 的 66.5%,也没有超过 1024 帧那一行的 66.2%。37.1k 除以 262.1k 大约是 14%。摘要写的 about 15% 对得上这一对比,对不上表 1 里 51k 到 55k 那几格。摘要里「大约 5 万 token」指的是小时级视频上的 Agent 上下文,表 1 是 51k、55.3k、55k、53.5k。MINERVA 这两行更低,不能说四套都是 5 万。
消融不是主表那一套
表 3 是 LongVideoBench 长子集里按题型抽的 150 题,调度是 Kimi-K2.6 配 Qwen3.6,不是表 1 的 Claude 加 Gemini。不能拿 75.33% 去减全量的 78.1%。
| 改动 | 准确率 | 上下文 |
|---|---|---|
| 工具齐全,Kimi 思考模式 | 75.33% | 32.2k |
| 同上,不思考 | 74.67% | 30.9k |
| 调度换成 Gemini-3.1-Pro | 80.67% | 50.1k |
| 视觉工具换成 Doubao-Seed | 74.67% | 29.4k |
| 调度换成 Gemma4-31B | 69.33% | 26.8k |
| 调度换成 DeepSeek-V4-Flash | 71.33% | 42.2k |
| 去掉序列级视觉工具 | 68.67% | 35.3k |
| 去掉单帧视觉工具 | 70.00% | 30.4k |
| 去掉检测、分割等视觉专家 | 72.00% | 25.4k |
| 去掉音频和字幕 | 68.67% | 37.4k |
| 去掉客观证据规则 | 72.60% | 31.6k |
去掉序列级视觉工具或去掉音频,都从 75.33% 掉到 68.67%。去掉视觉专家少 3.33 个百分点,上下文从 32.2k 降到 25.4k。省 token 和涨准确率不是同一方向。Gemini 调度准确率最高,上下文也最大。作者写这张表找不出一个普遍更优的底座。
步数上限和警告
不终止的情况取决于调度模型。Claude-Opus-4.6 在五个基准上没有不终止的运行。Gemini-3.1-Pro 当调度时,有一部分题不返回答案,工具调用拿不到有用证据,一直转到上下文耗尽。作者把 Video-MME、Video-MME-v2、MINERVA、LVBench、LongVideoBench 上这些无答案题收成 217 题的压力集。这个集是按 Gemini 的失败挑的,不是随机样本。下面的消融改用 Kimi-K2.6 加 Qwen3.6,所以挑选和被测模型不是同一个。单次运行,配成对自助 95% 区间。
表 4,警告开着,不终止率每个上限都是 0%。
| 步数上限 | 准确率 | 95% 区间 | 平均 token |
|---|---|---|---|
| 75 | 41.9% | [35.5%, 48.4%] | 37.5k |
| 100 | 42.9% | [36.4%, 49.3%] | 37.8k |
| 125 | 43.8% | [37.3%, 50.2%] | 42.0k |
| 150 | 42.9% | [36.4%, 49.3%] | 44.7k |
125 步最高,150 步是 42.9%,四个区间重叠。token 从 37.5k 增到 44.7k,论文写大约 +19%。默认仍用 125。
表 5 把警告拿掉,固定 125 步。无警告时 14.7%(32/217)不回答,其中 29 次是预算耗尽,3 次是工具错误,端到端准确率 35.0%,平均 47.5k。有警告时 0/217 不回答,准确率 43.8%,平均 42.0k。差 +8.8 个百分点,区间 [+2.3, +15.2]。已经能答完的 185 题上,无警告准确率是 41.1%,靠近有警告的 43.8%。token 从 47.5k 到 42.0k,大约少 12%。这是压力集,不是五个基准的平均风险。
限制
工具分类只从 MINERVA 的人工推理轨迹里挖,可能带这个数据集的分布,也可能漏掉别的域才重要的能力。成本不是总 token,也没有线上时延或费用。表 1 的 Video-MME-v2 是 472 题子集。MINERVA 的 64.7% 和 66.2% 来自 1515 题的原论文,其余行是 1357 题。LVBench 上大模型对照可能用了音频。压力集的区间互相重叠,125 步并没有在统计上和其他上限分开。
百度,Sen Yang、Boqiang Duan、Jing Yang、Weihao Bo、Jie Liu、Boyuan Tong、Ze Feng、Wenkang Zhang、Jingdong Wang、Hua Wu,Online Video Agent Harness for Long Video Understanding,2026-09-14,https://arxiv.org/abs/2609.12818
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.