400 个 视觉 token 对 上 10368: 百度 用 固定 语言 模型 评 CoVisco
语言模型固定为 Qwen3-4B。只送 400 个摘要 token 时,多项视频分数高于把 10368 个 token 都送进语言模型的对照。DocVQA 在只送摘要时是 20.5,比例 0.8 才到 75.1。

本文目录
400 个视觉 token 对上 10368:百度用固定语言模型评 CoVisco
百度 ERNIE 团队的 CoVisco(把视频按段编码,段内用可学习的摘要 token 做压缩接口,细粒度图块仍可在推理时挑一部分送进语言模型),arXiv 提交日 2026 年 9 月 30 日(2609.39924,v1)。作者 Yulong Liu、Xiaotian Han、Junyuan Shang、Yuchen Ding、Zhenyu Zhang、Shuohuan Wang、Guibo Zhu、Sirui Han、Dianhai Yu。单位包括 ERNIE Team, Baidu Inc.、香港科技大学和中国科学院自动化所。项目负责 Xiaotian Han,通讯作者 Sirui Han。许可证是 CC BY 4.0。代码在 https://github.com/ernie-research/CoVisco.git 。
256 帧、448×448 的视频大约是 26.2 万个图块 token。先把整段视频编码密了再删 token,训练时的表示和上线时的接口会对不上。CoVisco 在编码器里面就学摘要:每段有固定数量的摘要 token,段间只通过这条通道交换信息。下游可以只收摘要,或再加运行时选出的图块。对比学习预训练用了 5.65 亿图文对和 640 万条视频。
同一颗语言模型,只换视觉编码器
视频和图像理解都把语言模型固定成 Qwen3-4B-Instruct-2507。这样比的是视觉接口,不是谁换了更大的语言模型。视频基准里,codec 输入用原始 H.265/HEVC 流,不再重新编码。对照的均匀抽帧是 8 帧。OneVision-Encoder 的 codec 设置从 64 帧里按 codec 分数选出 10368 个 token,这些 token 既进视觉编码器,也送给语言模型;均匀帧设置是 8 帧、504×504。SigLIP2 是 8 帧、512×512。CoVisco 的 codec 输入在 224 和 504 两种分辨率下也都是 10368 个进编码器的 token,但送给语言模型的可以少得多。记号是(采样方式,分辨率,送给语言模型的细粒度保留比例)。0.0 表示只送摘要。四段、每段 Q=100 个摘要 token 时,只送摘要就是 400 个视觉 token。图像基准保留原分辨率。
表 3 是视频。粗体规则是该列所有行里最高,这里不标粗体,把数字列全。
| 设置 | MVBench | MLVU-dev | NExT-QA | VideoMME | Perception | TOMATO | LongVideoBench |
|---|---|---|---|---|---|---|---|
| OV-Encoder codec 504,比例 1.0 | 52.4 | 46.3 | 75.6 | 53.4 | 60.3 | 22.2 | 50.4 |
| OV-Encoder 均匀帧 504,比例 1.0 | 49.8 | 49.4 | 71.9 | 49.3 | 56.7 | 21.8 | 45.5 |
| SigLIP2 均匀帧 512,比例 1.0 | 47.2 | 48.4 | 70.6 | 46.8 | 56.0 | 22.3 | 45.2 |
| CoVisco codec 224,比例 0.0 | 55.8 | 57.8 | 72.8 | 52.9 | 58.7 | 25.1 | 48.0 |
| CoVisco codec 224,比例 0.4 | 56.7 | 58.5 | 74.0 | 55.7 | 59.7 | 26.0 | 50.5 |
| CoVisco codec 504,比例 0.0 | 53.2 | 56.7 | 69.9 | 51.3 | 56.1 | 25.1 | 47.3 |
| CoVisco codec 504,比例 0.4 | 53.2 | 56.7 | 71.3 | 53.0 | 57.0 | 26.4 | 48.2 |
| CoVisco 均匀帧 224,比例 0.0 | 56.0 | 61.2 | 73.5 | 53.5 | 59.0 | 25.5 | 47.3 |
| CoVisco 均匀帧 224,比例 0.2 | 56.9 | 59.8 | 73.9 | 57.0 | 59.5 | 25.7 | 52.7 |
| CoVisco 均匀帧 224,比例 0.4 | 56.4 | 59.6 | 73.5 | 57.0 | 59.0 | 24.9 | 52.2 |
只送 400 个摘要 token 时,224 均匀帧的 MVBench 56.0、MLVU-dev 61.2、VideoMME 53.5,已经高于把 10368 个 token 都送进语言模型的 OneVision-Encoder codec。NExT-QA 和 Perception Test 仍是后者更高:75.6 对最高的 CoVisco 74.0,60.3 对 59.7。把细粒度比例从 0 提到 0.2,224 均匀帧的 VideoMME 从 53.5 到 57.0,LongVideoBench-Val-V 从 47.3 到 52.7。codec、224、比例从 0 到 0.4:VideoMME 52.9 到 55.7,LongVideoBench 48.0 到 50.5。504 并不一律高于 224。
图像,尤其是文字,摘要不够
表 4,语言模型仍是同一颗。OCRBench 是原量表上的分数,不是百分比。
| 设置 | AI2D | ChartQA | DocVQA | InfoVQA | MMBench-EN | OCRBench | OCRBench v2 | MMStar | RealWorldQA |
|---|---|---|---|---|---|---|---|---|---|
| OV-Encoder codec,原分辨率,1.0 | 75.7 | 76.5 | 78.4 | 43.1 | 77.2 | 605 | 26.3 | 52.1 | 60.8 |
| OV-Encoder 均匀帧,1.0 | 76.5 | 77.8 | 79.5 | 45.5 | 78.5 | 630 | 26.1 | 54.3 | 61.2 |
| SigLIP2,1.0 | 78.6 | 76.4 | 75.0 | 42.0 | 79.6 | 621 | 26.1 | 55.0 | 62.1 |
| CoVisco,比例 0.0 | 66.8 | 17.4 | 20.5 | 20.7 | 68.2 | 261 | 21.2 | 43.8 | 45.5 |
| CoVisco,比例 0.2 | 67.9 | 51.8 | 64.0 | 32.1 | 70.9 | 474 | 24.0 | 45.7 | 52.8 |
| CoVisco,比例 0.8 | 69.8 | 68.8 | 75.1 | 42.2 | 71.8 | 567 | 24.0 | 48.8 | 54.1 |
| CoVisco,比例 1.0 | 70.5 | 70.7 | 75.5 | 44.1 | 71.6 | 576 | 24.4 | 48.3 | 53.3 |
只送摘要时 DocVQA 是 20.5,比例 0.8 升到 75.1,仍低于 OneVision-Encoder 均匀帧的 79.5。OCRBench 从 261 到比例 1.0 的 576,对照最高 630。图 2 只是选择器留下了物体、文字和局部变化的示意,论文写明这不是选择器最优的证据。
另有一组只测编码器、不接语言模型:零样本图像分类和检索沿用 SigLIP 2 的对照表,MMEB-V2 用池化后的摘要 token。正文的主比较是上面两张接上语言模型的表。长视频一节把训练时的四段拿到推理时改成 64、128 或 256 帧,以及不同段数。文中给了一张配置表,这里不把未在正文逐点解释的格子重排。结论是帧数、段数和采样方式换了以后,摘要接口仍然可用,不是绑死在一种时间切分上。
限制
没有做专门的 OCR 预训练,指令微调规模不大,摘要 token 容量固定为每段 100。OCR 结果是迁移测量,不是 OCR 系统的上限。最合适的 token 预算随任务变:视频上 400 个摘要就有竞争力,文档和文字不行。效率、端到端预算策略和流式视频没有在这篇里给出系统数字。所有视频、图像理解主表都挂在 Qwen3-4B-Instruct-2507 上,不能读成换一颗语言模型之后排序不变。
百度 ERNIE 团队、香港科技大学、中国科学院自动化所,Yulong Liu、Xiaotian Han、Junyuan Shang、Yuchen Ding、Zhenyu Zhang、Shuohuan Wang、Guibo Zhu、Sirui Han、Dianhai Yu,CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding,2026-09-30,https://arxiv.org/abs/2609.39924
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。