CodexQA

行业与实践研究与基准测试

400 个视觉 token 对上 10368:百度用固定语言模型评 CoVisco

CodexQA 团队阅读约 4 分钟

语言模型固定为 Qwen3-4B。只送 400 个摘要 token 时,多项视频分数高于把 10368 个 token 都送进语言模型的对照。DocVQA 在只送摘要时是 20.5,比例 0.8 才到 75.1。

本文目录

400 个视觉 token 对上 10368:百度用固定语言模型评 CoVisco

百度 ERNIE 团队的 CoVisco(把视频按段编码,段内用可学习的摘要 token 做压缩接口,细粒度图块仍可在推理时挑一部分送进语言模型),arXiv 提交日 2026 年 9 月 30 日(2609.39924,v1)。作者 Yulong Liu、Xiaotian Han、Junyuan Shang、Yuchen Ding、Zhenyu Zhang、Shuohuan Wang、Guibo Zhu、Sirui Han、Dianhai Yu。单位包括 ERNIE Team, Baidu Inc.、香港科技大学和中国科学院自动化所。项目负责 Xiaotian Han,通讯作者 Sirui Han。许可证是 CC BY 4.0。代码在 https://github.com/ernie-research/CoVisco.git 。

256 帧、448×448 的视频大约是 26.2 万个图块 token。先把整段视频编码密了再删 token,训练时的表示和上线时的接口会对不上。CoVisco 在编码器里面就学摘要:每段有固定数量的摘要 token,段间只通过这条通道交换信息。下游可以只收摘要,或再加运行时选出的图块。对比学习预训练用了 5.65 亿图文对和 640 万条视频。

同一颗语言模型,只换视觉编码器

视频和图像理解都把语言模型固定成 Qwen3-4B-Instruct-2507。这样比的是视觉接口,不是谁换了更大的语言模型。视频基准里,codec 输入用原始 H.265/HEVC 流,不再重新编码。对照的均匀抽帧是 8 帧。OneVision-Encoder 的 codec 设置从 64 帧里按 codec 分数选出 10368 个 token,这些 token 既进视觉编码器,也送给语言模型;均匀帧设置是 8 帧、504×504。SigLIP2 是 8 帧、512×512。CoVisco 的 codec 输入在 224 和 504 两种分辨率下也都是 10368 个进编码器的 token,但送给语言模型的可以少得多。记号是(采样方式,分辨率,送给语言模型的细粒度保留比例)。0.0 表示只送摘要。四段、每段 Q=100 个摘要 token 时,只送摘要就是 400 个视觉 token。图像基准保留原分辨率。

表 3 是视频。粗体规则是该列所有行里最高,这里不标粗体,把数字列全。

设置MVBenchMLVU-devNExT-QAVideoMMEPerceptionTOMATOLongVideoBench
OV-Encoder codec 504,比例 1.052.446.375.653.460.322.250.4
OV-Encoder 均匀帧 504,比例 1.049.849.471.949.356.721.845.5
SigLIP2 均匀帧 512,比例 1.047.248.470.646.856.022.345.2
CoVisco codec 224,比例 0.055.857.872.852.958.725.148.0
CoVisco codec 224,比例 0.456.758.574.055.759.726.050.5
CoVisco codec 504,比例 0.053.256.769.951.356.125.147.3
CoVisco codec 504,比例 0.453.256.771.353.057.026.448.2
CoVisco 均匀帧 224,比例 0.056.061.273.553.559.025.547.3
CoVisco 均匀帧 224,比例 0.256.959.873.957.059.525.752.7
CoVisco 均匀帧 224,比例 0.456.459.673.557.059.024.952.2

只送 400 个摘要 token 时,224 均匀帧的 MVBench 56.0、MLVU-dev 61.2、VideoMME 53.5,已经高于把 10368 个 token 都送进语言模型的 OneVision-Encoder codec。NExT-QA 和 Perception Test 仍是后者更高:75.6 对最高的 CoVisco 74.0,60.3 对 59.7。把细粒度比例从 0 提到 0.2,224 均匀帧的 VideoMME 从 53.5 到 57.0,LongVideoBench-Val-V 从 47.3 到 52.7。codec、224、比例从 0 到 0.4:VideoMME 52.9 到 55.7,LongVideoBench 48.0 到 50.5。504 并不一律高于 224。

图像,尤其是文字,摘要不够

表 4,语言模型仍是同一颗。OCRBench 是原量表上的分数,不是百分比。

设置AI2DChartQADocVQAInfoVQAMMBench-ENOCRBenchOCRBench v2MMStarRealWorldQA
OV-Encoder codec,原分辨率,1.075.776.578.443.177.260526.352.160.8
OV-Encoder 均匀帧,1.076.577.879.545.578.563026.154.361.2
SigLIP2,1.078.676.475.042.079.662126.155.062.1
CoVisco,比例 0.066.817.420.520.768.226121.243.845.5
CoVisco,比例 0.267.951.864.032.170.947424.045.752.8
CoVisco,比例 0.869.868.875.142.271.856724.048.854.1
CoVisco,比例 1.070.570.775.544.171.657624.448.353.3

只送摘要时 DocVQA 是 20.5,比例 0.8 升到 75.1,仍低于 OneVision-Encoder 均匀帧的 79.5。OCRBench 从 261 到比例 1.0 的 576,对照最高 630。图 2 只是选择器留下了物体、文字和局部变化的示意,论文写明这不是选择器最优的证据。

另有一组只测编码器、不接语言模型:零样本图像分类和检索沿用 SigLIP 2 的对照表,MMEB-V2 用池化后的摘要 token。正文的主比较是上面两张接上语言模型的表。长视频一节把训练时的四段拿到推理时改成 64、128 或 256 帧,以及不同段数。文中给了一张配置表,这里不把未在正文逐点解释的格子重排。结论是帧数、段数和采样方式换了以后,摘要接口仍然可用,不是绑死在一种时间切分上。

限制

没有做专门的 OCR 预训练,指令微调规模不大,摘要 token 容量固定为每段 100。OCR 结果是迁移测量,不是 OCR 系统的上限。最合适的 token 预算随任务变:视频上 400 个摘要就有竞争力,文档和文字不行。效率、端到端预算策略和流式视频没有在这篇里给出系统数字。所有视频、图像理解主表都挂在 Qwen3-4B-Instruct-2507 上,不能读成换一颗语言模型之后排序不变。

百度 ERNIE 团队、香港科技大学、中国科学院自动化所,Yulong Liu、Xiaotian Han、Junyuan Shang、Yuchen Ding、Zhenyu Zhang、Shuohuan Wang、Guibo Zhu、Sirui Han、Dianhai Yu,CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding,2026-09-30,https://arxiv.org/abs/2609.39924

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误