研究与基准测试/2026-09-30/8 分钟400 个视觉 token 对上 10368:百度用固定语言模型评 CoVisco语言模型固定为 Qwen3-4B。只送 400 个摘要 token 时,多项视频分数高于把 10368 个 token 都送进语言模型的对照。DocVQA 在只送摘要时是 20.5,比例 0.8 才到 75.1。