研究与基准测试/2026-08-28/10 分钟32K 窗口打过 128K 裸模型:腾讯 ContextPilot 评主动上下文管理Qwen3-8B 只配工具,四套均值从 45.93 掉到 27.61;训完 ContextPilot-8B-RL 是 69.40,窗口只有 32K。深度搜索平均分高于 SUPO,但 WebExplorer 的 xBench 仍是 56.67 对 58.00。