研究与基准测试/2026-09-24/8 分钟8B 平均 50.7:腾讯把搜索拆成规划和综合腾讯 IterSynth-8B 在五个深搜索集上平均 50.7,比 MiroThinker-8B 的 46.5 高 4.2。GAIA 55.3 低于对方 66.4。xBench-2510 表内比 Miro 的 34.0 高 12.0,正文另写 +5.4%。不更新参数时,Claude 上平均 66.1,高于 ReAct 的 60.6。