CodexQA

行业与实践研究与基准测试

8B 平均 50.7:腾讯把搜索拆成规划和综合

CodexQA 团队阅读约 4 分钟

腾讯 IterSynth-8B 在五个深搜索集上平均 50.7,比 MiroThinker-8B 的 46.5 高 4.2。GAIA 55.3 低于对方 66.4。xBench-2510 表内比 Miro 的 34.0 高 12.0,正文另写 +5.4%。不更新参数时,Claude 上平均 66.1,高于 ReAct 的 60.6。

本文目录

8B 平均 50.7:腾讯把搜索拆成规划和综合

腾讯与浙江大学的 IterSynth(把深搜索拆成规划者和综合者来回交替),arXiv 2026 年 9 月 24 日 v1(2609.29444)。作者 Xingyu Wu(浙江大学、腾讯)、Yuchen Yan(浙江大学)、Zhengxi Lu(浙江大学)、Siqi Chen(浙江大学、腾讯)、Xin Zhang、Aiting Liu、Chao Deng、Jie Liu、Jin Ma(腾讯)、Jian Shao、Jun Xiao(浙江大学)、Yongliang Shen(这一行没有再标单位)。通讯邮箱含 wuxingyu、syl@zju.edu.cn 和 daniellwang@tencent.com。代码在 https://github.com/Tencent/IterSynth 。许可证是 CC BY 4.0。

深搜索要拆问题、查证、读材料、再写成有依据的答案。常见 ReAct 用同一个策略串起推理、搜索和综合,上下文越堆越吵。IterSynth 让 Planner 决定还缺什么,Synthesizer 把证据写进一份会更新的摘要,摘要才是搜索的持久状态。训练用 Role-Decoupled Policy Optimization(RDPO):终点结果奖励加上每一轮的量表评分,再按角色各自算优势,而不是把两种角色的样本混在一个池里归一化。底座是 Qwen3-8B。监督微调大约 1 万条问答,再在由这个微调策略挑出的中等难度子集上做 RDPO。工具是搜索引擎和浏览器。强化学习 rollout 用缓存检索,评测用线上工具。

五集,小模型平均 50.7

五个长程集:BrowseComp、BrowseComp-ZH、GAIA(表头写的是 text-only)、Xbench-DeepSearch 的 2505 和 2510。平均是这五项的算术平均。大模型和部分 30B 行有缺测,它们的平均不是同一组五个数,不能和 50.7 直接比高低。

8B 及以下这一档:

方法BrowseCompBrowseComp-ZHGAIAxBench-2505xBench-2510平均
OffSeeker-8B-DPO12.826.651.549.0–35.0
WebExplorer-8B-RL15.732.050.053.723.034.9
AgentCPM-Explore-4B24.129.163.970.034.044.2
MiroThinker-v1.0-8B31.140.266.460.634.046.5
IterSynth-8B30.955.455.366.046.050.7

平均 50.7,比这一档此前最高的 MiroThinker-v1.0-8B 的 46.5 高 4.2。正文写成 +4.2%。不是五项都最高。BrowseComp 30.9,低于 Miro 的 31.1。GAIA 55.3,低于 Miro 的 66.4,也低于 AgentCPM 的 63.9。xBench-2505 的 66.0 高于 Miro 的 60.6,低于 AgentCPM 的 70.0。BrowseComp-ZH 55.4,比 Miro 的 40.2 高 15.2,正文写成 +15.2%。xBench-2510 是 46.0 对 Miro 的 34.0,表内差 12.0;正文另写 +5.4%,这里两套都留着,不把它们算成同一个差。

30B 档里,平均高于 ReSum-30B 的 33.3、AgentFold-30B-A3B 的 50.2、OpenSeeker-30B-SFT 的 50.6。低于 IterResearch-30B-A3B 的 56.6 和 WebSailor-V2-30B 的 56.8。正文说「接近」这两行。Tongyi-DR-30B 58.2、MiroThinker-v1.0-30B 58.3、v1.5-30B 67.0、v1.7-mini 69.4 都更高。带工具的大模型行缺项多,例如 Claude-4.5-Opus 只报了 BrowseComp 67.8 和中文 62.4,平均 65.1 是这两项的,不是五集。

不训练也能当提示词

同一套 Planner / Synthesizer 流程,不更新参数,接到 Claude-4.5-Opus 和 DeepSeek-V3.1 上。这张表没有英文 BrowseComp,四项平均。

底座流程GAIAxBench-2510BrowseComp-ZHxBench-2505平均
Claude-4.5-OpusReAct58.355.060.269.060.6
Claude-4.5-OpusIterResearch66.053.061.972.063.2
Claude-4.5-OpusIterSynth61.257.070.276.066.1
DeepSeek-V3.1ReAct51.531.039.152.043.4
DeepSeek-V3.1IterResearch51.833.040.855.045.2
DeepSeek-V3.1IterSynth56.835.043.656.047.9

相对 ReAct,Claude 平均高 5.5(66.1 对 60.6),DeepSeek 高 4.5(47.9 对 43.4)。Claude 的 GAIA 上 IterSynth 61.2,低于 IterResearch 的 66.0。DeepSeek 四项都高于另外两种流程。

消融:角色拆开比混在一起高

训练BrowseComp中文GAIA25052510平均
RDPO30.955.455.366.046.050.7
去掉按角色归一化27.952.150.161.045.047.2
GRPO28.253.650.563.049.048.9
只做 SFT23.750.147.661.038.044.1

去掉角色拆分后平均 47.2。GRPO 平均 48.9,但 xBench-2510 的 49.0 高于 RDPO 的 46.0。只做 SFT 是 44.1。

角色对调只报三项(2505、中文、GAIA),平均不是五集。完整模型这三项平均 58.9。把 Synthesizer 换成没训练的 Qwen3-8B,平均 41.5,低 17.4。把 Planner 换成没训练的 Qwen3-8B,平均 17.8,低 41.1。Planner 掉得更多。

限制

附录里的失败不是主表的错误率。GAIA 上,综合者的摘要会丢掉两件已检索事实之间的关系,规划者按这份摘要作答就会错。BrowseComp 上,搜索结果互相矛盾时,综合者会把看起来权威但事实上错的来源写进摘要,后面的正确证据被带偏。ReAct 在 64K 上下文里完不成的比例不低:xBench-2510 上 DeepSeek-V3.1 有 27%、Claude-Sonnet-4.6 有 30% 在窗口用尽前停不下来;BrowseComp-ZH 的 100 条子集上是 31% 和 34%。这是 ReAct 对照的失败,不是 IterSynth-8B 主表。强化学习用缓存检索、评测用线上工具,两套工具不完全同一分布。大模型平均分缺项,不能当成五集总分。测试时重采样的逐点增益在附录,正文没有坐标,这里不补。

腾讯、浙江大学,Xingyu Wu、Yuchen Yan、Zhengxi Lu、Siqi Chen、Xin Zhang、Aiting Liu、Chao Deng、Jie Liu、Jin Ma、Jian Shao、Jun Xiao、Yongliang Shen,IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis,2026-09-24,https://arxiv.org/abs/2609.29444

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误