CodexQA

Industry & PracticeResearch & Benchmarks

计划先定死再写:美团 LongCat 用 ResearchSpec 评深度研究

CodexQA 团队9 min read

公开三套基准分别高出对照里最强的 0.30、3.17、5.62。内部基准 76.04,仍比 ChatGPT 的完整 Deep Research 低 0.55。计划固定后不再重开,编辑加轮次也不保证每项都涨。

In this piece

计划先定死再写:美团 LongCat 用 ResearchSpec 评深度研究

美团 LongCat 团队 2026 年 9 月 28 日公开的技术报告 LongCat-DeepResearch Technical Report(arXiv:2609.36071v1)。LongCat-DeepResearch 是一套「模型加研究编排」:先把题目收成可执行的 ResearchSpec,再按小节分头查、分头写,最后只做跨节协调,而不是整篇反复重写。公开三套基准上它高于文中对照的完整 Deep Research 产品,内部基准上排第二。

先定计划,再分节写,计划中途不重开

多个 Planning Writer 先检索再各自提案。Planning Judge 把提案合成一份计划。Critic 找缺口,Reviser 吸收进现有小节。校验要求标识唯一、父子关系成立、编号连续、必填字段齐全。非法计划先修复或回退;校验失败就停止往下分发。

ResearchSpec 在分节研究期间固定,之后不再重开全局议程。每个 Researcher 拿到原问题、完整计划和自己那一节(例如 S1.2),在独立上下文里写成带引用的完整小节。可以在自己的任务里继续查,但不能把全局议程重新打开。Global Editor 看组装后的全文,指出跨节重复和归属;Local Editor 按指示改对应小节。两者都读完整稿,因此仍受输入上下文长度限制。

同一套阶段接口还用来构造研究问题、任务评分标准和轨迹,供 LongCat 通用模型的中训练和后训练。报告明确:系统级分数不能拆到某一条流水线、某一个数据源或某一个训练阶段。

四套尺子,输入只有原题

评测生成时只给原任务提示。评分标准(rubric)和参考报告只用于打分,不给生成系统。生成时可以检索公开网页。网页入口是内部托管的搜索和读页:搜索返回标题、URL 和摘要,读页再把选中的页面解析出来。编排决定何时搜、读哪一页。

四套基准:

  • DeepResearchBench:100 道博士级任务,22 个领域,中英各 50。四个维度是 Comprehensiveness(覆盖全不全)、Insight/Depth(有没有分析深度)、Instruction-Following(跟没跟指令)、Readability(好不好读)。相对分是 100 × S_tgt / (S_tgt + S_ref),先按题再宏平均。参考报告是 2025 年 4 月 Gemini-DeepResearch 的快照。LongCat 这一行覆盖 2026-09-14 评测的全部 100 题。裁判是该基准的 RACE,模型 GPT-5.5 (medium)。论文不报告 FACT。FACT 用 GPT-5.4 Mini 和 Jina Reader,而且引用条数对篇幅敏感;它也不证明来源权威,或每一句都为真。
  • DeepResearchBench II:132 题,22 个领域,中英各 66。论文报告 9430 条原子评分标准,先自动抽取、自评、人工修订,专家审核超过 400 小时。维度是 Information Recall(该想起的信息有没有)、Analysis(分析)、Presentation(呈现)。数字必须显式对上。如果支撑句的引用被屏蔽来源挡住,该条官方记 -1。裁判同样是 GPT-5.5 (medium)。
  • ResearchRubrics:101 条真实提示,2593 条专家标准。每题先按权重汇总,再对题宏平均。维度分的分子是分数乘权重,分母只用正权重,负权重只在分子里扣分。所以几个维度分的平均不等于总分。LongCat 覆盖全部 101 题。裁判是 Gemini 2.5 Pro,判定是二元的。
  • 内部基准:Content、Analysis、Presentation 加一个加权总分。用自动评估器,不是公开排行榜。

对照不是裸模型,而是官方客户端里的完整 Deep Research:Gemini 3.7 Flash、GPT-5.6 Sol (xhigh)、Claude Opus 5 (xhigh)。系统级分数不能拆出「模型贡献」和「编排贡献」。点估计没有做统计显著性。文中还有一个描述性平均:四个 Overall 不加权相加再除以四。四套尺子的尺度和协议不同,这个平均数只是对照方便,不是统一考分。

附录还写明覆盖并不整齐。ResearchRubrics 上,ChatGPT-DeepResearch 和 Gemini-DeepResearch 用它们共同评完的题;Claude-DeepResearch 的总分是外部报告的汇总,这篇里没有逐题成绩可核。主结果包含恢复:失败尝试仍记在原任务上,低分但成功的报告不会挑出来重生成。这些数包含恢复,不是「第一次就写成」的可靠性。

主结果:公开三套高于对照里最强的,内部差 0.55

表 1 的 Overall:

系统DeepResearchBenchDeepResearchBench IIResearchRubrics内部四个 Overall 的不加权均值
Gemini 3.7 Flash Deep Research50.2146.7264.9242.4951.09
GPT-5.6 Sol (xhigh) Deep Research54.9547.1674.2176.5963.23
Claude Opus 5 (xhigh) Deep Research53.4348.1872.9161.4258.99
LongCat-DeepResearch55.2551.3579.8376.0465.62

引言里的三个相对优势,就是 LongCat 减去该套公开基准上三个对照里的最高分:DeepResearchBench +0.30(相对 GPT-5.6 Sol),DeepResearchBench II +3.17(相对 Claude Opus 5),ResearchRubrics +5.62(相对 GPT-5.6 Sol)。

分维度并没有全胜。

DeepResearchBench 上 LongCat:全面 56.21,洞察 56.48,指令遵循 55.18,可读性 49.96。可读性低于 ChatGPT 的 51.51 和 Claude 的 51.35。

DeepResearchBench II 上 LongCat:回忆 46.42,分析 60.69,呈现 83.13,总分 51.35。分析高于次高的 52.26。呈现低于 ChatGPT 的 86.98。

ResearchRubrics 上 LongCat:显式 86.97,隐式 79.52,指令遵循 66.27,引用 65.00,综合 78.92,表达 60.00,总分 79.83。指令遵循、引用、表达至少各输给一个对照。

内部基准 LongCat 总分 76.04,低于 ChatGPT 的 76.59,差 0.55;高于 Claude 的 61.42 和 Gemini 的 42.49。内部维度:内容 87.11,分析 70.74,呈现 52.99。

拆组件:少了规划和分节,分往下掉;少了编辑,掉得少

表 2 是 LongCat 在 DeepResearchBench II 和 ResearchRubrics 的开发子集上做的组件消融。同一列题目 ID 相同。数字是 DRB-II / ResearchRubrics / 两者不加权均值。

  • 完整流程:48.68 / 79.14 / 63.91
  • 一个 Writer 直接进 Reviser:44.65 / 74.46 / 59.56
  • 一个 Researcher 写整篇:45.64 / 78.49 / 62.07
  • 不经 Editor:48.60 / 78.00 / 63.30

去掉 Planning Judge 和 Critic,同时改了流程和 Writer 数量,不能单独归因。No Editor 用的是同一次完整运行里、编辑前存下来的稿。开发子集事先看过,官方参考对齐也没有建立。检索窗口和实际计算量在各臂之间并不相同。每份报告只有一次完成的打分,不估计裁判重复打分的方差。

计划改两轮,覆盖率先升后降

表 3 固定 ResearchRubrics 开发子集,关掉 planning compaction,显式跑完两轮 Critic/Reviser。W0 是三个 Writer 里的第一个,不是按报告分挑出来的。J0 是 Judge 合并后、尚未批评和修订的计划。R1、R2 各再修订一轮。四份计划快照都交给原来的并行 Researcher 和 Editor。生成开思考、种子 42,沿用原来的累计任务预算。

ResearchSpec 覆盖率是计划阶段的诊断:用 GPT-5.5 (medium) 把正权重标准映射到计划摘录和小节号,此时还不跑 Researcher 和 Editor。覆盖率是「被判定完全覆盖的正权重标准」占全部正权重标准的百分比,部分覆盖、缺失、计划阶段评不了的都留在分母里。它不是成稿质量,也不是事实对错。

阶段ResearchSpec 覆盖率显式隐式总分
W053.7684.3482.2181.67
J060.4789.0987.1185.13
R163.1491.5982.7684.34
R262.4890.9187.9984.89

合并计划提高了成稿质量,再修订进一步提高计划覆盖。R1 覆盖率最高,R2 覆盖率回落,隐式分和总分则是 R2 更高、显式分略降。显式、隐式都不是总分:总分用全部类别和完整正权重分母。论文把这记成「再细化有类别层面的混合效果」。

编辑加轮次,可读偏好升,原生分不是单调的

表 4 仍是开发子集,按题对齐。A0 是未编辑草稿。A1 用原来的 Editor 改 A0 一轮。B1 对同一份 A0 用增强 Editor 改一轮,多了来源摘录和事实核对指令。B2 改 B1,B3 改 B2。A1 是对照,不是 B 序列的起点。增强版不新检索,摘录总量不超过 24000 字符,每个来源不超过 2400 字符。来源可见、指令和轮次是绑在一起改的,拆不开各自贡献。

配置DRB-IIResearchRubrics两者均值可读偏好
A0 无编辑55.8785.9170.89—
A1 原 Editor 一轮56.0485.6670.8550.00
B1 增强一轮55.1585.1870.1750.42
B2 增强两轮55.6886.8771.2853.33
B3 增强三轮58.3886.0072.1953.96

可读偏好不是胜率。GPT-5.5 (medium)、思考开启、种子 42,把改后稿和它自己的 A0 比组织和表达,正反两种顺序都看。边际 m 落在 -2 到 2,映射成 50 + 25m。50 是持平,高于 50 偏向改后稿。A0 自己不打这个分。这是自动相对偏好,不是绝对可读性,也不是人工评分。

增强轮次把平均可读偏好从持平附近推到 53.96,最后一轮相对未编辑稿保住或提高了原生分。中间不是单调的:B1 的两套原生分都低于 A0。分基准也不一致。LongCat 的 B3 相对 A0,在 DRB-II 上平均边际是 -0.183,在 ResearchRubrics 上是 +0.500,合起来 +0.158。开发子集在看过初步结果后扩大过,论文写成探索,不是独立确认。配对区间用 10000 次题目 bootstrap、种子 42,没有做多重比较校正。B3 相对 A0,DRB-II 变化 +2.51。

换编排和换模型,增益是叠上去的

表 5 在完整题集上比三种配置。上一版模型是 LongCat-2.0。ReAct 加直接成稿:同一套搜索和读页,最终输出上限 65536 token,思考开启。当前编排在这次对比里单次输出上限 32000 token。累计任务上限是 600 次模型调用、1048576 个 completion token、500 次搜索、500 次读页。额度相同不等于实际算力相同。

模型编排DRB-IDRB-IIResearchRubrics三套均值
LongCat 上一版ReAct / 直接成稿47.6533.1360.3347.04
LongCat 上一版当前编排53.5848.6871.9058.05
LongCat 当前当前编排55.2551.3579.8362.14

模型固定时,换成当前编排,三套均值从 47.04 到 58.05。编排固定时,换成当前模型,再到 62.14。最后一行就是主表里的 LongCat-DeepResearch。论文据此把模型能力和研究编排看成互补,而不是二选一。这里的三套均值不含内部基准,和表 1 的四套均值不是同一个数。

案例:议程能改,覆盖仍然会漏

DeepResearchBench II 的 012 题是 AI 增强的组合管理,要求覆盖经典理论、AI/ML 应用、多准则决策、组合优化与再平衡,方法收到 2024 年 4 月。合并后的 ResearchSpec 拆成 19 个小节:经典理论 10、AI/ML 5、多准则 2、优化与再平衡 2。合并计划覆盖了预测方法,但没点名 Heaton、Polson、Witte 或 Deep Portfolio Theory。Critic 把它标成 HP1。Reviser 写进已有的 S2.2,加了一个可执行的研究问题和具名实体,没有新开小节。

成稿阶段,Fama–French 1992 的实证同时出现在 CAPM 小节(S1.2)和三因子小节(S1.5)。Global Editor 把详细讨论划给 S1.5,让 S1.2 留一句并交叉引用。Local Editor 按这个决定改了已有文本。同一份全局计划还为 error maximization 和 NSGA-II 的细节做了归属。

限制就写在这个案例里。成稿仍保留内部编号「S1.5」,展示用的三因子标题却把这个标识省掉了。最终报告仍漏掉评分标准要求的 Treynor 和 CPPI。只有最终报告被打分,这个案例分离不出规划和编辑各自涨了多少。附录里另一则劳动力市场案例更直接:121366 字的成稿漏了两篇评分标准点名的研究,两篇标题在修订后的 Spec 和终稿里都不在,信息回忆仍是 0。计划能追溯,缺的证据不会自动补上。

这些数不能被读成什么

ResearchSpec 固定之后不再重开全局议程。留下小节产物,不等于留下每一个检索页。编辑不保证每个有用细节都留在终稿里。额外的规划候选和编辑轮次不保证有益,而且占用本可以拿去继续找证据的额度。增强 Editor 把来源可见、指令和轮次绑在一起改,单项贡献没有拆开。

自动基准里,没改动的内容也可能被评分标准打出不同判断。题目 bootstrap 只反映题目抽样,不反映重复生成或重复裁判的不确定性。开发子集有的是按先前模型分数挑的,检索窗口、实际计算和恢复历史在各研究之间不一样。网页内容和托管中的研究产品会变,精确回放做不到。报告可以很长、很密、有重复,可读性仍是作者自己标出的缺口。

没有报告 FACT。对照产品的预算和工具不同。覆盖队列不同,细节在附录 B。内部基准用自动评估器。四个 Overall 的不加权均值尺度并不统一。系统级分数不能单独记到模型、编排或某一次训练上。

出处:美团 LongCat 团队,He Zhu、Yue Xu、Wanli Wu 等,LongCat-DeepResearch Technical Report,2026-09-28,https://arxiv.org/abs/2609.36071

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction