CodexQA

Industry & PracticeResearch & Benchmarks

结果分看不出断在哪一步:美团 ATLAS 给工具 Agent 做双时段诊断

CodexQA 团队7 min read

41 个 LLM 诊断信号。校准后的 ATLAS Judge 总 F1 0.952,高于只给任务定义的 0.800。蒸馏到 9B 后 17 项总 F1 94.6,仍低于 DeepSeek-V4-Pro 的 96.4。线上三天 10% 流量,会话跟进率 +6.9%,付费 GTV +7.32%,抽查的 P0 幻觉 −6.9 个百分点。

In this piece

结果分看不出断在哪一步:美团 ATLAS 给工具 Agent 做双时段诊断

中国科学技术大学和美团的预印本 ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents,PDF 页眉是 arXiv:2608.30685v1,2026 年 8 月 31 日。ATLAS 是 Ability Taxonomy and Logical Assessment System。通讯里有 zhoupeilun02@meituan.com,项目页是 https://atlas-eval.github.io/ 。它评的是美团本地生活助手小团上的工具调用 Agent:一次请求里的执行轨迹,以及跨多轮之后服务还跟不跟得上用户。只看最终结果,看不出错在哪一步。

小团要同时对上活的供给和前面说过的话

脚注里的产品规模是:小团面向数亿活跃用户;商家信息核验 7 亿次,真实评价再校准 13 亿次,商家使用其 AI 助手功能超过 340 万次。这些不是下面实验的样本量。

一次请求里,Agent 要反复检索、比较、按工具返回改下一步。早一步理解错或选错工具,会叠到后面的结果上。商家、供给和是否还有货会变,所以一条看起来能用的推荐,仍可能过时或不能下单。跨轮还有另一个问题:前面的指代、约束和用户纠正如果没带上,每一轮单独看都像做完了,服务却漂走。

ATLAS 把这件事拆成两个时段。轮内用轨迹级信号,定位执行位置和能力问题。执行位置是思考与反思、工具与技能执行、回复生成。能力问题是相关性、事实性、时效、可靠性、意图与规划。规范与合规单独当护栏,覆盖安全、隐私、合规和结构合法性,不拿来和普通质量做交换。轮间用用户级信号,看后续服务是否还响应用户已经建立的上下文。

需要语义判断的信号用 LLM 裁判,并在真实业务日志做成的高置信参考集上校准。选中的信号再蒸馏成更小的诊断模型。同一套信号还当策略优化的反馈。论文没有把具体信号定义写成可复现的攻击或绕过步骤,下面也只保留任务、样本量和汇总分。

二元判定是默认,可用门槛大约是 F1 0.90

一条信号先找出可局部判断的对象,例如主张、供给项、错字位置或反思步骤,再聚合成这一条的分。二元通过或失败是默认。重复率、过期项比例、纠正率、排序质量这类才保留连续值。

规则信号由程序直接判定,不进后面的 F1 对比。LLM 信号的可用性看 F1,因为类别不平衡,准确率会偏。分值型信号先按该信号的离散化和容差变成判定单元。可用的条件是校准集上的 F1 不低于 τ。τ 放在高置信区间,通常是 0.90。达不到就改证据绑定、豁免和边界例子,在同一校准集上重测,过了才进诊断。

参考集分两种。回复生成类主要由人工标:5 名资深标注员,统一协议,每条至少 3 人独立标,争议交领域专家。长工具轨迹、长工具输出或证据链复杂的,用三个强教师模型,只留意见完全一致的样本。低频的安全和合规边界,用受控的查询和轨迹扰动再按同一路径重标。

蒸馏不是每个信号一个模型,也不是全部信号一个模型。只有执行位置、能力问题和输入输出形式都兼容的才分到一组。训练数据来自真实日志,并轻改最终回复的措辞,任务语义保持。教师独立判断后投票。训练前丢掉 JSON 解析失败、未闭合的 think 标签、重复回复和异常短的推理。若底模已经以高对数概率对上标签,这条也从蒸馏里拿掉。若有 think 字段,它的损失权重更低,例子是 0.1,避免学生去模仿教师的推理口气。

策略优化把选中信号的加权和当成标量奖励,再用 GRPO。同一条查询采样一组轨迹,优势是这条奖励减去组内均值,再除以组内标准差加一个小常数。论文省略标准 GRPO 目标,强调的是优势来自和评测同一套语义的诊断反馈,不是单一的最终结果分。权重 λ 的具体数值没有在正文给出。

三套查询不重叠的真实流量

三套数据都来自小团生产流量,查询互不重叠。DJudge 给 41 个 LLM 诊断信号做校准和评测,每个信号大约 500 到 1000 条,带高置信参考标签。DPolicy-Eval 大约 2000 条查询,做贴近上线的离线回放。DRL 大约 10000 条查询,做策略优化。蒸馏的训练集另外构造,也和这些查询分开,评测仍对 DJudge 的参考。

离线回放用真实用户查询,工具走线上同一套接口,商家、POI 和供给在执行时从活的业务数据解析。

RQ1 的裁判骨干都是 DeepSeek-V4-Pro。高置信监督的构造用了 Claude Opus-4.6、GPT-5.4 和 Gemini 3.1-Pro。四种接口:Direct Judge 只有任务定义、输入说明和输出格式;Static Rubric 加自动生成的固定量表;Curated Rubric 保留该信号的紧凑标准和主要豁免;ATLAS Judge 是完整校准接口,含证据绑定、分步复核和受限输出。

RQ2 把 17 个选中信号蒸馏到 Qwen3.5-9B。对照是未调的 Qwen3.5-9B、Qwen3.6-27B、Qwen3.6-35B-A3B 和 DeepSeek-V4-Pro。监督来自 DeepSeek-V4-Pro、DeepSeek-V4-Flash 和 GLM-5.1。Swift,8 张 GPU,AdamW,批大小 128,学习率 1×10^−5,最大输出 2148,最大序列 16384。

强化学习优化的是 Qwen3.6-35B-A3B,32 张 GPU,Verl、Megatron 和 vLLM,AdamW,学习率 1×10^−6,批大小 128,每组 16 条轨迹,温度 1.0,最大输出 8192,最大序列 32768。实验机器是 NVIDIA H20。

裁判接口:ATLAS Judge 的总 F1 是 0.952

表 1 是各组 LLM 信号的平均 F1。列是相关性、事实性、时效、可靠性、意图与规划、规范与合规、用户级、总体。

  • Direct Judge:0.831,0.842,0.691,0.811,0.768,0.813,0.784,0.800
  • Static Rubric:0.843,0.853,0.849,0.775,0.811,0.876,0.761,0.826
  • Curated Rubric:0.885,0.905,0.838,0.808,0.843,0.932,0.880,0.877
  • ATLAS Judge:0.939,0.956,0.961,0.972,0.937,0.984,0.953,0.952

每一列都是 ATLAS Judge 最高。抬得最多的是时效,从 Direct 的 0.691 到 0.961;可靠性从 0.811 到 0.972。Static Rubric 的可靠性 0.775 和用户级 0.761,都低于 Direct Judge,所以加一份自动量表不是单调变好。附录表 4 和表 5 是逐信号 F1,这篇不把 41 行再抄一遍。

9B 蒸馏后总体 F1 94.6,有一条低于未调的 9B

表 2 是百分数。列是 DeepSeek-V4-Pro、未调 Qwen3.5-9B、Qwen3.6-27B、Qwen3.6-35B-A3B、蒸馏后的 Ours,以及 Ours 相对未调 9B 的绝对差。

相关性五项均值:95.2,76.9,90.8,88.2,92.7,+15.8。其中开场相关性 +21.7(72.6 到 94.3),主推荐匹配 +22.4(69.5 到 91.9)。

事实性六项均值:95.9,81.4,84.1,82.3,94.6,+13.2。地点约束 +29.2(69.4 到 98.6),供给归因 +23.9(68.5 到 92.4)。失败透明只 +0.3(94.1 到 94.4),而且 94.4 低于 DeepSeek-V4-Pro 的 99.8,也低于 Qwen3.6-27B 的 97.1。POI 可追溯是 −0.6:未调 9B 已经 99.2,蒸馏后 98.6,仍低于 DeepSeek-V4-Pro 的 99.7。

可靠性两项均值:97.2,78.0,95.5,85.6,95.5,+17.5。语义重复 +21.5(73.3 到 94.8)。

规范与合规四项均值:98.4,87.3,96.2,84.4,96.7,+9.4。合规 +16.0(77.5 到 93.5)。格式合法性蒸馏后 96.1,低于 Qwen3.6-27B 的 97.9 和 35B-A3B 的 97.1。

17 项总均值:96.4,81.0,90.3,84.9,94.6,+13.6。蒸馏后的 9B 高于未调 9B,也高于 27B 和 35B-A3B 的总均值,但仍低于 DeepSeek-V4-Pro 的 96.4。35B-A3B 的总均值 84.9 低于 27B 的 90.3,更大不等于更对齐这些边界。

离线每组都更高,但图里没有逐柱数字

离线回放比三套策略:底模、当时的线上版本、用 ATLAS 诊断反馈优化后的 Ours。图 6 画了思考与反思、工具与技能执行、回复生成、规范与合规、用户级评价的平均分。正文只说 Ours 在每一组都最高,工具与技能执行抬得最多,规范与合规本来就高、优化后仍保持。柱高没有写成数字,不能从「大约 0.9」反推。

线上三天、10% 流量:跟进率 +6.9%,P0 幻觉 −6.9 个百分点

优化后的策略接到美团本地生活助手入口,对当时的线上版本做 A/B。实验窗是 6 月 27 日到 6 月 29 日,论文没有写年份。实验组固定 10% 真实流量,对照和实验同一时段。人工抽查这扇窗口里的 1000 条回复。

表 3 的产品指标是相对变化,方向都是论文标的有利方向:

  • AI 消息读完率 +0.92%
  • 人均停留 +1.26%
  • AI 搜索查询量 +0.76%
  • 有效 QV +0.50%
  • 会话跟进率 +6.9%
  • 付费 GTV +7.32%
  • 5 秒退出率 −0.31%(越低越好)

人工抽查是百分点,不是相对百分比:回复与供给的相关性 +6.2 pp,P0 幻觉率 −6.9 pp,ID 幻觉率 −2.0 pp。论文没有给这三项的基线绝对水平,所以 −6.9 pp 不能换算成「降到百分之几」。

这些数不能被读成什么

脚注里的用户和核验次数不是 DJudge、DPolicy-Eval 或 DRL 的样本数。DJudge 的「大约 500 到 1000」没有逐信号展开。41 是 LLM 信号;规则信号有,但没有一个并进表 1 的总数。表 1 是组平均 F1,不是百分数;表 2 才是百分数。POI 可追溯蒸馏后变差。图 6 没有逐柱数字。A/B 只有三天、10% 流量,且没写年份,不能当成长期大盘。人工抽查 1000 条没有给出抽样框和标注者人数。λ 没有公布。GRPO 的完整目标被省略。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测口径和表内数字。

出处:中国科学技术大学、美团,Wei Chen、Peilun Zhou、Zhaoyu Hu 等,ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents,2026-08-31,https://arxiv.org/abs/2608.30685

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction