八 篇 里 只有 三 处 在 讲 评 测: 美 团 的 KDD 2026 论文 速 览
美团技术团队汇总 8 篇 KDD 2026 论文。和 Agent 评测直接有关的是 CDRRM 的三千条样本、LocalSearchBench 的 900 道多跳题,以及 DataAgents 赛题的异构数据包。没有配套准确率。

八篇里只有三处在讲评测:美团的 KDD 2026 论文速览
美团技术团队在 2026 年 8 月 13 日汇总了 8 篇 KDD 2026 论文,并加上大众点评在 KDD Cup DataAgents 赛道的冠军、季军做法。KDD 是数据挖掘会议,文中写录用率通常 15% 到 20%,这是会议录取比例,不是模型分数。八篇里和 Agent 评测直接有关的是评分准则、本地生活搜索基准,以及赛题怎么考数据分析 Agent。其余五篇是推荐、广告或训练系统,这里只按原文顺序点名,不把它们的业务提升写成评测成绩。
推荐基座不是这篇的评测对象
第一篇 MTFM 讲外卖多场景推荐基座:输入不对齐,跨域数据变成异质 Token,用用户级样本聚合减实例数,再用分组查询注意力和混合目标注意力降内存。摘要只说离线和在线都有效,并已替换多个主场景的独立精排。没有订单提升数字,也没有 Agent 轨迹指标。
评分准则先对比好坏,再用三千条样本
第二篇 CDRRM(Contrast-Driven Rubric Generation)做奖励模型的评分准则。传统奖励模型是黑箱,依赖贵标注。已有准则方法又冗余、有偏见。做法是先对比好回答和差回答,找出关键差异,再聚合成短的、跟任务有关的准则,交给评判模型。
实验结论只有三句:三个基准上达到当时的最好水平;减轻话痨和位置偏见;只用 3000 条样本,未微调模型超过全量微调基线。原文没写这三个基准的名字,也没写具体分差。
本地生活搜索基准:九城、六类、九百题
第三篇 LocalSearchBench 补的是本地生活 AI 搜索没有基准的空档。范围是国内 9 座城市、6 大服务品类、900 道多跳问答。环境叫 LocalPlayground,商户检索工具叫 LocalRAG。评了 16 个主流大语言推理模型。结论是表现不佳,信息完整性和可信度不足,并拆了工具调用和多跳推理的缺陷。全文没有准确率、也没有点名哪 16 个模型。
中间四篇不考 Agent
第四篇 JTransNet 解决联合广告拍卖的匿名性和确定性分配,已在美团零售广告全量。第五篇 UME 做跨域送达时间预估,含冷启动和特征缺失。第六篇 GRAD 用生成模型做自动竞价。第七篇 HMAF 做保量合约和实时竞价的分坑分配。四篇都是广告或物流决策,不是 Agent 评测集。
第八篇 MTGenRec 是生成式推荐的训练系统:动态哈希表、自动合表、去重、变长序列均衡,以及断点续训和混合精度。相对 TorchRec,训练加速 1.6 到 2.4 倍,精度不变;8 卡到 128 卡接近线性扩展。这是训练吞吐,不是问答准确率。
DataAgents:异构数据包加上会重试的运行时
KDD Cup 2026 的 DataAgents 赛道考复杂数据分析。输入是一份异构多模态包:数据库、PDF、JSON、图表、视频。问题是高层自然语言。Agent 要自己拆任务,选择工具,处理并行分支、循环和汇合,再给出答案。难点被写成真实数据的异构鸿沟,以及推理链路不是一条直线。
大众点评把「问点仔」里的 Agent Harness 搬到赛题上,业余时间做成运行时:能自己看多种数据文件,能选 SQL 和 Python。稳定性靠错误反馈、超时控制和自动重试。视频走多模态理解子 Agent,非结构化文档走 ETL 子 Agent。成绩是该赛道冠军和季军。代码在 https://github.com/zhezh/kddcup2026_champion 。原文说技术细节会另写博客,所以这篇没有任务得分、超时阈值和重试次数。
读的时候把 15% 到 20% 留在会议录取率上,把 1.6 到 2.4 倍留在训练速度上。900 题和 16 个模型没有配套分数。3000 条样本没有基准名称。
出处:美团,美团技术团队,KDD'26美团学术论文精选及KDD Cup'26 DataAgents赛道冠军思路解读,2026-08-13,https://tech.meituan.com/2026/08/13/KDD-2026-meituan-papers.html
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。