CodexQA

Industry & PracticeResearch & Benchmarks

订单最多涨过 6%,业务线名字没写:美团 MTFM 的离线和在线口径

CodexQA 团队4 min read

美团 MTFM 在外卖多个精排场景全量。最显著的一条业务线订单增长超过 6%,但没有业务线名字和实验窗口。推理成本降 24.0%,192 GFLOPs 是计算量不是账单。

In this piece

订单最多涨过 6%,业务线名字没写:美团 MTFM 的离线和在线口径

美团技术团队在 2026 年 9 月 22 日写了统一推荐基座 MTFM(Meituan Foundation Model for Recommendation)怎么在外卖多个精排场景全量。它建在更早的生成式精排框架 MTGR 上。相关工作 2026 年 5 月被 KDD 2026 接收。这篇同时给了离线 GAUC、消融和在线订单,但最显眼的「超过 6%」没有点名是哪条业务线,也没有实验窗口。

要同时过扩展、换场景和成本

推荐基座被写成三件事。规模可扩展:参数和数据变大时,效果要稳定、可预期地涨。场景可延展:适配旧场景或接新场景的成本要低。架构高效:多场景海量数据下,训练和推理成本还能接受。

MTFM 用类 Transformer 做端到端建模。Target Token Scale-Up 用来抬能力。异构 Tokenizer 加上动态掩码,让多场景特征不用先对齐成同一张表。Self-Attention 和 Target Attention 叠在一起,再配 User-Level 样本和 GPU 算子。

和「先同构再拆域」的 STAR、M3OE、MLoRA,以及「基座蒸馏到专家」的 ExFM、LFM4Ads 不同,原文把 MTFM 写成端到端的统一精排,不是基座加一组场景专家。

结构消融和跨场景迁移

最终结构是 Target:Full = 3:1,共 16 层,4 个 Block,每个 Block 里 1 层 Full Attention、3 层 Target Attention。消融说这个配置在各任务 GAUC 上都最好。显存下来之后,batch size 可以扩大 1.7 倍,样本吞吐是全 Full Attention 架构的 2.9 倍。原文没有给出各任务 GAUC 的绝对分。

跨场景迁移用来缓解数据稀疏。小流量业务显著提升 0.60 到 0.93pp 不等,中流量业务提升 0.25pp,大流量业务持平、略正。没有写出每档业务的名字和流量占比。

多业务一起训、网络变深之后,初期多组随机重复实验的离线指标波动超过 0.4pp,迭代基准不可信。他们看中间层激活、参数和梯度,判断有局部梯度衰减和参数退化,再从初始化和优化器改。部分 Dense 参数从 AdamW 换成 Muon,并加上 Weight Decay 和 Update RMS Scale。这是训练稳定性的修复,不是线上订单。

性能数和效果数要分开

单样本计算量 192 GFLOPs,相对传统 DLRM 高了数百倍。在线推理成本降低 24.0%。计算量变大、账单变小,靠的是后面的算子,不是模型变小。

训练侧:2k 长序列下,逐样本动态 Mask 原来要 22ms,改成 Flash-Attention V2 加 Triton Kernel 之后降到 1ms。相对 NVIDIA 的实现,前向加速 128%,反向加速 152%。Group LayerNorm 在 2k 序列上,内存带宽利用率从 30% 提到 60% 以上,相对原生提速超过 30%。Muon 的 Newton-Schulz 对小矩阵改成批处理之后,这一阶段加速 241%,端到端训练吞吐提升 19%。去掉 Host/Device 阻塞之后,整体训练速度再提升约 15%。

特征从 1.3K 个以上,用 Agent Auto Research 做分析和分组搜索,删掉近 500 个,GAUC 无损,训练吞吐 +6%,线上特征处理耗时同步下降。原文没有给出耗时下降的毫秒数。

推理侧:多表查表合并后,显存从 22GB 降到 5.9GB。User 侧跳过全零 Mask 块,长序列单算子延迟降低约 50%。Item 侧按「Item 可见 User、User 不可见 Item」跳过无效方向,在 2000 个 User Token 加 200 个 Item Token 的配置下延迟降低 13%。自定义 GLN 吞吐提升 38%。推理图精简吞吐提升 20%。

Scaling 有区间,在线 6% 没有窗口

层数增加时,各业务离线效果稳步涨,原文说离线指标和层数高度相关,没有给每加一层的 GAUC。Token 维度在 192 到 768 之间效果明显提升。序列长度在 400 到 2000 之间,离线 GAUC 稳定提升。统一模型的离线 GAUC 全面超过各场景基线。这些「全面」「稳定」没有逐业务表格进正文。

在线:MTFM V1 在美团外卖多个业务全量。核心订单指标提升显著,最显著的一条业务线订单增长超过 6%,并写成近两年多个核心业务推荐场景里单次优化的最大收益。没有实验起止日期,没有流量比例,没有这条业务线的名字,也没有其余业务线的订单增幅。

读的时候只保留原文给得出的边界:超过 6% 是「最显著的一条业务线」,不能写成全部业务线;24.0% 是推理成本,不是订单;0.60 到 0.93pp 和 0.25pp 是跨场景离线迁移,单位是 pp 不是订单百分比;重复实验波动超过 0.4pp 是项目初期的离线不稳定,后来用初始化和 Muon 处理,没有给出修复后的波动;删近 500 个特征只保证 GAUC 无损,不保证线上订单不变。

出处:美团,美团技术团队,MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践,2026-09-22,https://tech.meituan.com/2026/09/22/Meituan-Foundation-Model-for-Recommendation.html

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction