7.6
深览指数
科技Bestblogs·美团 · 技术团队··AI 生成

MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践

美团技术团队公开了其统一推荐基座大模型 MTFM 的技术细节。该模型通过异构 Tokenizer 实现多业务特征免对齐、混合注意力架构(Full + Target Attention)降低计算复杂度,并采用 User-Level 训练范式提升算力经济性。在外卖多个核心业务上线后,订单量提升最高超 6%,推理成本降低 24%。文章详述了工程落地的深度优化,包括训练稳定性、GPU 算子开发(FA 镜像、GLN Kernel)和推理图精简,适合推荐系统工程师和算法从业者了解工业界大模型落地的真实技术选型与取舍。原文 ↗

核心观点
  • 美团通过建设统一推荐基座大模型 MTFM,首次实现外卖多业务场景(首页、拼好饭等)的统一精排,解决了长期独立建模导致的算力和数据无法复用的问题,并验证了在推荐场景的 Scaling Law。
  1. 01MTFM 引入异构 Tokenizer,将输入抽象为 H-Token(历史)、R-Token(实时)和 T-Token(目标),不同业务使用独立的 Tokenizer 编码后统一堆叠,实现了跨业务特征的免对齐。
  2. 02模型采用 Target:Full=3:1 的混合注意力结构(FA 算子和 TA 算子堆叠),将 Full Attention 全量计算(O(n²))限制在单层,其余层仅用 Target Attention(O(n)),有效降低长序列(上千步)的推理延迟。
  3. 03提出 Target Token Scale-Up 技术,将单个 Target Token 拆分为多个子 Token 并进行 Mixing(线性映射和 Overlap 共享),解决了目标信息在逐层压缩后的瓶颈问题,提升了模型表达能力。
  4. 04将训练范式从 PV-Level 升级为 User-Level,同一用户多业务曝光共享序列计算,训练成本大幅降低(单 GPU 吞吐量显著提升),且缓解了小流量业务的数据稀疏问题。
  5. 05针对 64 层深层网络训练不稳定的问题,采用深度感知初始化(DeepNet 的 s 因子)和 Muon 优化器(在 AdamW 基础上加入 Orthogonal Gradient Update),实现了稳定的预训练收敛。
  6. 06在工程落地中自主开发了多个定制化 Triton Kernel,包括 FA 镜像 Kernel(解决 Full/TA 混合结构中长序列的显存瓶颈)和 GLN 融合 Kernel(合并 GELU-LayerNorm 计算),整网推理延迟降低 24%。
  7. 07线上 A/B 测试显示,MTFM 在美团外卖首页、拼好饭、搜索等核心业务上均取得显著收益,其中订单量提升 1.5% - 6.3%,且正收益主要来自长尾和转化率低的长序列样本。
  8. 08MTFM 在层数(8→64)、隐层维度(128→1024)和序列长度(128→2048)上均展现出清晰的 Scaling Law,即模型容量增加带来的收益尚未饱和。
反方 / 局限
  • 文章明确指出,异构 Tokenizer 虽然解决了特征对齐问题,但也导致不同业务之间无法共享 Embedding 表,在业务数量进一步增加时,Embedding 参数量会线性膨胀,可能存在存储和训练的边际成本问题。
  • User-Level 训练范式虽然提升了算力经济性,但增加了特征构造和样本组织的复杂度(需维护全天的用户行为序列),且对实时特征更新(如流式特征)的兼容性相对较弱。
4 分钟 · 5 卡片 · 10 资料
读原文 →

前置背景

技术原理

平行视角

未来推演

延伸追问