7.4
深览指数
科技微博·机器之心Pro··AI 生成
同等预算下,Looped Transformer更强吗?清华、字节Seed给出答案
针对 Looped Transformer 的收益是否仅来自更多算力消耗的质疑,清华和字节跳动 Seed 团队通过论文 SMELT,首次在匹配计算量、参数量和 KV cache 的公平条件下进行对比。研究发现,在相同预算下,Looped 架构在所有实验规模下均取得更低验证损失,且优势随算力增长扩大至 18%。机制分析揭示,循环的第二次执行会复用并修正首次结果,在结构化任务(如代码、数学)上收益尤其显著。这篇论文为评估非标准架构提供了重要的基准方法,适合关注 AI 前沿算法研究与架构对比的读者。原文 ↗
核心观点
- ▍在公平匹配计算量、参数量和 KV cache 的预算下,Looped Transformer(SMELT)相比基线 Transformer 具有真实且独特的优势,其收益并非仅来自更多算力消耗。
- ▍循环带来的下游任务收益不仅来自 loss 降低,还来自循环本身对模型表征的特殊优化,尤其是在代码、数学等高度结构化的任务和长文本场景中表现突出。
- 01研究提出了预算匹配框架,利用 MoE 架构的参数与计算解耦特性,同时控制每 token FLOPs、总参数量和 KV cache,实现公平对比。
- 02最优循环配方 SMELT 为:在稀疏 MoE 模型中,将中间 50% 的层循环执行两次,并采用更大的执行深宽比。
- 03在 16 个匹配配置下,SMELT 的验证损失均低于基线,在 Compute-Optimal 前沿上节省 6.8%-18.0% 的训练算力,且优势随算力预算增大。
- 04在 DCLM 和 MMLU 评测中,SMELT 在多数配置上取得更高分数,且在相同验证损失下,其下游分数高于基线,差距随模型规模增大。
- 05循环的第二次执行会复用约 30% 的第一次专家,并增加新专家;残差流更新幅度更大;注意力虽看向相同位置,但读取和写回的内容不同。
- 06在 Dyck Language 任务中,第二次执行将注意力从 BOS 转向示例答案位置,且 attention sink 减弱,表明模型进行了更深度的内容检索。
反方 / 局限
- — 论文承认消融实验的模型规模(最大 1.6B 激活参数,总参 54B)和稀疏度范围有限,且未涉及实际运行时间层面的系统效率优化。
- — 研究未直接比较 Looped Transformer 与其他非标准架构(如残差网络、ALBERT 等参数共享方案)的优劣,适用性边界有待探索。
8 分钟 · 5 卡片 · 11 资料
读原文 →