7.4
深览指数
科技智东西·王 涵··AI 生成
全球首个千亿级MoE视频模型开源!Sand.ai给视频生成Scaling找了条新路
Sand.ai 发布并开源全球首个千亿级 MoE 视频生成模型 MAGI-2 Preview,总参数约 114B,单次激活约 6B,在 Artificial Analysis 的 Image to Video 榜单上排名第六。该模型通过统一单流架构实现音画联合建模,采用细粒度 Multi-Head MoE 扩大容量,并自研 MagiMoE 和 MagiMuon 系统支撑千亿参数稳定训练。文章详细拆解了模型层、架构层和系统层的技术路线,适合关注前沿 AI 视频生成技术、Scaling Law 演进及 MoE 架构落地的技术从业者与研究者阅读。原文 ↗
核心观点
- ▍Sand.ai 验证了大规模 MoE 视频模型扩展的一条可行路线:统一单流负责音画联合建模,细粒度 Multi-Head MoE 扩大容量,自研系统支撑千亿参数稳定训练。
- 01MAGI-2 Preview 总参数约 114B,单次前向激活约 6B 参数,在 Artificial Analysis 的 Image to Video 榜单上位列第六。
- 02该模型采用统一单流架构,文本、视频和音频进入同一个 Transformer,在每一层 self-attention 中直接交互,无需多流或级联方案。
- 03Multi-Head MoE 将 3072 维隐藏表示拆成 12 个 256 维子空间,每个子空间独立路由、各自选择专家,实现细粒度专家分工。
- 04Head Parallel 将跨设备通信前置到路由之前,按 head 分发数据,主要通信量只取决于输入表示本身,而非动态变化的专家 token。
- 05Sand.ai 自研高性能 MoE kernel 库 MagiMoE 和分布式优化器 MagiMuon,以支撑千亿参数 MoE 的稳定训练。
- 06预训练阶段强调保留广泛有效数据,通过精准细粒度标注让模型理解主体、动作、场景、时序等对应关系,而非过度清洗。
- 072026 年前 5 个月国内 AI 短剧市场规模突破 220 亿元,全年有望冲击 400 亿元,用户超 6 亿。
反方 / 局限
- — 文章未提及 MoE 架构在推理阶段可能面临的延迟与成本问题,也未讨论与 Dense 模型在同等算力下的直接对比。
- — 榜单排名基于 Artificial Analysis 的 Image to Video 评测,但未说明该评测覆盖的样本量与评价标准,难以判断其与主流视频生成基准(如 VBench、EvalCrafter)的对应关系。
Sand.aiMAGI-2 PreviewMoE (Mixture of Experts)Multi-Head MoEHead ParallelMagiMoEMagiMuonArtificial Analysis Image to Video 榜单MiniMax H3字节跳动 Seedance 2.5Grand View Research
10 分钟 · 4 卡片 · 8 资料
读原文 →