7.2
深览指数
科技量子位·鹭羽··AI 生成
114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型
Sand.ai 发布了全球首个千亿参数 MoE 视频生成模型 MAGI-2-preview,总参数 114B,激活仅 6B,生成 10 秒 1080P 视频成本约 5 毛钱,仅为行业主流的十分之一。文章详细介绍了其克服视频 MoE 通信与训练稳定性挑战的技术路径:自研 MagiMoE 内核、Multi-Head LatentMoE 架构、单流音视频融合框架,以及从“删减”转向“组织”的数据策略。作者的核心论点是,视频模型的 Scaling 路线不能照搬 LLM,需要从底层重构,而 Sand.ai 的开源将改变视频生成行业的竞争格局。适合关注 AI 技术前沿、模型架构与开源生态的研究者或从业者阅读。原文 ↗
核心观点
- ▍视频生成模型的 Scaling 路线不能照搬 LLM 的稠密模型或简单迁移 MoE,必须从底层架构、通信机制和数据处理系统全链路重构,才能解决“模型更大、视频更长、成本可控”的‘不可能三角’。
- 01MAGI-2-preview 采用单流架构,文本、视频、音频从 Transformer 第一层开始共同建模,而非传统靠 cross-attention 后期融合。
- 02模型采用 Multi-Head LatentMoE,将 3072 维隐藏表示拆为 12 个 256 维 head 独立路由,每层 3072 个专家单元,每个 token 激活 72 个小专家,专家粒度远超 DeepSeek-V4-Pro 等主流 MoE。
- 03Sand.ai 自研 MagiMoE 内核和 Head Parallel 策略,将路由、排序、计算合并,减少显存搬运;通信量不随激活专家数波动,解决了视频模型长序列下的通信瓶颈。
- 04数据策略从‘删减’转向‘组织’,扩大有效数据规模并精准标注,让模型依次学会不同场景、动作、声音的对应关系。
- 05在 AA 视频生成榜单上,MAGI-2-preview 以 6B 激活参数排名第六,效果接近第一梯队闭源模型。
- 06按 8 卡 H100 行情,生成 10 秒 1080P 视频成本约 5 毛钱,是行业主流模型的十分之一。
反方 / 局限
- — 文章承认 6B 激活参数的实际成本不等于 6B 稠密模型,专家通信、路由、显存和部署方式仍会产生额外开销。
- — 文章指出 MAGI-2-preview 是预览版,还不是视频生成的最终答案,需等待正式版验证。
Sand.aiMAGI-2-previewMoEMagiMoEMulti-Head LatentMoEHead Parallel曹越Swin Transformer李开复DeepSeek-V4-Pro
12 分钟 · 5 卡片 · 14 资料
读原文 →