5.7
深览指数
科技Bestblogs·MiniMax 稀宇科技··AI 生成
开放通用智能,MiniMax H3 正式开源
MiniMax 正式开源了其通用视频生成模型 H3,支持文本、图像、视频、音频等多模态输入,能生成最高 2K 分辨率、15 秒时长的视频,并包含立体声音频。文章详细拆解了 H3 的三大模块架构(H3-Context-IR、H3-Base、H3-Regenerate-2K),以及 H3-VisualVAE、H3-AudioVAE 和 H3-Omni-Transformer 等核心组件设计。对于关注多模态 AI 生成、视频生成技术路线和开源模型的深度读者,这是一篇来自官方的一手技术架构文档,而非第三方评测。原文 ↗
核心观点
- ▍MiniMax H3 是一个通用型多模态生成系统,支持复杂输入与高质量视频输出,能统一处理文本、图像、视频、音频输入,生成最高 2K 分辨率、15 秒时长的视频,包含立体声音频,支持多种宽高比与帧率。
- ▍H3 架构分为三大模块:H3-Context-IR(多模态上下文理解与表示)、H3-Base(基础生成)和 H3-Regenerate-2K(通过 in-context regeneration 提升分辨率至 2K)。
- 01H3-Base 采用多模态序列处理架构,包含 H3-Encoder、H3-VisualVAE 和 H3-AudioVAE;文本由 H3-Encoder 编码,视觉输入通过 H3-VisualVAE 和 H3-Encoder 双编码,音频仅由 H3-AudioVAE 处理。
- 02H3-Omni-Transformer 是一个拥有 33B 参数的 dense、single-stream Transformer,其中约 13B 参数位于与 AdaLN 相关的分支中。
- 03H3-Regenerate-2K 将 H3-Base 的 768p 输出与原始上下文联合输入模型,通过 in-context regeneration 生成更高保真度的 2K 视频,避免传统超分辨率方法的信息丢失。
- 04模型以 Hugging Face 模型仓库发布,支持 SGLang/vLLM 等推理框架,并提供 T2VA(文本转视频)、FL2VA(图像转视频)、Ref2VA(参考视频转视频)三类使用案例及 API 接口说明。
MiniMax H3H3-Context-IRH3-BaseH3-Regenerate-2KH3-VisualVAEH3-AudioVAEH3-Omni-TransformerMiniMax 稀宇科技SGLangvLLMHugging Face
4 分钟 · 4 卡片 · 10 资料
读原文 →