5.1
深览指数
科技智东西·杨 京丽··AI 生成

2K画质,三成价格!钱包友好型国产视频模型来了

MiniMax 发布通用全模态生成模型 H3,支持文本、图像、视频和声音统一输入,最高输出 15 秒 2K 分辨率带原生双声道的音视频。其核心卖点在于宣称 2K 分辨率下每秒价格不到主流模型的 1/3,并计划未来开放模型权重。文章详细介绍了 H3 在任务统一、训练策略、架构(H3-Omni Transformer)和成本控制(H3-VAE、上下文再生)方面的技术细节,但多为 MiniMax 官方表述,缺乏独立第三方验证或深度竞争分析。适合关注国产 AI 视频生成技术的从业者快速了解产品动态。原文 ↗

核心观点
  • MiniMax H3 试图用一个统一的全模态生成架构,取代过去被拆分为文生图、图生视频、音色参考等彼此隔离的任务管线,以语言为桥梁连接不同模态和任务。
  1. 01H3 支持同时输入参考视频、人物图片和声音,根据自然语言描述(如“参考视频1的希区柯克镜头运动,让图2中的人物唱歌,歌声参考音频3”)生成新视频,最高支持 15 秒、2K 分辨率输出,并联合生成人声、音效和音乐。
  2. 02在价格方面,MiniMax 宣称 H3 在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 分辨率下不到 1/2,但具体价格暂未公布。
  3. 03在第三方评测机构 Artificial Analysis 的文生视频有声榜单中,H3 排名第二,Elo 得分为 1242 分,略低于谷歌 Gemini Omni Flash 的 1245 分。
  4. 04为降低训练和 2K 生成成本,H3 采用了四项关键技术:Contextual Omni Representation、H3-VAE(4 倍序列长度收益)、H3-Omni Transformer(异构训练架构,端到端提升 30% 吞吐量)和 In-context Regeneration。
  5. 05MiniMax 计划在未来几天内,在符合相关法律法规的前提下,开放模型权重,推动开源生态和国产芯片适配。
  6. 06H3 的预训练任务混合了图像、视频、音频以及多种参考和编辑数据,视频训练覆盖音频联合生成和多镜头建模,音频训练不再区分人声、音效和音乐。
反方 / 局限
  • MiniMax 自身承认,H3 在复杂多模态理解、模型规模和部分场景的画面精细度上仍有提升空间。
8 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问