5.3
深览指数
科技智东西·杨 京丽··AI 生成
又一国产模型重磅开源!有声视频编辑全球第一,16家芯片及平台首日适配
MiniMax 于 8 月 3 日开源新一代通用视频模型 MiniMax H3。该模型在 Artificial Analysis 有声视频编辑榜单上以 1130 分 Elo 排名第一,可生成最长 15 秒、2K 分辨率、带原生立体声的视频。H3 系统由三个模块组成,其中核心生成模块 H3-Base 支持本地部署,2K 画质生成需调用官方 API。文章还介绍了 16 家芯片厂商和开发平台在首日完成适配的情况。适合关注 AI 视频生成技术进展、开源生态及国产模型竞争力的从业者阅读。原文 ↗
核心观点
- ▍MiniMax H3 在 Artificial Analysis 有声视频编辑榜单上以 1130 分 Elo 位列第一,领先于 Gemini Omni Flash、Wan 2.7 等模型。
- 01MiniMax H3 是一个通用型全模态生成系统,可理解文本、图像、视频、音频组成的多模态上下文,生成最长 15 秒、2K 分辨率、带原生 32kHz 立体声音频的视频。
- 02H3 系统由 H3-Context-IR(预处理编排)、H3-Base(核心生成)、H3-Regenerate-2K(2K 画质再生成)三个模块组成。
- 03H3-Base 包含 FL2VA(首尾帧模式)和 Ref2VA(全模态参考模式)两个版本,Ref2VA 最多可输入 9 张图像、3 段视频和 3 段音频。
- 04H3-Regenerate-2K 并非传统超分辨率模块,而是让基础模型结合原始上下文对 768p 视频重新生成,以还原小文字和精细纹理。
- 05华为昇腾、摩尔线程、AMD、Intel 等 16 家芯片厂商和开发平台在模型开源首日完成了适配支持。
- 06实测中,H3 生成的航拍风光视频在自然景观真实度、镜头连贯性上表现较好,但寺庙建筑有较明显的 AI 生成感。
- 07实测生成的广告视频,叙事顺序清楚,风格统一,但出现了店员递奶茶动作重复两次的镜头编排失误。
反方 / 局限
- — H3-Context-IR 和 H3-Regenerate-2K 模块暂未开源,开发者需调用官方 API 才能完成完整 2K 工作流,本地部署仅能生成 768p 视频。
MiniMax H3Artificial AnalysisH3-Context-IRH3-BaseH3-Regenerate-2KHugging Face华为昇腾AMDIntelGemini Omni FlashWan 2.7
10 分钟 · 4 卡片 · 12 资料
读原文 →