6.5
深览指数
科技微博·量子位··AI 生成

视频后期,危!MiniMax H3手绘即特效,多模态的「Coding时刻」来了

MiniMax 发布 H3 视频模型,首次将剪辑、字幕、转场、BGM、特效等后期链路全部端到端集成到模型内,用户输入文本即可直接输出带完整后期效果的成品视频,而非传统视频模型仅提供原始素材。实测显示 H3 在手绘特效、文字渲染(多帧稳定)、语音与画面情绪同步方面接近商用水平,且 2K 分辨率下 API 价格仅为主流模型的 1/3。文章核心贡献在于揭示视频模型从「素材生成工具」向「成品交付工具」的范式转变,并说明 H3 开源策略对中小企业 IP 定制的商业价值。适合 AI 产品经理、视频创作者、技术决策者快速了解当前视频生成的能力边界与成本结构。原文 ↗

核心观点
  • MiniMax H3 打破了视频模型只提供「素材」的既有范式,将剪辑、字幕、转场、特效、BGM 全部端到端化,用户输入文本即可得到可直接发布的成品视频。
  • H3 在文字渲染(多帧稳定)、手绘特效、语音与画面情绪同步等维度达到接近商用水平,特定场景下可替代部分后期制作流程。
  1. 01H3 在 Artificial Analysis 榜单上获得视频编辑类第一,且是榜单中唯一开放权重(开源)的模型。
  2. 02实测中,H3 能理解长 prompt 中的多分镜指令(如「六分镜预告片」),并遵守每个分镜的情绪方向与表演逻辑。
  3. 03H3 支持全模态输入(文字、图片、音频、视频皆可作为上下文),并通过 H3-Omni Transformer 架构实现多模态理解。
  4. 04API 定价:2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2。
  5. 05H3 支持直接丢入音频教模型读台词,语音与画面情绪同步,而非简单的 TTS 念稿。
反方 / 局限
  • 文章承认 H3 的文字渲染并非 100% 完美,但达到「能用」的商用水平。
  • 传统视频模型「抽卡」问题(同一 prompt 生成十次结果不同)在 H3 上有所改善,但作者未提供量化对比数据,仅以「可控性大幅提高」定性描述。
8 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

未来推演