7.2
深览指数
科技量子位·田, 晏林··AI 生成

陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

本文以云栖大会为切口,系统梳理了阿里在千问Qwen3.8系列、图像、视频、音乐、语音及世界模型等领域的全模态布局。核心观察是:阿里已不满足于单项模型能力,而是推动多模型进入专业创作与生产链路,如陆川团队5天完成明代爆炸场景,小旭音乐6人孵化15个AI歌手。作者认为下一阶段的关键在于原生全模态统一模型,目标是从抽卡式生成走向理解完整叙事和持续完成任务。适合关注AI产业应用、大模型生态的读者。原文 ↗

核心观点
  • 阿里多模态战略已从追赶单项能力转向构建全模态生产链,核心过渡点是让AI从生成单个镜头走向理解完整叙事(Agentic Video)。
  • 多模态下一阶段的关键是原生全模态统一模型,目标是不同模态在底层共享同一任务上下文,消除目前模型协作时的信息割裂。
  1. 01陆川团队使用阿里视频生成模型,5天内完成明代《天变邸抄》记载的爆炸场景复原,传统做法需数月和千万投入。
  2. 02王珞丹抽卡抽到凌晨4点描述“卡点”在于:模型难以准确呈现创作者的“具体状态”,但对宽泛概念反而可能给出惊喜,暴露了当前多模态创作中长叙事一致性的不足。
  3. 03小旭音乐团队6人孵化十多个AI歌手IP,其生产流程涉及音乐模型、视频模型、大模型等多个阿里模组协作,4个月涨粉20万,全网播放量破2亿。
  4. 04阿里预告下一代视频生成模型将于11月发布,方向之一是从生成单个镜头走向理解完整叙事(Agentic Video)。
  5. 05阿里在云栖大会公布Qwen3.8系列(含Omni、Flash、Max等变体)、Qwen-Image-3.1、Happy Shrimp 1.1、HappyOyster 2.0 Preview等全模态模型,参数规模瞄准5万亿到10万亿。
  6. 06太合音乐总裁余灏指出,无授权AI翻唱成本极低,大量版本泛滥,可能侵蚀原版版权方和艺人的价值,AI音乐已涉及产业规则问题。
反方 / 局限
  • 文章虽强调全模态“兜底生产”,但陆川《历史·现场》的成功案例成本是:团队做了四轮提示词优化+参考真实爆炸影像校准,说明当前模型对专业创作仍需大量人工组织与调优,并未实现“自动完成”。
  • 小旭音乐透露“平均4个项目才能跑出1个成功AI歌手账号”,意味着模型在专业领域的成功率仍较低,距离规模化生产有差距。
  • 文章核心判断(三年内出现原生全模态统一模型)主要来自阿里内部观点,缺乏第三方专家或竞争对手的独立验证。
13 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问