4.1
深览指数
产品量子位··AI 生成

阿里视频大模型Wan3.0开启公测:文档、ppt也能变视频

阿里云正式公测视频生成大模型Wan 3.0,核心升级点为单次可生成30秒视频,并首次支持doc、xls、ppt、pdf等文档格式作为输入来生成视频。文章重点介绍了其在叙事时长、多功能参考和真实世界还原方面的能力,强调模型正从内容生成工具向生产力工具跃迁。适合关注AI视频生成技术进展、大模型应用落地的从业者或研究者快速了解产品动态。原文 ↗

核心观点
  • 阿里巴巴视频生成大模型Wan 3.0的核心升级是单次可生成30秒视频,并首次支持将文档、PPT等结构化信息直接转化为视频,从而实现从‘生成一个镜头’到‘讲述完整故事’的跃迁。
  1. 01Wan 3.0在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入,单个文件或链接不超过100MB、50页。
  2. 02模型支持智能时长功能,可根据提示词自动推荐合适时长,并具备强大的提示词工程与指令遵循能力。
  3. 03文章宣称Wan 3.0能实现‘千人千面’的人像生成,并稳定保持角色、道具、声音、空间关系等细粒度维度的参考一致性。
  4. 04Wan 3.0还支持视频编辑(修改画面、剧情与台词),并且提供了480P/720P/1080P的API定价,分别为0.3/0.6/1.2元/秒。
反方 / 局限
  • 文章承认Wan 3.0在声音质感与文字准确度方面仍有进步空间,未提及具体的局限性或与其他竞品模型的对比。
4 分钟 · 5 卡片 · 8 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问