产品量子位··AI 生成
阿里视频大模型Wan3.0开启公测:文档、ppt也能变视频
阿里云正式公测视频生成大模型Wan 3.0,核心升级点为单次可生成30秒视频,并首次支持doc、xls、ppt、pdf等文档格式作为输入来生成视频。文章重点介绍了其在叙事时长、多功能参考和真实世界还原方面的能力,强调模型正从内容生成工具向生产力工具跃迁。适合关注AI视频生成技术进展、大模型应用落地的从业者或研究者快速了解产品动态。原文 ↗原文 ↗
核心观点
- ▍阿里巴巴视频生成大模型Wan 3.0的核心升级是单次可生成30秒视频,并首次支持将文档、PPT等结构化信息直接转化为视频,从而实现从‘生成一个镜头’到‘讲述完整故事’的跃迁。
- 01Wan 3.0在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入,单个文件或链接不超过100MB、50页。
- 02模型支持智能时长功能,可根据提示词自动推荐合适时长,并具备强大的提示词工程与指令遵循能力。
- 03文章宣称Wan 3.0能实现‘千人千面’的人像生成,并稳定保持角色、道具、声音、空间关系等细粒度维度的参考一致性。
- 04Wan 3.0还支持视频编辑(修改画面、剧情与台词),并且提供了480P/720P/1080P的API定价,分别为0.3/0.6/1.2元/秒。
反方 / 局限
- — 文章承认Wan 3.0在声音质感与文字准确度方面仍有进步空间,未提及具体的局限性或与其他竞品模型的对比。
概念锚点
前置背景
平行视角
未来推演
延伸追问