6.1
深览指数
产品智东西··AI 生成

我做了个新闻联播版《甄嬛传》,全靠这款字节模型

字节跳动发布Seed Audio 1.0,一个能从提示词一次性生成对白、音效、环境声的音频创作模型,无需拼接。实测显示,它不仅能还原复杂场景(如古风武侠、茶餐厅)的完整声音,还能模仿参考音色(如新闻联播女声念甄嬛台词),并支持20余种语言。官方盲测CMOS得分领先头部竞品0.79,在10+场景下可用率达91%。但当前版本在部分场景下仍存在AI感,情绪细节真实度有提升空间。适合AI产品经理、内容创业者、音频创作者评估工具效用。原文 ↗

核心观点
  • Seed Audio 1.0是一款能将对白、音效、环境声统一在单一生成框架中的音频创作模型,标志着AI音频从“会说”迈向“会创作”完整场景。
  1. 01在盲测主观偏好CMOS打分中,Seed Audio 1.0相较头部商用音频服务最高提升0.79,用户更偏好其生成音频。
  2. 02在电影、短剧、播客、动画等十余类场景测试中,该模型生成的整体音频可用率达91%。
  3. 03在多语种能力测试方面,该模型支持20余种语言生成,绝大多数语种人声自然度MOS平均分超4分(≥4分为优质标准)。
  4. 04实测中,Seed Audio 1.0仅凭一段环境描写(如“加油站悬疑”)就能生成包含角色对白、脚步声、环境音效的完整场景音频。
  5. 05该模型能模仿参考音频的音色风格,无需额外训练即可用新闻联播女声生成《甄嬛传》台词。
  6. 06模型支持100ms级时间精度,可根据视频时间线精确控制对白、音效的进入时机与衔接方式。
反方 / 局限
  • 在部分场景(如粤语茶餐厅对话)中,模型生成的音频仍存在一定AI感,情绪细节和真实度仍有提升空间,尤其是在对话开头部分。
11 分钟 · 5 卡片 · 14 资料
读原文 →

前置背景

功能拆解

平行视角

未来推演

延伸追问