产品量子位··AI 生成
AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单
阿里巴巴发布Qwen-Audio-3.0-TTS语音合成大模型,支持20种方言和16种语言,在细粒度情感控制(如[gasp]标记)、高噪声环境下的语音克隆等维度有显著提升,并在Artificial Analysis榜单登顶。文章本质是产品发布稿,核心信息集中在功能参数与评测结果,缺乏对行业影响或技术局限的深入分析。适合对TTS技术前沿进展感兴趣、想快速了解阿里最新语音模型能力的读者。原文 ↗原文 ↗
核心观点
- ▍阿里Qwen-Audio-3.0-TTS实现了从“能说话”到“会表达”的跃迁,核心突破在于细粒度标签控制、方言强化和多语种优化。
- 01新模型在细粒度控制上引入 [gasp]、[giggles]、[angry] 等结构化标签,可将控制精度细化到单字级别的情绪表达。
- 02模型覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语和菲律宾语;在CV3-Eval多语种评测中,10种语言词/字错误率获SOTA,说话人相似度评测中Plus版全胜。
- 03针对方言痛点设计了专门的强化训练,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言。
- 04通过真实声学仿真训练,使语音克隆在高噪声、高混响环境下也能过滤干扰、保留音色。
- 05音频输出从24kHz提升至48kHz,单次合成时长可达3分钟,面向录音棚、影视配音级品质。
- 06提供Flash版(首包延时300ms级)和Plus版,已在阿里云百炼开放调用,并在Artificial Analysis榜单登顶。
前置背景
平行视角
未来推演
延伸追问