4.9
深览指数
科技智东西··AI 生成

阿里甩出“配音”神器:能调整情绪,还会说方言

阿里千问大模型发布语音合成模型Qwen-Audio-3.0-TTS,在第三方评测的语音合成榜单中位居第一。该模型支持通过文本标签或自然语言指令精细控制语气、情绪和呼吸,覆盖16种语言和20种中文方言,并能在噪声环境下进行声音复刻。本文为产品发布通告,技术细节以官方案例和评测数据为主,适合关注AI语音技术进展的从业者快速了解产品能力。原文 ↗

核心观点
  • Qwen-Audio-3.0-TTS通过细粒度标签控制和自然语言指令,实现了对语气、情绪、呼吸等语音细节的精准调节,并拓展了多语种和方言覆盖能力。
  1. 01模型在Artificial Analysis的Speech Arena语音合成榜单中Elo得分为1237,排名第一。
  2. 02用户可在文本中插入[angry]、[gasp]、[giggles]等标签,或使用自然语言指令(如“悬疑剧旁白,屏住呼吸”)控制合成效果。
  3. 03模型支持中文、英语、日语、韩语、德语等16种语言,在CV3-Eval多语种测试中,有10种语言的字词错误率最低,说话人相似度全部16项最优。
  4. 04方言支持扩至20种(广东话、重庆话、东北话等),设方言强化训练阶段以保持韵律和声调真实感。
  5. 05模型加入真实声学环境仿真训练,可在参考音频存在噪声或混响时过滤干扰并提取说话人音色。
  6. 06输出规格方面,音频采样率从24kHz提升至48kHz,单次合成最长3分钟。
反方 / 局限
  • 文章未提及模型的推理成本、延迟对实时交互场景的具体影响,也未与同类开源模型(如ChatTTS)进行对比。
10 分钟 · 3 卡片 · 5 资料
读原文 →

前置背景

平行视角

延伸追问