科技Bestblogs·通义实验室··AI 生成
从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,通过 Flash 与 Plus 双版本分别优化实时交互(延迟约 300ms)与高质量生成,并在权威榜单中夺冠。核心创新在于支持自然语言指令控制声音风格,以及利用结构化标签实现呼吸、情绪等细粒度表达。本文适合关注语音合成技术进展或 AI 产品设计的研究者与开发者阅读。原文 ↗原文 ↗
核心观点
- ▍Qwen-Audio-3.0-TTS 通过双版本策略(Flash 与 Plus)和自然语言指令控制,实现了从“能说话”到“会表达”的进化,提升了语音合成在真实场景中的表现力与实用性。
- 01Flash 版本首包延迟约 300ms,适合实时交互场景;Plus 版本在 Artificial Analysis 榜单夺冠,自然度和音色还原度表现更佳。
- 02支持 16 种语言与 20 种方言,覆盖多语种和地域文化需求。
- 03支持通过自然语言定义情绪、角色、场景、语速,以及使用 [gasp] 等标签精确控制呼吸、笑场等非语言细节。
- 04在嘈杂或高混响环境下仍具备极强的音色复刻鲁棒性,支持 48kHz 高清输出及长达 3 分钟的语音合成。
反方 / 局限
- — 文章未提及模型在极端低资源语言或方言上的表现,以及自然语言指令控制是否存在语义歧义或不精确的问题。
前置背景
平行视角
未来推演
延伸追问