5.5
深览指数
科技量子位·允中··AI 生成

腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview,基于Hy3大模型底座,融合语音识别与语义理解,WER(词错误率)在中文、英文、粤语上均控制在3%左右,领先开源竞品。文章重点介绍了其在上下文感知、方言识别、复杂声学场景(高噪、耳语)上的专项优化,以及MoE架构、数千万小时无监督训练、多阶段强化学习等技术路径。适合关注AI语音技术、大模型落地的技术负责人或产品经理阅读,了解当前ASR领域在“理解语境”而非“逐字转写”方向上的最新进展。原文 ↗

核心观点
  • Hy ASR 3.0 preview的核心进步是从“逐字转写”演进为“理解语境、兼容场景”,融合高精度语音识别与深度语义理解,在更复杂的真实输入中给出准确、连贯且更接近用户意图的转写结果。
  1. 01在开源评测集中,Hy ASR 3.0 preview在多语种WER上控制在3%左右,其中中文普通话WER 3.34%、英语WER 2.62%、粤语WER 3.12%,整体领先竞品。
  2. 02自建评测集中,模型在通用识别、方言识别、上下文Context理解、复杂声学场景(高噪、耳语)等场景中WER均保持较低水平,整体领先竞品。
  3. 03架构上采用MoE架构,基座模型升级至Hy3;语音侧自研无监督语音Encoder,通过数千万小时级无监督语音数据训练提取高质量声学表征。
  4. 04团队构建了高质量的SFT recipe,覆盖上下文context、专业名词、不同声学环境及多样人群语音;方言识别数据覆盖10大方言片区和20余个二级小片区。
  5. 05引入多阶段强化学习,分别针对通用转写准确性、Any-context上下文能力和复杂长尾场景进行优化,降低误识别和漏识别。
反方 / 局限
  • 文章未提及模型的推理延迟、计算成本或部署门槛,也未与竞品(如Whisper、Deepgram)在同等成本下做对比,因此无法评估其工程落地效率。
  • 未提及极端边缘场景(如极低信噪比、多说话人重叠、非标准方言变体)下的表现,以及是否依赖特定硬件加速。
5 分钟 · 5 卡片 · 14 资料
读原文 →

前置背景

技术原理

应用场景

平行视角

延伸追问