6.0
深览指数
产品腾讯新闻··AI 生成

腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了

腾讯混元发布Hy ASR 3.0 preview,核心卖点是“能理解上下文的语音识别”,而非逐字转写。它基于Hy3大模型和自研无监督语音Encoder,通过MoE架构、数据Scaling和后训练优化三重驱动,在方言识别(覆盖10大方言片区)、上下文同音词纠错、行业术语理解和复杂噪声环境(高噪、耳语)等维度均有显著提升。该模型已在腾讯元宝首发上线,并开放腾讯云API服务。文章属于产品发布技术介绍,主要面向对ASR技术前沿和腾讯云产品能力感兴趣的技术决策者。原文 ↗

核心观点
  • Hy ASR 3.0 preview的核心目标是让语音识别从“听清”演进为“听懂”,通过上下文感知和语义理解来消除歧义(如同音词),而非仅做逐字转写。
  1. 01在方言识别上,覆盖了粤语、吴语等10大方言片区和20余个二级小片区,在开源评测集中,中文普通话WER为3.34%,英语WER 2.62%,粤语WER 3.12%。
  2. 02针对同音词歧义(如“期终考试”vs“期中考试”),利用Hy3大模型的上下文理解能力进行智能纠错,这在长音频会议纪要、访谈转写中优势明显。
  3. 03模型架构采用MoE,自研无监督语音Encoder通过数千万小时级无监督语音数据训练,并通过联合训练和强化学习后训练优化,提升复杂声学场景(高噪、耳语)的鲁棒性。
  4. 04支持热词注入增强,可针对企业特定业务快速识别品牌名、人名和行业术语(如EBITDA、核磁共振氢谱),降低接入和持续维护成本。
  5. 05已在腾讯元宝中首发上线,并开放腾讯云API,支持智能客服、内容理解、语音搜索等场景。
反方 / 局限
  • 文章未提及Hy ASR 3.0在当前竞品(如OpenAI Whisper、百度、阿里等)中的定位对比,也未披露其模型参数量、推理延迟或成本等关键工程指标,对实际部署决策的参考价值有限。
5 分钟 · 3 卡片 · 6 资料
读原文 →

前置背景

平行视角

延伸追问