7.4
深览指数
科技腾讯新闻·钛媒体APP··AI 生成

全球语音大模型,角逐方向盘后的麦克风

本文系统梳理了2025年7月前后全球实时语音AI的技术竞赛格局,核心结论是:在车载、穿戴等场景中,延迟(特别是首音延迟)是决定技术可用性的硬天花板,端到端原生架构正在逐步替代传统三级流水线。作者分析了SpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google、Meta、微软等巨头的差异化技术路线(端到端、轮次制、混合路由、开源),并指出拥有硬件终端的公司(特斯拉、Amazon、Meta、百度等)在入口争夺中具备结构性优势,而纯API模型公司若不能进入硬件领域将处于被动。文章还详述了国内“七雄”(阿里、字节、MiniMax、讯飞、百度、智谱、腾讯)的竞争格局,强调车企是首要客户画像。适合关注AI产业、智能汽车、消费电子投资与产品决策的深度读者阅读。原文 ↗

核心观点
  • 在实时语音交互中,延迟(特别是首音延迟)是决定技术可用性的物理天花板,端到端原生架构将逐步替代传统三级流水线,但不同场景(如车载 vs 深度推理)将对应不同的技术路线(端到端、轮次制、混合路由)生态位共存。
  • 拥有自有硬件终端(特斯拉、Amazon、Meta、百度等)的公司,在语音入口争夺中具备结构性优势,能通过生态反哺和用户锁定效应将语音API作为非独立盈利的组件;纯API模型公司若不能进入硬件领域,将在下一阶段处于被动。
  1. 01SpaceXAI的Grok Voice Think Fast 2.0首音延迟压至0.70秒,采用原生端到端架构(自研VAD、音频分词器、端到端模型),推理token减少60%,能在用户说完第一句话前开始执行工具调用。
  2. 02阿里云Qwen Audio 3.0 Realtime Plus以99.2%刷新Big Bench Audio纪录,但在延迟上付出代价:平均首音延迟4.02秒,是Grok的5.7倍,在车载/穿戴场景中不可用。
  3. 03Anthropic选择轮次制(listen→think→speak)而非全双工,牺牲实时流畅度换取推理深度和工具准确性,在需要深思熟虑的场景(如演练客户提案、推敲逻辑漏洞)中优于全双工方案。
  4. 04特斯拉通过“Hey Grok”免唤醒词将语音控制扩展到导航、打电话、放音乐、调空调、开手套箱等,是目前全球最大规模的实时语音Agent生产部署,每段对话既是A/B测试也是训练数据。
  5. 05Grok TTS定价比ElevenLabs低90%,Grok STT流式定价0.20美元/小时,不到Deepgram的几十分之一;这种成本价倾销策略只有在马斯克手中同时掌握特斯拉(终端)、Starlink(网络)和X(数据与分发)时才有商业合理性。
  6. 06国内市场呈现“七雄”格局:字节Seeduplex已在700万辆量产车上落地;MiniMax以250毫秒以下延迟服务全球平台;科大讯飞在语音语义市场份额15.6%位居第一;百度端到端模型响应延迟412毫秒,地图AI副驾五一服务突破2亿人次。
  7. 07Meta以Apache 2.0协议开源Llama-Voice(7B参数TTS模型),上线48小时下载量突破80万,结合Ray-Ban Meta Gen 2硬件终端,拥有从开源模型到消费硬件的完整通路。
反方 / 局限
  • 作者承认Anthropic和亚马逊的路线提示了“速度不是唯一标准”:在需要深度推理和可靠执行的场景中,“慢而靠谱”比“快而飘乎”更有价值,终点可能不是某一条路线的全面胜利,而是不同技术路线各自占据不同场景的生态位。
  • 文章提到端侧推理(如Liquid AI与奔驰合作、Llama-Voice在消费级GPU运行)是一个正在浮现的变量,待高通、苹果和车企定制芯片迭代完成后,云端语音API的商业模式可能面临根本性挑战。
  • OpenAI的token计费模式在长对话场景下成本膨胀,实际部署成本波动区间0.05至0.15美元/分钟,用户每一轮追问都在悄悄抬高账单,这是其语音模型商业化绕不开的难题。
17 分钟 · 5 卡片 · 13 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问