7.5
深览指数
科技Bestblogs·OpenAI··AI 生成

我们在六个月内构建了用于响应式语音 AI 的实时系统

OpenAI 分享了其第三代语音系统 GPT-Live 的工程实现细节。核心是采用全双工语音模型,移除了传统的轮流检测器,实现模型同时监听与说话,从而大幅降低延迟。文章详细介绍了为实现亚秒级响应而重建的模型推理、上下文管理和媒体传输架构,包括有状态推理、动态上下文压缩、以及将 WebRTC 握手从六次降至一次的 WARP 协议等关键技术。对关注实时系统、语音AI产品落地和大型模型工程化的读者,这是一份来自前沿团队的一手技术案例。原文 ↗

核心观点
  • 全双工语音模型是GPT-Live消除延迟的核心,它通过让模型同时监听和说话,取代了传统需要轮流检测的语音交互模式。
  • 为实现大规模低延迟,OpenAI将媒体路径与应用逻辑分离,音频通过专用快速路径流式传输,确保慢速工具调用不阻塞语音流。
  1. 01GPT-Live的全双工模型移除了独立的轮流检测器,可以实现连续的媒体循环,避免了传统方案中由检测器引入的额外延迟。
  2. 02架构中,音频通过专用快速路径流式传输,而工具调用和业务逻辑异步运行,这种设计确保了慢速后端操作不会阻塞语音流。
  3. 03有状态推理支持长会话:当模型实例达到上下文限制时,预热的替代实例会被填入压缩后的上下文,实现无任何可听见间隔的切换。
  4. 04WARP协议将WebRTC标准握手从六次往返降至一次,而Instant Connect通过预协商SDP参数,使会话能够通过单个UDP数据包启动,大幅降低了连接建立延迟。
  5. 05生产影子流量测试暴露了真实世界的延迟和可扩展性问题,包括CPU端瓶颈、地理延迟以及与状态相关的故障,触发了遥测增强、区域路由和分阶段发布等改进。
反方 / 局限
  • 文章承认生产环境中存在地理延迟问题,暗示全球部署的实时语音交互质量受节点位置影响,这是架构面临的现实挑战。
3 分钟 · 4 卡片 · 7 资料
读原文 →

前置背景

技术原理

平行视角

延伸追问