8.2
深览指数
科技Bestblogs·快手技术··AI 生成
Live Captioning Engineering:业界首个直播电商 AI 实时字幕系统的端到端实践
本文由快手电商直播技术团队撰写,系统复盘其构建业界首个千万级并发直播实时字幕系统的工程范式 Live Captioning Engineering。文章从「准、快、齐、稳」四个互相牵制的目标出发,详细拆解了统一媒体时间线、流式 ASR 优化、多级分发与客户端幂等合并等核心设计,将端到端耗时从 1.5~2 秒压至 400~500 毫秒,字错率从 7.81% 降至 3.51%。内容深入且具体,包含大量工程决策细节与踩坑复盘,适合音视频工程师、后端架构师和直播平台技术负责人阅读。原文 ↗
核心观点
- ▍直播字幕的四个目标「准、快、齐、稳」互相牵制,必须放在一条端到端链路里重新平衡,不能分别优化单一指标。
- ▍实时字幕的交付物不是文本,而是带有时间、版本和状态语义的流式数据,整个系统须围绕这一认知设计。
- 01团队设计了统一媒体时间线(PTS)机制:创建 PTS Queue,解码器输出 PCM 帧时写入 PTS 和 duration,识别结果返回后按文本覆盖时长定位帧区间,得到直播时间线上的起止 PTS。
- 02分发侧采用「房间级 Topic + 固定两级级联」架构,源站只生产一份字幕事件,二级节点聚合同一房间订阅,一级节点面向地域扇出,支撑千万级持续并发。
- 03流式 ASR 的中间结果以 sentenceId + revision + isFinal 表达版本语义,客户端按单调递增 revision 幂等合并,只允许改写尚未稳定的文本后缀,避免整句跳变和已读内容回退。
- 04ASR 优化手段包括动态 VAD、热词挖掘、人声增强、领域微调、错例回流以及多教师伪标注的字级融合,将字错率从 7.81% 降到 3.51%。
- 05端到端耗时从最初 1.5~2 秒优化到 400~500 毫秒。
- 06验证体系覆盖每一跳延迟、长生命周期任务治理与三层效果门禁。
反方 / 局限
- — 文章明确指出一个认知误区:把 CER(字错率)当作主要的验收标准,但 CER 只回答识别是否准确,无法回答字幕是否在正确时间以稳定形态出现。
- — 另一个误区是使用短请求容量模型来设计长连接分发系统,导致容量评估片面,未能覆盖连接数、房间数、消息频率、载荷、连接时长、热点集中度与故障恢复速度等关键指标。
4 分钟 · 4 卡片 · 9 资料
读原文 →