快手直播字幕延迟压至500毫秒内
「快手电商直播技术团队公开实时字幕工程范式 Live Captioning Engineering,把主播发声到字幕可展示的端到端延迟从过去的一点五到两秒压缩至400到500毫秒,字符错误率从百分之七点八一降至百分之三点五一,并在电商直播的高并发场景下支撑千万级持续并发。」
快手电商直播技术团队近日公开了一套名为 Live Captioning Engineering 的实时字幕工程范式,把直播字幕这件事从“能出字”推进到了“实时出、准出字”。最直观的两个数字是:主播发声到字幕具备展示条件的端到端延迟,从过去的一点五到两秒压缩到了400到500毫秒;字符错误率(CER)则从百分之七点八一降到百分之三点五一。更关键的是,这些指标要在千万级持续并发的压力下稳住,而以高并发、强实时著称的电商直播场景,此前一直没有出现一套成体系的工程打法。
这套范式的核心思路,是把字幕交付拆成四段接力,任何一段拖沓都会直接反映为观众感知到的延迟。
第一段是语音识别(ASR),模型把主播的声音流实时转成文字;
第二段是 PTS 对齐,把识别出的文本与音视频时间戳对上,确保字幕和画面中的嘴型不脱节;
第三段是级联分发,识别结果经过服务链路推送到海量观众端;
第四段是端侧渲染,由用户手机上的播放器把字幕真正画出来。四段串起来,才算完成“说话到出字”的完整闭环。
最考验工程功力的是流式修订机制。直播语音是连续不断的,模型只能边听边改,前一句话的识别结果很可能在听到后半句时被推翻重来。系统因此必须回答三个问题:这是哪句话、这是第几次修订、修订后的内容该排在时间轴的哪个位置。这正是 sentenceId、revision 和播放器时间线三件套存在的意义:sentenceId 锁定一句完整的话,revision 标记这句话已经被修订到第几版,播放器时间线决定修订后的字幕该在哪一帧刷新。三者配合,才能在不闪烁、不串行的前提下,把不断被修正的字幕稳稳贴在画面上。
从工程视角看,这套方案的价值不止于字幕本身。它把实时 AI 系统里最棘手的“流式、修订、对齐”三个问题拆解得足够具体,也给出了可复用的解法:识别精度与端到端延迟要一起优化,链路要按阶段切分并各自设定指标,前端渲染也要参与时间轴的一致性设计。对于正在搭建高并发实时 AI 系统的团队来说,这些沉淀下来的工程经验,参考价值并不亚于单纯的识别准确率提升。
来源:Heooo AI工具导航