Meta发布实时音频感知模型支持多人分轨转写
「Meta推出首个实时音频感知模型Muse Voice Transcribe,支持20余人分轨转写与实时流式识别。开发者可通过API调用,定价每千分钟3美元。模型覆盖70余种语言,自适应延迟机制兼顾速度与准确度,在流式语音转文本排行榜位列第一。」
Meta公司近日推出Muse Voice Transcribe,这是其首个实时音频感知模型。该模型在同一流程中整合了流式自动语音识别、说话人分离与端点检测,用户在说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。这一特性大幅降低了延迟,适合实时听写、会议记录和通话字幕等场景。
从技术路径来看,Muse Voice Transcribe实现了真正的“边说边转写”。传统语音识别往往需要等待整段音频输入完毕后才开始处理,而该模型采用流式架构,能够一小段一小段持续输出文字。与此同时,模型内置的说话人分离功能可在包含20余名说话者的录音中准确区分不同发言者,端点检测则能自动识别说话是否结束,从而确定一段输入的自然边界。
在识别能力上,Muse Voice Transcribe的训练覆盖了70余种语言,其中25种语言在发布时已完成验证。该模型不仅支持长度超过1小时的音频,还支持句内或句间的自然语言切换,极大便利了多语言混合场景。开发者还可通过语言、关键词和上下文偏置来优化特定术语或场景下的识别效果,增强模型在垂直领域的适用性。
为了兼顾实时响应与识别准确度,Meta引入了名为“自适应延迟”的动态决策机制。系统不会为所有词语采用固定的速度与准确度取舍,而是针对每个词独立判断需要额外接收多少音频后再输出识别结果。对于容易识别的语音,系统可以更快提交转写结果;对于发音不清、术语较多或语境复杂的词语,系统则会调用更多前后文音频信息来提升判断准确性。
目前,开发者可通过Meta Model API调用Muse Voice Transcribe能力,定价为每1000分钟音频3美元,等同每小时0.18美元。据Meta透露,截至2026年9月1日,该模型在Artificial Analysis流式语音转文本排行榜中位列第一,显示出其在实时语音转写领域的领先实力。
来源:Heooo AI工具导航