行业资讯

Meta发布实时音频感知模型Muse Voice Transcribe

Heooo 09月02日12时34分 4 阅读

「Meta推出首个实时音频感知模型Muse Voice Transcribe,支持边说边转写,可分离20余名说话者,训练覆盖70余种语言。开发者可通过Meta Model API调用,定价每1000分钟3美元。该模型位居流式语音转文本排行榜首位,引入自适应延迟机制平衡速度与准确率。」

Meta近日推出其首个实时音频感知模型Muse Voice Transcribe。该模型面向开发者提供语音转文本能力,可通过Meta Model API直接调用。定价方面,每1000分钟音频收费3美元,约合每小时0.18美元,这一价格定位使其在实时语音转写场景中具备较强的成本优势。

Muse Voice Transcribe的核心亮点在于“流式”处理。传统语音识别通常需要等待整段音频输入完毕后再输出结果,而该模型在同一流程中整合了流式自动语音识别、说话人分离与端点检测。系统能够边说边出字,以更低的延迟持续输出文字,非常适合实时听写、会议记录、通话字幕等场景。用户说话的同时即可看到文字生成,无需等待录音结束。

在多人对话场景中,Muse Voice Transcribe可在包含20余名说话者的录音中自动分离不同发言者,并识别说话是否结束,从而确定输入边界。语言支持方面,模型训练覆盖70余种语言,其中25种在发布时完成验证。它支持超过1小时的音频输入,也支持句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提升特定术语或场景下的识别准确率。

为了兼顾实时响应与识别准确度,Meta引入了“自适应延迟”机制。系统不会对所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出结果。对于发音清晰的语音,系统会更快提交转写;而对于发音不清、术语较多或语境复杂的词语,则会调用更多前后文信息,以提升识别质量。

Meta表示,截至2026年9月1日,Muse Voice Transcribe位列Artificial Analysis流式语音转文本排行榜第一名。这一排名反映了其在实时语音识别领域的综合表现,也表明Meta在音频感知模型方向上取得了初步进展。

# Meta # 语音识别 # 实时转写

来源:Heooo AI工具导航