开源项目

小米开源工业级目标说话人语音识别大模型

Heooo 09月11日19时01分 46 阅读

「小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。模型采用端到端 LLM 架构,以目标说话人参考音频作声纹提示,可在多人同时说话的复杂环境中精准提取并仅转录目标语音,多个主流多说话人测试集达到 SOTA,单人性能比肩标准 ASR。」

小米技术宣布正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,模型的开源代码与权重已同步上线 GitHub 与 HuggingFace,供开发者直接获取与使用。

该模型要解决的是语音识别领域长期存在的“鸡尾酒会”难题。当前语音识别技术在单人说话场景下已经可以做到较高精度,但当说话人数变为两人或多人、声音互相叠加时,识别率就会大幅下降。Xiaomi-CocktailASR-1 的目标,正是在多人同时说话的复杂声学环境中,把目标说话人的语音精准提取出来并完成转录,而不被其他人的声音所干扰。

在技术路线上,Xiaomi-CocktailASR-1 采用端到端 LLM 架构,将目标说话人的一段参考音频作为声纹提示输入模型。借助这段声纹提示,模型能够在混合语音中锁定目标用户,只转录该用户的语音内容。这种以参考音频驱动的方式,让模型无需针对特定说话人重新训练,即可完成目标说话人提取与识别的联合建模。

从评测结果看,该模型在多个主流多说话人测试集上均达到 SOTA 水平,并大幅领先现有方案。同时在单人说话场景下,它的识别性能可以比肩标准 ASR 模型。也就是说,一套模型即可无缝兼顾单人识别与多人混杂两种场景,开发者不必在两套系统之间来回切换。

除了识别精度,小米还为该模型加入了两项实用能力。其一是拒识非目标说话人干扰语音的能力,当目标说话人不在场时,模型会直接输出空文本,从而有效避免误触发;其二是支持思维链推理模式,能够为识别结果提供可解释的推理过程,让开发者更容易理解模型是如何从混合语音中定位并转录目标内容的。

从开源生态角度看,工业级目标说话人语音识别模型的开放,意味着开发者可以在会议记录、多人对话转写、智能助手等需要区分说话人的方向上直接进行二次开发与工程验证。官方同步提供了 GitHub 与 HuggingFace 两个入口,前者面向代码与工程实现,后者便于模型权重的获取与推理验证。

# 小米 # 语音识别 # 开源模型 # 目标说话人

来源:Heooo AI工具导航