阿里千问语音识别大模型攻克专业场景难题
「阿里通义千问发布Qwen-Audio-3.0-ASR-Flash语音识别大模型,主打长音频不丢词、行业词不用教,已在阿里云百炼平台开放调用。该模型在长音频上下文记忆、内置多行业词库、分级热词定制、语音润色及多语言支持五大维度升级,医疗专业词召回率达95.36%,七语种平均语义错误率17.09%,并同步推出流式版本,适配会议纪要、实时字幕等场景。」
阿里通义千问于近日正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,这一新模型聚焦解决专业场景下的语音转写痛点,主打“长音频不丢词、行业词不用教”,并已在阿里云百炼平台开放调用。该模型的推出标志着语音识别技术在应对复杂真实场景时迈出了关键一步。
新模型在五大维度实现了显著升级。首先,长音频上下文记忆能力得到强化,转写时可参考前文语义,在长达数小时的会议中,人名、技术概念等关键信息能够全程保持一致,有效避免了跨片段转写时出现的“断片”现象。这一特性对于需要处理长时间录音的会议纪要、访谈记录等场景尤为重要。
其次,模型内置了多行业词库,覆盖医疗、IT编程等多个垂直领域。数据显示,在医疗场景下,专业词的召回率高达95.36%,IT编程领域也达到了91.87%。这意味着用户无需进行繁琐的人工配置,即可精准识别冷门术语,大幅降低了行业应用的准入门槛。
第三,模型支持分级热词定制,企业可以根据自身需求设置专属词汇,且这些词汇能够即时生效。在多数场景下,热词的召回率突破99%,同时不会因为热词数量的增加而引发误触发问题,保证了转写结果的稳定性。
第四,模型集成了语音润色功能,能够一步完成去除口头禅、清理重复表达、处理自我纠正以及语义重组等任务。经过润色后的输出文本可读性接近“ASR+大模型润色”两步方案的效果,但流程更为简洁高效,为用户节省了额外的处理步骤。
第五,该模型一套方案即可覆盖30余种语言,在七种主要语言的测试中,平均语义错误率仅为17.09%,优于Azure、Gemini等同业模型。这一优势使其非常适合跨国会议、出海客服等需要多语言支持的场景,为全球化业务提供了有力的技术支撑。
与Flash版本同步推出的还有Qwen-Audio-3.0-ASR-Streaming,该版本面向实时转写场景,理论出字延迟低至300毫秒,在中文工业场景下错字率为7.80%,英文场景为11.52%,均处于行业领先水平。此前,该系列模型已在Artificial Analysis评测中以1.7%的错字率拿下全球第一,展现了强大的技术实力。
目前,Qwen-Audio-3.0系列已广泛应用于会议纪要、实时字幕、教育录播、智能客服等多个领域。随着阿里云百炼平台的开放,更多开发者与企业能够便捷地接入这一能力,推动语音识别技术在专业场景中的落地与创新。
来源:Heooo AI工具导航