技术进展

阿里发布语音识别大模型提升专业词识别

Heooo 07月31日16时35分 22 阅读

「阿里巴巴推出Qwen-Audio-3.0-ASR-Flash语音识别大模型,专注优化上下文一致性、行业词识别和热词定制化,并具备语音润色能力。在医疗场景专业词听中率突破95.36%,错字率仅1.7%曾居全球第一。该系列现已在阿里云百炼平台开放,提供Flash、Filetrans和Streaming三个版本,适用于会议纪要、实时字幕等场景。」

阿里巴巴今日正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,这是其在智能语音技术领域的一次重要迭代。该模型的核心目标在于让AI更精准地理解专业词汇,从而在医疗、编程、金融等垂直行业中提供更可靠的语音转文字服务。

据官方介绍,Qwen-Audio-3.0-ASR-Flash主要在三个维度进行了系统性优化:上下文一致性、行业词识别和热词定制化。上下文一致性确保模型在长语音输入中保持语义连贯,避免因语境变化导致的识别偏差;行业词识别则依托研究团队从医疗、IT编程、股票、社会名人等领域持续挖掘的高质量词库,显著提升对专业术语和冷门词的捕捉能力;热词定制化允许用户根据具体需求动态添加自定义词汇,进一步适配个性化场景。

在最新的行业词汇内部评测中,新模型对各行业专业词的“听中率”均有明显提升,其中医疗场景的听中率突破了95.36%,展现了在高度专业化领域的强劲表现。此外,该模型还具备语音润色能力,能够直接输出结构化文本,省去了后续人工整理的步骤,提升了实际应用效率。

目前,Qwen-Audio-ASR-Flash系列已在多个实际场景中得到验证,包括会议纪要整理、实时字幕、教育录播和智能客服等。值得一提的是,该系列曾在AI评测平台Artificial Analysis上以1.7%的错字率拿下全球第一,这一成绩充分证明了其技术领先性。

在开放层面,Qwen-Audio-3.0-ASR现已通过阿里云百炼平台提供调用,共推出三个版本:Qwen-Audio-3.0-ASR-Flash(支持最长5分钟语音识别)、Qwen-Audio-3.0-ASR-Filetrans(离线文件转写)以及Qwen-Audio-3.0-ASR-Streaming(实时语音识别)。开发者可根据不同业务需求灵活选择,例如实时字幕场景适合Streaming版本,而历史录音转写则可使用Filetrans版本。

此次发布不仅强化了阿里在AI语音技术领域的布局,也为行业用户提供了更高效、更精准的语音处理工具。随着专业词库的持续扩充和模型能力的不断优化,Qwen-Audio系列有望在更多垂直场景中发挥价值,推动语音交互技术的落地应用。

# 语音识别 # 大模型 # 阿里云

来源:Heooo AI工具导航