行业资讯

Qwen-Audio-3.0系列语音模型上线阿里千问平台

Heooo 08月17日18时01分 26 阅读

「阿里云正式发布Qwen-Audio-3.0系列语音模型,包含ASR、TTS、Realtime三款产品,在全球权威AI评测平台Artificial Analysis的语音排行榜上斩获识别、合成、实时交互三项第一。该系列已上线千问AI平台和阿里云百炼平台,并应用于千问App、千问办公等产品。」

阿里云日前正式宣布,Qwen-Audio-3.0系列语音模型全面上线千问AI平台和阿里云百炼平台。开发者既可以通过API服务调用模型能力,也可以订阅Token Plan灵活使用,标志着这一自研语音模型家族正式面向公众开放。

该系列共包含三款产品:语音识别大模型Qwen-Audio-3.0-ASR、语音合成大模型Qwen-Audio-3.0-TTS,以及实时语音交互对话模型Qwen-Audio-3.0-Realtime。三款模型各司其职:ASR模型负责将语音精准转换为文字,能够应对复杂语境和专业领域识别;TTS模型则实现从文字到自然语音的生成,支持多语种、多方言,并可精细控制情绪、语气与节奏;Realtime模型则提供端到端的语音理解与对话能力,支持边听边说、随时打断追问,甚至能够调用外部工具,为智能助手、客服系统等场景带来更接近人类的交互体验。

值得关注的是,在全球权威AI评测平台Artificial Analysis今年7月发布的语音排行榜上,Qwen-Audio-3.0系列一举拿下语音识别(ASR)、实时交互(RealTime)和语音合成(TTS)三个赛道的全球第一,实现“大满贯”式的领先。这一成绩既体现了阿里巴巴在语音技术领域的深厚积累,也从侧面反映出该系列模型在准确性、自然度与响应速度等核心指标上的综合实力。

目前,Qwen-Audio-3.0系列已在千问App、千问办公以及Qoder等实际产品中落地应用,覆盖智能问答、办公辅助、语音交互等多种场景。随着API与平台能力的开放,更多开发者可以快速集成这些全球领先的语音能力,推动语音交互在更多行业实现创新落地。

# 阿里云 # Qwen-Audio # 语音模型

来源:Heooo AI工具导航