千问发布Qwen-Audio-3.1语音大模型系列 封面图
行业资讯

千问发布Qwen-Audio-3.1语音大模型系列

Heooo 09月24日10时01分 23 阅读

「千问发布Qwen-Audio-3.1系列语音大模型,一次推出ASR、ASR-Next、TTS、TTS-Next与Realtime五款模型,API已在千问AI平台上架。系列支持30种语言与16种中文方言,流式识别首字响应约160毫秒。同期全线降价,TTS降幅约70%,Realtime约85%,ASR最高达95%。」

千问大模型发布Qwen-Audio-3.1系列语音大模型,一次性推出五款模型,形成覆盖理解、生成、交互与创作的完整音频能力栈。系列成员包括语音识别Qwen-Audio-3.1-ASR、音频理解ASR-Next、语音合成TTS、音频创作TTS-Next以及实时交互Realtime。目前相关API已在千问AI平台全面上架,其中ASR-Next的API即将上线。

与模型发布同步,千问对全线语音模型价格做了大幅调整。其中TTS降幅约70%,Realtime降幅约85%,ASR降幅达到95%。对于需要长期承载高并发语音流量的开发者而言,这一轮降价直接改变了语音能力的调用成本结构,也让实时交互类应用的规模化落地具备了更现实的商业前提。

作为系列中的基础识别能力,Qwen-Audio-3.1-ASR增强了对多语种、方言的识别与上下文理解能力,并新增原生转写润色功能,可自动去除语气词与重复表达。它还支持端到端分角色转写,联合输出说话人标签、时间戳与文本,一套模型即可覆盖30种语言和16种中文方言,流式识别首字响应约160毫秒,接近即时反馈的交互体验。

千问发布Qwen-Audio-3.1语音大模型系列

ASR-Next则基于下一代架构,把音频理解的边界从语音中的文字扩展到更广的声音信息,覆盖情绪、环境声与机械声。它支持声音描述、事件定位与音频问答推理,意味着模型不再只是把声音转成文字,而是尝试理解声音本身所承载的语义与场景。

语音合成侧,TTS支持同音色跨语言自然迁移,并可通过指令控制情绪与语速,让同一把声音在不同语言与不同表达状态之间自然切换。面向音频创作的TTS-Next则统一生成人声、音效与环境音,支持多角色音色复刻、细粒度时间戳与48kHz输出,服务播客、有声书以及影视游戏等对音质和层次要求更高的场景。

实时交互模型Realtime基于多教师蒸馏架构实现全双工交互,用户可随时插话打断,模型支持多语言实时切换、情绪理解以及在对话过程中调用工具。这使语音从单向的输入输出通道,转变为可承载复杂任务流的交互入口。

实测数据方面,ASR在开源方言测试集平均CER为4.55%,在中文方言自建集平均CER为10.38%,方言转普通话平均语义句准率达到82.10%。ASR-Flash-Next与ASR-Flash在四个测试集共八项指标中分获五项、三项最优,全面优于此前的Fun-ASR级联系统。

目前Realtime正与Qoder、千问办公等Agent以及千问AI眼镜等智能硬件结合,延续语音作为人机交互自然入口的趋势。从识别、理解到合成、创作与实时对话,Qwen-Audio-3.1系列把分散的音频能力收拢为一条完整链路,配合最高95%的降价幅度,语音大模型的开发者生态有望迎来新一轮活跃。

# Qwen-Audio-3.1 # 语音大模型 # 千问 # 语音识别 # 实时交互

来源:Heooo AI工具导航