千问发布五款语音大模型,ASR价格降九成五
「阿里千问发布Qwen-Audio-3.1系列五款语音大模型,覆盖识别、合成、实时交互与音频创作。ASR支持30种语言和16种中文方言,TTS实现跨语言音色迁移,Realtime做到全双工对话,同时全线大幅降价,ASR降幅达九成五。」
千问把自家语音技术栈整体翻新,一口气放出Qwen-Audio-3.1系列五款模型,从语音识别、语音合成到实时交互,再到音频创作与泛音频理解,凑齐了一套覆盖“理解、生成、交互、创作”的完整音频能力矩阵。与模型发布同步落地的还有一轮力度很大的价格调整:TTS直降约七成,Realtime降幅约八成五,ASR更是砍掉九成五。这意味着语音能力的调用门槛被压到极低,开发者可以更低成本地把“耳朵和嗓子”接进自己的产品。
识别这条线上,Qwen-Audio-3.1-ASR成为新一代语音识别大模型,最见功夫的地方是“听得懂上下文”。它新增原生转写润色能力,能自动剥掉语气词、删掉重复表达、重组语义,让输出文字更顺、更有逻辑,而不只是把声音原样转成文字。分角色转写则把“谁在什么时候说了什么”完整还原,为会议、访谈和对话分析留下可追溯的结构化记录。这套端到端方案把说话人标签、时间戳与文本联合输出,既能处理轮流发言,也能留住短插话和重叠语音,把每个人说的话掰得清清楚楚。
覆盖广度同样可观:一套模型吃下30种语言和16种中文方言,行业词、专业实体和分级热词都能识别,还会参考长音频的历史上下文,让人名和术语在整个音频里保持一致。延迟方面,首字响应压到约160毫秒,边说边转写不卡顿。成绩单也够硬:公开方言数据集KeSpeech和WSYue的11个子集上平均字错误率4.55%,中文16种方言内部测试平均字错误率10.38%,温州话这类难啃的方言提升尤其明显,方言翻普通话的平均语义句准率达到82.10%。
更进一步的是基于下代架构的Qwen-Audio-3.1-ASR-Next。它把识别对象从“语音里的文字”扩展成“完整的音频信息”,能听懂人物情绪、环境声和机械声,完成声音描述、事件定位和音频问答推理。给一段混着对话、背景音乐与环境声的音频,它不只输出字幕,还能告诉你里面有哪些声音、相关事件何时发生,并回答关于整段内容的提问。在分角色ASR测试中,ASR-Flash-Next和ASR-Flash分别在八项指标里拿下五项和三项最优,全面超过此前的Fun-ASR级联系统。
合成这边,Qwen-Audio-3.1-TTS强调真实表达,而非只求字音正确。它支持多语种与方言合成,同一音色跨语言时能自然迁移,让一个声音秒讲数种语言,还能靠指令控制情绪、语速和表达方式,让声音贴合具体内容与场景。
真正的惊喜来自下代架构的Qwen-Audio-3.1-TTS-Next,它把音频创作从“单一人声合成”升格为“通用音频生成系统”。过去做一段完整音频,需要主播、音效师、混音师、剪辑师分头干活再后期缝合;现在围绕文本、时间戳和参考音频,一个模型就能统一生成人声、音效和环境音。它支持多人音色复刻与多轮对话,连续内容里各角色音色不“变声”,还会演绎停顿、接话、附和与情绪转折;多类声音融合生成,能呈现材质、远近与空间层次,有声书里可以同时处理旁白、两角色对话,再补上城市低鸣、晚风和易拉罐碰撞声。更专业的是它吃自然语言控制,可指定语气、语速、音量、音乐风格与配器,支持细粒度时间戳、声音复刻和48kHz输出,对白起止与声音事件节奏都能精准排布。
实时交互这条线上,Qwen-Audio-3.1-Realtime不再把识别、模型和合成简单串起来,而是走全双工,能同时说和听,用户随时插话、打断,体验贴近真人通话。模型理解的不只是文字,还有声音背后的情绪与意图,察觉语气低落时会放慢语速、调整措辞,而不是机械回一句“我理解”;对话中切换语言,上下文、语气和节奏不断档;面对不确定信息少编,面对高风险内容守住边界。它还基于多教师蒸馏架构,在保持低延迟的同时提升推理与安全能力,并能在实时对话里直接调用Agent工具,连接API、知识库和业务系统去查、去执行,把结果自然带回对话。
落地已经在路上。Qwen-Audio-3.1-Realtime正与Qoder、千问办公等Agent,以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等硬件结合,让用户不必打开电脑手机,直接动嘴发起任务,并在对话里追加条件或修改需求。从ASR的润色与方言、ASR-Next的泛音频理解、TTS的跨语言音色、TTS-Next的完整音频创作,到Realtime的拟人共情与工具调用,千问沿着五条清晰的技术路径同时推进,把“能听懂、能创作、能聊天”打包成语音这一连接人、内容与AI的自然入口,而九成五的ASR降价,则把这道入口的门槛几乎拆到了地平线以下。
来源:Heooo AI工具导航