科大讯飞发布新一代语音识别大模型
「科大讯飞发布新一代语音识别大模型 Spark-ASR-2.0,采用非自回归与 LLM 增强自回归协同、动态上下文注入等技术创新,在中英文混合、方言、高噪声等场景下词错误率明显降低,推理成本较上代仅增 10%,明日起陆续上线讯飞输入法并开放 API。」
科大讯飞正式发布最新一代语音识别大模型 Spark-ASR-2.0。据官方介绍,该模型在整体语音识别效果上实现了大幅提升,并且将从次日起逐步上线讯飞输入法,同时通过讯飞开放平台对外提供 API 服务。
在技术层面,Spark-ASR-2.0 主要依靠三项关键创新:一是非自回归与 LLM 增强自回归的协同架构,兼顾解码效率与语义理解能力;二是中英文混合文本与声学的联合增强,用以应对同一句话中多语言混杂的表达习惯;三是动态上下文注入,让模型在解码过程中能够结合前后语境动态调整输出。这几项技术共同支撑了模型在多项任务上的表现提升。
从官方披露的效果维度看,Spark-ASR-2.0 的改善集中在几个方向:通用识别方面覆盖中英文混合、方言与专业术语;复杂声学场景方面覆盖高噪声、小音量、快语速以及儿童语音;此外还涉及上下文识别与文本流畅规范性。相较于 Spark-ASR-1.0,新模型在各核心场景上的效果均有明显进步,词错误率即 WER 明显降低,其中中英文混合、方言、高噪声与文本流畅规范性等维度的提升幅度尤为突出。
值得注意的是,Spark-ASR-2.0 在效果提升的同时控制了成本,整体推理成本相对 Spark-ASR-1.0 仅增加了 10%。官方对产品定位的描述是,过去的语音识别追求的是一字不差地还原所说内容,而 Spark-ASR-2.0 则更进一步,让识别结果“流畅成文”,即在提升识别准确率的同时,结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,使文字更连贯、语义更清晰。这意味着语音转写产品的评价标准,正在从单纯的字词准确率转向可读性与成文质量。
横向对比方面,官方称 Spark-ASR-2.0 与当前业界最好水平相比,在方言、高噪声和小音量场景上拥有显著优势,主要任务效果均好于业界最优水平,这也再次验证了其在复杂声学场景下的语音识别实力。
在落地节奏上,Spark-ASR-2.0 将从次日起逐步上线讯飞输入法,并通过讯飞开放平台向开发者提供 API 服务。此外,该模型还将陆续在讯飞 AI 眼镜、讯飞智能办公本、讯飞听见等更多产品业务上落地应用,形成从输入法到硬件终端再到会议转写工具的完整覆盖路径。对于依赖语音交互的开发者而言,开放平台 API 的提供意味着可以在自身应用中直接调用这一代模型的识别能力。
来源:Heooo AI工具导航