行业资讯

科大讯飞发布Spark-ASR-2.0语音大模型

Heooo 09月24日07时33分 20 阅读

「科大讯飞正式发布新一代语音识别大模型Spark-ASR-2.0,将于9月24日起在讯飞输入法逐步上线,并通过讯飞开放平台面向开发者与企业客户提供API服务,同时陆续在讯飞AI眼镜、智能办公本、讯飞听见等核心软硬件产品中落地,持续拓展声学大模型在多元场景中的应用边界。」

科大讯飞正式发布全新一代语音识别大模型 Spark-ASR-2.0,这是其在语音交互与智能硬件落地方向上的又一次关键升级。与以往偏重单点能力的语音模型不同,Spark-ASR-2.0 被定位为可同时支撑软件产品与硬件终端的声学基础能力,它的发布也意味着语音识别正在从独立功能模块,走向贯穿多产品的底层能力。

按照官方公布的上线节奏,Spark-ASR-2.0 将于发布次日、也就是9月24日起在讯飞输入法中逐步上线。作为用户量庞大的输入工具,输入法是最直接的语音识别验证场,日常口述、长句听写、中英文混说等复杂场景,都会成为模型的真实测试环境。与此同时,该模型通过讯飞开放平台面向开发者与企业客户全面提供 API 服务,外部团队可以直接调用这一能力,将其嵌入自有应用与企业工作流中。

在硬件与产品侧,Spark-ASR-2.0 还将陆续在讯飞 AI 眼镜、讯飞智能办公本、讯飞听见等核心软硬件业务中深度落地。这几类产品对语音的要求差异明显:眼镜强调近场拾音与低功耗,办公本偏重会议记录与长文本整理,讯飞听见则聚焦录音转写与多说话人场景。同一模型在多元场景中复用,考验的是它在不同声学环境与算力约束下的适配能力。

从技术路线看,科大讯飞此前上线的语音基座大模型 Spark-Audio-1.0-Preview 已基于国产化算力训练,并指向传统音频处理级联方案的固有短板:先转文字再理解的两段式流程,一方面会丢失语气、情绪与背景环境音等信息,另一方面造成语音转写、声纹识别等环节相互割裂,影响场景判断的完整性。声学大模型的思路是把音频理解作为整体来处理,Spark-ASR-2.0 正是这一方向上的迭代产物。

值得注意的是,语音识别只是科大讯飞大模型矩阵中的一环。其星火 X2.5 大模型采用 MoE 架构,总参数规模293B、激活参数30B,重点提升代码与智能体能力,并增强数学、理解等通用能力,基于国产算力完成训练推理,已上线讯飞开放平台;端侧 4B 与 1.7B 模型已先行开源,原生支持最长100万 Token 上下文,面向车载、智能硬件及万物互联等端侧场景。语音模型、通用模型与端侧模型协同,构成了从云端到终端的完整能力拼图,而后续更大规模的主力通用大模型也已在规划之中。

对开发者而言,Spark-ASR-2.0 通过开放平台提供 API,意味着语音能力可以以较低门槛接入各类应用与智能硬件;对硬件厂商而言,模型在自有产品线中的落地则提供了可参考的工程样本。随着端到端声学大模型持续演进,语音识别与音频理解的边界还将进一步延伸,语音入口的价值也有望被重新定义。

# 科大讯飞 # 语音识别 # Spark-ASR-2.0 # 大模型 # 开放平台

来源:Heooo AI工具导航