技术进展

科大讯飞发布全国产语音基座大模型

Heooo 09月16日22时02分 47 阅读

「科大讯飞发布语音基座大模型 Spark-Audio-1.0-Preview,基于全国产化算力训练,支持文本与语音双模态输入、文本输出,覆盖99种语言与202种方言识别,具备语音转写、多语言翻译、环境音识别、说话人识别、情感分析与音频问答能力。模型已开放体验,API 后续上线讯飞开放平台。」

科大讯飞正式发布语音基座大模型 Spark-Audio-1.0-Preview。这款模型最受关注的一个标签是“全国产”:它基于全国产化算力训练完成,从底层算力环节入手,把供应链风险挡在了门外,也为语音大模型的自主可控提供了一条可落地的技术路径。

从模态设计上看,Spark-Audio-1.0-Preview 支持文本和语音两种模态的输入,并以文本模态输出。这种“多模态进、文本出”的结构,决定了它能够承接的任务类型相当宽泛,而不是局限于单一场景。

具体而言,语音转写、多语言翻译、多方言识别是这款模型的基本功;在此之上,它还覆盖环境音识别、说话人识别、情感分析以及复杂的音频问答。也就是说,模型要处理的不仅是“话说了什么”,还包括“谁在说”“怎么说的”“周围发生了什么”。

在覆盖面这项硬指标上,Spark-Audio-1.0-Preview 一口气支持99种语言和202种方言的识别。多语言与多方言的双重覆盖,意味着同一套基座模型可以面向差异极大的语言环境提供服务,而不必为每种语言单独定制一套系统。

讯飞将这一能力跃迁总结为智能语音从“听清”到“听懂”的升级。过去机器追求的是把声波准确地转写成文字,评判标准集中在字准率;现在模型需要进一步分辨说话人的身份、语调中携带的情绪,以及背景里存在的声音信息。这背后是语音技术评价维度的整体扩展,从单一的转写准确度,走向对音频内容的综合理解。

这类综合理解能力,直接对应一批真实场景。跨语言会议与交流需要翻译与说话人区分同时在线;方言地区的语音服务需要模型听得懂本地口音;客服与内容审核场景则往往需要结合情绪判断与环境音信息;而音频问答能力,则让模型可以直接对一段录音给出结论性回答,而不只是提供一份转写稿。

从开发者生态的角度看,语音基座模型的价值很大程度上取决于接入门槛。目前 Spark-Audio-1.0-Preview 已正式开放体验,API 后续将上线讯飞开放平台。对于希望把语音理解能力嵌入自有应用的开发者而言,这意味着一条从体验到集成的路径正在被打通。

整体来看,Spark-Audio-1.0-Preview 释放了两个方向上的信号:一是全国产化算力训练在语音大模型规模上已经具备可行性;二是语音模型的能力边界正在从转写工具向音频理解平台迁移。随着 API 上线,这套能力将接受真实业务场景的检验。

# 科大讯飞 # 语音大模型 # Spark-Audio # 多语言识别

来源:Heooo AI工具导航