技术进展

讯飞星火语音基座大模型正式上线

Heooo 09月16日23时01分 25 阅读

「科大讯飞上线语音基座大模型 Spark-Audio-1.0-Preview,采用0.65B音频编码器搭配30B-A3B的MoE大模型,基于1300万小时音频与纯国产算力训练,支持99种语言、202种方言,可完成转写、翻译、情感分析、环境音识别与音频问答,多语言识别效果超过 Gemini-3.1 Pro。」

科大讯飞宣布,Spark-Audio-1.0-Preview 正式上线并开放体验,API 后续将在讯飞开放平台推出。这是一款语音基座大模型,最受关注的两点是:它基于纯国产算力集群训练完成,并且在同一个模型内同时接受文本与语音两个模态的输入。

过去,大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法的短板有两条。一是信息丢失,文字只能记录说了什么,会丢掉语音里自带的语气、情绪以及背景环境音等关键信息,导致模型对场景的判断不完整。二是链路割裂,语音转写、声纹识别、语音翻译等能力被拆成独立模块串联运行,模块之间存在断点,容易累积错误,体验上也会出现延迟与卡顿。语音基座大模型不再只做语音转文字,而是一次性听懂人声、环境音、音乐等内容,并理解声音里的语义、情绪和场景。

从结构上看,Spark-Audio-1.0-Preview 采用0.65B的音频编码器(Dense 结构),搭配30B-A3B的大语言模型(MoE 结构),训练数据包含1300万小时音频以及大量文本数据,全部基于国产算力集群完成。单一模型即可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务,让机器从听清进一步走向听懂。与讯飞星火大模型的1加N体系类似,开发者也可以在语音基座大模型上做微调,衍生出语音识别、语音同传、语音交互等专用模型或系统。

官方称,该模型在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景下的高噪声、小声说等偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型相比,表现也十分接近。模型支持99种语言及202种方言的识别。在多项任务中,与同尺寸的 Qwen3.5-omni-flash(35B-A3B)相比,它在多语言、多方言语音识别的平均效果上占优;与尺寸高一个数量级的 Qwen3.5-omni-plus 效果接近。在 Fleurs、Kespeech、LibriSpeech 等中英文、多语言、多方言语音识别评测中,其得分高于 Gemini-3.1 Pro,并在 Fleurs 中文测试集中取得 SOTA。

讯飞也坦言,此次发布的版本在通用知识、数学与代码等任务上没有出现明显降智,但在指令遵循、对话、音频理解等任务上仍有进步与追赶空间,下一步将在巩固优势的同时补齐短板。对于希望基于语音能力做二次开发的团队而言,这款可直接读懂语音的基座模型,为语音识别、同传与实时交互类应用提供了一条新的技术路径。

# 讯飞星火 # 语音基座大模型 # MoE # 国产算力

来源:Heooo AI工具导航