阶跃星辰发布 StepAudio 3 系列语音大模型
「阶跃正式发布 StepAudio 3 系列语音大模型,包含 Realtime、ASR、TTS、Gen、Music 五款模型,目前均已上线开放平台。其中 Realtime 以 98.9% 与 99.7% 两项得分登顶 Artificial Analysis 榜单,ASR 词错误率低至 1.7% 并列全球第一。」
阶跃正式发布 StepAudio 3 系列语音大模型,一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 与 StepAudio 3 Music 五款模型,目前均已上线阶跃星辰开放平台。官方表示,该系列分别面向真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作等核心场景,其中多款模型在 Artificial Analysis 榜单中位列全球第一。
StepAudio 3 Realtime:边听边说,还能思考与执行
如今不少实时语音产品已经支持全双工、打断和低延迟交互,但真正拉开体验差距的,是模型能否在持续发生的对话中边听边理解,判断何时接话,同时完成推理与任务执行。StepAudio 3 Realtime 支持原生全双工实时对话,在 Artificial Analysis Conversational Dynamics 榜单中以 98.9% 的综合得分排名全球第一,能够像真实交流中的人一样判断对话节奏,知道什么时候该回应、什么时候该等待,并处理用户的临时打断与连续反馈。它同时以 99.7% 的语音推理准确率位列 Speech Reasoning 榜单全球第一,该榜单聚焦模型直接理解音频并完成复杂推理任务的能力,是评估原生语音模型的重要第三方基准。此外,模型可同时理解语义、语气、情绪、副语言和环境声音,支持推理与语音生成并行,Tool Call 与长任务可异步执行且不阻塞当前语音会话,让实时语音模型在同一场对话中完成听、说、想、做。
StepAudio 3 ASR:从听清,到听懂
真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。StepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识及推理能力结合,支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景,能够更准确识别人名、地名与专业术语,在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。模型也能处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入,在 Artificial Analysis 非流式语音识别准确性榜单中,WER 仅为 1.7%,并列全球第一,可服务于会议纪要、视频字幕与直播理解、智能客服、车载交互、医疗记录与专业内容生产等场景。
StepAudio 3 TTS:不止朗读,更像真人表达
StepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型,在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式,还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现,并结合语义内容理解表达意图,自主调整情绪与语气。模型基于流式生成架构,实现生成与播放同步进行,满足实时语音应用需求。
StepAudio 3 Gen:人声、音效、环境、音乐一次生成
传统音频内容生产链路很长,角色配音、环境音、音效与背景音乐往往需要分别制作再剪辑混音。StepAudio 3 Gen 把这些分散环节统一到一个模型里,可基于自然语言描述和参考音频,统一生成人声、音效、环境音和背景音乐,用户只需描述角色、场景和剧情,无需针对特定角色或场景额外训练。模型支持对多个角色的音色、说话方式、语气、情绪、方言口音以及笑声、喘息、停顿等副语言特征进行精细控制,也可指定对白、音效、环境声与背景音乐出现的时间与顺序,对影视、动画、游戏、广播剧、有声书和短视频创作者而言,声音制作流程有机会被压缩到一次生成和持续迭代中。
StepAudio 3 Music:不止生成,更参与创作
StepAudio 3 Music 不只支持从零生成,也支持基于 ABC 记谱法控制的多轮交互创作,涵盖歌曲创作、清唱配乐、歌曲翻唱等功能。用户可以输入歌词、清唱、参考歌曲或记谱信息,让模型围绕已有创作继续生成与完善,并通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。模型还对主歌、副歌、桥段、间奏等歌曲结构,以及跨段落的旋律发展、能量变化和演唱表达进行建模,在清唱配乐场景中可理解清唱里的旋律、节奏与情绪,进一步补充和声、节奏、乐器与完整编曲。
从实时对话、语音识别到语音合成、音频内容生产与音乐创作,StepAudio 3 系列把语音与音频能力拆解成面向不同场景的模型矩阵,并在第三方基准上给出了可量化的成绩,这也让开发者可以在同一平台上按需组合这些能力,构建更完整的语音交互与内容生产应用。
来源:Heooo AI工具导航