Fish Audio推出S2.1Pro实时对话语音模型
「Fish Audio在成立周年之际发布其最强大的生产级语音大模型S2.1Pro,专为实时对话场景打造。该模型实现约90毫秒首帧音频延迟,支持83种语言及统一语音识别架构,突破传统情绪菜单限制,允许通过括号标签实现耳语、紧张笑声等细粒度行内指令。S2.1Pro原生支持多说话人对话生成,仅需10至30秒短参考样本即可完成高质量语音克隆,无需额外微调即可复刻目标语调与说话风格。目前通过Fish Audio API上线,并提供合理限额免费版本供开发测试。」
在成立周年之际,Fish Audio正式推出其迄今最强大的生产级语音大模型S2.1Pro。与针对脚本旁白的传统文本转语音(TTS)系统不同,该模型专为实时对话语音场景打造,目前已通过Fish Audio API上线,同时提供满足开发与测试需求的合理限额免费版本。
在技术性能方面,S2.1Pro实现了约90毫秒的首帧音频播放延迟,可无缝支持自然顺畅的对话轮替。这一极低延迟特性使得模型能够应用于实时交互场景,如语音助手、在线客服和虚拟角色对话,用户几乎感受不到等待时间。模型覆盖83种语言并采用统一的语音识别架构,这意味着无论用户使用何种语言,都能获得一致且高质量的语音合成体验,为全球化应用提供了坚实的技术基础。
在语音控制灵活性上,S2.1Pro突破了预设情绪菜单的限制,允许直接在文本中嵌入自由格式的括号标签,精准实现耳语、紧张笑声等行内细粒度指令。传统语音模型通常只能通过预设情绪选项(如快乐、悲伤、愤怒)来调整语音,而S2.1Pro的括号标签机制让开发者能够像编写剧本一样,在文本中直接指定特定词语或句子的语气变化,例如在需要表现紧张场景时加入(紧张)或(耳语)标签,模型即可实时调整输出语音的语调、音量和节奏。这种细粒度控制能力极大地扩展了语音合成的表现力,使其更接近人类自然对话的丰富情感层次。
此外,S2.1Pro原生支持多说话人对话生成,且仅需10至30秒的短参考样本即可完成高质量语音克隆,在无需额外微调的前提下精准复刻目标语调与说话风格。这意味着开发者可以通过提供极短的音频样本,快速为不同角色或用户生成个性化语音,并直接在同一对话中切换不同说话人,无需复杂的模型训练流程。这一特性对于需要多角色互动的应用场景,如有声书、游戏角色配音、虚拟会议等,具有极高的实用价值。
S2.1Pro的推出标志着语音AI正在从传统的脚本式合成向极低延迟、高拟真度交互的实时对话模式加速演进。随着模型通过API开放并提供免费版本,更多开发者和企业将能够以较低门槛接入这一技术,推动全球化智能语音交互落地。Fish Audio此举不仅降低了语音合成技术的使用成本,也为语音助手、实时翻译、无障碍通信等领域带来了新的可能性,有望进一步促进语音AI在日常生活和商业场景中的普及。
来源:Heooo AI工具导航