微软首款全双工AI语音模型曝光
「微软正在测试首款原生实时语音模型MAI Realtime,支持16种语言和2种语音风格,实现听说并行与自动语言切换。该模型采用双向全双工交互,打破传统语音助手的轮次交替模式,通过端点检测技术实现同步聆听与回应。目前已在MAI Playground平台邀请合作伙伴测试,上线时间未定。」
微软在AI语音领域迈出关键一步。据科技媒体TestingCatalog报道,微软正在测试其首款原生实时语音模型MAI Realtime。该模型支持16种语言和2种语音风格,能够在对话中实现听说并行,并支持自动识别和中途切换语言。这意味着用户无需等待AI说完才能开口,对话体验将无限逼近真人交流。
MAI Realtime采用双向、全双工交互方式,打破了传统语音助手“用户说完、模型再答”的轮次交替模式。系统依靠端点检测技术识别说话的开始、停顿和结束,当用户中途插话时,模型能即时调整输出,实现同步聆听与回应。这是微软MAI语音模型家族从单向走向双向的关键一步——此前发布的MAI-Voice-2和MAI-Transcribe-1.5均只能分别完成语音合成或语音识别的单向任务。
在语言覆盖上,MAI Realtime支持中文、英语、日语、韩语、法语、德语、阿拉伯语等16种语言。用户可主动指定对话语言,也可启用自动检测功能,模型能在对话过程中自动识别并切换语言。语音风格方面,测试版本提供Victoria和Grant两种声音,据称比Copilot目前的语音模式更加自然。
不过该模型的定位仍是对话系统,不支持唱歌或生成非语音音效。调试面板可实时显示延迟数据、模型思考内容和处理步骤,样本分享功能有望在测试范围扩大后向更多平台用户开放。目前微软已邀请部分合作伙伴在MAI Playground平台进行测试,但何时上线Microsoft Foundry、何时扩展至Copilot语音功能,尚无明确时间表。
从单向到全双工,从轮次交替到同步对话,微软正在用MAI Realtime向业界宣告——AI语音交互的“对讲机时代”或将成为过去式。这一技术突破不仅提升了交互自然度,也为未来更复杂的多模态对话系统奠定了基础。
来源:Heooo AI工具导航