微软测试全双工语音模型MAI Realtime
「微软正在测试其首款原生全双工AI语音模型MAI Realtime,支持16种语言和2种语音风格,可实现同步聆听与回应。该模型在MAI Playground平台邀请合作伙伴测试,尚未公布上线时间。相比此前单向模型,MAI Realtime在交互方式和自然度上有显著提升,但暂不支持唱歌或非语音音效。」
微软正在测试其首款原生实时语音模型MAI Realtime,这一消息由科技媒体TestingCatalog于8月2日披露。该模型采用全双工交互方式,能够在同一时间接收用户语音并输出回复,无需等待一方完全说完,显著提升了对话的自然流畅度。
MAI Realtime支持包括中文在内的16种语言,涵盖英语、德语、西班牙语、法语、意大利语、葡萄牙语、日语、韩语、荷兰语、印地语、印度尼西亚语、阿拉伯语、俄语、土耳其语、越南语和泰语。用户既可以主动指定语言,也可以启用自动检测功能,系统能够自动识别并切换语言。
在语音风格方面,测试版本提供Victoria和Grant两种语音,据称比Copilot目前的语音模式更加自然。该模型的定位是对话系统,不支持唱歌或生成非语音音效。调试面板能够显示实时延迟、模型思考内容和处理步骤,样本分享功能可能将在测试权限扩大后向平台用户开放。
运行机制上,MAI Realtime采用双向、全双工交互方式,不再严格遵循“用户说完、模型再答”的轮次交替。它依靠端点检测识别说话的开始、停顿和结束,并能在用户插话时调整输出,从而实现同步聆听和回应。
微软此前发布的MAI语音模型均为单向模型,包括用于语音合成的MAI-Voice-2及其Flash版本,以及用于语音识别的MAI-Transcribe-1.5。MAI Realtime的推出标志着微软在语音AI领域迈出重要一步,从单向处理转向实时双向交互。
目前,微软已邀请部分合作伙伴在MAI Playground平台测试该模型,但尚未公布其上线Microsoft Foundry的具体时间,也未明确是否会扩展到Copilot语音功能。这一测试进展表明微软正加速推进实时语音AI的研发,未来可能为开发者和用户带来更自然的语音交互体验。
来源:Heooo AI工具导航