微软MAI-Transcribe-2转录模型登场,60语种错误率仅5.2%
「微软发布新一代AI语音转文字模型MAI-Transcribe-2,宣称速度、准确率与成本均具优势。在FLEURS测试中平均词错误率5.2%,比GPT-Transcribe快10倍,支持60种语言、说话人分离与逐词时间戳,限时定价每小时0.10美元,约合人民币0.67元。」
微软近日推出新一代AI语音转文字模型MAI-Transcribe-2,并宣称这是其迄今为止最快、最准确、最便宜的语音识别方案。在定价方面,该模型上市初期实施限时优惠,每小时收费仅为0.10美元,约合人民币0.67元,优惠将持续至2026年年底。这一价格策略明显意在抢占高性价比的语音转录市场。
从性能表现来看,MAI-Transcribe-2在FLEURS测试集中取得了突出的成绩。在强制指定语言和自动推断语言两种模式下,模型的平均词错误率均为5.2%。作为对比,同一测试中Gemini 3.1 Pro的两项结果分别为5.3%和5.8%,GPT-Transcribe为10.4%和10.6%,而Whisper v3-Large则高达22.8%和23.5%。这意味着MAI-Transcribe-2在识别准确率上全面超越了目前主流的云端语音转录模型。
速度方面,微软援引Artificial Analysis的评测数据指出,MAI-Transcribe-2的推理速度比GPT-Transcribe快10倍,比Scribe v2快7倍,比Gemini 3.5 Transcribe快5倍。这种显著的性能优势使得该模型能够适用于实时字幕、会议记录、语音交互等对延迟敏感的应用场景。
在功能设计上,MAI-Transcribe-2引入了多项面向实际生产环境的增强能力。其中说话人分离功能可以区分同一段录音中的不同发言者,并将文字归属到对应说话人,这对于会议纪要、访谈整理等需求尤为实用。逐词时间戳则能为每个词标注精确的时间位置,便于开发者实现音频检索、导航、在线编辑和字幕对齐等功能。
在转写风格方面,模型提供了两种可配置模式:verbatim模式会保留语气词、口误等原始语音特征,适合合规审查和语言学分析场景;clean模式则会自动去除语气词,生成更易阅读和发布的文本,适合字幕制作、笔记整理等内容生产环节。此外,MAI-Transcribe-2还支持关键词偏置、自动语言识别、语言切换以及噪声环境转写,能够处理自然混用语言的对话,用户无需预先指定语言,模型即可自动检测录音内容所用语言。
模型覆盖了60种语言,可以满足全球化业务对多语种语音识别的需求。目前,开发者可以通过Microsoft Foundry、MAI Playground和OpenRouter等平台调用或试用该模型。这一产品发布进一步加剧了云端语音AI服务市场的竞争,同时也为开发者提供了更具性价比和更高性能的转录技术选项。
来源:Heooo AI工具导航