行业资讯

微软最强转录模型MAI-Transcribe-2发布

Heooo 09月04日09时01分 4 阅读

「微软推出全新语音转文字模型MAI-Transcribe-2,宣称在准确率、速度和价格上均优于主流竞品。该模型在FLEURS测试中平均词错误率仅5.2%,支持60种语言、说话人分离、逐词时间戳等功能。限时优惠价为0.10美元/小时,持续至2026年底。」

微软近日发布了一款名为MAI-Transcribe-2的全新语音转文字模型,并宣称这是其目前最快、最准确、最廉价的产品。该模型面向开发者与商业场景,旨在解决语音转录任务中长期存在的速度与精度权衡问题。

在性能评测中,MAI-Transcribe-2表现突出。在FLEURS测试集上,模型同时支持强制指定语言与自动推断语言两种模式,平均词错误率均为百分之五点二。相比之下,同一测试中,Gemini 3.1 Pro的两项结果分别为百分之五点三和百分之五点八;GPT-Transcribe为百分之十点四和百分之十点六;而Whisper v3-Large则为百分之二十二点八和百分之二十三点五。这意味着MAI-Transcribe-2在识别准确率上全面领先于当前主流竞品,尤其在自动语言识别场景下优势更为明显。

在速度方面,根据微软援引的Artificial Analysis评测结果,MAI-Transcribe-2比GPT-Transcribe快十倍,比Scribe v2快七倍,比Gemini 3.5 Transcribe快五倍。这一性能提升为实时语音转录、会议记录生成和呼叫中心分析等大规模应用场景提供了更强的支撑。

除了基础的语音转文字能力,该模型还新增了多项实用功能。说话人分离功能可以在一段录音中区分不同发言者,并将转录文字准确归属到对应说话人;逐词时间戳则为每个单词标注精确位置,便于音频检索、导航、编辑以及字幕对齐工作。模型还支持可配置的转写风格,其中verbatim模式会保留语气词和口误,适合合规审查与语言学分析场景;clean模式则会自动删除语气词,生成更易读的字幕、笔记和发布文本。

MAI-Transcribe-2支持多达60种语言,并能够自然处理混用语言的对话。用户无需预先指定语言,模型可以自动检测录音中的语言并完成转写。此外,关键词偏置、自动语言识别、语言切换以及噪声环境转写等功能也同时可用。

在定价方面,MAI-Transcribe-2上市期间的限时收费标准为每小时零点一美元,该优惠价格可持续至2026年年底。目前,开发者已经可以通过Microsoft Foundry、MAI Playground和OpenRouter等平台调用或试用该模型。

# 微软 # 语音识别 # MAI-Transcribe-2 # 转录模型

来源:Heooo AI工具导航