技术进展

OpenAI推出两种转录模型提升准确率

Heooo 07月29日22时35分 31 阅读

「OpenAI近日发布GPT-Live-Transcribe和GPT-Transcribe两种转录模型,支持API调用。GPT-Live-Transcribe专为低延迟实时转录设计,费用为每分钟0.017美元;GPT-Transcribe优化异步转录,费用为每分钟0.0045美元。新模型在上下文理解、口音和语言适应性上显著提升,在Common Voice的22种语言测试中,GPT-Transcribe的转录错误率为19.27%,远低于Whisper的40.37%。在真实世界音频基准上,其错误率仅为8.98%,展现出更强的抗噪和术语识别能力。」

OpenAI公司近日在X平台发布公告,宣布推出GPT-Live-Transcribe和GPT-Transcribe两种转录模型,并支持通过API方式调用。这一举措标志着OpenAI在语音转录技术领域迈出了重要一步,旨在为开发者和企业提供更高效、更精准的音频处理解决方案。

从定价策略来看,GPT-Live-Transcribe的转录费用为每分钟0.017美元(约合0.12元人民币),而GPT-Transcribe的转录费用为每分钟0.0045美元(约合0.03元人民币)。这种差异化的定价反映了两种模型的不同定位:GPT-Live-Transcribe专为低延迟实时转录场景构建,适合需要即时反馈的应用,如直播字幕、会议实时记录等;GPT-Transcribe则优化了已完成音频文件和批量工作负载的异步转录,适用于后期处理、语音分析等任务。

在性能表现上,新模型相比OpenAI此前模型有了显著提升。官方表示,这两种转录模型能够更好地理解上下文,并在各种口音和语言的真实世界音频上提供更准确的转录,包括短语、数字、专业术语以及带有响亮背景噪音的语音。在Context Aware ASR基准测试中,GPT-Transcribe的语义准确率从无自由形式上下文的41.6%提高到了有上下文的45.2%,增幅达3.6个百分点,这证明了上下文信息对转录质量的积极影响。

更令人印象深刻的是在Common Voice的22种语言测试中,GPT-Transcribe的转录错误率仅为19.27%,而Whisper(whisper-1)的错误率高达40.37%,性能提升超过一倍。在真实世界音频录制基准的九种语言测试中,GPT-Transcribe实现了8.98%的转录错误率,相比之下Whisper为15.21%。这些数据充分展示了新模型在跨语言和真实环境下的鲁棒性,尤其对于嘈杂背景、专业术语等挑战性场景,GPT-Transcribe表现出更强的适应能力。

从技术角度看,GPT-Live-Transcribe和GPT-Transcribe的推出不仅丰富了OpenAI的API产品线,也为开发者提供了更灵活的选择。低延迟模型适用于需要实时交互的应用,而异步模型则更适合对成本敏感、对延迟要求不高的批量处理任务。这种双模型策略有助于覆盖更广泛的使用场景,从智能语音助手到企业级语音分析系统,都可能从中受益。

总体而言,OpenAI此次发布的转录模型在准确率、上下文理解和多语言支持方面均取得了突破,为AI语音转录领域树立了新的标杆。随着API的开放,预计将推动更多创新应用的出现,进一步加速语音技术的普及和落地。

# OpenAI # 转录模型 # GPT-Transcribe # 低延迟 # 语音识别

来源:Heooo AI工具导航