OpenAI开放GPT-Live-1语音API
「OpenAI正式开放GPT-Live-1语音模型API,支持全双工实时语音交互,每分钟0.05美元。该模型可边听边说,自然处理打断与停顿,并与后台推理模型协同工作,适用于客服、语言学习等场景。」
OpenAI近日宣布推出GPT-Live-1语音模型的公开API,将此前仅限于ChatGPT应用中的先进语音能力开放给全球开发者。这一举措标志着实时语音交互技术迈入新阶段,开发者现在可以以每分钟0.05美元的价格,将具备“边听边说”能力的全双工语音助手集成到自己的产品中。
GPT-Live-1的最大突破在于其全双工架构。与传统语音AI系统需依次完成语音识别、语言理解与语音合成不同,GPT-Live-1能够在用户说话的同时生成回应,从而更自然地处理对话中的打断、停顿、附和等复杂交互行为。这种设计显著降低了端到端延迟,避免了传统流水线式处理中常见的衔接卡顿问题。
在性能测试中,GPT-Live-1在Full Duplex Bench基准上比前代GPT-Realtime-2.1高出30个百分点,尤其在轮流发言延迟和交互行为建模方面表现突出。当与GPT-6 Astra等后台模型配合使用时,其在Tau3端到端语音智能体任务评估中也拔得头筹。
值得注意的是,GPT-Live-1专注于实时语音交互前端,而将复杂推理任务交由后台模型处理。当用户提出需要搜索、多步推理或长文本生成的问题时,语音模型会无缝切换至指定的后台大模型(如GPT-4或GPT-6),同时保持自然的语音对话流。这种前后端分离的设计让开发者可根据业务需求灵活组合成本与性能——简单任务用轻量模型,复杂场景调用高阶模型。
应用场景方面,GPT-Live-1原生支持电话系统,已用于餐厅预订、客户服务等全双工语音智能体。语言学习平台Speak的早期测试显示,相比轮次制系统,GPT-Live-1使系统不必要的主动打断减少近80%。此外,模型还提供语音转写、关键词偏置、轮次检测等功能,并针对嘈杂环境优化音频处理。OpenAI还扩展了可用声音库,覆盖更多口音、方言及语言,进一步提升全球化适配能力。
开发者还可将GPT-Live-1与Codex等工具链结合,实现“语音接收—工具执行—语音反馈”的闭环流程,为构建真正智能的语音代理开辟了新路径。
来源:Heooo AI工具导航