OpenAI发布全双工语音模型GPT-Live-1
「OpenAI 在 API 中正式推出全双工语音模型 GPT-Live-1,用单一模型同时处理输入与输出音频,解决传统级联式架构的延迟与卡顿问题。模型支持即时打断,并可将深层推理与工具调用委派给后端文本模型。测试显示其将思考停顿期的中断减少近 80%,前端语音层定价为每分钟 0.05 美元。」
OpenAI 近日在 API 中正式推出全新的全双工语音模型 GPT-Live-1,把类人般流畅的语音交互体验直接带给广大开发者。
传统语音智能体普遍采用级联式架构,需要依次完成语音转文字、模型推理、文字转语音等多个步骤,环节串联带来的延迟让对话常常出现明显卡顿。在应对停顿、打断或话题切换等复杂场景时,这类系统也往往显得非常脆弱。GPT-Live-1 的突破首先体现在架构层面的简化:它用单一模型同时处理输入与输出音频,不再依赖多环节的串行拼接。
更值得关注的是它的协同设计。模型在保持即时响应打断能力的同时,还能将深层推理以及工具调用无缝委派给后端的文本模型,让对话在后台持续进行,前台交互依旧保持高度灵活。这意味着语音层不必独自承担全部计算压力,而是与文本模型形成明确分工。
在实际性能表现上,早期测试给出了颇为具体的数字。语言学习平台 Speak 发现,GPT-Live-1 将思考停顿期间的中断减少了近 80%。开发者还可以通过系统提示词来定制智能体的语气、节奏与对话风格,并让模型妥善处理背景噪声与静默上下文,这类能力对电话客服、餐饮预订以及长会话交互等场景尤为关键。在基准测试中,该模型搭配中等推理强度的 GPT-6Astra 后表现名列前茅。
目前,GPT-Live-1 已在 API 中全面可用,前端语音层的定价为每分钟 0.05 美元。Yelp、Intercom 等多位行业合作伙伴表示,该模型大幅提升了轮次切换的准确性,让 AI 语音支持真正走出了走走停停的节奏,实现了如真人面对面般自然流畅的体验。
从级联式架构到全双工模型,语音交互的技术路线正在发生明显转变。对开发者而言,用单一模型处理音频输入输出、再把推理任务外派给文本模型的组合,既压缩了延迟,也保留了定制空间。随着这类模型进入 API 生态,语音智能体能够承载的交互场景有望被进一步推开。
来源:Heooo AI工具导航