行业资讯

OpenAI将GPT-Live-1引入API,支持全双工语音交互

Heooo 09月11日13时01分 27 阅读

「OpenAI宣布将GPT-Live-1引入API,开发者可打造实时语音应用。该模型支持全双工对话,能同时听取与输出语音,并处理打断、停顿与背景噪声,还可用于电话客服等场景。其前端语音层每分钟0.05美元,新增12种声音,评测表现领先。」

OpenAI宣布将GPT-Live-1引入API,开发者可以据此打造支持实时语音交互的应用与业务流程。与以往需要拼接多段能力的方案不同,这一模型把语音能力直接开放给开发者调用,覆盖从实时对话到电话智能体的多种形态。

GPT-Live-1最受关注的能力是全双工对话:它能够同时听取和输出语音,并在对话过程中处理打断、停顿以及背景噪声。这意味着用户不必再等待机器把话说完,交流节奏更接近人与人之间的自然通话。该模型还支持电话场景,可用于预订餐厅、客户服务等全双工语音智能体。

在生态衔接上,OpenAI表示开发者可以将其与Codex等工具连接,也可以通过OpenAI Presence开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作流。这让语音层不再只是交互入口,而成为可以真正驱动业务系统的执行通道。

技术架构方面,GPT-Live-1将语音理解与语音输出整合在同一模型中,减少了传统语音转文字、大语言模型推理、文字转语音之间的多次衔接,从而降低延迟。同时,模型支持把复杂推理和工具调用交由后端文本模型处理,前端专注语音交互,后端专注思考与执行。开发者可通过系统提示词调整语气、语速和对话风格,也可配置后端模型、工具及智能体框架。OpenAI介绍,GPT-Live-1支持原生语音识别转写和回复文本,并具备字母数字理解、关键词偏置及轮次检测能力。

早期评估数据展示了这一架构的实际价值。语言学习平台Speak使用GPT-Live-1后,学习者思考停顿期间的误打断次数较此前基于轮次的系统减少近80%。医疗服务平台联合创始人兼首席技术官Tony Stoyanov表示,其团队将代码量减少了80%,删除约2.3万行代码。OpenAI公布的评测结果显示,GPT-Live-1在Full Duplex Bench测试中比GPT-Realtime-2.1高出30个百分点,在搭配GPT-6 Astra中等推理强度时,Tau3端到端语音智能体任务测试排名第一。

价格方面,GPT-Live-1前端语音层为每分钟0.05美元,按每小时60分钟计算约3美元,约合20.2元人民币,后端模型和智能体工具的费用另行计算。OpenAI同时扩大了实时语音选项,新增Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder等声音,并计划在未来数月继续增加语音和语言支持。

从开发者角度看,全双工语音与工具调用、后端推理的组合,正在把语音智能体从演示品推向可上线的生产系统。更低的延迟、更少的误打断以及可配置的音色与风格,意味着语音交互的门槛进一步下降,电话客服、预订、企业内部流程自动化等场景有望率先受益。

# GPT-Live-1 # 语音API # 全双工语音 # 智能体

来源:Heooo AI工具导航