行业资讯

OpenAI 上线 GPT-Live-1 实时语音 API

Heooo 09月11日14时35分 19 阅读

「OpenAI 宣布将 GPT-Live-1 引入 API,开发者可据此构建实时语音应用。该模型把语音理解与输出整合进同一模型,支持全双工对话、打断处理与背景噪声抑制,可用于电话客服等语音智能体。评测显示其比上一代提升 30 个百分点。」

OpenAI 宣布将 GPT-Live-1 引入 API,开发者可以基于该模型构建支持实时语音交互的应用与业务流程。与此前需要拼接多个组件的方案不同,GPT-Live-1 把语音理解与语音输出整合在同一个模型之中,支持全双工对话,能够同时听取和输出语音,并在对话过程中处理打断、停顿以及背景噪声。

据 OpenAI 介绍,这种一体化设计减少了传统链路中“语音转文字、大语言模型推理、文字转语音”的多次衔接,从而降低整体延迟。对于更复杂的推理与工具调用需求,模型可以把这部分工作交给后端文本模型处理,形成前端语音层与后端智能分工协作的结构。开发者可以通过系统提示词调整模型的语气、语速和对话风格,也可以自行配置后端模型、工具以及智能体框架,按业务需要灵活组合。

电话场景是此次能力扩展的重点之一。GPT-Live-1 可用于预订餐厅、客户服务等全双工语音智能体。开发者可以将其与 Codex 等工具连接,也可以通过 OpenAI Presence 开发能够查询企业系统、执行获批操作并在必要时转交人工处理的语音工作流,让语音智能体从单纯的问答走向可落地的业务执行。

在基础能力方面,GPT-Live-1 支持原生语音识别转写和回复文本,并具备字母数字理解、关键词偏置以及轮次检测能力,这些特性直接关系到语音交互中打断判断与话轮切换的准确性。在早期评估中,语言学习平台 Speak 使用 GPT-Live-1 后,学习者在思考停顿期间出现的误打断次数,较此前基于轮次的系统减少近八成。医疗服务平台联合创始人兼首席技术官 Tony Stoyanov 表示,其团队借助该模型把代码量减少了约八成,删除了约两万三千行代码,显著简化了原有的语音工程链路。

OpenAI 公布的评测结果同样值得关注。GPT-Live-1 在 Full Duplex Bench 测试中的表现比上一代 GPT-Realtime 实时语音模型高出 30 个百分点;在搭配 GPT-6 Astra 中等推理强度时,该模型在 Tau3 端到端语音智能体任务测试中排名第一。这意味着实时语音模型不仅在听与说的体验上有所提升,在需要多步推理与工具协作的复杂任务上也具备竞争力。

价格方面,GPT-Live-1 目前已在 API 中提供,前端语音层价格为每分钟零点零五美元。按每小时 60 分钟计算,单纯前端语音层的费用约为 3 美元,约合人民币二十元左右,后端模型和智能体工具的费用则需要另行计算。对于语音交互这类长时间在线的场景,成本结构将成为开发者选型的重要参考。

此外,OpenAI 同步扩大了实时语音选项,新增 Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta 和 Cinder 等声音,并计划在未来数月继续增加语音和语言支持。从模型整合、打断处理到电话智能体与声音库扩充,GPT-Live-1 的发布释放出一个清晰信号:实时语音正在从单点能力演进为可承载完整业务流程的开发平台,语音应用的构建门槛与工程成本有望进一步下降。

# OpenAI # 实时语音模型 # 语音智能体 # API

来源:Heooo AI工具导航