谷歌发布 Gemini 3.8 Live 系列实时对话模型
「谷歌推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化部署与高复杂度任务。后者在 Artificial Analysis 语音质量指数以 82.6% 排名第一,Big Bench Audio 得分 97.7%,并支持 97 种语言实时切换与后台工具调用,音频统一加入 SynthID 水印。」
谷歌宣布推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,官方称这是其迄今最先进的实时对话产品,在智能水平与并行推理能力上实现重大升级,让语音交互更直观、更智能。
两款模型的定位各有侧重。Gemini 3.8 Live 面向规模化部署与成本优化,兼顾对话智能、交流流畅度与视觉理解能力,适合对成本效率敏感的大规模应用场景;Gemini 3.8 Live Extended Thinking 则面向高复杂度任务,强化多步推理能力,提供更强的智能表现。
在多项基准测试中,Gemini 3.8 Live Extended Thinking 取得领先成绩,拿下 Artificial Analysis 语音对语音质量指数总排名第一,得分 82.6%;在 τ-Voice 智能体任务完成率达到 68.6%,在 Sierra 的 τ-Voice-banking 基准测试中达到 35.1%;推理能力方面,在 Big Bench Audio 得分 97.7%,同时仍保持有竞争力的定价。Gemini 3.8 Live 则获得较高的用户认可度,在 Speech Agent Arena 排名第二,且具备出色的成本效益,适合大规模部署。
两款模型在 ServiceNow EVA-Bench 语音智能体基准测试中,成功平衡了准确性与对话质量,推高了复杂工作流的帕累托前沿,说明实时语音模型在复杂业务流程中的可用性正在提升。
功能层面,Gemini 3.8 Live 可近实时处理视觉输入,在对话过程中自动检测并切换 97 种支持的语言,还能在后台执行工具与 API 调用,同时保持对话流畅不中断。针对需要深度推理的任务,Gemini 3.8 Live Extended Thinking 可实现推理与发言同步进行,在不打断对话节奏的前提下提升复杂工作流的智能水平,并通过“让我确认一下…”这类早期语言提示自然回应,还可以实时讲解多步后台任务的处理进度。
开发者可通过 Gemini Live API,在声网、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等平台上构建并部署高性能语音驱动界面。谷歌同时与 Salesforce、Genspark、Lumeris 等企业开展合作,共同推进生态建设。
在内容安全方面,谷歌所有 AI 生成音频均添加了 SynthID 隐形水印,直接嵌入音频输出,可用于检测 AI 生成内容,帮助防止虚假信息传播。
推送节奏上,Gemini 3.8 Live 已开始推送:开发者可在 Gemini API 和 Google AI Studio 使用,企业用户可在 Gemini Enterprise 抢先体验,并即将登陆 Gemini Enterprise for Customer Experience,全用户可在 Search Live 体验。Gemini 3.8 Live Extended Thinking 同样开启推送:开发者可在 Gemini API 和 Google AI Studio 使用,企业用户可在 Gemini Enterprise 抢先体验,即将登陆 Gemini Enterprise for Customer Experience 以及 Google Workspace 企业客户;普通用户可在 Gemini Live 体验,Google AI Pro 和 Ultra 订阅者可在 Google Workspace 的 Docs 使用,所有 Google AI 订阅者可在 Gmail 和 Keep 体验。
从产品矩阵来看,谷歌通过标准版与深度思考版的组合,把实时语音交互同时推向成本敏感的大规模场景与需要多步推理的高难度场景,叠加 97 种语言自动切换、后台工具调用与同步推理发言等能力,语音智能体的落地边界正在进一步拓宽。
来源:Heooo AI工具导航