Gemini3.8Live升级语音智能,对话推理与任务执行融合
「谷歌发布Gemini3.8Live与Gemini3.8Live Extended Thinking,新增近实时推理、语音与思考同步处理以及后台工具和API调用能力。两款模型已登陆Gemini API、Google AI Studio等平台,支持97种语言自动检测,Extended Thinking版本在Speech to Speech Quality Index中获82.6分。」
谷歌近日发布Gemini3.8Live与Gemini3.8Live Extended Thinking两款语音模型,将实时语音交互从单纯的听与说,扩展到理解、推理与任务执行的一体化能力。目前两款模型已陆续登陆Gemini API、Google AI Studio等开发者平台,并分别覆盖Search Live、Gemini Enterprise及Google Workspace、Gemini Live等场景。
两款模型的一项核心能力,是支持AI在持续语音对话的过程中后台执行工具与API调用。用户在交流时,不必因为网络搜索或任务执行而暂停对话,模型可以在后台完成调用并把结果自然融入回复。这一设计让语音助手从被动应答转向持续在线的智能体形态,也让语音成为承载多步骤任务的操作入口。
交互细节方面,模型支持97种语言自动检测以及对话中途切换语言,还具备近实时视觉定位能力。针对耗时较长的思考任务,模型会通过“让我检查一下……”之类的语言提示告知用户当前状态,避免用户面对长时间的沉默。这类提示机制在语音场景中尤为关键,因为语音交互缺少可视化的等待进度,沉默很容易被理解为中断。
性能数据方面,Gemini3.8Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index中获得82.6分,Gemini3.8Live在Speech Agent Arena排名第二。Extended Thinking版本在T-Voice测试中得分68.6%,在Sierra T-Voice基准测试中为35.1%,Big Bench Audio测试达到97.7%。多组基准成绩显示,该版本在保持语音对话自然度的同时,把推理深度提升到了新的水平。
生态集成层面,谷歌已与Agora、LiveKit、Vercel、Pipecat、Fishjam和Vision Agents等平台合作,方便开发者把新模型接入既有产品与实时音视频链路。谷歌同时表示,两款模型生成的全部音频均嵌入不可见SynthID水印,用于识别AI生成音频,这为开发者在上线语音应用时提供了可追溯的技术手段。
整体来看,此次升级把实时语音交互的能力边界进一步拓宽,语音AI正朝着持续、多任务的智能体交互形态演进。对开发者而言,后台工具调用与更低的对话打断成本,意味着可以围绕语音构建更复杂的任务型应用。
来源:Heooo AI工具导航