行业资讯

谷歌Gemini 3.8 Live上线虚拟人功能

Heooo 09月25日11时33分 28 阅读

「谷歌为Gemini 3.8 Live推出Live Avatar功能,将接近实时的视频生成与语音结合,实现精准唇形同步与自然表情,支持97种语言无缝切换。功能依托异步工具调用保持对话不中断,支持企业自定义虚拟形象,并以SynthID嵌入隐形水印,现已在Gemini Enterprise上线。」

谷歌近日宣布,在上周推出Gemini 3.8 Live的基础上,正式推出带有Live Avatar功能的Gemini 3.8 Live,为原生实时对话模型带来接近实时的视觉呈现效果。该功能将接近实时的视频生成与语音相结合,打造能够倾听、观察并以动态视觉形象交流的交互体验。

对话本身天生就是多模态的。人们通过倾听、观察、说话和面部表情进行交流,Live Avatar将这些能力赋予企业智能代理,同时处理视觉和音频输入,生成更丰富的对话内容。借助精准的唇形同步、自然的表情变化与流畅的对话轮次切换,企业可以拓展更具交互性的虚拟服务。

在推理能力方面,该功能依托Gemini的高级推理能力。通过异步工具调用,Live Avatar可以在后台触发工具调用并获取数据,同时保持对话正常进行,在处理复杂任务时保证对话流程不中断。这意味着用户在使用虚拟人进行咨询或办理业务时,不必等待后台数据返回,交互节奏更加连贯。

多语言支持是此次更新的亮点之一。Live Avatar支持原生多语言语音同步,可动态适配唇形同步与表情,能够在97种语言之间无缝切换,不会降低视频保真度,也不会出现视觉偏移。对于面向全球市场的企业而言,同一套虚拟形象可以在不同语种之间自由流转。

除预设的多样化形象库之外,企业还可以自定义Live Avatar。开发者通过高质量参考图像即可生成完整动画、响应灵敏的虚拟形象,同时保留参考形象的相似度、品牌风格与角色特征。目前自定义虚拟形象仅对企业白名单用户开放,后续开放节奏值得关注。

安全方面,谷歌为Live Avatar构建了严格的安全保障机制,所有AI生成内容都通过SynthID添加隐形水印,直接嵌入音频与视频输出,帮助识别AI生成内容,减少错误信息和错误归属问题。这一做法为实时生成的视觉内容提供了可追溯的技术手段。

目前,带Live Avatar的Gemini 3.8 Live已在Gemini Enterprise上线,用户可通过官方文档探索API开始使用。从纯语音对话到具备视觉形象的实时交互,实时多模态代理正在成为企业级AI应用的新形态。

# 谷歌 # Gemini 3.8 Live # 虚拟人

来源:Heooo AI工具导航