谷歌发布Gemini 3.8 Flash TTS系列语音模型
「谷歌推出Gemini 3.8 Flash TTS与Flash-Lite TTS两款文本转语音模型,支持自然语言创建全新语音、30秒音频复刻声音、2000多种现成语音与100多种语言,可逐行控制台词演绎,并内置SynthID水印与同意验证。」
谷歌宣布,Gemini 家族新增两款文本转语音模型,分别是 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。这两款模型把语音生成从过去的静态预设转变为可动态调校的创作工具,面向创作者、开发者与企业提供更具表现力的音频体验,同时也为 Gemini Notebook 与 Google Vids 等产品改进了使用体验。
两款新模型定位各有侧重。Gemini 3.8 Flash TTS 面向深度创意方向与角色设计,可通过自然语言提示从头创建全新语音,适用于游戏、沉浸式有声读物、播客和互动媒体等场景,并支持对表演提示、节奏、方言转换等进行精细控制。Gemini 3.8 Flash-Lite TTS 则面向大容量、高性价比的规模场景,针对大批量配音、音频内容创作和富有表现力的语音代理进行优化,同样能对音调、节奏和表现力细微差别进行精细控制。
在语音库方面,用户可以从原有的 30 种原始语音扩展到近乎无限的语音库。模型提供生成式语音设计能力,可通过自然语言提示在 100 多种语言和方言中自定义角色、口音与语音特征,从头创建定制语音;同时提供 2000 多种现成语音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复刻功能仅需 30 秒音频样本即可重现一致的声音特征,并内置同意验证、SynthID 水印与 C2PA 凭据,用于保护开发者和声音人才。此外还支持自定义语音的保存与管理,确保在持续项目中保持一致性,最小化漂移。语音混音功能即将推出,用户可从语音库中选择一种语音,对音色、音高、节奏和口音进行微调,并用提示调整特征。
选定声音之后,两款模型都允许用户精确控制每一行台词的演绎方式。用户可以自行编写舞台指导,或让 Gemini 通过自然脚本提示引导交付效果,无论是平静的客服语气还是低声的悬疑场景都能实现。在长篇生成上,模型能够在数小时的连续音频中保持高语音质量、自然节奏与角色音色,扬声器漂移极小,适合播客与有声读物。模型还原生支持双声音场景编排,可从单个脚本中无缝指导多轮对话,同时保持两种声音清晰分离,实现自然的对话轮换。用户还可以添加 laughs、sigh、gasp 等非语言提示以及 mhm、yeah 这类主动倾听插入语,用于精确控制喜剧时机与反应节奏,为对话增添逼真质感。
性能方面,Gemini 3.8 Flash TTS 在 Hume AI 的语音设计基准测试中以 71.4 分位居总体第一,在口音建模方面以 60.8 分处于领先地位。两款模型在 Hume AI 的整体质量指数中分别占据第一和第二的位置,与 Gemini 3.1 Flash TTS 相比,在长格式内容和双扬声器剧本控制等广泛用例中都有重大改进。在 Voice Arena 的盲法人类偏好评估中,这两款模型在全球主要语言例如日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语的竞争对手中占据领先地位。
谷歌在语音创建和复刻功能中内置了保护措施。对于语音复刻,系统会进行同意验证,用户必须提供来自语音所有者的口头同意记录,并与参考说话者匹配后才能创建语音。Gemini Audio 模型生成的每个音频片段都带有难以察觉的 SynthID 水印,水印被直接编织进音频输出中,从而确保可以检测到 AI 生成的语音。
即日起,开发者可以在 Google AI Studio 中体验新的语音生成功能,通过提示从头创建全新的声音身份,或复刻自己的声音,并将其直接带入双扬声器剧本编辑器逐行指导交付。两款模型均已向开发者推送,可在 Gemini API 和 Google AI Studio 中使用;面向企业用户,很快将通过 Gemini Enterprise 中的 API 推出;面向所有用户,Gemini 3.8 Flash TTS 可在 Gemini Notebook 中使用,Gemini 3.8 Flash-Lite TTS 可在 Google Vids 中使用。需要注意的是,通过 AI Studio 进行的语音复刻在部分地区暂不可用。
来源:Heooo AI工具导航