行业资讯

谷歌发布可自动删口头禅的语音模型

Heooo 08月27日22时00分 12 阅读

「谷歌推出Gemini 3.5 Transcribe语音转文本模型,能自动删除“嗯”“呃”等口头禅及说错后的纠正内容,生成更通顺文本。该模型已支持Pixel 11的Gboard“Rambler”功能,相比Chirp 3速度提升约70%,实时错误率降至5.5%%,支持85种语言与自定义词汇表。」

谷歌今日发布了Gemini 3.5 Transcribe语音转文本模型,这是Gemini 3.5系列中率先亮相的成员之一。在业界目光仍聚焦于Gemini 3.5 Pro之际,这款面向语音输入场景的模型率先落地,展示了谷歌在语音技术方向的布局思路。

Gemini 3.5 Transcribe的核心亮点在于其“理解式”的转写能力。不同于传统语音识别仅将声音机械地转为文字,该模型能够自动识别并删去“嗯”“呃”一类影响语句流畅度的口头禅。如果用户在说话过程中发现讲错并立即自行纠正,模型也能实时调整已经生成的文本,最终输出更加通顺、整洁的内容。此外,用户还可以提供自定义词汇表,让模型在专业术语和特定领域词语的识别上表现更好。

在性能层面,谷歌给出了具体数据。与此前命名为Chirp 3的语音转文字引擎相比,Gemini 3.5 Transcribe从用户说话到最终生成转录文本的整体速度预估提升约70%。在实时语音场景下,该模型的错误率已经降至5.5%,而Chirp 3此前的错误率为7.32%。虽然准确率的提升幅度看起来并不算惊人,但对于高频使用语音输入的用户而言,每次少打几个错字都意味着后续手动修改的工作量明显减少,因此这一改进依然具有实际价值。

该模型目前已经为Pixel 11上Gboard键盘的“Rambler”功能提供支持,谷歌表示接下来还将陆续把它引入旗下更多产品和服务。在支持范围上,Gemini 3.5 Transcribe如今可识别85种语言,并且能够处理最多包含3名说话者的预录音频,兼顾了实时语音输入与录音转写两类场景。

值得一提的是,这款模型并非只是把语音转换为文字,而是会对内容进行一定程度的整理和润色。从“Rambler”功能的实际体验来看,在较短的文本中,它确实能够较好地清理前后不一致的表达和说话时的磕绊,让文本看起来更自然。但这也带来一个需要使用者注意的问题:AI在整理过程中可能改变用户原本的措辞。因此,在采访记录、法律证词、学术引文等需要严格保留原话、不允许随意修改表述的场景中,这种智能润色功能恐怕并不合适。

整体而言,Gemini 3.5 Transcribe代表了语音识别技术从“听见”走向“听懂”的趋势。通过删减冗余、修正口误和理解意图,它让语音输入更加贴近自然书写,同时也在准确性、速度和多语言覆盖上建立了新的基准。对于普通用户而言,这意味着更流畅的输入体验;对于开发者来说,也预示着未来语音类应用在交互逻辑上可能迎来新的想象空间。

# 语音识别 # Gemini 3.5 # 谷歌AI

来源:Heooo AI工具导航