技术进展

谷歌发布多语言AI战略,支持超300种语言

Heooo 09月16日21时34分 28 阅读

「谷歌发布全球语言智能最新成果,其AI技术与产品已支持超过300种语言、覆盖全球71亿人口。通过原生音频智能、通用语音模型与多个开源语音数据集,谷歌推进1000种语言计划,并推出端侧翻译模型与手语转文本技术,让低资源语种与无障碍群体都能被技术理解。」

近日,谷歌发布了关于全球语言智能的最新技术成果,宣布其各项AI技术与产品已能够支持超过300种语言,覆盖全球71亿人口,占全球人口比例的86%。谷歌表示,真正的语言大模型不仅要完成简单的文本翻译,更要深入理解人类在真实世界中充满语气、情感与文化细微差别的交流方式。

在技术架构层面,传统的语音识别通常采用将音频转为文本、处理文本再转回音频的多步刚性管线,这一过程会剥离掉人类对话中至关重要的语调、节奏、情感与上下文。为了还原真实的交流质感,谷歌推动了向原生音频智能的跃迁,让诸如Gemini等模型能够直接处理和理解音频本身。

其中,Gemini 3.5 Live Translate实现了跨70种语言、2000多个语言对的实时口语翻译,并能够自然捕捉语码转换和情感线索;Gemini 3.5 Transcribe作为高精度语音转文本模型,可在嘈杂环境或复杂专业术语场景下输出规整文本。该能力同时赋能了安卓键盘Gboard上的Rambler功能,支持去除口语赘词、修正语法,并用语音指令直接进行重写与跨语种无缝切换。

为了将AI能力延伸至全球更多低资源语种,谷歌正式推进了1000种语言计划,旨在支持全球使用最广泛的1000种语言。在此背景下,依托1200万小时音频训练而成的通用语音模型USM,利用跨语言迁移学习技术,将高资源语言中学到的模式应用到训练数据稀缺的语种中。谷歌表示,这些研究建立在过去25年开放研究和400多篇同行评审语音论文的基础之上。

在语言数据的采集上,由于互联网内容天然偏向少数主导语种,谷歌放弃了传统的单一爬取模式,转而通过在地基层的开源数据合作来获取真实的文化语境。其中包括与多个机构合作打造、覆盖27种撒哈拉以南非洲语言的WAXAL大规模开源语音数据集;与印度科学研究所及Bhashini合作、采用区域锚定方式收集了109种语言超3万小时语音的瓦尼计划;以及汇聚全球四大洲1600多名本地专家与20所大学共同贡献多模态数据点的放大计划。

此外,谷歌还推出了互动式语言探索工具Language Explorer,用于持续可视化映射全球超过7000种语言的LinguaMeta数据仓库。这些技术成果正通过数字语言包容中心等公益项目赋能全球的农民、医护人员与教师。

针对全球仍有超过30亿人无法获得稳定互联网连接的现实痛点,谷歌打造了TranslateGemma轻量级开源翻译模型家族。该系列模型针对55种语言在端侧设备上高效运行,无需连接云端即可实现高质量翻译。同时,针对低资源地区广泛使用功能机的群体,谷歌通过支持Viamo等机构在卢旺达试点推出询问Viamo任何事语音人工智能助手,借助Gemini模型已成功为功能机用户解答了超过200万个问题。

在无障碍设计与文化地标发音的细节打磨上,传统工具往往迫使非标准发音人群去适应技术。谷歌通过从头设计无障碍交互,推出了基于50多种手语训练、支持美式手语转英文的手语转文本技术SL2T,赋能Gboard与Pixel 11的实时转录。同时,谷歌深入新西兰与毛利语专家合作,优化了地图中地名与街道的本地化发音,将真正地道的文化语境与准确读音内嵌至文本转语音模型中。

历经20年的AI语言研发,谷歌的语言技术已深度嵌入搜索、安卓、Chrome、YouTube和谷歌Play等九大核心平台。谷歌强调,技术的核心意义绝不是削减人类表达的多样性,而是拓展表达的边界,在尊重地方文化与真实语境的前提下,帮助更多人以自己的方式参与、表达并被世界理解。

# 谷歌 # 多语言AI # Gemini # 语音识别 # 开源数据集

来源:Heooo AI工具导航