DeepMind手语翻译模型首次进入消费级
「谷歌DeepMind推出大规模多语言手语转文本模型,首次将手语AI带入消费级产品。Pixel 11手机上的Gboard和Live Transcribe支持手语转文字,初期仅限美国手语。模型在50多种手语的10万小时数据上训练,采用隐私保护设计,全球约7000万听力障碍人士将受益。」
谷歌旗下人工智能实验室DeepMind近日宣布推出一款大规模多语言手语转文本(SL2T)翻译模型,这一成果标志着手语人工智能首次进入消费级产品。得益于该模型,谷歌Pixel 11系列智能手机上的Gboard键盘和Live Transcribe应用程序已支持手语转文本输入功能,初期仅限美国手语,后续将逐步扩展至更多手语种类和更多设备。
全球约有7000万听力障碍人士使用200余种手语进行交流。手语转文本功能的落地,使他们能够享受到类似语音输入的灵活“打字替代”体验。根据谷歌方面的测试,使用美国手语进行输入比使用英语打字更快、更自然、更令人愉悦,这极大地提升了日常沟通的效率与便利性。
DeepMind强调,手语并非简单的手势序列,而是一种独立的自然语言,拥有自身独特的语法和词汇体系。因此,手语翻译不能采用逐词对应的方式,而需要真正的机器翻译。能够胜任SL2T任务的模型,必须“看懂”手语使用者在表达过程中身体多个部位的同步运动,包括手形、位置、移动轨迹、面部表情以及头部姿态等。这对计算机视觉处理能力提出了极高的要求。
在技术实现层面,Google DeepMind的SL2T模型在超过50种手语的10万小时数据上进行了训练。模型首先将手语视频转化为一系列姿势特征点的位置信息,而不是直接处理原始视频流,从而有效保护用户隐私安全——用户的视频内容无需发送到服务器端,所有关键处理均在设备端完成。同时,该模型摒弃了以往广泛使用的“中间注释”方法,直接解读空间信息,减少了信息丢失,提升了翻译的准确性和实时性。
手语转文本功能的推出,不仅是AI技术在人机交互领域的一次重要突破,也体现了技术发展对无障碍体验的深度关注。随着后续更多手语种类的接入和更多设备的适配,手语AI有望成为听力障碍群体日常沟通中不可或缺的工具,让技术真正服务于多样化的用户需求。
来源:Heooo AI工具导航