DeepMind手语模型SL2T落地消费手机
「谷歌DeepMind发布多语言手语转文本模型SL2T,搭载至Pixel 11,首次实现手语AI进入消费级手机。该模型基于50种手语、10万小时素材训练,通过前置摄像头解析人体动作生成文本,支持Gboard和Live Transcribe,并注重隐私保护。未来将扩展更多手语和安卓机型。」
谷歌旗下DeepMind近日发布全新多语言手语转文本模型SL2T,并将其搭载至Pixel 11手机系统,首次推动手语AI进入普通消费电子产品。该模型率先接入Gboard键盘和Live Transcribe,用户通过前置摄像头完成手语动作,即可进行消息编辑、网页检索及与Gemini对话,替代传统键盘输入。这一突破意味着手语用户无需依赖物理键盘或触摸屏,仅凭自然手势即可完成日常手机操作,极大降低了无障碍交互的门槛。
从技术层面看,SL2T的训练规模远超以往同类系统。模型基于超过50种手语、累计10万小时手语素材训练,其中约四分之一来自美国手语数据集。跨语种联合训练帮助模型学习不同手语之间的共通动作逻辑,并在FLEURS-ASL评测中刷新手语转写模型纪录。与依赖固定词汇标签的传统方案不同,SL2T可直接解析人体动作生成文本,同时处理面部表情、肢体空间位置和唇部动作等非手部语义信息。这种端到端的动作理解能力,使得模型能够捕捉手语表达中的细微语气与情感线索,生成更自然、准确的文本输出。
隐私保护方面,手机端MediaPipe Holistic实时追踪手部、面部和躯干共130处关键点,仅向外传输动作坐标,原始视频会即时删除,不上传云端。这一设计确保用户手语数据不会以视频形式留存,在实现功能的同时最大限度降低隐私风险。目前该功能仅支持美国手语转英文,谷歌计划后续扩展更多手语及安卓机型。
值得关注的是,DeepMind此前于2025年5月开源手语互译模型SignGemma,为SL2T落地提供算法基础。此外,其WaveNet、Euphonia及Live Transcribe等无障碍技术也积累了语音、视觉多模态经验。随着谷歌、科大讯飞、华为和苹果持续布局,AI无障碍交互正从科研验证加速走向消费级产品,未来更多残障人群将受益于这些贴合实际需求的技术创新。
来源:Heooo AI工具导航