谷歌手语 AI 落地手机,打手势就能发消息

谷歌旗下 DeepMind 近日发布大规模多语言手语转文本模型 SL2T,并首次把手语人工智能从实验室带进了消费电子产品。这项功能已接入 Pixel 11 上的输入法 Gboard 与实时转写应用 Live Transcribe,首批支持将美国手语(ASL)翻译成英文。对全球数以千万计的听障人群来说,这意味着他们终于可以像普通人用语音输入一样,直接用手势「打字」。

## 对着手机打手语,就能搜索和发消息

借助 SL2T,听障用户可以在任何原本需要打字的地方用手语与手机交流。在 Gboard 里,用户可以对着摄像头打手语,用来搜索网页、撰写消息或文档,也可以向 Gemini 提问或交代任务;在 Live Transcribe 里,用户还能用手语直接回应对话,不必再和对方反复打字。

根据内部测试者的反馈,使用美国手语输入比用英语键盘打字更快、更自然,体验也更流畅。长期以来,语音转文字已经成为智能手机的标配功能,但全球现存超过两百种手语、约七千万听障人士,却长期缺少成熟稳定的移动端手语识别工具,无障碍交互始终存在缺口。

## 为什么手语识别比语音识别难得多

手语翻译面临两项核心挑战。第一,语音转写是在同一种语言内部,把声音按顺序映射成文字;而手语是拥有独立语法和词汇的自然语言,因此需要真正的机器翻译,而不是把一个个手势顺序转换成单词。

第二,模型必须学会「看见」并理解身体动作。手语通过手、手臂、躯干、头部和面部同时发生的动作传递含义,在高帧率下准确追踪这些动作,是一项难度和计算量都很高的计算机视觉任务。也正因如此,早期的手语手套等产品存在根本局限——手语并非简单的「用手表达英语」,它既需要细微的全身动作视觉感知,也需要完整的语言翻译能力。

## 十万小时数据,覆盖五十多种手语

SL2T 的训练使用了超过十万小时的数据,覆盖五十多种手语,其中约四分之一为美国手语数据。谷歌表示,将不同手语、方言以及不同熟练程度的使用者放在一起联合训练,有助于模型学习共享的底层结构,实验效果优于单语种模型。

在隐私保护上,SL2T 并不会把原始摄像头画面直接发送到服务器。手机端的 MediaPipe Holistic 模型会先追踪用户身体上约一百三十个关键点,只把相应的几何坐标传输出去,原始视频则立即丢弃。模型再把这些坐标序列直接翻译成文字,跳过了手语研究中常用的中间标注环节。谷歌认为,直接翻译能更好地处理面部神态和空间结构等信息,也摆脱了人工标注带来的词汇范围限制。

在评估美国手语到英文翻译质量的 FLEURS-ASL 基准上,SL2T 是目前最强的手语翻译模型,其零样本 BLEURT 得分达到 70,明显高于此前公开结果。不过,模型在罕见手势、快速手指拼写、被动语态和缺乏上下文的时态判断上仍可能出错。

## 听障群体全程参与设计

SL2T 并非 DeepMind 第一次尝试面向残障群体的无障碍人工智能。早在 2025 年,科研团队就开源了基于轻量化架构的手语互译模型 SignGemma,为如今的消费级落地打下算法根基。此外,实验室还研发过帮助用户复刻嗓音、辨识含糊语音等多项普惠技术。

值得一提的是,SL2T 的开发过程中,聋人社区与手语顾问委员会全程参与了从构想、数据收集到用户测试和影响力评估的各个环节。官方也明确界定,这项技术目前定位为低风险的辅助草稿生成工具,适用于消息、搜索、导航、记笔记和轻松的一对一交流,而不应用于医疗问诊、法律程序、课堂教学或政府福利判定等场景。

首批功能仅开放美国手语到英文的翻译,后续谷歌计划逐步适配更多手语种类,并向更多安卓机型铺开。手语人工智能走进手机,迈出的虽只是一小步,却为缩小听障群体在数字世界的沟通鸿沟打开了新可能。

来源:Google DeepMind(SL2T 官方博客,https://deepmind.google/blog/putting-sign-language-ai-into-users-hands)