全球约 7000 万听障人士日常依赖的 200 多种手语,最近第一次走进了消费级手机输入法。谷歌 DeepMind 8 月 12 日推出的大规模多语言手语转文本模型,已经率先登陆 Pixel 11 的 Gboard 和 Live Transcribe,起手只支持美国手语。
这次的关键不只是识别手势,而是把整段手语当作一门独立的自然语言来翻译。DeepMind 强调手语有自己的语法和词序,不能像过去那样把手势逐个对应成单词再拼成句子,否则出来的中文会支离破碎。所以这套模型走的是机器翻译的路子,读懂整段动作再一次性输出文本。
模型在 50 多种手语、约 10 万小时数据上训练,要同时识别手部、面部、肩膀等身体多部位的协同动作,对计算机视觉的要求很高。内测用户反馈,在对话场景里打美国手语比敲英语键盘更快、更顺手,疲劳感也明显更小。
隐私上的处理是它能落地的另一块拼图。手语输入的视频只在手机端转成姿势特征点,原始画面不会上传服务器,这意味着在会议室、医院、课堂这种敏感环境里,沟通也敢直接开着。
当然,台阶还在。第一批只覆盖美国手语,更多语种和设备要等后续更新,手语世界的语言多样性还远没有被一台手机装下。
你最先想用它在哪种场合打字,是日常聊天、工作汇报,还是看病、办事这种需要留记录的正式场景?
