SL2T:手语识别第一次离开实验室,进了输入法
Google DeepMind 发布大规模多语手语转文字模型 SL2T,并首次把手语 AI 装进消费级产品:Pixel 11 上的 Gboard 手语听写与 Live Transcribe,先支持美国手语转英文。全球有 200 多种手语、约 7000 万聋人及听力障碍者使用者,而这一层此前一直没被语音技术的进展覆盖到。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
被漏掉的那一层
过去几十年里,AI 处理口语的能力突飞猛进——自动翻译、听写、对话界面,对听人来说已经顺畅到几乎无感。
但这场技术革命没有到达世界上 200 多种手语,以及估计 7000 万使用它们的聋人与听力障碍者。
发布了什么
SL2T 是一个大规模多语的手语转文字翻译模型,官方称其在质量与通用性上是一次突破。真正的新意在后半句:手语 AI 第一次从实验室进入消费产品。
- Gboard 的手语听写:像听人用语音听写代替打字一样,聋人用户可以在任何原本需要打字的地方打手语——搜索、起草消息或文档、让 Gemini 执行任务
- Live Transcribe:对话中可以直接用手语回应,而不必来回打字
- 起点是美国手语(ASL)转英文,运行在 Pixel 11 上,更多设备与语言在后面
据其测试者反馈,用 ASL 打手语比用英文打字更快、更自然。
为什么这条对非无障碍方向的人也有意义
它是「多模态到底有没有用」这个问题的一个硬答案:不是让模型多看懂一种输入,而是让一整类此前无法使用某个界面的人开始能用。
原文特意点出一件事:手语是聋人社群的第一语言,也是聋人文化认同的基石;而聋人群体在手语、口语、读写各方面的熟练程度差异很大,所以各种模态的可及性都要支持,不能假设「会读写就够了」。
它也说明了进展慢的原因不只是技术难:关于手语本身如何运作,存在广泛的误解——比如把手语当成口语的逐词手势编码,而不是有自己语法的独立语言。
边界
这是一次产品发布,博客文章没有给出模型的量化评测数字。所以这条信号能说的是覆盖面与可用性上的进展,不是效果量。首发范围也很窄:一种手语、一种目标语言、一款手机。
为什么是现在
为什么重要
多模态的价值第一次以「让一整类此前用不了这个界面的人开始能用」的形式落地,而不是「模型又多看懂一种输入」。这是可及性,不是能力表演。
背景
技术背景
SL2T 为大规模多语手语转文字翻译模型,驱动 Pixel 11 上 Gboard 的手语听写与 Live Transcribe 的手语回应功能,首发为美国手语转英文。全球有 200 余种手语、约 7000 万聋人及听力障碍者使用。
关注人群
谁该关注
下一步
学习路径
- 先看它解决的是覆盖面问题而不是精度问题,这决定了该用什么指标衡量它
- 注意「手语是有自身语法的独立语言」这一点,它解释了为什么这个方向进展慢
- 再看首发范围有多窄,判断从一种手语到多种手语的距离
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- SL2T 的翻译质量有没有可比的量化指标?
- 从 ASL 扩展到其他手语,需要多少标注数据?
- 模型跑在端侧还是云端,对隐私和延迟各意味着什么?
来源参考