# 谷歌 DeepMind 推出手语转文本模型，手语 AI 首次进入消费级

- 来源：IT之家（RSS）
- 发布时间：2026-08-13 10:22
- AIHOT 分数：63
- AIHOT 链接：https://aihot.virxact.com/items/cmsqy4lc109pvroz2xt8p06x8
- 原文链接：https://www.ithome.com/0/989/105.htm

## AI 摘要

谷歌 DeepMind 推出一款大规模多语言手语转文本（SL2T）翻译模型，使手语 AI 首次进入消费级产品。该模型已在谷歌 Pixel 11 系列手机的 Gboard 和 Live Transcribe 中支持手语转文本输入，初期仅限美国手语。模型在超过 50 种手语的 10 万小时数据上训练，通过将手语转化为姿势特征点保护隐私，无需发送原始视频流。

## 正文

IT之家 8 月 13 日消息，谷歌旗下人工智能实验室当地时间 12 日宣布推出一款大规模多语言手语转文本 (SL2T) 翻译模型。

得益于这一模型，手语人工智能首次进入消费级产品：谷歌 Pixel 11 系列智能手机上的 Gboard 和 Live Transcribe 应用程序支持手语转文本输入功能（初期仅限美国手语，后续将扩展至更多种手语和更多设备）。

全球约 7000 万听力障碍人士使用 200 余种手语，新的功能使他们能享受到类似语音输入的灵活“打字替代”体验。测试显示，使用美国手语比用英语打字更快、更自然、更令人愉悦。

DeepMind 表示，手语是一种独立的自然语言，拥有自身独特的语法和词汇。因此手语翻译需要真正的机器翻译，而非按顺序将手语转换为文字。而能满足 SL2T 任务的模型必须能“看懂”手语使用者的身体多部位同步运动，这需要强大的计算机视觉处理能力。

Google DeepMind 的 SL2T 模型在超过 50 种手语的 10 万小时数据上进行训练。其将手语转化为一系列姿势特征点的位置信息以保护用户隐私安全，无需将原始视频流发送到服务器端。同时其放弃了以往广泛使用的“中间注释”，直接解读空间信息。

《无障碍升级，消息称谷歌 Gboard 键盘即将支持“手语转文字”功能》（此前爆料，现已证实）
