该系统设计注重隐私。手机摄像头运行MediaPipe Holistic,逐帧提取130个关键点的2D坐标(涵盖面部、身体、手部)。原始摄像头视频随即被丢弃,永远不会离开设备 。只有这些抽象的几何坐标被发送到谷歌服务器进行翻译,未经用户明确授权,不会保留任何输入或输出的日志
。这套2D关键点表示方案不追踪舌头动作,也不提供深度排序,这使得区分手部接触与悬空的难度增加——而这两者在ASL中都至关重要
。
SL2T使用一个Transformer模型,直接基于关键点坐标序列生成英语文本。与早期方法不同,它不会先输出中间标注(glosses)或手工编码的语言表示 。该模型实现的是翻译而非转录——它生成的是自然英语文本,而非ASL手势的一对一映射。
谷歌召集了外部AI手语咨询委员会(AISLAC),成员包括美国国家聋人协会(NAD)、罗彻斯特理工学院国家聋人技术学院(RIT/NTID)、DPAN和**世界聋人联合会(WFD)**的代表。AISLAC共同撰写了《联合影响报告》,定义了模型的操作边界与局限性 。
Sam Sepah是一位聋人谷歌员工,也是手语团队的成员,在SL2T的开发中发挥了核心作用。他是用于模型评估的FSboard数据集论文的合著者之一 。谷歌博客和《联合影响报告》强调,团队在发布前的测试中与包括Sepah在内的聋人员工密切合作,以发现仅靠基准测试无法捕捉的模型行为和界面问题
。