成個系統嘅設計好重視私隱。手機鏡頭運行 MediaPipe Holistic,逐格提取 130個關鍵點嘅2D坐標(包括臉部、身體、雙手)。提取完之後,原始相機影片會即時刪除,永遠唔會離開部手機。只有呢啲抽象嘅幾何坐標先會被送到 Google 伺服器做翻譯,而且冇用戶明確授權嘅話,系統唔會保留任何輸入或輸出記錄
。不過,呢個2D坐標表示方式唔追蹤舌頭位置,亦冇深度排序,所以好難分辨手部接觸同懸空——呢兩個動作喺 ASL 入面都係有意義嘅
。
SL2T 使用嘅變壓器模型直接根據姿勢坐標序列嚟生成英文文本,係自動回歸式嘅——即係話,佢唔會先輸出中間嘅「註解」或者人手編碼嘅語言表示。更重要嘅係,呢個模型係做翻譯而唔係做聽寫,所以佢會產出自然嘅英文句子,而唔係逐個手語符號對應翻嘅詞語。
喺 FLEURS-ASL 呢個零樣本評估數據集上面——呢個數據集係由認證聾人傳譯員喺錄音室環境錄製嘅複雜抽象語言——SL2T 得到 70 BLEURT 分數,Google 話遠遠高過之前任何已公布嘅結果。其他基準測試成績包括:
Google 成立咗一個外部嘅 人工智能手語諮詢委員會(AISLAC),成員包括 美國國家聾人協會(NAD)、羅徹斯特理工學院/國家聾人技術學院(RIT/NTID)、DPAN 同 世界聾人聯合會(WFD) 嘅代表。AISLAC 聯合撰寫咗《聯合影響報告》,定義咗呢個模型嘅操作界限同限制。
Sam Sepah 係一位聾人 Google 員工,屬於手語團隊嘅成員,喺 SL2T 嘅開發過程中擔任咗好重要嘅角色。佢係模型評估所用嘅 FSboard 手指拼寫數據集嘅共同作者。Google 嘅官方網誌同《聯合影響報告》都強調,團隊喺推出前同包括 Sepah 在內嘅聾人員工緊密合作,進行大量測試,發現咗一啲純粹靠基準測試睇唔到嘅模型行為同介面問題
。