Google DeepMind 的 SL2T(手語轉文字)是首款在消費產品中出貨的 AI 手語翻譯模型,搭載於 Pixel 11 系列的 Gboard 與 Live Transcribe。 模型訓練超過 10 萬小時、涵蓋 50 種以上手語;透過 MediaPipe Holistic 在手裝置端提取 130 個關鍵點座標,僅上傳座標而非原始影片以保護隱私。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
2026 年 8 月 12 日,Google DeepMind 正式推出 SL2T(sign-language-to-text),這是一個大規模多語言 transformer 模型,能直接將手語影片轉換為書面文字——這是首個達到消費者手機出貨的手語 AI 功能 。初始版本支援美國手語(ASL)轉英文,並在 Pixel 11 系列的 Gboard(用於打字、搜尋、訊息)與 Live Transcribe(用於非正式一對一對話)中為手語轉文字聽寫功能提供動力
。此次發布代表從純研究轉向實際出貨產品,但也伴隨明確的範圍界定與已知限制。
SL2T 以超過 10 萬小時的手語影片進行訓練,涵蓋超過 50 種手語,其中約四分之一為 ASL 。Google 的研究發現,透過聯合訓練多種手語、方言與熟練程度,模型表現優於單一語言系統,因為它能學習到共享的結構性模式,從而提升泛化能力
。值得注意的是,訓練資料刻意排除了 18 歲以下的表達者,這可能降低對年輕使用者的準確度
。
系統設計以隱私為核心。手機相機執行 MediaPipe Holistic,逐幀提取130 個關鍵點的 2D 座標(臉部、身體、手部)。原始相機影片隨後立即被丟棄,永遠不會離開裝置 。只有這些抽象的幾何座標會被送至 Google 伺服器進行翻譯,未經使用者明確授權,不會保留使用者輸入或輸出的任何紀錄
。2D 標記表示法不追蹤舌頭標記,也不提供深度排序,因此更難區分手部接觸與懸空——這兩者在 ASL 中都很重要
。
SL2T 使用 transformer,直接以標記座標序列為條件,並以自迴歸方式生成英文文字。與先前作法不同,它不會先輸出中介詞彙或手工編碼的語言表示 。該模型執行的是翻譯而非轉錄——它產出的是自然的英文句子,而非 ASL 手勢的逐字對應。
在 FLEURS-ASL(一個在錄音室環境中由認證聾人翻譯員錄製的零樣本評測資料集)上,SL2T 獲得 70 BLEURT,Google 表示這遠高於任何先前發表的結果 。其他基準測試結果包括:
請注意,這些皆為廠商自報的數據;截至發表日為止,尚無任何獨立第三方評測結果公開發表。
Google 成立了外部AI 手語諮詢委員會(AISLAC),成員包括美國全國聾人協會(NAD)、羅徹斯特理工學院/國家技術聾人學院(RIT/NTID)、DPAN 與**世界聾人聯合會(WFD)**的代表。AISLAC 共同撰寫了《聯合影響報告》,定義了模型的運作邊界與限制 。
SL2T 明確設計且僅針對低風險、非正式場合,例如文字聽寫、訊息、搜尋查詢與一對一對話(如在咖啡廳或零售店)。醫療、法律與學術場合中的高風險或多方對話則不在適用範圍內 。
Google 在其文件中明確表示,SL2T 不能替代專業手語翻譯服務,且不應在溝通錯誤可能導致傷害的情況下使用 。
Sam Sepah 是 Google 的聾人員工,也是手語團隊的成員,在 SL2T 的開發中扮演了核心角色。他是該模型評測中所使用之 FSboard 資料集論文(FSboard dataset publication)的共同作者 。Google 的部落格與《聯合影響報告》強調,團隊在上市前測試過程中與包括 Sepah 在內的 Google 聾人員工密切合作,以找出基準評測無法捕捉的模型行為與介面問題
。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Google DeepMind 的 SL2T(手語轉文字)是首款在消費產品中出貨的 AI 手語翻譯模型,搭載於 Pixel 11 系列的 Gboard 與 Live Transcribe。
Google DeepMind 的 SL2T(手語轉文字)是首款在消費產品中出貨的 AI 手語翻譯模型,搭載於 Pixel 11 系列的 Gboard 與 Live Transcribe。 模型訓練超過 10 萬小時、涵蓋 50 種以上手語;透過 MediaPipe Holistic 在手裝置端提取 130 個關鍵點座標,僅上傳座標而非原始影片以保護隱私。
典範達 70 BLEURT,但需留意為開發者自行公佈;官方明訂不適用於醫療、法律、學術等高風險場合,且不應取代專業手語翻譯服務。