Google DeepMindの手話→テキストモデル「SL2T」がPixel 11のGboardとLive Transcribeに初搭載。 100,000時間以上・50以上の手話言語で学習。ASLから英語への翻訳を開始。 MediaPipe Holisticで130点の骨格ランドマークを抽出し、生映像は端末外に出ないプライバシー設計。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Google DeepMind が2026年8月12日に発表した SL2T(sign-language-to-text)は、手話動画を直接テキストに変換するマルチリンガルトランスフォーマーモデルであり、消費者向け製品に搭載された初めての手話AI機能です 。初期対応言語はアメリカ手話(ASL)から英語への翻訳で、Pixel 11 ファミリーの Gboard(タイピング、検索、メッセージ)と Live Transcribe(インフォーマルな1対1の会話)で手話→テキストのディクテーション機能を提供します
。これは純粋な研究から製品へのシフトを意味しますが、明確に定義された範囲と既知の限界を伴っています。
SL2Tは 10万時間以上 の手話動画、50以上の手話言語 でトレーニングされ、その約4分の1がASLデータです 。複数の手話、方言、習熟度レベルを同時学習することで、単一言語システムよりも優れた汎化性能を達成したとGoogleは報告しています
。なお、トレーニングデータからは 18歳未満の話者を意図的に除外 しており、若年ユーザー向けの精度が低下する可能性があります
。
プライバシーを重視した設計です。端末のカメラで動作する MediaPipe Holistic が、フレームごとに 130のキーポイント(顔、体、手)の2Dランドマーク座標を抽出。生のカメラ映像は即座に破棄され、端末の外に出ることはありません 。翻訳のためにGoogleのサーバーに送信されるのは、この抽象化された幾何学的座標のみで、明示的なユーザー許可なしにユーザーの入出力ログが保持されることはありません
。ただし、この2Dランドマーク表現では舌のランドマークを追跡せず、深度情報も提供しないため、ASLで重要な「接触」と「ホバリング」の区別が困難です
。
SL2Tは、ランドマーク座標系列を直接条件付け、英語テキストを自己回帰的に生成するトランスフォーマーです。従来のアプローチのように、中間的なグロス(手話の書記表現)や手作業による言語表現を経由しません 。モデルは「転写」ではなく「翻訳」を行うため、ASLの手話記号を単語単位でマッピングするのではなく、自然な英語テキストを生成します。
認定されたろう者通訳者によってスタジオ環境で収録された複雑で抽象的な言語によるゼロショット評価データセット FLEURS-ASL において、SL2Tは 70 BLEURT を記録。Googleはこれを従来のどの報告結果よりも大幅に高いとしています 。その他のベンチマーク結果は以下の通り。
これらは全てベンダー(Google)による報告値であり、2026年8月の発表時点で独立した第三者評価は公表されていません。
Googleは外部の AI手話諮問委員会(AISLAC) を設置。同委員会には 全米ろう者協会(NAD)、RIT/NTID、DPAN、世界ろう者連盟(WFD) などの代表者が参加し、モデルの運用範囲と限界を定義する共同影響評価レポートを共同執筆しました 。
SL2Tは、テキストディクテーション、メッセージ送信、検索クエリ、1対1の会話(例:コーヒーショップや小売店でのやり取り)といった 低リスクでインフォーマルな状況 に限定して設計・評価されています。医療、法務、学術の場 での高リスクまたは多人数の会話は対象外です 。
Googleは文書で、SL2Tは プロの通訳サービスの代替にはならない と明記しており、コミュニケーションエラーが危害を引き起こす可能性のある状況で依存すべきではないとしています 。
ろう者のGooglerで手話チームのメンバーである Sam Sepah 氏は、SL2Tの開発において中心的な役割を果たしました。彼はモデル評価に使用されたFSboardデータセットの論文の共著者でもあります 。Googleのブログと共同影響評価レポートは、チームがSepah氏を含むろう者のGooglerと緊密に連携し、ベンチマークだけでは捉えられないモデルの挙動やインターフェイスの問題を発見するためにプレリリーステストを実施したことを強調しています
。
本記事は2026年8月12日時点の情報に基づいています。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Google DeepMindの手話→テキストモデル「SL2T」がPixel 11のGboardとLive Transcribeに初搭載。
Google DeepMindの手話→テキストモデル「SL2T」がPixel 11のGboardとLive Transcribeに初搭載。 100,000時間以上・50以上の手話言語で学習。ASLから英語への翻訳を開始。
MediaPipe Holisticで130点の骨格ランドマークを抽出し、生映像は端末外に出ないプライバシー設計。