Google DeepMinds SL2T ist das erste KI Modell zur Übersetzung von Gebärdensprache, das in einem Verbraucherprodukt ausgeliefert wird – startend auf der Pixel 11 Familie in Gboard und Live Transcribe. Das Modell wurde mit über 100.000 Stunden Videomaterial aus mehr als 50 Gebärdensprachen trainiert und erreicht im Ze...
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Am 12. August 2026 hat Google DeepMind SL2T (sign-language-to-text) vorgestellt – ein massiv mehrsprachiges Transformer-Modell, das Gebärdensprachvideos direkt in geschriebenen Text übersetzt. Es ist die erste KI für Gebärdensprache, die den Weg in ein Verbraucherprodukt gefunden hat .
Zunächst unterstützt SL2T die Amerikanische Gebärdensprache (ASL) ins Englische und steckt in zwei Funktionen der Pixel-11-Familie: in Gboard (für Texteingabe, Suche und Nachrichten) sowie in Live Transcribe (für informelle Einzelgespräche) . Google selbst bezeichnet die Funktion als das Äquivalent zur Spracheingabe – nur eben für Gebärdensprache.
SL2T wurde mit mehr als 100.000 Stunden Gebärdensprach-Videomaterial aus über 50 Sprachen trainiert, wovon etwa ein Viertel auf ASL entfällt . Durch das gleichzeitige Training mit vielen Sprachen, Dialekten und Könnensstufen übertrifft das Modell laut Google Systeme, die nur eine Sprache gelernt haben – es erkennt gemeinsame strukturelle Muster und generalisiert besser
. Wichtig: Die Trainingsdaten enthalten keine Gebärdensprachler unter 18 Jahren, was die Genauigkeit bei jüngeren Nutzern beeinträchtigen könnte
.
Das System ist auf Datenschutz ausgelegt. Die Kamera des Telefons nutzt MediaPipe Holistic, um Bild für Bild 2D-Koordinaten von 130 Schlüsselpunkten (Gesicht, Körper, Hände) zu extrahieren. Das rohe Kamerabild wird sofort verworfen und verlässt das Gerät nie . Nur diese abstrakten geometrischen Koordinaten werden an die Server von Google zur Übersetzung gesendet. Ohne ausdrückliche Zustimmung der Nutzer werden keine Protokolle der Eingaben oder Ausgaben gespeichert
. Die 2D-Darstellung erfasst allerdings keine Zungenbewegungen und keine Tiefeninformationen, was die Unterscheidung von Berührungen und Annäherungen erschwert – ein wichtiges Merkmal in der ASL
.
SL2T ist ein Transformer, der direkt auf die Koordinaten-Sequenzen zugreift und englischen Text autoregressiv erzeugt. Anders als frühere Ansätze überspringt es die Erstellung von Zwischen-Glossen oder speziellen linguistischen Repräsentationen . Das Modell übersetzt also, es transkribiert nicht Wort für Wort, sondern erzeugt natürlich klingenden englischen Text.
Im FLEURS-ASL-Test – einem Datensatz mit komplexen, abstrakten Sätzen, die von zertifizierten gehörlosen Dolmetschern im Studio aufgenommen wurden – erreicht SL2T im Zero-Shot-Durchlauf 70 BLEURT. Google zufolge liegt dieser Wert weit über allen bisher veröffentlichten Ergebnissen . Weitere Benchmarks:
Es ist wichtig zu betonen: Dies sind von Google selbst veröffentlichte Werte. Eine unabhängige Evaluierung liegt zum jetzigen Zeitpunkt nicht vor.
Google hat einen externen KI-Beirat für Gebärdensprache einberufen, dem Vertreter der National Association of the Deaf (NAD), des RIT/NTID, der DPAN und des Weltverbands der Gehörlosen (WFD) angehören. Das Gremium hat den Joint Impact Report verfasst, der die Einsatzbereiche und Grenzen des Modells definiert .
SL2T ist ausschließlich für risikoarme, informelle Alltagssituationen konzipiert und getestet: Texteingabe, Nachrichten, Suchanfragen und Einzelgespräche (z. B. im Café oder an der Ladentheke). Für medizinische, rechtliche und akademische Kontexte ist das Modell nicht vorgesehen .
Google stellt in seiner Dokumentation klar, dass SL2T keinen Ersatz für professionelle Dolmetschdienste darstellt und nicht in Situationen eingesetzt werden sollte, in denen Kommunikationsfehler zu Schaden führen könnten .
Sam Sepah, ein gehörloser Google-Mitarbeiter und Mitglied des Gebärdensprach-Teams, spielte eine zentrale Rolle in der Entwicklung von SL2T. Er ist Ko-Autor der Veröffentlichung zum FSboard-Datensatz, der für die Evaluierung des Modells genutzt wurde . Google betont in seinem Blog und im Joint Impact Report, dass das Team während der Tests vor der Veröffentlichung eng mit gehörlosen Google-Mitarbeitern – darunter Sepah – zusammengearbeitet hat, um Verhaltensweisen und Probleme der Benutzeroberfläche zu identifizieren, die allein durch Benchmarks nicht sichtbar geworden wären
.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Google DeepMinds SL2T ist das erste KI Modell zur Übersetzung von Gebärdensprache, das in einem Verbraucherprodukt ausgeliefert wird – startend auf der Pixel 11 Familie in Gboard und Live Transcribe.
Google DeepMinds SL2T ist das erste KI Modell zur Übersetzung von Gebärdensprache, das in einem Verbraucherprodukt ausgeliefert wird – startend auf der Pixel 11 Familie in Gboard und Live Transcribe. Das Modell wurde mit über 100.000 Stunden Videomaterial aus mehr als 50 Gebärdensprachen trainiert und erreicht im Zero Shot Benchmark FLEURS ASL einen BLEURT Wert von 70.
SL2T arbeitet datenschutzorientiert: Nur abstrakte Koordinaten von 130 Körperpunkten verlassen das Gerät, das Rohvideo wird sofort verworfen.