Google DeepMind's SL2T (sign language to text) is het eerste AI model voor gebarentaalvertaling dat in een consumentenproduct wordt uitgerold, gelanceerd op de Pixel 11 familie in Gboard en Live Transcribe.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Op 12 augustus 2026 heeft Google DeepMind SL2T uitgebracht, een massaal meertalig transformermodel dat video van gebarentaal direct omzet in geschreven tekst. Het is de eerste AI-functie voor gebarentaal die op een consumententelefoon terechtkomt . In eerste instantie ondersteunt het Amerikaanse Gebarentaal (ASL) naar Engels. SL2T zorgt voor gebaren-naar-tekst-dictatie in Gboard (voor typen, zoeken en berichten) en Live Transcribe (voor informele een-op-eengesprekken) op de Pixel 11-familie
. De lancering markeert een verschuiving van puur onderzoek naar een daadwerkelijk product, maar komt met zorgvuldig afgebakende grenzen en bekende beperkingen.
SL2T is getraind op meer dan 100.000 uur aan gebarentaalvideo, verspreid over meer dan 50 gebarentalen. Ongeveer een kwart van die data bestaat uit ASL . Door gezamenlijk te trainen op meerdere gebarentalen, dialecten en vaardigheidsniveaus, presteert het model beter dan systemen die op één taal zijn getraind. Het leert gedeelde structurele patronen die de generalisatie verbeteren
. Opvallend is dat de trainingsdata geen gebarentalers onder de 18 jaar bevat, wat de nauwkeurigheid voor jongere gebruikers kan verminderen
.
Het systeem is ontworpen met het oog op privacy. De camera van de telefoon draait MediaPipe Holistic, dat per frame 2D-coördinaten van 130 belangrijke punten (gezicht, lichaam, handen) extraheert. De ruwe cameravideo wordt vervolgens onmiddellijk weggegooid en verlaat het apparaat nooit . Alleen deze abstracte geometrische coördinaten worden naar de servers van Google gestuurd voor vertaling, en er worden geen logboeken van gebruikersinvoer of -uitvoer bewaard zonder expliciete toestemming
. De 2D-weergave houdt geen tongbewegingen bij en biedt geen diepte-informatie, waardoor het moeilijker is om onderscheid te maken tussen handcontact en zweven – beide belangrijk in ASL
.
SL2T gebruikt een transformermodel dat direct op de reeks landmarktcoördinaten werkt en autoregressief Engelse tekst genereert. In tegenstelling tot eerdere benaderingen produceert het geen tussenliggende glossen of handmatig gecodeerde taalkundige representaties . Het model vertaalt in plaats van transcribeert: het produceert natuurlijk Engels, geen woord-voor-woord vertaling van ASL-gebaren.
Op FLEURS-ASL, een zero-shot evaluatiedataset van complexe, abstracte taal opgenomen in studiocomfort door gecertificeerde dove tolken, scoort SL2T 70 BLEURT. Google zegt dat dit ver boven elk eerder gerapporteerd resultaat ligt . Aanvullende benchmarkresultaten zijn:
Het is belangrijk om op te merken dat dit door de leverancier gerapporteerde cijfers zijn; er is geen onafhankelijke evaluatie gepubliceerd op het moment van lancering.
Google heeft een extern AI Sign Language Advisory Committee (AISLAC) opgericht, met vertegenwoordigers van de National Association of the Deaf (NAD), RIT/NTID, DPAN en de World Federation of the Deaf (WFD). AISLAC heeft het Joint Impact Report mede-opgesteld, dat de operationele grenzen en beperkingen van het model definieert .
SL2T is expliciet ontworpen en alleen geëvalueerd voor laagdrempelige, informele situaties, zoals tekstdictatie, berichten, zoekopdrachten en een-op-eengesprekken (bijv. in een café of winkel). Hoogwaardige of meerpartijengesprekken in medische, juridische en academische omgevingen vallen buiten het toepassingsgebied .
Google stelt in zijn documentatie dat SL2T geen vervanging is voor professionele tolkdiensten en niet mag worden gebruikt in situaties waar communicatiefouten schade kunnen veroorzaken .
Sam Sepah, een Dove Google-medewerker en lid van het gebarentaalteam, speelde een centrale rol in de ontwikkeling van SL2T. Hij is co-auteur van de publicatie van de FSboard-dataset die in de evaluatie van het model is gebruikt . De blog van Google en het Joint Impact Report benadrukken dat het team nauw heeft samengewerkt met Dove Google-medewerkers – waaronder Sepah – tijdens pre-release tests om modelgedrag en interfaceproblemen bloot te leggen die benchmarks alleen niet konden vangen
.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Google DeepMind's SL2T (sign language to text) is het eerste AI model voor gebarentaalvertaling dat in een consumentenproduct wordt uitgerold, gelanceerd op de Pixel 11 familie in Gboard en Live Transcribe.