Googles DeepMind SL2T är den första AI modellen för teckenspråksöversättning som skickas i en konsumentprodukt.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Den 12 augusti 2026 sjösatte Google DeepMind SL2T (sign-language-to-text), en massivt flerspråkig transformatormodell som översätter video med teckenspråk direkt till skriven text – och det är den första teckenspråks-AI-funktionen som når en konsumenttelefon . Inledningsvis stöds amerikanskt teckenspråk (ASL) till engelska, och SL2T driver tecken-till-text-diktering i Gboard (för att skriva, söka och messa) och Live Transcribe (för informella en-till-en-samtal) i Pixel 11-familjen
. Lanseringen innebär ett skifte från ren forskning till en produkt, men kommer med noggrant definierade gränser och kända begränsningar.
SL2T tränades på mer än 100 000 timmar teckenspråksvideo som omfattar över 50 teckenspråk, med ungefär en fjärdedel av datan på ASL . Genom att träna flera teckenspråk samtidigt fann Google att modellen presterar bättre än system som bara tränats på ett språk – den lär sig gemensamma strukturella mönster som förbättrar generaliseringen
. Noterbart är att träningsdatan medvetet utesluter personer under 18 år, vilket kan minska noggrannheten för yngre användare
.
Systemet är designat för integritet. Telefonens kamera kör MediaPipe Holistic, som extraherar 2D-positionskoordinater för 130 nyckelpunkter (ansikte, kropp, händer) bildruta för bildruta. Råvideokastas sedan omedelbart och lämnar aldrig din enhet . Endast dessa abstrakta geometriska koordinater skickas till Googles servrar för översättning, och inga loggar över användarens inmatning eller utdata sparas utan uttryckligt tillstånd
. 2D-representationen spårar inte tungans rörelser eller djupordning, vilket gör det svårare att skilja mellan handkontakt och svävande – båda viktiga för ASL
.
SL2T använder en transformator som direkt bearbetar koordinatsekvensen av positionsdata och genererar engelsk text autoregressivt. Till skillnad från tidigare metoder genererar den inte först mellanliggande glossor eller handkodade språkliga representationer . Modellen översätter snarare än transkriberar – det vill säga, den producerar naturlig engelsk text, inte en ord-för-ord-avbildning av ASL-tecken.
På FLEURS-ASL, ett utvärderingsdataset för nollskottsöversättning av komplext, abstrakt språk som spelats in i studiomiljö av certifierade döva tolkar, uppnår SL2T 70 BLEURT, vilket Google säger är långt över tidigare rapporterade resultat . Andra benchmarkresultat inkluderar:
Det är viktigt att notera att det rör sig om leverantörsrapporterade siffror; ingen oberoende utvärdering har publicerats i samband med lanseringen.
Google tillsatte en extern AI Sign Language Advisory Committee (AISLAC), som inkluderar representanter från National Association of the Deaf (NAD) (USA:s nationella dövas förbund), RIT/NTID (Rochester Institute of Technologys nationella tekniska institut för döva), DPAN (DPAN, en ideell organisation för döva medier) och World Federation of the Deaf (WFD) (Världsdövas federation). AISLAC var medförfattare till den gemensamma konsekvensrapport som definierar modellens operativa gränser och begränsningar .
SL2T är uttryckligen utformat och utvärderat endast för lågrisk-, informella situationer som textdiktering, meddelanden, sökfrågor och en-till-en-samtal (t.ex. på ett kafé eller i en butik). Högrisk- eller flerpersonssamtal inom medicinska, juridiska och akademiska miljöer ligger utanför modellens syfte .
Google anger i sin dokumentation att SL2T inte är en ersättning för professionella tolkningstjänster och inte ska förlitas på i sammanhang där kommunikationsfel kan orsaka skada .
Sam Sepah, en döv Google-anställd och medlem i teckenspråksgruppen, spelade en central roll i SL2T:s utveckling. Han är medförfattare till den publikation om FSboard-datasetet som användes i modellens utvärdering . Googles blogg och den gemensamma konsekvensrapporten betonar att gruppen arbetade nära döva Google-anställda – inklusive Sepah – under hela testfasen före lansering för att identifiera modellbeteenden och gränssnittsproblem som enbart riktmärken inte kunde fånga
.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Googles DeepMind SL2T är den första AI modellen för teckenspråksöversättning som skickas i en konsumentprodukt.