
Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Den 12. august 2026 sendte Google DeepMind SL2T (sign-language-to-text) på markedet – en massivt flersproget transformermodel, der oversætter tegnsprogsvideo direkte til skrevet tekst. Det er den første tegnsprogs-AI, der når ud i en mobiltelefon . Ved lanceringen understøtter den amerikansk tegnsprog (ASL) til engelsk og driver tegn-til-tekst-diktering i Gboard (til skrivning, søgning og beskeder) og Live Transcribe (til uformelle en-til-en-samtaler) på Pixel 11-familien
. Lanceringen markerer et skift fra ren forskning til et færdigt produkt, men kommer med klart definerede grænser og kendte begrænsninger.
SL2T er trænet på mere end 100.000 timer tegnsprogsvideo, der dækker over 50 tegnsprog, hvoraf cirka en fjerdedel er ASL . Ved at træne på flere tegnsprog, dialekter og færdighedsniveauer samtidig har Googles forskning vist, at modellen klarer sig bedre end systemer trænet på ét enkelt sprog – den lærer fælles strukturelle mønstre, der forbedrer generaliseringen
. Det skal bemærkes, at træningsdataene bevidst udelukker tegnsprogsbrugere under 18 år, hvilket kan mindske nøjagtigheden for yngre brugere
.
Systemet er designet med fokus på privatliv. Telefonens kamera kører MediaPipe Holistic, der billede for billede udtrækker 2D-landmarkskoordinater for 130 nøglepunkter (ansigt, krop, hænder). Råvideoen kasseres straks og forlader aldrig enheden . Kun disse abstrakte geometriske koordinater sendes til Googles servere til oversættelse, og ingen logfiler over brugerinput eller -output gemmes uden udtrykkelig tilladelse
. 2D-landmarksrepræsentationen registrerer ikke tungens bevægelser eller giver dybdeinformation, hvilket gør det sværere at skelne mellem håndkontakt og svævende hænder – begge dele er vigtige i ASL
.
SL2T bruger en transformer, der forarbejder landmark-koordinaterne direkte og genererer engelsk tekst autoregressivt. I modsætning til tidligere tilgange producerer den ikke først mellemliggende glosslister eller håndkodede sproglige repræsentationer . Modellen oversætter snarere end transskriberer – den producerer naturligt engelsk, ikke en ord-for-ord-gengivelse af ASL-tegn.
På FLEURS-ASL, et zero-shot-evalueringsdatasæt med komplekst, abstrakt sprog optaget i studiemiljø af certificerede døve tolke, opnår SL2T 70 BLEURT, hvilket Google siger er langt over tidligere rapporterede resultater . Yderligere benchmark-resultater omfatter:
Det er vigtigt at bemærke, at disse tal er leverandørrapporterede; der er ikke offentliggjort nogen uafhængig evaluering ved lanceringen.
Google har nedsat et eksternt AI Sign Language Advisory Committee (AISLAC) med repræsentanter fra National Association of the Deaf (NAD), RIT/NTID, DPAN og World Federation of the Deaf (WFD). AISLAC var medforfatter på den fælles konsekvensrapport, der definerer modellens driftsgrænser og begrænsninger .
SL2T er udtrykkeligt designet og evalueret kun til lavrisiko, uformelle situationer som tekst-diktering, beskeder, søgeforespørgsler og en-til-en-samtaler (f.eks. på en café eller i en butik). Højrisiko- eller flerpersonssamtaler i medicinske, juridiske og akademiske sammenhænge er uden for modellens anvendelsesområde .
Google understreger i sin dokumentation, at SL2T ikke erstatter professionelle tolketjenester og ikke bør anvendes i situationer, hvor kommunikationsfejl kan forårsage skade .
Sam Sepah, en døv Google-medarbejder og medlem af tegnsprogsteamet, spillede en central rolle i udviklingen af SL2T. Han er medforfatter på publikationen af FSboard-datasættet, der blev brugt i modellens evaluering . Googles blog og den fælles konsekvensrapport understreger, at teamet arbejdede tæt sammen med døve Google-medarbejdere – herunder Sepah – gennem test før lancering for at afdække modeladfærd og grænsefladeproblemer, som benchmarks alene ikke kunne fange
.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Google DeepMinds SL2T (sign language to text) er den første AI til tegnsprogsoversættelse, der når ud i et forbrugertilbud – den kommer på Pixel 11 familien i Gboard og Live Transcribe.