Google DeepMind wprowadza SL2T – pierwszy model AI tłumaczący język migowy na tekst w konsumenckim produkcie. Model został wytrenowany na ponad 100 000 godzin nagrań w ponad 50 językach migowych.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
12 sierpnia 2026 roku Google DeepMind udostępnił model SL2T (sign-language-to-text) – wielojęzyczny transformer tłumaczący nagrania języka migowego bezpośrednio na tekst pisany. To pierwszy w historii model AI rozpoznający język migowy, który trafił do konsumenckiego telefonu – w tym przypadku do rodziny Pixel 11 . Na starcie dostępne jest tłumaczenie z amerykańskiego języka migowego (ASL) na angielski. Funkcja działa w aplikacjach Gboard (pisanie, wyszukiwanie, wysyłanie wiadomości) oraz Live Transcribe (nieformalne rozmowy w cztery oczy)
. Firma podkreśla, że to przejście od czystych badań do gotowego produktu, ale jednocześnie wyraźnie zaznacza, że model ma jasno określone granice i znane ograniczenia.
SL2T został wytrenowany na ponad 100 000 godzin nagrań języka migowego obejmujących ponad 50 języków migowych, z czego około jedna czwarta to dane w ASL . Dzięki równoczesnemu treningowi na wielu językach, dialektach i poziomach biegłości, model – według badań Google – osiąga lepsze wyniki niż systemy wyspecjalizowane w jednym języku. Uczy się wspólnych wzorców strukturalnych, co poprawia generalizację
. Co ważne, dane treningowe celowo nie zawierają nagrań osób poniżej 18 roku życia, co może obniżać dokładność dla młodszych użytkowników
.
System zaprojektowano z myślą o prywatności. Kamera telefonu uruchamia MediaPipe Holistic, który wyodrębnia współrzędne 2D dla 130 kluczowych punktów (twarz, ciało, dłonie) w każdej klatce. Oryginalne wideo jest natychmiast usuwane i nigdy nie opuszcza urządzenia . Na serwery Google wysyłane są wyłącznie te abstrakcyjne współrzędne geometryczne, a logi wejść i wyjść nie są przechowywane bez wyraźnej zgody użytkownika
. Reprezentacja 2D nie śledzi jednak ruchu języka ani nie dostarcza informacji o głębi, co utrudnia rozróżnienie między kontaktem dłoni a unoszeniem jej nad powierzchnią – oba te elementy są istotne w ASL
.
SL2T używa transformera, który warunkuje się na sekwencji współrzędnych i generuje tekst angielski w sposób autoregresyjny. W przeciwieństwie do wcześniejszych podejść, nie generuje najpierw pośrednich glos ani innych lingwistycznych reprezentacji . Model tłumaczy, a nie transkrybuje – produkuje naturalny angielski tekst, a nie dosłowne odwzorowanie znaków ASL.
W teście FLEURS-ASL, czyli zbiorze danych do oceny tłumaczenia w stanie zerowym (zero-shot) składającym się z nagrań skomplikowanego, abstrakcyjnego języka w warunkach studyjnych z udziałem certyfikowanych tłumaczy niesłyszących, SL2T osiąga 70 punktów BLEURT. Google twierdzi, że to wynik znacznie przewyższający wszystkie dotychczas opublikowane . Inne wyniki przedstawiają się następująco:
Warto podkreślić, że są to dane podane przez producenta – do momentu premiery nie opublikowano niezależnej ewaluacji.
Google powołał zewnętrzny Komitet Doradczy ds. Sztucznej Inteligencji Języka Migowego (AISLAC), w skład którego wchodzą przedstawiciele National Association of the Deaf (NAD), RIT/NTID, DPAN oraz Światowej Federacji Głuchych (WFD). AISLAC współtworzył Raport o Wpływie, który definiuje granice operacyjne i ograniczenia modelu .
SL2T został zaprojektowany i przetestowany wyłącznie do nieformalnych sytuacji o niskim ryzyku, takich jak dyktowanie tekstu, pisanie wiadomości, zapytania w wyszukiwarce czy rozmowy w cztery oczy (np. w kawiarni lub u sprzedawcy). Konteksty wysokiego ryzyka lub rozmowy wieloosobowe w środowisku medycznym, prawnym i akademickim są poza zakresem działania modelu .
Google w swojej dokumentacji wyraźnie stwierdza, że SL2T nie zastępuje profesjonalnych usług tłumaczeniowych i nie należy na nim polegać w sytuacjach, w których błędy komunikacyjne mogłyby wyrządzić szkodę .
Sam Sepah, niesłyszący pracownik Google i członek zespołu ds. języka migowego, odegrał kluczową rolę w rozwoju SL2T. Jest współautorem publikacji na temat zbioru danych FSboard, który został wykorzystany w ewaluacji modelu . Blog Google oraz Raport o Wpływie podkreślają, że zespół ściśle współpracował z niesłyszącymi pracownikami Google – w tym z Sepahem – podczas testów przedpremierowych, aby wykryć zachowania modelu i problemy interfejsu, których nie byłyby w stanie wychwycić same benchmarki
.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Google DeepMind wprowadza SL2T – pierwszy model AI tłumaczący język migowy na tekst w konsumenckim produkcie.
Google DeepMind wprowadza SL2T – pierwszy model AI tłumaczący język migowy na tekst w konsumenckim produkcie. Model został wytrenowany na ponad 100 000 godzin nagrań w ponad 50 językach migowych.
Prywatność: kamera telefonu wyodrębnia jedynie współrzędne punktów orientacyjnych sylwetki (130 punktów na twarzy, ciele i dłoniach).