Google DeepMind ha integrato SL2T, il suo modello di traduzione dalla lingua dei segni al testo, in Gboard e Live Trascrizione sui nuovi Pixel 11. Il sistema cattura i movimenti del corpo tramite la fotocamera, ma solo coordinate astratte lasciano il telefono, preservando la privacy.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Il 12 agosto 2026, Google DeepMind ha reso disponibile SL2T (sign-language-to-text), un modello transformer multilingue che traduce il video della lingua dei segni direttamente in testo scritto. È la prima volta che una funzionalità di intelligenza artificiale per la lingua dei segni arriva su un telefono di consumo . Inizialmente, SL2T supporta la traduzione dalla Lingua dei Segni Americana (ASL) all'inglese e alimenta la dettatura segno-testo in Gboard (per digitare, cercare e scrivere messaggi) e in Live Trascrizione (per conversazioni informali uno contro uno) sulla famiglia Pixel 11
. Il lancio segna un passaggio dalla pura ricerca a un prodotto reale, ma arriva con confini ben definiti e limitazioni note.
SL2T è stato addestrato su più di 100.000 ore di video in lingua dei segni che coprono oltre 50 lingue dei segni, con circa un quarto di quei dati in ASL . Addestrando il modello su più lingue, dialetti e livelli di competenza, il team di Google ha scoperto che il modello supera i sistemi monolingua, imparando schemi strutturali condivisi che migliorano la generalizzazione
. È importante notare che i dati di addestramento escludono intenzionalmente i firmatari sotto i 18 anni, il che potrebbe ridurre la precisione per gli utenti più giovani
.
Il sistema è progettato per la privacy. La fotocamera del telefono esegue MediaPipe Holistic, che estrae le coordinate 2D di 130 punti di riferimento (viso, corpo, mani) fotogramma per fotogramma. Il video grezzo della fotocamera viene poi immediatamente eliminato e non lascia mai il dispositivo . Solo queste coordinate geometriche astratte vengono inviate ai server di Google per la traduzione, e nessun log degli input o output dell'utente viene conservato senza esplicita autorizzazione
. La rappresentazione 2D dei punti di riferimento non traccia i movimenti della lingua e non fornisce un ordinamento in profondità, rendendo più difficile distinguere tra contatto manuale e mani che si sfiorano, entrambi importanti in ASL
.
SL2T utilizza un trasformatore che elabora direttamente la sequenza di coordinate dei punti di riferimento e genera testo in inglese in modo autoregressivo. A differenza degli approcci precedenti, non produce prima gloss intermedi o rappresentazioni linguistiche codificate a mano . Il modello traduce anziché trascrivere, producendo testo in inglese naturale e non una mappatura parola per parola dei segni ASL.
Su FLEURS-ASL, un dataset di valutazione zero-shot di linguaggio complesso e astratto registrato in condizioni di studio da interpreti certificati sordi, SL2T ha ottenuto un punteggio di 70 BLEURT, che secondo Google è molto superiore a qualsiasi risultato precedentemente riportato . Altri risultati includono:
È importante notare che questi dati sono forniti dal produttore; al momento del lancio, non è stata pubblicata alcuna valutazione indipendente.
Google ha istituito un Comitato Consultivo Esterno per l'IA della Lingua dei Segni (AISLAC) che include rappresentanti della National Association of the Deaf (NAD) degli Stati Uniti, del RIT/NTID, del DPAN e della World Federation of the Deaf (WFD). L'AISLAC ha co-redatto il Joint Impact Report che definisce i confini operativi e le limitazioni del modello .
SL2T è esplicitamente progettato e valutato solo per situazioni informali e a basso rischio come la dettatura di testi, la messaggistica, le query di ricerca e le conversazioni uno contro uno (ad esempio, in un bar o in un negozio). Le conversazioni in contesti ad alto rischio o multi-persona in ambiti medici, legali e accademici sono fuori dal suo scopo .
Google dichiara nella sua documentazione che SL2T non sostituisce i servizi di interpretariato professionale e non dovrebbe essere utilizzato in contesti in cui errori di comunicazione potrebbero causare danni .
Sam Sepah, un dipendente sordo di Google e membro del team per la Lingua dei Segni, ha avuto un ruolo centrale nello sviluppo di SL2T. È co-autore della pubblicazione del dataset FSboard utilizzato nella valutazione del modello . Il blog di Google e il Joint Impact Report sottolineano che il team ha lavorato a stretto contatto con i dipendenti sordi di Google, incluso Sepah, durante i test pre-rilascio per scoprire comportamenti del modello e problemi di interfaccia che i soli benchmark non potevano cogliere
.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Google DeepMind ha integrato SL2T, il suo modello di traduzione dalla lingua dei segni al testo, in Gboard e Live Trascrizione sui nuovi Pixel 11.
Google DeepMind ha integrato SL2T, il suo modello di traduzione dalla lingua dei segni al testo, in Gboard e Live Trascrizione sui nuovi Pixel 11. Il sistema cattura i movimenti del corpo tramite la fotocamera, ma solo coordinate astratte lasciano il telefono, preservando la privacy.
Addestrato su oltre 100.000 ore di video e oltre 50 lingue dei segni, il modello è inizialmente disponibile per la traduzione dall'ASL all'inglese.