SL2T byl trénován na více než 100 000 hodinách videa se znakovým jazykem, které pokrývá přes 50 znakových jazyků; zhruba čtvrtina těchto dat je v ASL . Společným tréninkem na mnoha znakových jazycích, dialektech a úrovních dovedností model podle Googlu překonává systémy trénované na jediném jazyce – učí se sdílené strukturální vzorce, které zlepšují generalizaci
. Je důležité zmínit, že tréninková data záměrně nezahrnují osoby mladší 18 let, což může snižovat přesnost pro mladší uživatele
.
Systém je navržen s ohledem na soukromí. Kamera telefonu spouští MediaPipe Holistic, který snímek po snímku extrahuje 2D souřadnice 130 klíčových bodů (obličej, tělo, ruce). Nezpracované video je poté okamžitě zahozeno a nikdy neopustí zařízení . Na servery Google jsou odeslány pouze tyto abstraktní geometrické souřadnice a bez výslovného souhlasu uživatele nejsou uchovávány žádné záznamy o vstupech ani výstupech
. Reprezentace pomocí 2D souřadnic nesleduje pohyby jazyka a neposkytuje informaci o hloubce, což ztěžuje rozlišení mezi dotykem ruky a pouhým přiblížením – obojí je přitom pro ASL důležité
.
SL2T používá transformer, který pracuje přímo se sekvencí souřadnic a autoregresivně generuje anglický text. Na rozdíl od starších přístupů nevytváří nejprve mezičlánky nebo speciální lingvistické reprezentace . Model spíše překládá než přepisuje – vytváří přirozený anglický text, nikoli doslovný přepis znaků ASL.
Na datasetu FLEURS-ASL, který slouží k vyhodnocení schopnosti překládat komplexní, abstraktní jazyk nahraný ve studiu certifikovanými neslyšícími tlumočníky, dosahuje SL2T skóre 70 BLEURT, což je podle Googlu daleko nad všemi dříve publikovanými výsledky . Další výsledky benchmarků zahrnují:
Je důležité poznamenat, že se jedná o údaje uváděné výrobcem; k datu uvedení nebyla zveřejněna žádná nezávislá evaluace.
Google ustanovil externí Poradní výbor pro AI ve znakovém jazyce (AI Sign Language Advisory Committee, AISLAC), jehož členy jsou zástupci National Association of the Deaf (NAD), RIT/NTID, DPAN a World Federation of the Deaf (WFD). Výbor je spoluautorem Společné zprávy o dopadu, která definuje provozní hranice a omezení modelu .
SL2T je navržen a testován výhradně pro nízkorizikové, neformální situace, jako je diktování textu, psaní zpráv, vyhledávací dotazy a rozhovory mezi dvěma lidmi (např. v kavárně nebo v obchodě). Vysoce rizikové nebo vícestranné konverzace v lékařském, právním a akademickém prostředí jsou mimo jeho rozsah .
Google ve své dokumentaci uvádí, že SL2T není náhradou za profesionální tlumočnické služby a neměl by být používán v situacích, kde by chyby v komunikaci mohly způsobit újmu .
Sam Sepah, neslyšící zaměstnanec Googlu a člen týmu pro znakový jazyk, sehrál ústřední roli ve vývoji SL2T. Je spoluautorem publikace o datasetu FSboard, který byl použit při evaluaci modelu . Blog Googlu i Společná zpráva o dopadu zdůrazňují, že tým během předprodukčního testování úzce spolupracoval s neslyšícími zaměstnanci Googlu – včetně Sepaha – aby odhalil chování modelu a problémy s rozhraním, které by samotné benchmarky nemohly odhalit
.