SL2T навчали на понад 100 000 годинах відео з мовою жестів, що охоплює понад 50 мов, причому приблизно чверть цих даних припадає на ASL . Завдяки спільному навчанню на багатьох мовах, діалектах і рівнях володіння, дослідники Google виявили, що модель перевершує одномовні системи — вона вивчає спільні структурні закономірності, що покращує узагальнення
. Важливо зазначити, що з навчальних даних навмисно виключено матеріали за участю осіб віком до 18 років, що може знизити точність для молодших користувачів
.
Система спроєктована з урахуванням конфіденційності. Камера телефону запускає MediaPipe Holistic, який покадрово витягує 2D координати 130 ключових точок (обличчя, тіло, руки). Вихідне відео з камери одразу видаляється і ніколи не залишає пристрій . На сервери Google для перекладу передаються лише ці абстрактні геометричні координати, і жодних журналів введення чи виведення даних не зберігається без явного дозволу користувача
. 2D-представлення орієнтирів не відстежує артикуляцію язика та не забезпечує глибини, що ускладнює розрізнення контакту руки та зависання — обидва аспекти важливі для ASL
.
SL2T використовує трансформер, який безпосередньо обробляє послідовність координат орієнтирів і авторегресивно генерує англійський текст. На відміну від попередніх підходів, він не створює проміжні глоси або лінгвістичні представлення . Модель саме перекладає, а не транскрибує — тобто вона видає природний англійський текст, а не дослівне відображення знаків ASL.
На наборі даних FLEURS-ASL (нульовий тест на складній абстрактній мові, записаній у студійних умовах сертифікованими нечуючими перекладачами), SL2T отримує 70 BLEURT, що, за словами Google, значно перевищує всі раніше опубліковані результати . Інші показники продуктивності:
Важливо зазначити, що це показники, надані розробником; на момент запуску жодної незалежної оцінки опубліковано не було.
Google створив зовнішній Консультативний комітет зі ШІ для мови жестів (AISLAC), до якого увійшли представники Національної асоціації глухих (NAD), RIT/NTID, DPAN та Всесвітньої федерації глухих (WFD). AISLAC став співавтором Спільного звіту про вплив, який визначає операційні межі та обмеження моделі .
SL2T чітко призначений і оцінений лише для некритичних, неформальних ситуацій, таких як диктування тексту, обмін повідомленнями, пошукові запити та розмови віч-на-віч (наприклад, у кав'ярні чи магазині). Високоризикові або багатосторонні розмови в медичних, юридичних та академічних закладах виходять за рамки використання .
У своїй документації Google зазначає, що SL2T не є заміною професійних послуг перекладу і не повинен використовуватися в контекстах, де помилки комунікації можуть завдати шкоди .
Сем Сепа, нечуючий співробітник Google і член команди з мови жестів, відіграв центральну роль у розробці SL2T. Він є співавтором публікації набору даних FSboard, який використовувався для оцінки моделі . У блозі Google та Спільному звіті про вплив наголошується, що команда тісно співпрацювала з нечуючими співробітниками Google, включаючи Сему Сепу, під час передрелізного тестування, щоб виявити поведінку моделі та проблеми інтерфейсу, які не можна було виявити за допомогою лише бенчмарків
.