Google DeepMind выпустил модель SL2T (sign language to text) — первую ИИ систему перевода языка жестов, которая появилась в потребительском продукте, а именно в смартфонах Pixel 11 в приложениях Gboard и Live Transcribe.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
12 августа 2026 года Google DeepMind запустила SL2T (sign-language-to-text) — массовую мультиязычную трансформер-модель, которая переводит видео с языком жестов непосредственно в письменный текст. Это первая функция ИИ для языка жестов, добравшаяся до потребительского телефона . На старте модель поддерживает американский язык жестов (ASL) и переводит его на английский. SL2T работает как голосовой набор для языка жестов: пользователи могут «печатать» жестами в Gboard (для набора текста, поиска и сообщений) и Live Transcribe (для неформальных бесед один на один) на семействе Pixel 11
. Запуск знаменует переход от чисто исследовательской разработки к реальному продукту, но сопровождается чётко оговорёнными границами и известными ограничениями.
SL2T обучалась на более чем 100 000 часов видео с языком жестов, охватывающих свыше 50 языков жестов, причём примерно четверть данных приходится на ASL . Благодаря совместному обучению на нескольких языках, диалектах и уровнях влащения, исследователи Google обнаружили, что модель превосходит одноязычные системы — она усваивает общие структурные закономерности, улучшающие обобщение
. Важно отметить, что из обучающих данных намеренно исключены носители языка младше 18 лет, что может снизить точность для молодых пользователей
.
Система спроектирована с учётом конфиденциальности. Камера телефона запускает MediaPipe Holistic, который покадрово извлекает 2D-координаты 130 ключевых точек (лицо, тело, кисти рук). После этого исходное видео немедленно удаляется и никогда не покидает устройство . На серверы Google для перевода отправляются только эти абстрактные геометрические координаты, и никакие журналы ввода или вывода не сохраняются без явного разрешения пользователя
. 2D-представление ориентиров не отслеживает точки языка и не передаёт глубину, что затрудняет различение контакта и зависания рук — оба этих понятия важны для ASL
.
SL2T использует трансформер, который обрабатывает последовательность координат ориентиров и авторегрессионно генерирует английский текст. В отличие от более ранних подходов, модель не выдаёт промежуточные глоссы или специальные лингвистические представления . Она именно переводит, а не транскрибирует — то есть создаёт естественный английский текст, а не пословное отображение знаков ASL.
На наборе данных FLEURS-ASL — оценочном датасете для zero-shot сценариев, состоящем из сложных, абстрактных высказываний, записанных в студийных условиях сертифицированными глухими переводчиками, — SL2T набирает 70 BLEURT. По словам Google, это намного выше любого ранее опубликованного результата . Дополнительные результаты бенчмарков включают:
Важно отметить: эти цифры предоставлены разработчиком; на момент запуска независимая оценка не публиковалась.
Google создал внешний Консультативный комитет по ИИ для языка жестов (AI Sign Language Advisory Committee, AISLAC). В него вошли представители Национальной ассоциации глухих (NAD), RIT/NTID, DPAN и Всемирной федерации глухих (WFD). AISLAC выступил соавтором Совместного отчёта о воздействии (Joint Impact Report), в котором определены границы применения модели и её ограничения .
SL2T разработана и оценивается исключительно для неформальных ситуаций с низким уровнем риска: ввод текста, обмен сообщениями, поисковые запросы и беседы один на один (например, в кафе или магазине). Ситуации с высокими ставками или многосторонние разговоры в медицинских, юридических и академических учреждениях находятся вне зоны ответственности модели .
В документации Google указано, что SL2T не является заменой профессиональных услуг переводчика жестового языка и на неё не следует полагаться в ситуациях, где ошибки в общении могут причинить вред .
Сэм Сепа (Sam Sepah), глухой сотрудник Google и участник команды по языку жестов, сыграл ключевую роль в разработке SL2T. Он является соавтором публикации о датасете FSboard, который использовался при оценке модели . В блоге Google и в Совместном отчёте о воздействии подчёркивается, что команда тесно сотрудничала с глухими сотрудниками Google — включая Сепу — на протяжении всего этапа предрелизного тестирования, чтобы выявить особенности поведения модели и проблемы интерфейса, которые невозможно было обнаружить с помощью одних лишь тестов
.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Google DeepMind выпустил модель SL2T (sign language to text) — первую ИИ систему перевода языка жестов, которая появилась в потребительском продукте, а именно в смартфонах Pixel 11 в приложениях Gboard и Live Transcribe.