Google DeepMind lance SL2T, le premier modèle d'IA de traduction de la langue des signes intégré dans un produit grand public, sur la famille Pixel 11 dans Gboard et Live Transcribe. Le modèle, entraîné sur plus de 100 000 heures de vidéo couvrant plus de 50 langues des signes, atteint un score de 70 BLEURT sur le b...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Le 12 août 2026, Google DeepMind a déployé SL2T (sign-language-to-text), un modèle de transformeur massivement multilingue qui traduit la vidéo de langue des signes directement en texte écrit — et c'est la première fonctionnalité d'IA pour la langue des signes à atteindre un téléphone grand public . Dans un premier temps, il prend en charge la langue des signes américaine (ASL) vers l'anglais, et alimente la dictée signe-à-texte dans Gboard (pour la saisie, la recherche et la messagerie) et Live Transcribe (pour les conversations informelles en tête-à-tête) sur la famille Pixel 11
. Ce lancement marque le passage de la recherche pure à un produit commercialisé, mais il s'accompagne de limites clairement définies et de contraintes techniques connues.
SL2T a été entraîné sur plus de 100 000 heures de vidéo en langue des signes couvrant plus de 50 langues des signes, dont environ un quart en ASL . En s'entraînant conjointement sur plusieurs langues des signes, dialectes et niveaux de compétence, la recherche de Google a constaté que le modèle surpasse les systèmes monolingues — apprenant des schémas structurels partagés qui améliorent la généralisation
. Il est à noter que les données d'entraînement excluent intentionnellement les signeurs de moins de 18 ans, ce qui pourrait réduire la précision pour les jeunes utilisateurs
.
Le système est conçu pour la confidentialité. La caméra du téléphone exécute MediaPipe Holistic, qui extrait les coordonnées 2D de 130 points clés (visage, corps, mains) image par image. La vidéo brute de la caméra est ensuite immédiatement supprimée et ne quitte jamais l'appareil . Seules ces coordonnées géométriques abstraites sont envoyées aux serveurs de Google pour traduction, et aucun journal des entrées ou sorties utilisateur n'est conservé sans autorisation explicite
. La représentation 2D des points de repère ne suit pas les points de repère de la langue ni ne fournit d'ordre de profondeur, ce qui rend plus difficile la distinction entre le contact et le survol de la main — deux éléments importants en ASL
.
SL2T utilise un transformeur qui se conditionne directement sur la séquence de coordonnées des points de repère et génère du texte anglais de manière autorégressive. Contrairement aux approches antérieures, il ne produit pas d'abord des glossaires intermédiaires ou des représentations linguistiques codées à la main . Le modèle traduit plutôt qu'il ne transcrit — ce qui signifie qu'il produit un texte anglais naturel, pas un mot-à-mot des signes ASL.
Sur FLEURS-ASL, un ensemble d'évaluation zero-shot de langage complexe et abstrait enregistré en conditions de studio par des interprètes sourds certifiés, SL2T obtient un score de 70 BLEURT, ce que Google dit être bien supérieur à tout résultat précédemment rapporté . Parmi les autres résultats de référence :
Il est important de noter qu'il s'agit de chiffres fournis par le vendeur ; aucune évaluation indépendante n'a été publiée à ce jour.
Google a réuni un comité consultatif externe sur l'IA de la langue des signes (AISLAC), qui comprend des représentants de la National Association of the Deaf (NAD), du RIT/NTID, du DPAN et de la World Federation of the Deaf (WFD). L'AISLAC a co-écrit le rapport d'impact conjoint qui définit les limites opérationnelles et les contraintes du modèle .
SL2T est explicitement conçu et évalué uniquement pour des situations informelles à faible risque telles que la dictée de texte, la messagerie, les requêtes de recherche et les conversations en tête-à-tête (par exemple, dans un café ou un commerce). Les conversations à enjeux élevés ou multipartites dans des contextes médicaux, juridiques et académiques sont hors de portée .
Google indique dans sa documentation que SL2T ne remplace pas les services d'interprétation professionnels et ne doit pas être utilisé dans des contextes où des erreurs de communication pourraient causer un préjudice .
Sam Sepah, un employé sourd de Google et membre de l'équipe Langue des signes, a joué un rôle central dans le développement de SL2T. Il est co-auteur de la publication de l'ensemble de données FSboard utilisé dans l'évaluation du modèle . Le blog de Google et le rapport d'impact conjoint soulignent que l'équipe a travaillé en étroite collaboration avec les employés sourds de Google — dont Sepah — tout au long des tests de pré-lancement pour découvrir des comportements du modèle et des problèmes d'interface que les seuls benchmarks ne pouvaient pas capturer
.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Google DeepMind lance SL2T, le premier modèle d'IA de traduction de la langue des signes intégré dans un produit grand public, sur la famille Pixel 11 dans Gboard et Live Transcribe.
Google DeepMind lance SL2T, le premier modèle d'IA de traduction de la langue des signes intégré dans un produit grand public, sur la famille Pixel 11 dans Gboard et Live Transcribe. Le modèle, entraîné sur plus de 100 000 heures de vidéo couvrant plus de 50 langues des signes, atteint un score de 70 BLEURT sur le benchmark FLEURS ASL.
L'architecture privilégie la vie privée : le logiciel MediaPipe Holistic extrait les coordonnées du squelette directement sur l'appareil, et seule cette version abstraite est envoyée aux serveurs pour traduction.