Google DeepMind lanza SL2T (sign language to text), el primer modelo de IA para traducción de lengua de señas que llega a un producto de consumo: la familia Pixel 11. SL2T se integra en Gboard (para escribir, buscar y chatear) y Live Transcribe (para conversaciones informales), comenzando con ASL a inglés.
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
El 12 de agosto de 2026, Google DeepMind lanzó SL2T (sign-language-to-text), un modelo transformador masivamente multilingüe que traduce video de lengua de señas directamente a texto escrito. Es la primera función de IA para lengua de señas que llega a un teléfono de consumo . Inicialmente compatible con la Lengua de Señas Americana (ASL) al inglés, SL2T permite el dictado de señas a texto en Gboard (para escribir, buscar y enviar mensajes) y Live Transcribe (para conversaciones informales uno a uno) en la familia Pixel 11
. Este lanzamiento representa un avance de la investigación al producto final, pero viene con límites y limitaciones definidas.
SL2T se entrenó con más de 100,000 horas de video de lengua de señas que abarcan más de 50 lenguas de señas, con aproximadamente una cuarta parte de esos datos en ASL . Al entrenar conjuntamente con múltiples lenguas de señas, dialectos y niveles de competencia, la investigación de Google descubrió que el modelo supera a los sistemas de una sola lengua: aprende patrones estructurales compartidos que mejoran la generalización
. Es importante destacar que los datos de entrenamiento excluyen intencionalmente a firmantes menores de 18 años, lo que podría reducir la precisión para usuarios más jóvenes
.
El sistema está diseñado para la privacidad. La cámara del teléfono ejecuta MediaPipe Holistic, extrayendo coordenadas de puntos de referencia 2D para 130 puntos clave (cara, cuerpo, manos) fotograma a fotograma. El video en bruto de la cámara se descarta inmediatamente y nunca sale del dispositivo . Solo estas coordenadas geométricas abstractas se envían a los servidores de Google para la traducción, y no se conservan registros de las entradas o salidas del usuario sin autorización explícita
. La representación de puntos de referencia 2D no rastrea los puntos de la lengua ni proporciona orden de profundidad, lo que dificulta distinguir entre el contacto de las manos y el movimiento de cernido (hovering), ambos importantes en ASL
.
SL2T utiliza un transformador que se condiciona directamente a la secuencia de coordenadas de los puntos de referencia y genera texto en inglés de forma autorregresiva. A diferencia de enfoques anteriores, no genera primero glosas intermedias o representaciones lingüísticas codificadas a mano . El modelo traduce, no transcribe; es decir, produce texto natural en inglés, no una asignación palabra por palabra de los signos de ASL.
En FLEURS-ASL, un conjunto de datos de evaluación de aprendizaje cero (zero-shot) de lenguaje complejo y abstracto grabado en condiciones de estudio por intérpretes sordos certificados, SL2T obtiene 70 BLEURT, que Google afirma está muy por encima de cualquier resultado reportado anteriormente . Otros resultados de referencia incluyen:
Es importante tener en cuenta que estas son cifras reportadas por el proveedor; no se ha publicado ninguna evaluación independiente hasta la fecha de lanzamiento.
Google convocó un Comité Asesor de IA en Lengua de Señas (AISLAC) externo, que incluye representantes de la Asociación Nacional de Sordos (NAD) de EE. UU., el RIT/NTID, DPAN y la Federación Mundial de Sordos (WFD). AISLAC coescribió el Informe de Impacto Conjunto que define los límites operativos y las limitaciones del modelo .
SL2T está diseñado y evaluado explícitamente solo para situaciones informales y de bajo riesgo, como dictado de texto, mensajería, consultas de búsqueda y conversaciones uno a uno (por ejemplo, en una cafetería o comercio). Las conversaciones de alto riesgo o multipersona en entornos médicos, legales y académicos están fuera del alcance .
Google declara en su documentación que SL2T no es un sustituto de los servicios de interpretación profesional y no debe utilizarse en contextos donde los errores de comunicación puedan causar daños .
Sam Sepah, un empleado sordo de Google y miembro del equipo de Lengua de Señas, desempeñó un papel central en el desarrollo de SL2T. Es coautor de la publicación del conjunto de datos FSboard utilizado en la evaluación del modelo . El blog de Google y el Informe de Impacto Conjunto enfatizan que el equipo trabajó en estrecha colaboración con empleados sordos de Google, incluido Sepah, durante las pruebas previas al lanzamiento para descubrir comportamientos del modelo y problemas de interfaz que los puntos de referencia por sí solos no podían capturar
.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Google DeepMind lanza SL2T (sign language to text), el primer modelo de IA para traducción de lengua de señas que llega a un producto de consumo: la familia Pixel 11.
Google DeepMind lanza SL2T (sign language to text), el primer modelo de IA para traducción de lengua de señas que llega a un producto de consumo: la familia Pixel 11. SL2T se integra en Gboard (para escribir, buscar y chatear) y Live Transcribe (para conversaciones informales), comenzando con ASL a inglés.
El modelo fue entrenado con más de 100,000 horas de video de más de 50 lenguas de señas; una cuarta parte de los datos son en ASL.