구글 딥마인드의 SL2T(수어 텍스트) 모델이 드디어 소비자 제품에 탑재되어 픽셀 11 제품군의 Gboard와 Live Transcribe에서 수어를 텍스트로 변환하는 기능을 지원합니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
2026년 8월 12일, 구글 딥마인드는 수어 동영상을 직접 문자 텍스트로 번역하는 대규모 다국어 변환 모델인 SL2T(수어-텍스트, sign-language-to-text)를 출시했습니다. 이는 수어 AI 기능이 소비자용 휴대폰에 탑재된 첫 사례입니다 . 초기에는 미국 수어(ASL)를 영어로 번역하며, 픽셀 11 제품군에서 Gboard(입력, 검색, 메시징용)와 Live Transcribe(일상적인 1:1 대화용)를 통해 수어-텍스트 받아쓰기 기능을 제공합니다
. 이번 출시는 순수 연구 단계에서 벗어나 실제 제품으로 이어졌다는 점에서 의미가 크지만, 명확히 정의된 범위와 알려진 한계도 함께 안고 있습니다.
SL2T는 50개 이상의 수어를涵盖한 10만 시간 이상의 수어 동영상으로 학습되었으며, 이 중 약 4분의 1이 ASL 데이터입니다 . 여러 수어, 방언, 숙련도를 함께 학습함으로써 구글의 연구 결과는 단일 언어 시스템보다 뛰어난 성능을 보였는데, 이는 공유된 구조적 패턴을 학습하여 일반화 성능이 향상되었기 때문입니다
. 특히, 학습 데이터에서 18세 미만 사용자는 의도적으로 제외되었으며, 이로 인해 어린 사용자에 대한 정확도가 낮아질 수 있습니다
.
이 시스템은 프라이버시를 고려하여 설계되었습니다. 휴대폰 카메라는 MediaPipe Holistic을 실행하여 프레임별로 얼굴, 몸, 손의 130개 키포인트에 대한 2D 랜드마크 좌표를 추출합니다. 원본 카메라 영상은 즉시 폐기되며 기기 외부로 절대 유출되지 않습니다 . 이 추상적인 기하학적 좌표만 구글 서버로 전송되어 번역되며, 사용자의 명시적인 동의 없이는 입력이나 출력 로그가 저장되지 않습니다
. 그러나 2D 랜드마크 방식은 혀의 움직임을 추적하지 못하고 깊이 정보를 제공하지 않아, ASL에서 중요한 손의 접촉과 떠 있는 상태를 구분하기 어렵게 만듭니다
.
SL2T는 랜드마크 좌표 시퀀스를 직접 입력으로 받아 영어 텍스트를 자기회귀적으로 생성하는 트랜스포머 모델입니다. 기존 접근 방식과 달리 중간 단계의 용어집이나 수동으로 코딩된 언어 표현을 먼저 출력하지 않습니다 . 이 모델은 글자 그대로의 전사보다는 번역에 가깝습니다. 즉, ASL 수어의 단어 대 단어 매핑이 아닌 자연스러운 영어 문장을 생성합니다.
공인 농인 수화 통역사가 스튜디오 환경에서 녹음한 복잡하고 추상적인 언어의 제로샷 평가 데이터셋인 FLEURS-ASL에서 SL2T는 70 BLEURT를 기록했으며, 구글은 이는 이전에 보고된 어떤 결과보다 훨씬 높은 수치라고 밝혔습니다 . 추가 벤치마크 결과는 다음과 같습니다.
이러한 수치는 구글 자체 보고 수치이며, 출시일 현재 독립적인 평가는 공개되지 않았습니다.
구글은 미국 농인 협회(NAD) , 로체스터 공과대학교 농인 기술 연구소(RIT/NTID) , DPAN, 세계 농인 연맹(WFD) 등이 포함된 외부 기관인 **AI 수어 자문 위원회(AISLAC)**를 구성했습니다. AISLAC는 모델의 운영 범위와 한계를 정의하는 공동 영향 보고서를 공동 작성했습니다 .
SL2T는 문자 받아쓰기, 메시징, 검색 쿼리, 커피숍이나 소매점에서의 1:1 대화와 같은 저위험, 비공식적인 상황에서만 사용하도록 명시적으로 설계 및 평가되었습니다. 의료, 법률, 학술 환경에서의 고위험 또는 다자간 대화는 대상 범위를 벗어납니다 .
구글은 문서에서 SL2T가 전문 통역 서비스를 대체할 수 없으며, 의사소통 오류가 피해를 초래할 수 있는 상황에서는 의존해서는 안 된다고 명시하고 있습니다 .
Sam Sepah는 청각 장애인 구글러이자 수어 팀의 일원으로 SL2T 개발에 핵심적인 역할을 했습니다. 그는 모델 평가에 사용된 FSboard 데이터셋 출판물의 공동 저자입니다 . 구글의 블로그와 공동 영향 보고서는 팀이 Sepah를 포함한 청각 장애인 구글러들과 긴밀히 협력하여 출시 전 테스트를 진행했으며, 이를 통해 벤치마크만으로는 포착할 수 없는 모델 동작과 인터페이스 문제를 발견했다고 강조합니다
.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
구글 딥마인드의 SL2T(수어 텍스트) 모델이 드디어 소비자 제품에 탑재되어 픽셀 11 제품군의 Gboard와 Live Transcribe에서 수어를 텍스트로 변환하는 기능을 지원합니다.