SL2T được huấn luyện trên hơn 100.000 giờ video ngôn ngữ ký hiệu, bao gồm hơn 50 ngôn ngữ ký hiệu, với khoảng một phần tư dữ liệu là ASL . Bằng cách huấn luyện đồng thời trên nhiều ngôn ngữ ký hiệu, phương ngữ và trình độ khác nhau, nghiên cứu của Google cho thấy mô hình này hoạt động tốt hơn các hệ thống đơn ngữ — nhờ học được các cấu trúc chung giúp cải thiện khả năng tổng quát hóa
. Điều đáng chú ý là dữ liệu huấn luyện loại trừ người dùng dưới 18 tuổi, điều này có thể làm giảm độ chính xác đối với người dùng trẻ tuổi
.
Hệ thống được thiết kế với ưu tiên bảo mật. Camera trên điện thoại sử dụng MediaPipe Holistic, trích xuất tọa độ điểm mốc 2D cho 130 điểm chính (khuôn mặt, cơ thể, bàn tay) theo từng khung hình. Video thô từ camera sẽ bị loại bỏ ngay lập tức và không bao giờ rời khỏi thiết bị . Chỉ các tọa độ hình học trừu tượng này mới được gửi đến máy chủ của Google để dịch; không có nhật ký đầu vào hoặc đầu ra nào của người dùng được lưu lại nếu không có sự cho phép rõ ràng
. Biểu diễn điểm mốc 2D không theo dõi các điểm mốc của lưỡi hoặc cung cấp thứ tự độ sâu, khiến việc phân biệt giữa chạm tay và lơ lửng trở nên khó khăn — cả hai đều quan trọng trong ASL
.
SL2T sử dụng một bộ biến đổi transformer có điều kiện trực tiếp trên chuỗi tọa độ điểm mốc và tạo ra văn bản tiếng Anh theo cơ chế tự hồi quy. Không giống như các phương pháp trước đây, nó không xuất ra các ngữ chú thích trung gian hay các biểu diễn ngôn ngữ học được mã hóa thủ công . Mô hình dịch chứ không phiên âm — nghĩa là nó tạo ra văn bản tiếng Anh tự nhiên, không phải bản đồ từng từ của các ký hiệu ASL.
Trên FLEURS-ASL, một bộ dữ liệu đánh giá zero-shot với ngôn ngữ phức tạp, trừu tượng được ghi trong điều kiện phòng thu bởi các Phiên dịch viên Khiếm thính được Chứng nhận, SL2T đạt 70 BLEURT, mà Google cho biết là cao hơn nhiều so với bất kỳ kết quả nào được báo cáo trước đây . Các kết quả benchmark bổ sung bao gồm:
Cần lưu ý rằng đây là những con số do chính hãng công bố; chưa có đánh giá độc lập nào được công bố kể từ ngày ra mắt.
Google đã thành lập một Ủy ban Cố vấn AI Ngôn ngữ Ký hiệu bên ngoài (AISLAC), bao gồm đại diện của Hiệp hội Người Khiếm thính Quốc gia Hoa Kỳ (NAD), RIT/NTID, DPAN, và Liên đoàn Người Khiếm thính Thế giới (WFD). AISLAC đã đồng tác giả Báo cáo Tác động Chung, xác định các ranh giới và hạn chế vận hành của mô hình .
SL2T được thiết kế và đánh giá rõ ràng chỉ cho các tình huống thông thường, không quan trọng như đọc chính tả văn bản, nhắn tin, truy vấn tìm kiếm và các cuộc trò chuyện một-một (ví dụ: tại quán cà phê hoặc cửa hàng bán lẻ). Các cuộc trò chuyện nhiều bên hoặc có tính chất quan trọng trong môi trường y tế, pháp lý và học thuật nằm ngoài phạm vi cho phép .
Google tuyên bố trong tài liệu của mình rằng SL2T không phải là sự thay thế cho các dịch vụ phiên dịch chuyên nghiệp và không nên được tin cậy trong các bối cảnh mà lỗi giao tiếp có thể gây ra tác hại .
Sam Sepah, một kỹ sư Khiếm thính của Google và là thành viên của Nhóm Ngôn ngữ Ký hiệu, đóng vai trò trung tâm trong quá trình phát triển SL2T. Anh là đồng tác giả của ấn phẩm bộ dữ liệu FSboard được sử dụng trong đánh giá mô hình . Blog và Báo cáo Tác động Chung của Google nhấn mạnh rằng nhóm đã làm việc chặt chẽ với các kỹ sư Khiếm thính của Google — bao gồm cả Sepah — trong suốt quá trình thử nghiệm trước khi phát hành để khám phá các hành vi của mô hình và các vấn đề giao diện mà các điểm chuẩn đơn thuần không thể phát hiện được
.