SL2T को 100,000 घंटे से अधिक सांकेतिक भाषा के वीडियो पर प्रशिक्षित किया गया है, जिसमें 50 से अधिक सांकेतिक भाषाएं शामिल हैं। इसमें से लगभग एक चौथाई डेटा ASL का है । एक साथ कई सांकेतिक भाषाओं, बोलियों और कौशल स्तरों पर प्रशिक्षण देकर, Google के शोध ने पाया कि यह मॉडल एकल-भाषा प्रणालियों से बेहतर प्रदर्शन करता है, क्योंकि यह साझा संरचनात्मक पैटर्न सीखता है जो सामान्यीकरण में सुधार करता है
। ध्यान देने वाली बात यह है कि ट्रेनिंग डेटा में 18 वर्ष से कम उम्र के साइनर्स (हस्ताक्षरकर्ताओं) को शामिल नहीं किया गया है, जिससे युवा उपयोगकर्ताओं के लिए सटीकता कम हो सकती है
।
यह सिस्टम प्राइवेसी को ध्यान में रखकर डिजाइन किया गया है। फोन का कैमरा MediaPipe Holistic चलाता है, जो फ्रेम-दर-फ्रेम 130 प्रमुख बिंदुओं (चेहरा, शरीर, हाथ) के लिए 2D लैंडमार्क कोऑर्डिनेट निकालता है। इसके बाद रॉ कैमरा वीडियो को तुरंत हटा दिया जाता है और वह कभी भी डिवाइस से बाहर नहीं जाता । केवल ये अमूर्त ज्यामितीय निर्देशांक अनुवाद के लिए Google के सर्वर पर भेजे जाते हैं, और स्पष्ट उपयोगकर्ता प्राधिकरण के बिना उपयोगकर्ता इनपुट या आउटपुट के कोई लॉग नहीं रखे जाते हैं
। 2D लैंडमार्क प्रतिनिधित्व जीभ के लैंडमार्क को ट्रैक नहीं करता है और न ही गहराई का क्रम प्रदान करता है, जिससे हाथ के संपर्क और होवरिंग के बीच अंतर करना मुश्किल हो जाता है - ASL में ये दोनों महत्वपूर्ण हैं
।
SL2T एक ट्रांसफॉर्मर का उपयोग करता है जो सीधे लैंडमार्क कोऑर्डिनेट सीक्वेंस पर कंडीशन करता है और ऑटोरेग्रेसिव रूप से अंग्रेजी टेक्स्ट जेनरेट करता है। पिछले तरीकों के विपरीत, यह पहले मध्यवर्ती ग्लॉस या हाथ-कोडित भाषाई प्रतिनिधित्व आउटपुट नहीं करता है । मॉडल ट्रांसक्राइब करने के बजाय अनुवाद करता है - जिसका अर्थ है कि यह ASL संकेतों का शब्द-दर-शब्द मैपिंग नहीं, बल्कि प्राकृतिक अंग्रेजी टेक्स्ट तैयार करता है।
FLEURS-ASL पर, जो प्रमाणित बधिर दुभाषियों द्वारा स्टूडियो स्थितियों में रिकॉर्ड किए गए जटिल, अमूर्त भाषा का एक जीरो-शॉट मूल्यांकन डेटासेट है, SL2T 70 BLEURT स्कोर करता है, जो Google के अनुसार किसी भी पहले से रिपोर्ट किए गए परिणाम से कहीं अधिक है । अतिरिक्त बेंचमार्क परिणामों में शामिल हैं:
यह ध्यान रखना महत्वपूर्ण है कि ये विक्रेता-रिपोर्टेड आंकड़े हैं; लॉन्च की तिथि तक कोई स्वतंत्र मूल्यांकन प्रकाशित नहीं हुआ है।
Google ने एक बाहरी AI साइन लैंग्वेज एडवाइज़री कमेटी (AISLAC) का गठन किया, जिसमें नेशनल एसोसिएशन ऑफ द डेफ (NAD), RIT/NTID, DPAN, और वर्ल्ड फेडरेशन ऑफ द डेफ (WFD) के प्रतिनिधि शामिल हैं। AISLAC ने संयुक्त प्रभाव रिपोर्ट का सह-लेखन किया जो मॉडल की परिचालन सीमाओं और कमियों को परिभाषित करती है ।
SL2T को विशेष रूप से कम-जोखिम वाली, अनौपचारिक स्थितियों जैसे टेक्स्ट डिक्टेशन, मैसेजिंग, सर्च क्वेरी और एक-पर-एक बातचीत (जैसे, कॉफी शॉप या रिटेलर पर) के लिए डिज़ाइन और मूल्यांकन किया गया है। चिकित्सा, कानूनी और शैक्षणिक सेटिंग्स में उच्च-जोखिम वाली या बहु-पक्षीय बातचीत दायरे से बाहर हैं ।
Google अपने दस्तावेज़ीकरण में कहता है कि SL2T पेशेवर व्याख्या सेवाओं का विकल्प नहीं है और इसका उपयोग उन संदर्भों में नहीं किया जाना चाहिए जहां संचार त्रुटियों से नुकसान हो सकता है ।
सैम सेपा, एक बधिर गूगलर और साइन लैंग्वेज टीम के सदस्य, ने SL2T के विकास में केंद्रीय भूमिका निभाई। वह मॉडल के मूल्यांकन में उपयोग किए गए FSboard डेटासेट प्रकाशन के सह-लेखक हैं । Google के ब्लॉग और संयुक्त प्रभाव रिपोर्ट में इस बात पर जोर दिया गया है कि टीम ने प्री-रिलीज़ परीक्षण के दौरान बधिर गूगलर्स - जिनमें सेपा भी शामिल हैं - के साथ मिलकर काम किया ताकि मॉडल व्यवहार और इंटरफ़ेस मुद्दों का पता लगाया जा सके जो अकेले बेंचमार्क नहीं पकड़ पाए
।