Google DeepMind تطلق SL2T، أول نموذج ذكاء اصطناعي لترجمة لغة الإشارة إلى نص يُشحن في منتج استهلاكي، على سلسلة Pixel 11 في تطبيقي Gboard وLive Transcribe. النموذج دُرب على أكثر من 100,000 ساعة من فيديوهات لغة الإشارة لأكثر من 50 لغة، ويستخدم تقنية تتبع نقاط الجسم (130 نقطة) على الجهاز للحفاظ على الخصوصية.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
في 12 أغسطس 2026، أطلقت Google DeepMind نموذج SL2T (من لغة الإشارة إلى نص)، وهو نموذج محول ضخم متعدد اللغات يُترجم فيديو لغة الإشارة مباشرة إلى نص مكتوب، ليكون أول ميزة ذكاء اصطناعي للغة الإشارة تصل إلى هاتف استهلاكي .
يدعم النموذج في البداية لغة الإشارة الأمريكية (ASL) إلى الإنجليزية، ليعمل كأداة إملاء من الإشارة إلى النص في تطبيقي Gboard (للطباعة والبحث والمراسلة) وLive Transcribe (للمحادثات غير الرسمية وجهاً لوجه) عبر هواتف Pixel 11 . ويمثل الإطلاق نقلة من البحث الخالص إلى منتج حقيقي، لكن مع حدود واستثناءات محددة بعناية.
دُرب النموذج على أكثر من 100,000 ساعة من فيديوهات لغة الإشارة تغطي أكثر من 50 لغة إشارة، حوالي ربعها بلغة الإشارة الأمريكية . وبالتدريب المشترك على لغات متعددة ولهجات ومستويات مهارة، وجدت أبحاث Google أن النموذج يتفوق على الأنظمة أحادية اللغة، إذ يتعلم أنماطاً بنيوية مشتركة تُحسّن من تعميمه
. ومن المهم الإشارة إلى أن بيانات التدريب تستبعد عمداً من تقل أعمارهم عن 18 عاماً، مما قد يقلل الدقة مع المستخدمين الأصغر سناً
.
صُمم النظام للخصوصية. تقوم كاميرا الهاتف بتشغيل MediaPipe Holistic لاستخراج إحداثيات ثنائية الأبعاد لـ 130 نقطة رئيسية (الوجه والجسم واليدين) إطاراً بإطار. ثم يُتخلص من فيديو الكاميرا الخام فوراً ولا يغادر الجهاز أبداً . فقط هذه الإحداثيات الهندسية المجردة تُرسل إلى خوادم Google للترجمة، ولا تُحتفظ بسجلات لإدخالات المستخدم أو مخرجاته دون إذن صريح
. ولكن، تمثيل الإحداثيات ثنائي الأبعاد لا يتتبع نقاط اللسان ولا يوفر ترتيباً للعمق، مما يصعّب التمييز بين لمس الأيدي والتحليق فوقها، وكلاهما مهم في لغة الإشارة الأمريكية
.
يستخدم SL2T محولاً يعالج مباشرة سلسلة إحداثيات الوضعية ويولد النص الإنجليزي بشكل تراجعي (توليد كلمة تلو الأخرى). على عكس الأساليب السابقة، لا يُخرج أولاً تمثيلات وسيطة . النموذج يترجم بدلاً من أن ينسخ حرفياً، أي يُنتج نصاً إنجليزياً طبيعياً وليس مطابقة كلمة بكلمة لإشارات ASL.
في اختبار FLEURS-ASL (مجموعة بيانات تقييم للغة معقدة ومجردة سُجلت في ظروف استوديو بمترجمين صم معتمدين)، يسجل SL2T 70 نقطة على مقياس BLEURT، وهو أعلى بكثير من أي نتيجة سابقة منشورة، حسب قول Google . نتائج إضافية:
من المهم ملاحظة أن هذه الأرقام معلنة من جوجل نفسها؛ لم يُنشر أي تقييم مستقل حتى تاريخ الإطلاق.
شكّلت Google لجنة استشارية خارجية باسم AI Sign Language Advisory Committee (AISLAC) تضم ممثلين عن الجمعية الوطنية للصم (NAD) وRIT/NTID وDPAN والاتحاد العالمي للصم (WFD). شاركت AISLAC في كتابة التقرير المشترك للأثر الذي يحدد حدود النموذج التشغيلية .
صُمم النموذج وقُيّم فقط لـ المواقف غير الرسمية منخفضة المخاطر مثل الإملاء النصي والرسائل واستعلامات البحث والمحادثات الفردية (كالمقاهي والمتاجر). أما السياقات عالية المخاطر أو المحادثات الجماعية في المجالات الطبية والقانونية والأكاديمية فهي خارج نطاق التصميم .
تذكر Google في وثائقها أن SL2T ليس بديلاً عن خدمات الترجمة الفورية المهنية ولا يجب الاعتماد عليه في سياقات قد تسبب فيها أخطاء التواصل ضرراً .
لعب سام سيباه (Sam Sepah)، وهو موظف أصم في Google وعضو في فريق لغة الإشارة، دوراً محورياً في تطوير SL2T. وهو مؤلف مشارك في منشور مجموعة بيانات FSboard المستخدمة في تقييم النموذج . وتؤكد مدونة Google والتقرير المشترك على أن الفريق عمل عن كثب مع موظفي Google الصم - بمن فيهم سيباه - خلال الاختبارات قبل الإطلاق لاكتشاف سلوكيات النموذج وقضايا الواجهة التي قد لا تكشفها المعايير وحدها
.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
Google DeepMind تطلق SL2T، أول نموذج ذكاء اصطناعي لترجمة لغة الإشارة إلى نص يُشحن في منتج استهلاكي، على سلسلة Pixel 11 في تطبيقي Gboard وLive Transcribe.
Google DeepMind تطلق SL2T، أول نموذج ذكاء اصطناعي لترجمة لغة الإشارة إلى نص يُشحن في منتج استهلاكي، على سلسلة Pixel 11 في تطبيقي Gboard وLive Transcribe. النموذج دُرب على أكثر من 100,000 ساعة من فيديوهات لغة الإشارة لأكثر من 50 لغة، ويستخدم تقنية تتبع نقاط الجسم (130 نقطة) على الجهاز للحفاظ على الخصوصية.
النسخة الأولى تدعم لغة الإشارة الأمريكية (ASL) إلى الإنجليزية فقط، مع حظر استخدامه في السياقات عالية المخاطر مثل المجال الطبي والقانوني.