Google DeepMind เปิดตัว SL2T โมเดล AI แปลภาษามือเป็นข้อความครั้งแรกในสินค้าคอนซูเมอร์ โดยเริ่มทำงานบน Pixel 11 ใน Gboard และ Live Transcribe เทรนด้วยข้อมูลภาษามือกว่า 100,000 ชั่วโมงจาก 50 ภาษามือ ใช้ MediaPipe Holistic สกัดจุด landmarks 130 จุดบนใบหน้าและร่างกาย โดยไม่ส่งวิดีโอออกนอกเครื่อง รองรับเฉพาะ ASL สู่ภาษาอ...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
เมื่อวันที่ 12 สิงหาคม 2026 Google DeepMind ได้ปล่อย SL2T (sign-language-to-text) โมเดล transformer หลายภาษาขนาดใหญ่ที่แปลภาษามือเป็นข้อความโดยตรง ซึ่งเป็นฟีเจอร์ AI ภาษามือตัวแรกที่มาถึงโทรศัพท์คอนซูเมอร์ โดยเริ่มต้นรองรับ American Sign Language (ASL) สู่ภาษาอังกฤษ ทำงานบนฟีเจอร์ป้อนข้อความด้วยภาษามือใน Gboard (สำหรับพิมพ์ ค้นหา และส่งข้อความ) และ Live Transcribe (สำหรับการสนทนาแบบตัวต่อตัว) บนตระกูล Pixel 11
การเปิดตัวนี้แสดงถึงการเปลี่ยนผ่านจากงานวิจัยสู่ผลิตภัณฑ์จริง แต่มาพร้อมขอบเขตการใช้งานและข้อจำกัดที่วางไว้อย่างรอบคอบ
SL2T ถูกเทรนด้วยวิดีโอภาษามือ มากกว่า 100,000 ชั่วโมง ที่ครอบคลุม มากกว่า 50 ภาษามือ โดยประมาณหนึ่งในสี่ของข้อมูลเป็น ASL การเทรนร่วมกันบนภาษามือ ภาษาถิ่น และระดับความชำนาญหลายแบบ ทำให้โมเดลมีประสิทธิภาพดีกว่าระบบภาษาเดียว จากการค้นพบของ Google เพราะได้เรียนรู้รูปแบบโครงสร้างร่วมกันที่ช่วยในการสรุปผล
值得注意的是 ข้อมูลการเทรน ไม่ได้รวมผู้ใช้ที่อายุต่ำกว่า 18 ปี ซึ่งอาจลดความแม่นยำสำหรับผู้ใช้ที่อายุน้อย
ระบบออกแบบมาเพื่อความเป็นส่วนตัว กล้องโทรศัพท์จะรัน MediaPipe Holistic เพื่อสกัด พิกัด landmark 2 มิติสำหรับ 130 จุดสำคัญ (ใบหน้า ลำตัว มือ) ในแต่ละเฟรม หลังจากนั้นวิดีโอสดจะถูกลบทิ้งทันทีและไม่เคยออกจากเครื่อง เฉพาะพิกัดเรขาคณิตนามธรรมเหล่านี้เท่านั้นที่ถูกส่งไปยังเซิร์ฟเวอร์ของ Google เพื่อแปลผล และจะไม่มีการเก็บบันทึกข้อมูลอินพุตหรือเอาต์พุตของผู้ใช้โดยไม่ได้รับอนุญาตอย่างชัดแจ้ง
การแสดงผลแบบ 2D landmark นี้ไม่สามารถติดตามจุดที่ลิ้นหรือให้ลำดับความลึก ทำให้แยกแยะระหว่างการแตะมือกับการลอยอยู่ได้ยาก ซึ่งทั้งสองอย่างมีความสำคัญใน ASL
SL2T ใช้ transformer ที่ปรับสภาพตามลำดับพิกัด landmark โดยตรงและสร้างข้อความภาษาอังกฤษแบบ autoregressive ต่างจากแนวทางก่อนหน้านี้ที่ต้องส่งออก gloss หรือการแสดงผลทางภาษาศาสตร์ที่เขียนด้วยมือก่อน โมเดลนี้ทำหน้าที่ แปล มากกว่า ถอดความ หมายความว่ามันสร้างข้อความภาษาอังกฤษที่เป็นธรรมชาติ ไม่ใช่การจับคู่คำต่อคำของสัญลักษณ์ ASL
บน FLEURS-ASL ซึ่งเป็นชุดข้อมูลประเมินแบบ zero-shot สำหรับภาษาที่ซับซ้อนและเป็นนามธรรม ซึ่งบันทึกในสตูดิโอโดย Certified Deaf Interpreters SL2T ได้คะแนน 70 BLEURT ซึ่ง Google กล่าวว่าสูงกว่าผลลัพธ์ที่รายงานก่อนหน้านี้มาก ผลลัพธ์มาตรวัดเพิ่มเติมได้แก่:
สิ่งสำคัญคือต้องทราบว่าตัวเลขเหล่านี้เป็นตัวเลขที่รายงานโดยผู้พัฒนา ยังไม่มีการประเมินจากบุคคลที่สามที่เป็นอิสระเผยแพร่ ณ วันเปิดตัว
Google ได้จัดตั้ง คณะกรรมการที่ปรึกษาด้าน AI ภาษามือภายนอก (AISLAC) ซึ่งรวมถึงตัวแทนจาก National Association of the Deaf (NAD), RIT/NTID, DPAN และ World Federation of the Deaf (WFD) AISLAC ร่วมเขียนรายงานผลกระทบร่วมที่กำหนดขอบเขตการทำงานและข้อจำกัดของโมเดล
SL2T ได้รับการออกแบบและประเมินเฉพาะสำหรับ สถานการณ์ทั่วไปที่ไม่มีความเสี่ยงสูง เช่น การป้อนข้อความ การส่งข้อความ การค้นหา และการสนทนาแบบตัวต่อตัว (เช่น ที่ร้านกาแฟหรือร้านค้าปลีก) การสนทนาที่มีความเสี่ยงสูงหรือหลายฝ่ายใน สถานพยาบาล กฎหมาย และการศึกษา อยู่นอกเหนือขอบเขต
Google ระบุในเอกสารว่า SL2T ไม่ใช่สิ่งทดแทนบริการล่ามมืออาชีพ และไม่ควรพึ่งพาในบริบทที่ข้อผิดพลาดในการสื่อสารอาจก่อให้เกิดอันตราย
Sam Sepah พนักงานหูหนวกของ Google และสมาชิกทีมภาษามือ มีบทบาทสำคัญในการพัฒนา SL2T เขาเป็นผู้เขียนร่วมในสิ่งพิมพ์ชุดข้อมูล FSboard ที่ใช้ในการประเมินโมเดล บล็อกของ Google และรายงานผลกระทบร่วมเน้นย้ำว่าทีมงานทำงานอย่างใกล้ชิดกับพนักงานหูหนวกของ Google รวมถึง Sepah ตลอดการทดสอบก่อนเปิดตัวเพื่อค้นหาพฤติกรรมของโมเดลและปัญหาอินเทอร์เฟซที่มาตรวัดเพียงอย่างเดียวไม่สามารถจับได้
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Google DeepMind เปิดตัว SL2T โมเดล AI แปลภาษามือเป็นข้อความครั้งแรกในสินค้าคอนซูเมอร์ โดยเริ่มทำงานบน Pixel 11 ใน Gboard และ Live Transcribe
Google DeepMind เปิดตัว SL2T โมเดล AI แปลภาษามือเป็นข้อความครั้งแรกในสินค้าคอนซูเมอร์ โดยเริ่มทำงานบน Pixel 11 ใน Gboard และ Live Transcribe เทรนด้วยข้อมูลภาษามือกว่า 100,000 ชั่วโมงจาก 50 ภาษามือ ใช้ MediaPipe Holistic สกัดจุด landmarks 130 จุดบนใบหน้าและร่างกาย โดยไม่ส่งวิดีโอออกนอกเครื่อง
รองรับเฉพาะ ASL สู่ภาษาอังกฤษ จำกัดเฉพาะการใช้งานทั่วไปที่ไม่ใช่ทางการแพทย์ กฎหมาย หรือวิชาการ มีข้อจำกัดด้านแสงน้อย รองรับผู้ใช้คนเดียว และคลิปไม่เกิน 60 วินาที