Google DeepMind melancarkan SL2T (sign language to text), model AI terjemahan bahasa isyarat ke teks yang pertama kali disertakan dalam produk pengguna, iaitu pada keluarga Pixel 11 menerusi Gboard dan Live Transcribe. SL2T dilatih dengan lebih 100,000 jam video bahasa isyarat merangkumi lebih 50 bahasa, dengan suku...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Google DeepMind's new SL2T sign-language-to-text AI model, how does it work (including its training data, on-device landmark trackin. Article summary: Google DeepMind's **SL2T (sign-language-to-text)** is a massively multilingual transformer model that translates sign language video directly into written text, shipping for the first time in consumer devices on the Pixe. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Pada 12 Ogos 2026, Google DeepMind melancarkan SL2T (sign-language-to-text), sebuah model transformer pelbagai bahasa yang menterjemah video bahasa isyarat terus ke dalam teks bertulis. Ini adalah ciri AI bahasa isyarat yang pertama sampai ke telefon pengguna . Pada mulanya, SL2T menyokong Bahasa Isyarat Amerika (ASL) ke Bahasa Inggeris dan menguasai ciri dikte isyarat-ke-teks dalam Gboard (untuk menaip, carian, dan pemesejan) dan Live Transcribe (untuk perbualan satu-satu secara tidak formal) pada keluarga Pixel 11
. Pelancaran ini menandakan peralihan dari penyelidikan tulen kepada produk siap, namun ia hadir dengan sempadan dan had yang ditetapkan dengan teliti.
SL2T dilatih menggunakan lebih daripada 100,000 jam video bahasa isyarat yang merangkumi lebih 50 bahasa isyarat, dengan kira-kira satu perempat daripada data tersebut dalam ASL . Dengan melatih secara bersama pelbagai bahasa isyarat, dialek, dan tahap kemahiran, penyelidikan Google mendapati model ini mengatasi sistem bahasa tunggal — ia mempelajari corak struktur yang dikongsi bersama yang meningkatkan generalisasi
. Perlu diberi perhatian, data latihan sengaja tidak termasuk isyarat di bawah 18 tahun, yang mungkin mengurangkan ketepatan untuk pengguna yang lebih muda
.
Sistem ini direka untuk privasi. Kamera telefon menjalankan MediaPipe Holistic, mengekstrak koordinat titik rupa bentuk 2D untuk 130 titik utama (muka, badan, tangan) bingkai demi bingkai. Video kamera mentah kemudiannya dibuang serta-merta dan tidak pernah meninggalkan peranti . Hanya koordinat geometri abstrak ini yang dihantar ke pelayan Google untuk terjemahan, dan tiada log input atau output pengguna disimpan tanpa kebenaran jelas pengguna
. Perwakilan titik rupa bentuk 2D tidak menjejak titik lidah atau menyediakan susunan kedalaman, menjadikannya sukar untuk membezakan antara sentuhan tangan dan isyarat terapung — kedua-duanya penting dalam ASL
.
SL2T menggunakan transformer yang berfungsi terus pada jujukan koordinat titik rupa bentuk dan menjana teks Bahasa Inggeris secara autoregresif. Tidak seperti pendekatan yang lebih awal, ia tidak mengeluarkan glos sementara atau perwakilan linguistik yang dikodkan terlebih dahulu . Model ini menterjemah dan bukannya menyalin — bermakna ia menghasilkan teks Bahasa Inggeris yang semula jadi, bukan pemetaan kata demi kata bagi isyarat ASL.
Pada FLEURS-ASL, set data penilaian sifar-sentuh (zero-shot) bagi bahasa abstrak kompleks yang dirakam dalam keadaan studio oleh Jurubahasa Pekak Bertauliah, SL2T mendapat 70 BLEURT, yang menurut Google jauh melebihi mana-mana keputusan yang dilaporkan sebelum ini . Keputusan penanda aras tambahan termasuk:
Adalah penting untuk ambil perhatian bahawa ini adalah angka yang dilaporkan oleh vendor; tiada penilaian bebas telah diterbitkan setakat tarikh pelancaran.
Google menubuhkan Jawatankuasa Penasihat AI Bahasa Isyarat (AISLAC) luaran, yang merangkumi wakil dari Persatuan Pekak Kebangsaan (NAD), RIT/NTID, DPAN, dan Persekutuan Pekak Sedunia (WFD). AISLAC bersama-sama mengarang Laporan Impak Bersama yang mentakrifkan sempadan operasi dan had model .
SL2T direka dan dinilai secara eksplisit hanya untuk situasi tidak formal dan berisiko rendah seperti dikte teks, pemesejan, pertanyaan carian, dan perbualan satu-satu (contohnya, di kedai kopi atau peruncit). Perbualan berisiko tinggi atau pelbagai pihak dalam tetapan perubatan, guaman, dan akademik adalah di luar skop .
Google menyatakan dalam dokumentasinya bahawa SL2T bukan pengganti untuk perkhidmatan tafsiran profesional dan tidak boleh diharapkan dalam konteks di mana kesilapan komunikasi boleh menyebabkan kemudaratan .
Sam Sepah, seorang pekerja Google yang pekak dan ahli pasukan Bahasa Isyarat, memainkan peranan penting dalam pembangunan SL2T. Beliau adalah pengarang bersama penerbitan set data FSboard yang digunakan dalam penilaian model . Blog Google dan Laporan Impak Bersama menekankan bahawa pasukan bekerja rapat dengan pekerja Google yang pekak — termasuk Sepah — sepanjang ujian pra-keluaran untuk mendedahkan tingkah laku model dan isu antara muka yang tidak dapat ditangkap oleh penanda aras sahaja
.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Google DeepMind melancarkan SL2T (sign language to text), model AI terjemahan bahasa isyarat ke teks yang pertama kali disertakan dalam produk pengguna, iaitu pada keluarga Pixel 11 menerusi Gboard dan Live Transcribe.
Google DeepMind melancarkan SL2T (sign language to text), model AI terjemahan bahasa isyarat ke teks yang pertama kali disertakan dalam produk pengguna, iaitu pada keluarga Pixel 11 menerusi Gboard dan Live Transcribe. SL2T dilatih dengan lebih 100,000 jam video bahasa isyarat merangkumi lebih 50 bahasa, dengan suku daripadanya dalam Bahasa Isyarat Amerika (ASL).
Model ini menggunakan penjejakan titik rupa bentuk pada peranti untuk privasi; hanya koordinat geometri dihantar ke pelayan untuk terjemahan, manakala video mentah terus dipadam.