Google memperkenalkan Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS pada 23 September 2026. Kedua-duanya menukar teks menjadi audio pertuturan, tetapi ditujukan kepada keperluan yang berbeza: Flash TTS untuk membentuk suara watak dan mengarah cara dialog disampaikan, Flash-Lite TTS pula untuk menghasilkan audio dalam jumlah besar dengan kos lebih rendah. TTS ialah singkatan bagi text-to-speech, atau penukaran teks kepada pertuturan.
4
27
Model mana sesuai untuk kerja anda?
Pilih Flash TTS apabila identiti suara dan cara penyampaian penting. Menurut Google, pengguna boleh menerangkan peranan, loghat dan ciri vokal dalam bahasa biasa untuk mereka suara baharu, kemudian memberikan arahan persembahan bagi adegan berskrip. Ini menjadikannya pilihan yang lebih sesuai untuk suara watak yang tersendiri dan dialog yang memerlukan arahan terperinci.
4
30
Pilih Flash-Lite TTS apabila jumlah penghasilan dan kos menjadi pertimbangan utama. Google menyasarkannya kepada kerja seperti alih suara berskala besar, penciptaan kandungan audio dan ejen suara. Model ini masih menawarkan kawalan terhadap nada serta rentak pertuturan; nama “Lite” tidak bermakna suaranya hanya boleh dibaca tanpa ekspresi.
27
30
Pilihan suara, bahasa dan kawalan dialog
Google menyatakan pengguna boleh memilih daripada lebih 2,000 suara sedia guna atau mencipta suara tersuai melalui arahan teks. Mereka juga boleh mengarah dialog berbalas dan menetapkan cara setiap baris disampaikan, termasuk nada, loghat dan rentaknya.
4
28
29
Google menggambarkan penciptaan suara sebagai merangkumi lebih 100 bahasa dan dialek. Senarai model pihak ketiga memberikan angka lebih khusus, iaitu 130 bahasa untuk Flash TTS dan 101 untuk Flash-Lite TTS. Angka liputan itu tidak semestinya bermaksud setiap suara atau ciri berfungsi dalam semua bahasa yang disenaraikan.
27
17
18
Mencipta suara watak baharu tidak sama dengan meniru suara orang yang sudah wujud. Bagi peniruan suara, laporan pelancaran menerangkan penggunaan sampel rujukan kira-kira 30 saat serta semakan persetujuan sebelum suara tersebut boleh ditiru.
22
23
Bagaimana pula dengan keselamatan dan prestasi?
Google menyatakan peniruan suara disertakan pengesahan persetujuan. Laporan pelancaran turut menyebut tera air SynthID pada audio yang dijana dan kelayakan kandungan C2PA untuk suara yang ditiru. Ini ialah langkah perlindungan, bukannya jaminan bahawa semua bentuk penyalahgunaan dapat dihapuskan.
23
34
Dalam keputusan yang dilaporkan ketika pelancaran, Flash TTS mendapat 71.4 mata dan tempat pertama dalam Voice Design Benchmark Hume AI; satu lagi laporan menyenaraikan 60.8 mata bagi ukuran pemodelan loghat. Google turut menyatakan Flash TTS dan Flash-Lite TTS menduduki dua tempat teratas dalam Overall Quality Index Hume AI. Angka penanda aras ini ialah keputusan yang dilaporkan, bukan jaminan prestasi untuk setiap kegunaan sebenar.
19
21
Di mana kedua-duanya boleh digunakan?
Google menyatakan pelancaran kedua-dua model bermula pada 23 September melalui Google AI Studio dan Gemini API, iaitu saluran untuk pembangun mencuba model dan menghubungkannya dengan aplikasi. Nota keluaran API Google menyenaraikan model TTS tersebut dan Voices endpoint sebagai tersedia secara umum. Bagi produk pengguna, Google menetapkan Flash TTS untuk Gemini Notebook dan Flash-Lite TTS untuk Google Vids; akses melalui Gemini Enterprise pula dinyatakan sebagai akan datang. Pelancaran dalam sesuatu produk tidak bermaksud semua ciri suara tersedia di situ sejak hari pertama.
29
32
Laporan integrasi awal menamakan platform seperti Agora, LiveKit, Pipecat dan Vercel, serta syarikat termasuk Figma, HeyGen dan Wondercraft yang meneroka kegunaan alih suara, penyesuaian kandungan mengikut bahasa atau ejen suara. Contoh ini menunjukkan minat awal pembangun, bukan ketersediaan ciri yang seragam pada semua integrasi.
37