Google mengumumkan Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS pada 23 September 2026. Keduanya mengubah teks menjadi ucapan, tetapi ditujukan untuk kebutuhan produksi yang berbeda: Flash TTS mengutamakan perancangan karakter suara dan arahan kreatif, sedangkan Flash-Lite TTS dirancang untuk menghasilkan audio dalam jumlah besar dengan biaya lebih efisien.
4
27
Mana yang lebih cocok?
Pilih Flash TTS jika kekhasan suara menjadi prioritas. Menurut Google, pengguna dapat membuat suara baru dengan mendeskripsikan peran, aksen, dan karakter vokalnya dalam bahasa sehari-hari, lalu memberi arahan pengucapan untuk adegan bernaskah. Ini cocok untuk pekerjaan yang membutuhkan identitas suara dan penyampaian dialog yang spesifik.
4
30
Pertimbangkan Flash-Lite TTS untuk pekerjaan berskala besar, seperti sulih suara, produksi konten audio, atau agen suara. Fokus pada efisiensi tidak berarti hasilnya harus monoton: Google mengatakan model ini tetap memberi kendali atas nada, tempo, dan nuansa pengucapan.
27
30
Pilihan suara, bahasa, dan kendali dialog
Google menyebut tersedia lebih dari 2.000 suara siap pakai, selain kemampuan merancang suara baru lewat perintah teks. Pengguna juga dapat mengarahkan percakapan bolak-balik dan menentukan cara tiap baris disampaikan, termasuk nada, aksen, serta tempo.
4
28
29
Google menyatakan pembuatan suara mencakup lebih dari 100 bahasa dan dialek. Daftar model dari pihak ketiga mencantumkan angka yang lebih spesifik, yakni 130 bahasa untuk Flash TTS dan 101 untuk Flash-Lite TTS. Angka cakupan tersebut bukan jaminan bahwa setiap suara atau fitur tersedia dalam setiap bahasa.
27
17
18
Membuat karakter suara baru berbeda dari mereplikasi suara seseorang. Replikasi menggunakan rekaman pembicara yang sudah ada. Laporan peluncuran menyebut sampel acuan sekitar 30 detik dan pemeriksaan persetujuan sebelum suara direplikasi.
22
23
Bagaimana dengan pengamanannya?
Google mengatakan replikasi suara dilengkapi verifikasi persetujuan. Laporan peluncuran juga menyebut penanda audio SynthID pada hasil yang dibuat model dan kredensial C2PA untuk suara hasil replikasi. Keduanya merupakan langkah pengamanan, bukan jaminan bahwa seluruh potensi penyalahgunaan telah hilang.
23
34
Klaim performa dan ketersediaan
Dalam hasil pengujian yang dilaporkan saat peluncuran, Flash TTS meraih skor 71,4 dan peringkat pertama pada Voice Design Benchmark milik Hume AI. Laporan lain mencantumkan skor 60,8 untuk pengujian pemodelan aksen. Google juga mengatakan Flash TTS dan Flash-Lite TTS menempati dua posisi teratas pada Overall Quality Index Hume AI. Hasil pengujian ini tidak otomatis menggambarkan kinerja keduanya untuk setiap penggunaan.
19
21
Mulai 23 September, kedua model diluncurkan melalui Google AI Studio dan Gemini API. Catatan rilis API Google mencantumkan model TTS tersebut serta Voices endpoint sebagai tersedia secara umum. Untuk produk pengguna, Google menyebut Flash TTS di Gemini Notebook dan Flash-Lite TTS di Google Vids, sementara akses melalui Gemini Enterprise dijanjikan menyusul. Peluncuran di suatu produk tidak berarti seluruh fitur suara tersedia di produk itu sejak hari pertama.
29
32
Laporan awal juga menyebut Agora, LiveKit, Pipecat, dan Vercel sebagai platform yang mengintegrasikan teknologi ini, serta Figma, HeyGen, dan Wondercraft sebagai contoh perusahaan yang menjajaki penggunaannya untuk sulih suara, lokalisasi, atau agen suara. Itu menunjukkan minat awal, bukan ketersediaan fitur yang seragam di semua integrasi.
37