Google’ın 23 Eylül 2026’da duyurduğu Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS, metni konuşma sesine dönüştüren iki model. TTS, İngilizce “text-to-speech” ifadesinin kısaltması. Aralarındaki temel fark, hedeflenen iş akışı: Flash TTS yaratıcı kontrolü öne çıkarırken Flash-Lite TTS daha düşük maliyetle yüksek hacimli üretime odaklanıyor.
4
27
Hangi model hangi iş için?
Flash TTS, bir karakterin rolünü, aksanını ve ses özelliklerini günlük dille tarif ederek yeni bir ses tasarlamak; ardından sahnedeki repliklerin nasıl okunacağını yönlendirmek isteyenlere yönelik. Ayırt edici bir ses ve özenle belirlenmiş bir performans gerekiyorsa Google’ın öne çıkardığı seçenek bu.
4
30
Flash-Lite TTS ise çok sayıda dublaj kaydı, sesli içerik veya konuşan dijital asistan üretimi gibi işler için konumlandırılıyor. Bu, seslendirme üzerinde kontrol olmadığı anlamına gelmiyor: Google, ton ve konuşma hızı gibi ayrıntıların bu modelde de yönlendirilebildiğini belirtiyor.
27
30
Ses oluşturma, diller ve taklit
Google, 2.000’den fazla kullanıma hazır sesin yanı sıra metin komutlarıyla yeni ses tasarlama imkânı duyurdu. Karşılıklı konuşmalarda repliklerin tonu, aksanı ve temposu satır satır tarif edilebiliyor.
4
28
29
Şirket, ses oluşturma için 100’den fazla dil ve lehçeden söz ediyor. Üçüncü taraf model listelerinde Flash TTS için 130, Flash-Lite TTS için 101 dil belirtiliyor. Bu sayılar, her sesin ve özelliğin her dilde çalıştığına dair bir garanti olarak okunmamalı.
27
17
18
Yeni bir karakter sesi tasarlamak ile mevcut bir kişinin sesini yeniden oluşturmak farklı işlemler. Lansmana ilişkin haberlerde, ikinci işlem için yaklaşık 30 saniyelik bir referans kaydı ve ses sahibinin izninin doğrulanması gerektiği aktarılıyor.
22
23
Güvenlik önlemleri ve performans iddiaları
Google, ses yeniden oluşturma işleminde izin doğrulaması uyguladığını söylüyor. Lansman haberlerine göre üretilen seslere SynthID filigranı, yeniden oluşturulan seslere ise C2PA içerik kimlik bilgileri ekleniyor. Bunlar koruma önlemleri; olası kötüye kullanımın tamamen önlendiği anlamına gelmiyor.
23
34
Duyurulan test sonuçlarına göre Flash TTS, Hume AI’ın Voice Design Benchmark testinde 71,4 puanla birinci oldu; aksan modellemeye ilişkin bir ölçümde de 60,8 puan aldığı bildirildi. Google, iki modelin Hume AI’ın Overall Quality Index sıralamasında ilk iki sırayı aldığını söylüyor. Bu sonuçlar, modellerin her uygulamada aynı performansı göstereceğine dair bağımsız bir değerlendirme değil.
19
21
Nereden kullanılabilecek?
Google, iki modelin de 23 Eylül’de Google AI Studio ve Gemini API üzerinden kullanıma sunulmaya başladığını açıkladı. API sürüm notlarında TTS modelleri ile seslere erişim sağlayan Voices uç noktası genel kullanıma açık olarak listeleniyor. Şirket, tüketici ürünleri tarafında Flash TTS için Gemini Notebook’u, Flash-Lite TTS için Google Vids’i işaret etti; Gemini Enterprise erişiminin ise yakında geleceğini belirtti. Bu dağıtım takvimi, tüm ses özelliklerinin lansman gününde her üründe bulunduğu anlamına gelmiyor.
29
32
İlk entegrasyon haberlerinde Agora, LiveKit, Pipecat ve Vercel gibi platformlar; dublaj, yerelleştirme veya sesli asistan kullanımını değerlendiren şirketler arasında da Figma, HeyGen ve Wondercraft anılıyor. Bu örnekler ilgi ve entegrasyon çalışmalarını gösteriyor, tüm özelliklerin her platformda hazır olduğunu değil.
37