Google ogłosiło Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS 23 września 2026 r. Oba modele zamieniają tekst na mowę, ale są przeznaczone do innych zadań: Flash TTS daje większy nacisk na kreowanie głosu i reżyserowanie wypowiedzi, a Flash-Lite TTS — na tańsze wytwarzanie dużych ilości audio, na przykład do dubbingu czy agentów głosowych.
4
27
Który model wybrać?
Flash TTS pozwala opisać nowy głos zwykłym językiem — określić rolę postaci, akcent i cechy brzmienia — a następnie wskazać, jak mają zabrzmieć kwestie w scenariuszu. To wybór do projektów, w których ważny jest rozpoznawalny głos postaci i precyzyjna interpretacja tekstu. Flash-Lite TTS Google kieruje do produkcji na dużą skalę, m.in. dubbingu i treści audio. Wersja Lite również pozwala sterować tonem oraz tempem mówienia; różnica dotyczy przede wszystkim zakładanego zastosowania.
4
27
30
Gotowe głosy, języki i replikacja
Google zapowiada ponad 2000 gotowych głosów oraz możliwość tworzenia własnych za pomocą tekstowych poleceń. Można też kierować dialogiem i określać sposób wypowiedzenia poszczególnych kwestii, w tym ton, akcent i tempo.
4
28
29
Firma mówi o tworzeniu głosów w ponad 100 językach i dialektach. Zewnętrzne zestawienia podają bardziej szczegółowe liczby: 130 języków dla Flash TTS i 101 dla Flash-Lite TTS. Nie oznacza to jednak, że każdy głos i każda funkcja działają identycznie we wszystkich językach.
27
17
18
Replikacja głosu to coś innego niż wymyślenie nowego głosu postaci: wykorzystuje próbkę nagrania istniejącego mówcy. Według relacji z premiery wystarcza próbka trwająca około 30 sekund, ale przed odtworzeniem głosu wymagana jest weryfikacja zgody jego właściciela.
22
23 Doniesienia wskazują ponadto, że replikacja głosu w AI Studio nie jest dostępna w Europejskim Obszarze Gospodarczym, do którego należy Polska. Ograniczenie to nie jest równoznaczne z brakiem dostępu do samych modeli TTS.
19
34
Zabezpieczenia i wyniki testów
Google deklaruje weryfikację zgody przy replikacji głosu. Relacje z premiery opisują także SynthID, czyli niewidoczny dla słuchacza znak wodny w generowanym audio, oraz poświadczenia C2PA dla replikowanych głosów. Są to zabezpieczenia, a nie gwarancja wyeliminowania nadużyć.
23
34
Według wyników podawanych przy premierze Flash TTS uzyskał 71,4 punktu i pierwsze miejsce w teście Voice Design Benchmark firmy Hume AI; w innym zestawieniu podano 60,8 punktu za modelowanie akcentu. Google twierdzi też, że Flash TTS i Flash-Lite TTS zajęły dwa czołowe miejsca w Hume AI Overall Quality Index. Wyniki testowe nie przesądzają o jakości głosu w każdym konkretnym zastosowaniu.
19
21
Gdzie modele są udostępniane?
Od 23 września oba modele zaczęły trafiać do Google AI Studio i Gemini API. Dokumentacja API wymienia je wraz z punktem dostępu Voices jako ogólnie dostępne. Google zapowiedziało też Flash TTS w Gemini Notebook i Flash-Lite TTS w Google Vids; dostęp przez Gemini Enterprise określiło jako nadchodzący. Nie należy z tego wyciągać wniosku, że w dniu premiery każda funkcja głosowa działała w każdym z tych produktów.
29
32
Wśród wczesnych integracji wymieniano platformy Agora, LiveKit, Pipecat i Vercel, a także firmy badające zastosowania w dubbingu, lokalizacji lub agentach głosowych, m.in. Figma, HeyGen i Wondercraft. Nie oznacza to jednak jednakowej dostępności modeli we wszystkich tych usługach.
37