Google представила Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS 23 вересня 2026 року. Обидві моделі перетворюють текст на мовлення, але розраховані на різні завдання: Flash TTS — на виразні персонажні голоси й детальну режисуру озвучення, Flash-Lite TTS — на економніше виробництво великих обсягів аудіо, зокрема для дубляжу та голосових агентів.
4
27
Яку модель обрати?
Flash TTS підійде, коли важливо, як саме звучить персонаж або репліка. За описом Google, голос можна створити за текстовим запитом — вказати роль, акцент і голосові особливості, а потім керувати подачею в сценарії.
4
30
Flash-Lite TTS Google позиціонує для масштабних завдань: дубляжу, створення аудіоконтенту та роботи голосових агентів. Орієнтація на нижчу вартість і більший обсяг не означає, що модель обмежена монотонним читанням: для неї також заявлено керування тоном і темпом.
27
30
Голоси, мови та керування озвученням
Google повідомила про понад 2 000 готових голосів. Також можна створювати власні голоси за описом, задавати діалог між співрозмовниками й уточнювати звучання окремих реплік — зокрема тон, акцент і темп.
4
28
29
Компанія говорить про створення голосів понад 100 мовами й діалектами. Сторонні каталоги моделей наводять точніші числа: 130 мов для Flash TTS і 101 для Flash-Lite TTS. Це показники заявленого охоплення, а не гарантія, що кожен голос і кожна функція працюють усіма переліченими мовами.
27
17
18
Створити новий голос і відтворити голос наявного мовця — різні функції. Для відтворення використовується зразок запису: у повідомленнях про запуск ідеться приблизно про 30 секунд аудіо та перевірку згоди власника голосу.
22
23
Які є запобіжники і що показали тести?
За словами Google, відтворення голосу передбачає перевірку згоди. У повідомленнях про запуск також зазначено, що згенероване аудіо має цифрове маркування SynthID, а відтворені голоси — облікові дані походження контенту за стандартом C2PA. Це захисні механізми, але не підстава вважати, що ризик зловживань зник повністю.
23
34
За оприлюдненими під час запуску результатами, Flash TTS набрала 71,4 бала й посіла перше місце в тесті Voice Design Benchmark від Hume AI. Інше повідомлення наводить 60,8 бала в оцінюванні моделювання акценту. Google також заявила, що Flash TTS і Flash-Lite TTS посіли два перші місця в загальному індексі якості Hume AI. Це оприлюднені результати тестів, а не незалежна оцінка роботи моделей у конкретному продукті.
19
21
Де доступні моделі?
Google повідомила, що 23 вересня почала розгортати обидві моделі в Google AI Studio та Gemini API. У примітках до випуску API моделі TTS і окрему точку доступу Voices позначено як загальнодоступні. Для користувацьких продуктів компанія назвала Flash TTS у Gemini Notebook і Flash-Lite TTS у Google Vids; доступ через Gemini Enterprise вона анонсувала на майбутнє. Це не означає, що на старті кожна голосова функція була доступна в кожному з цих продуктів.
29
32
Серед платформ, про ранню інтеграцію яких повідомляли, — Agora, LiveKit, Pipecat і Vercel. Також згадували Figma, HeyGen і Wondercraft у контексті дубляжу, локалізації та голосових агентів. Ці приклади свідчать про інтерес розробників, але не підтверджують однакову доступність функцій у всіх інтеграціях.
37