Google представила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS 23 сентября 2026 года. Обе модели превращают текст в речь, но рассчитаны на разные задачи: Flash TTS — на выразительные голоса и детальную режиссуру звучания, Flash-Lite TTS — на массовый выпуск аудио с меньшими затратами, в том числе для дубляжа и голосовых агентов. TTS означает text-to-speech, то есть синтез речи по тексту.
4
27
Какую модель выбрать?
Flash TTS подойдёт, когда важно придумать узнаваемый голос персонажа и точно задать манеру исполнения. По описанию Google, голос можно создать с нуля, указав обычными словами роль персонажа, акцент и особенности звучания, а затем дать указания по подаче реплик.
4
30
Flash-Lite TTS Google позиционирует как вариант для больших объёмов: дубляжа, аудиоконтента и голосовых агентов. При этом «Lite» не означает монотонную речь — компания также заявляет для модели управление интонацией и темпом.
27
30
Голоса, языки и управление речью
Google объявила о библиотеке из более чем 2000 готовых голосов. Помимо выбора голоса, можно создавать свой по текстовому описанию, задавать звучание диалога и уточнять подачу каждой реплики — например, её тон, акцент или темп.
4
28
29
Компания говорит о создании голосов для более чем 100 языков и диалектов. Сторонние каталоги приводят отдельные показатели: 130 языков для Flash TTS и 101 для Flash-Lite TTS. Эти цифры не следует понимать как обещание, что каждый голос и каждая функция работают на каждом из перечисленных языков.
27
17
18
Создание нового голоса и копирование голоса существующего человека — разные возможности. Согласно сообщениям о запуске, для копирования нужен образец записи длительностью около 30 секунд, а также проверка согласия владельца голоса.
22
23
Что известно о защите и результатах тестов?
Google заявляет о проверке согласия при копировании голоса. В публикациях о запуске также говорится о невидимой аудиометке SynthID на сгенерированных записях и метаданных C2PA, подтверждающих происхождение скопированных голосов. Это меры защиты, а не гарантия того, что злоупотребления исключены.
23
34
По данным, опубликованным при запуске, Flash TTS набрала 71,4 балла и заняла первое место в тесте Voice Design Benchmark компании Hume AI; в другой публикации указан результат 60,8 балла в оценке моделирования акцентов. Google также заявила, что Flash TTS и Flash-Lite TTS заняли две верхние строчки в Hume AI Overall Quality Index. Это заявленные результаты тестирования, а не независимая оценка того, как модели справятся с конкретным проектом.
19
21
Где доступны модели?
По сообщению Google, 23 сентября обе модели начали появляться в Google AI Studio и Gemini API — инструментах для разработчиков. В примечаниях к выпуску API модели TTS и интерфейс Voices указаны как общедоступные. Для пользовательских продуктов компания назвала Flash TTS в Gemini Notebook и Flash-Lite TTS в Google Vids; доступ через Gemini Enterprise был обещан позднее. Это не означает, что на старте каждая голосовая функция работала во всех перечисленных продуктах.
29
32
Среди ранних интеграций в публикациях назывались платформы Agora, LiveKit, Pipecat и Vercel, а также компании Figma, HeyGen и Wondercraft, изучающие применение моделей для дубляжа, локализации или голосовых агентов. Упоминание этих проектов не означает одинаковую доступность функций во всех интеграциях.
37