Wer eine unverwechselbare Figur vertonen will, braucht etwas anderes als ein Team, das große Mengen Audiomaterial produziert. Genau entlang dieser Trennlinie positioniert Google die am 23. September 2026 angekündigten Text-zu-Sprache-Modelle Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS. TTS steht für „Text to Speech“, also die Umwandlung von geschriebenem Text in gesprochene Sprache.
4
27
Flash oder Flash-Lite: Wo liegt der Unterschied?
Flash TTS ist die Option für detaillierte Stimmgestaltung. Laut Google lässt sich eine neue Stimme durch eine Beschreibung ihrer Rolle, ihres Akzents und ihrer stimmlichen Eigenschaften entwerfen. Auch die Darbietung einer Szene kann gezielt vorgegeben werden. Das ist vor allem dann interessant, wenn Charakter und Sprechweise entscheidend sind.
4
30
Flash-Lite TTS ist auf kostengünstige Produktion in großen Mengen ausgelegt – etwa für Synchronisation, Audioinhalte und sprachbasierte Assistenten. „Lite“ bedeutet dabei nicht, dass die Ausgabe zwangsläufig monoton sein muss: Google nennt auch für dieses Modell Steuerungsmöglichkeiten für Tonfall, Tempo und Ausdruck.
27
30
Neue Stimmen entwerfen – oder vorhandene replizieren
Google spricht von mehr als 2.000 sofort nutzbaren Stimmen. Zusätzlich lassen sich Stimmen anhand natürlich formulierter Anweisungen neu gestalten. Für Dialoge können Anwenderinnen und Anwender laut Google festlegen, wie einzelne Zeilen klingen sollen, etwa mit Vorgaben zu Tonfall, Akzent und Sprechtempo.
4
28
29
Bei der Sprachabdeckung nennt Google mehr als 100 Sprachen und Dialekte. Modellübersichten Dritter beziffern sie genauer auf 130 Sprachen für Flash TTS und 101 für Flash-Lite TTS. Diese Angaben sind keine Zusage, dass jede Stimme und jede Funktion in jeder genannten Sprache verfügbar ist.
27
17
18
Eine Stimme neu zu entwerfen ist nicht dasselbe, wie die Stimme einer realen Person zu replizieren. Für Letzteres beschreiben Berichte zum Start eine Referenzaufnahme von ungefähr 30 Sekunden und eine Prüfung der Einwilligung der betroffenen Person.
22
23
Welche Schutzmaßnahmen nennt Google?
Google zufolge gehört zur Stimmreplikation eine Einwilligungsprüfung. Startberichte nennen außerdem SynthID-Wasserzeichen in erzeugten Audiodateien und C2PA-Herkunftsnachweise für replizierte Stimmen. Das sind Schutzmaßnahmen, keine Garantie gegen jeden Missbrauch.
23
34
Für Leserinnen und Leser im deutschsprachigen Raum ist eine Einschränkung wichtig: Laut einem Bericht zum Start war die Stimmreplikation über Google AI Studio im Europäischen Wirtschaftsraum nicht verfügbar. Daraus lässt sich nicht pauschal die Verfügbarkeit aller anderen Stimmfunktionen oder Zugangswege ableiten.
19
Was sagen die Leistungstests aus?
Nach den zum Start veröffentlichten Ergebnissen erreichte Flash TTS 71,4 Punkte und Platz eins im Voice Design Benchmark von Hume AI. Ein weiterer Bericht nennt 60,8 Punkte bei einem Test zur Akzentmodellierung. Google erklärte zudem, Flash TTS und Flash-Lite TTS hätten die ersten beiden Plätze im Overall Quality Index von Hume AI belegt. Das sind berichtete Testergebnisse – keine unabhängige Aussage darüber, wie gut ein Modell im konkreten Einsatz funktioniert.
19
21
Wo sind die Modelle verfügbar?
Google kündigte an, beide Modelle ab dem 23. September 2026 in Google AI Studio und über die Gemini API bereitzustellen. In den Versionshinweisen zur API sind die TTS-Modelle und ein Voices-Endpunkt als allgemein verfügbar aufgeführt. Für Google-Produkte nannte das Unternehmen Flash TTS in Gemini Notebook und Flash-Lite TTS in Google Vids; der Zugang über Gemini Enterprise wurde als „demnächst“ angekündigt. Der Start in einem Produkt bedeutet nicht automatisch, dass dort sofort jede Stimmfunktion nutzbar ist.
29
32
Frühe Berichte nennen zudem Integrationen durch Plattformen wie Agora, LiveKit, Pipecat und Vercel sowie Unternehmen wie Figma, HeyGen und Wondercraft, die Anwendungen für Synchronisation, Lokalisierung oder Sprachassistenten verfolgen. Das zeigt Interesse an den Modellen, belegt aber keine einheitliche Verfügbarkeit über alle Integrationen hinweg.
37