Gemini 3.8 Live ist auf skalierbare, kosteneffiziente Sprachdialoge ausgelegt. Gemini 3.8 Live Extended Thinking soll komplexe, mehrstufige Aufgaben bearbeiten und dabei weiter sprechen können.
Veröffentlicht vonBearbeitet mit GPT-5.6 TerraBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google hat mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zwei native Audio-zu-Audio-Modelle für Sprachagenten und Live-Dialoge vorgestellt. Das Standardmodell richtet sich an große, kosteneffiziente Anwendungen mit flüssigem Dialog und visuellem Kontext. Die Extended-Thinking-Variante ist für schwierigere, mehrstufige Aufgaben mit Hintergrunddenken vorgesehen. 10
2
Die wichtigste Neuerung betrifft Gemini 3.8 Live Extended Thinking. Nach Angaben von Google kann das Modell im Hintergrund planen und asynchrone Tools aufrufen, während es parallel weiterhin Audioantworten streamt. Bei länger laufenden Tool-Aufrufen kann es mit natürlichen Gesprächsüberleitungen den Dialog aktiv halten, statt die Unterhaltung bis zum Ergebnis vollständig anzuhalten. 1
2
Damit meint „gleichzeitiges Denken“ mehr als schnelle Sprecherwechsel: Sprachausgabe, Planung im Hintergrund und asynchrone Tool-Aktivitäten können parallel ablaufen. Ein Sprachagent könnte also den nächsten Schritt erläutern, während er auf Daten wartet oder einen mehrstufigen Vorgang bearbeitet. Ob das in der Praxis überzeugend wirkt, hängt aber von zuverlässigen Tools, einer guten Dialoggestaltung und dem tatsächlichen Informationsgehalt der gesprochenen Überbrückung ab. 1
2
Google positioniert Gemini 3.8 Live als Variante für latenzarme, volumenstarke Gesprächsanwendungen ohne durch Reasoning verursachte Verzögerungen. Das Modell kombiniert Live-Dialoge mit visueller Kontextverarbeitung: Ein Agent kann damit Bildinformationen neben dem gesprochenen Gespräch berücksichtigen. 10
45
Ein Google-Vertreter erklärte zudem, das Modell unterstütze 97 Sprachen und könne innerhalb eines Gesprächs zwischen Sprachen wechseln. Für konkrete Einsätze sollten Entwickler jedoch Qualität, regionale Verfügbarkeit und Leistung für die jeweiligen Akzente und Anwendungsfälle selbst prüfen. 16
In der Berichterstattung zum Start wurden Werte im Speech-to-Speech Quality Index von 76,0 für Gemini 3.8 Live und 82,6 für Gemini 3.8 Live Extended Thinking genannt. OpenAIs GPT-Live-1 kam in diesem Vergleich mit mittlerem Reasoning-Aufwand auf 81,5. 25
Extended Thinking liegt in dieser gemeldeten Gegenüberstellung damit vorn. Die Werte sind jedoch kein unabhängig geprüfter Gesamtbeweis für die beste Produktionsqualität. Bei einem echten Sprachagenten zählen auch Unterbrechungen, mehrsprachige und akzentgefärbte Sprache, korrekte Tool-Ergebnisse, Latenz unter Last, Sicherheitsmechanismen, Beobachtbarkeit und die Gesamtkosten pro erfolgreich gelöstem Anliegen. Der Benchmark ist ein Signal – kein allgemeingültiges Urteil. 25
Google führt beide neuen Modelle in der Preistabelle der Live API. In der kostenpflichtigen Standardstufe kostet Audioeingabe 3,00 US-Dollar pro Million Tokens beziehungsweise 0,005 US-Dollar pro Minute; Audioausgabe kostet 12,00 US-Dollar pro Million Tokens beziehungsweise 0,018 US-Dollar pro Minute. Texteingaben sind mit 0,75 US-Dollar pro Million Tokens angesetzt, Textausgaben einschließlich Thinking-Tokens mit 4,50 US-Dollar. 37
Wichtig für die Kalkulation: Preise anderer Gemini-Modelle, etwa Gemini 3.8 Flash, gelten nicht automatisch für die Live-Modelle. Unternehmen sollten die aktuelle Live-API-Preistabelle und Modelldokumentation heranziehen und reale Sitzungen testen. Die Kosten eines Sprachagenten hängen von der Mischung aus Audioein- und -ausgabe, visuellem Kontext, Text sowie verwendeten Tools ab. 37
Google DeepMind führt beide Modelle als allgemein verfügbar. In der veröffentlichten Übersicht sind für beide die Gemini-App, Google AI Studio, die Gemini API und die Google Enterprise Agent Platform aufgeführt. Für Extended Thinking nennt Google außerdem Google Search Live, für Gemini 3.8 Live Google Workspace. 54
Für Entwickler ergibt sich damit eine Wahl innerhalb derselben nativen Audio-zu-Audio-Familie: ein Modell für besonders flüssige Live-Dialoge und eines für höhere Reasoning-Anforderungen. Für Unternehmen reicht die grundsätzliche Verfügbarkeit allerdings nicht aus. Entscheidend sind auch Produktoberfläche, Datenkontrollen, Region und Integrationsweg der geplanten Implementierung. 54
Googles Wettbewerbsversprechen liegt in einem stärker integrierten Echtzeit-Stack: Sprachinteraktion, visueller Kontext, Hintergrunddenken und asynchrone Tools in einer Modellfamilie. Im Idealfall reduziert das den Aufwand, getrennte Systeme für Spracherkennung, Textmodell, Tool-Orchestrierung und Sprachsynthese miteinander zu verbinden – und hält den Dialog aufrecht, während im Hintergrund gearbeitet wird. 1
10
GPT-Live-1 von OpenAI bleibt ein relevanter Vergleichspunkt, insbesondere für Teams, die bidirektionale Gesprächsabläufe bewerten. Der genannte Benchmarkvergleich ist aber zu eng, um eine Plattformentscheidung zu treffen. Eine belastbare Evaluation sollte repräsentative Gespräche abbilden und Unterbrechungen, Tool-Korrektheit, Mehrsprachigkeit, Sicherheitskontrollen, Fehlerbehandlung, Latenz und Kosten pro erledigter Aufgabe messen. 25
Aus den vorliegenden Startmaterialien lässt sich keine konkrete SynthID-Richtlinie zur Audio-Wasserzeichenkennzeichnung für Gemini 3.8 Live oder Extended Thinking ableiten. Google erklärt zwar, SynthID sei auf die Kennzeichnung und Erkennung von Text ausgeweitet worden, der durch die Gemini-App und das Web-Erlebnis erzeugt wird. Daraus folgt jedoch nicht, dass jeder Audiostream dieser Live-Modelle markiert ist oder unter welchen Bedingungen eine Erkennung möglich wäre. 59
Auch Integrationen und Plattformunterstützung können sich schnell ändern. Wer eine produktive Architektur plant, sollte vor einer Festlegung die aktuelle Modelldokumentation, Preise, Plattformverfügbarkeit und geltenden Nutzungsbedingungen prüfen. 37
54
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Gemini 3.8 Live ist auf skalierbare, kosteneffiziente Sprachdialoge ausgelegt. Gemini 3.8 Live Extended Thinking soll komplexe, mehrstufige Aufgaben bearbeiten und dabei weiter sprechen können.
Gemini 3.8 Live ist auf skalierbare, kosteneffiziente Sprachdialoge ausgelegt. Gemini 3.8 Live Extended Thinking soll komplexe, mehrstufige Aufgaben bearbeiten und dabei weiter sprechen können. Der entscheidende Punkt ist nicht nur eine kurze Reaktionszeit: Extended Thinking kann laut Google im Hintergrund planen und asynchrone Tools aufrufen, während die Audioantwort weitergestreamt wird.