Gemini 3.8 Live is gericht op schaal, kostenbeheersing, vloeiende gesprekken en visuele context; Extended Thinking is bedoeld voor complexe taken met meerdere stappen. De opvallendste functie is dat Extended Thinking op de achtergrond kan redeneren en asynchrone tools kan aanroepen terwijl de gesproken reactie doorg...
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google heeft Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking geïntroduceerd: twee native audio-naar-audiomodellen voor realtime spraakagenten en live gesprekken. De standaardversie is bedoeld voor grootschalige, kostenefficiënte en vloeiende dialogen met visuele context. Extended Thinking richt zich op moeilijkere taken die achtergrondredeneren en meerdere stappen vereisen. 10
2
De onderscheidende functie zit in Gemini 3.8 Live Extended Thinking. Volgens Google kan dit model op de achtergrond redeneren, plannen en asynchrone tools aanroepen, terwijl het continu audio blijft uitsturen. Als een tool enkele seconden nodig heeft, kan de agent het gesprek dus gaande houden met natuurlijke tussenreacties in plaats van te wachten tot het resultaat volledig binnen is. 1
2
Dat is iets anders dan alleen een snelle beurtwisseling. In Googles opzet kunnen spraakgeneratie, achtergrondplanning en asynchrone toolactiviteit parallel lopen. Een spraakagent zou bijvoorbeeld een vervolgstap kunnen toelichten terwijl hij gegevens ophaalt of een proces met meerdere stappen afwerkt. Of dat ook werkelijk prettiger voelt voor de gebruiker, hangt af van de betrouwbaarheid van de tools, het gespreksontwerp en de vraag of die tussentijdse uitleg inhoudelijk nuttig blijft. 1
2
Google positioneert de gewone Gemini 3.8 Live voor gesprekservaringen met lage vertraging en veel volume, zonder vertraging die door uitgebreider redeneren ontstaat. Het model combineert live dialoog met visuele context, zodat een agent naast het gesprek ook beeldinformatie kan benutten. 10
45
Vertegenwoordigers van Google zeggen dat het model 97 talen ondersteunt en binnen één gesprek van taal kan wisselen. Ontwikkelaars doen er wel verstandig aan om de kwaliteit per taal, accent, regio en toepassing zelf te testen. 16
In berichtgeving rond de lancering worden scores op de Speech-to-Speech Quality Index genoemd van 76,0 voor Gemini 3.8 Live en 82,6 voor Gemini 3.8 Live Extended Thinking. OpenAI's GPT-Live-1 zou in dezelfde vergelijking, met een gemiddelde inspanningsinstelling, op 81,5 uitkomen. 25
Daarmee scoort Extended Thinking het hoogst in deze gerapporteerde vergelijking. Maar die cijfers zijn geen onafhankelijk gecontroleerd eindoordeel over productiekwaliteit. Een spraakagent moet ook goed omgaan met onderbrekingen, accenten en meertaligheid, correcte toolcalls, vertraging bij piekbelasting, veiligheid, monitoring en de totale kosten per succesvol afgehandelde taak. De benchmark is dus één evaluatiesignaal, niet het bewijs dat één platform overal de beste keuze is. 25
Google groepeert beide nieuwe modellen in zijn officiële prijstabel onder de Live API. In het betaalde standaardtarief kost audio-invoer US$ 3,00 per miljoen tokens, of US$ 0,005 per minuut. Audio-uitvoer kost US$ 12,00 per miljoen tokens, of US$ 0,018 per minuut. Tekstinvoer staat op US$ 0,75 per miljoen tokens; tekstuitvoer, inclusief denktokens, op US$ 4,50 per miljoen tokens. 37
Dat onderscheid is belangrijk: prijzen die elders worden genoemd voor Gemini 3.8 Flash gelden niet automatisch voor de Live-modellen. Voor een budgetraming zijn de actuele Live API-prijstabel en modeldocumentatie het uitgangspunt. Test daarnaast echte sessies, want de kosten hangen af van de mix van inkomende en uitgaande audio, visuele context, tekst en gekoppelde tools. 37
Google DeepMind vermeldt beide modellen als algemeen beschikbaar. In de gepubliceerde beschikbaarheidstabel staan voor beide de Gemini-app, Google AI Studio, de Gemini API en het Google Enterprise Agent Platform. Google Search Live staat vermeld voor Extended Thinking; Google Workspace voor Gemini 3.8 Live. 54
Voor ontwikkelaars betekent dit een keuze binnen dezelfde native audio-naar-audiofamilie: een standaardmodel voor directe live dialoog of een model met meer redeneercapaciteit voor complexere taken. Voor organisaties draait de afweging niet alleen om welk model beschikbaar is, maar ook om het productkanaal, datacontroles, regio en integratiemogelijkheden die voor de beoogde inzet gelden. 54
Googles belangrijkste belofte is een geïntegreerdere realtime-stack: gesproken interactie, visuele context, achtergrondredeneren en asynchrone tools binnen één modelfamilie. In theorie vermindert dat de noodzaak om afzonderlijke systemen voor spraakherkenning, een taalmodel, toolorkestratie en spraaksynthese aan elkaar te koppelen. Tegelijk kan het gesprek doorlopen terwijl op achtergrondwerk wordt gewacht. 1
10
GPT-Live-1 van OpenAI blijft een relevante vergelijking, vooral voor teams die volledig duplex gespreksgedrag onderzoeken. Maar de genoemde benchmark is te beperkt om een platformkeuze te beslechten. Een serieuze evaluatie gebruikt representatieve gesprekken en meet onder meer onderbrekingsafhandeling, juistheid van toolcalls, meertalige prestaties, veiligheidsmaatregelen, herstel na fouten, vertraging en kosten per afgerond resultaat. 25
Het beschikbare lanceringsmateriaal legt geen concreet beleid vast voor SynthID-audiowatermerken bij Gemini 3.8 Live of Extended Thinking. Google meldt wel dat SynthID is uitgebreid voor het watermerken en identificeren van tekst die door de Gemini-app en webomgeving is gegenereerd. Dat bevestigt niet dat elke audiostream uit deze Live-modellen van een watermerk is voorzien, en specificeert evenmin de detectie- of uitrolvoorwaarden. 59
Ook integraties en ondersteuning binnen het ecosysteem kunnen snel veranderen. Teams die een productiesysteem plannen, doen er daarom goed aan vóór een architectuurkeuze de actuele modeldocumentatie, prijzen, platformbeschikbaarheid en toepasselijke servicevoorwaarden te controleren. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live is gericht op schaal, kostenbeheersing, vloeiende gesprekken en visuele context; Extended Thinking is bedoeld voor complexe taken met meerdere stappen.
Gemini 3.8 Live is gericht op schaal, kostenbeheersing, vloeiende gesprekken en visuele context; Extended Thinking is bedoeld voor complexe taken met meerdere stappen. De opvallendste functie is dat Extended Thinking op de achtergrond kan redeneren en asynchrone tools kan aanroepen terwijl de gesproken reactie doorgaat.