Gemini 3.8 Live er rettet mod dialog med lav forsinkelse, stor skala og omkostningseffektivitet, mens Extended Thinking er lavet til komplekse opgaver med flere trin. Med Extended Thinking kan en agent ifølge Google fortsætte med at tale, mens den planlægger, afventer værktøjskald og behandler resultater i baggrunden.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google har lanceret Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking – to indbyggede lyd-til-lyd-modeller til stemmeagenter og samtaler i realtid. Standardmodellen er målrettet skala, pris, flydende dialog og visuel kontekst, mens Extended Thinking er tiltænkt sværere opgaver i flere trin, hvor baggrundsbaseret ræsonnement kan være en fordel. 10
2
Det særlige ved Gemini 3.8 Live Extended Thinking er, at modellen ifølge Google kan ræsonnere i baggrunden, planlægge og kalde asynkrone værktøjer, samtidig med at den fortsat streamer et mundtligt svar. Den kan bruge naturlige samtalefyldere, mens et værktøj med længere svartid kører, frem for at sætte hele dialogen på pause, indtil svaret er klar. 1
2
Det er mere end hurtige skift mellem spørgsmål og svar. I Googles model kan talegenerering, planlægning i baggrunden og asynkrone værktøjskald køre parallelt. En stemmeagent kan dermed fortsætte med at forklare næste skridt, mens den venter på data eller arbejder sig gennem en opgave med flere led. Om oplevelsen faktisk bliver bedre, afhænger dog af værktøjernes pålidelighed, dialogdesignet og af, om det sagte indhold er nyttigt frem for blot at udfylde stilheden. 1
2
Google placerer Gemini 3.8 Live som modellen til samtaleoplevelser med lavere forsinkelse og høj volumen, uden de forsinkelser som ræsonnement kan medføre. Den kombinerer live-dialog med visuel kontekst, så en agent kan inddrage det visuelle, mens samtalen foregår. 10
45
Google-repræsentanter har desuden oplyst, at modellen understøtter 97 sprog og kan skifte sprog under en samtale. Udviklere bør alligevel afprøve kvalitet, regional tilgængelighed og ydeevne for de konkrete accenter og anvendelser, de bygger til. 16
I omtalen af lanceringen blev der rapporteret resultater på Speech-to-Speech Quality Index på 76,0 for Gemini 3.8 Live og 82,6 for Gemini 3.8 Live Extended Thinking. Til sammenligning fik OpenAI's GPT-Live-1 81,5 med medium indsats. 25
I den rapporterede sammenligning ligger Extended Thinking altså højest, men tallene bør ikke læses som et uafhængigt, samlet kvalitetsstempel. En stemmeagent i drift skal også kunne håndtere afbrydelser, tale med forskellige accenter og sprog, præcise værktøjskald, belastning, sikkerhed, overvågning og den samlede pris for en løst opgave. Resultaterne er ét evalueringssignal – ikke bevis for, at ét system er bedst i alle kontaktcenter- eller assistentscenarier. 25
Googles officielle prisside samler begge nye modeller under Live API. På den betalte standardtakst står lydinput til 3,00 dollar pr. million tokens eller 0,005 dollar pr. minut, mens lydoutput koster 12,00 dollar pr. million tokens eller 0,018 dollar pr. minut. Tekstinput er angivet til 0,75 dollar pr. million tokens, og tekstoutput – inklusive thinking-tokens – til 4,50 dollar pr. million tokens. 37
Det er en vigtig skelnen: Tokenpriser, der oplyses andre steder for Gemini 3.8 Flash, gælder ikke automatisk for Live-modellerne. Ved budgettering bør teams bruge den aktuelle Live API-pristabel og modeldokumentation og derefter teste realistiske sessioner. Udgiften afhænger af blandingen af lyd ind og ud, visuel kontekst, tekst og tilknyttede værktøjer. 37
Google DeepMind angiver begge modeller som generelt tilgængelige. Den offentliggjorte oversigt omfatter Gemini-appen, Google AI Studio, Gemini API og Google Enterprise Agent Platform for begge modeller. Google Search Live er angivet for Extended Thinking, mens Google Workspace er angivet for Gemini 3.8 Live. 54
For udviklere betyder det et valg mellem en standardmodel til live-dialog og en model med mere ræsonnement i samme lyd-til-lyd-familie. For virksomheder er spørgsmålet ikke kun, hvilken model der er tilgængelig, men også hvilken platform, datakontrol, geografisk region og integrationsvej der gælder for den planlagte løsning. 54
Googles hovedbudskab er en mere samlet stak til realtidsinteraktion: tale, visuel kontekst, baggrundsræsonnement og asynkrone værktøjer i én modelfamilie. I princippet kan det mindske behovet for at sy separate løsninger sammen til talegenkendelse, sprogmodel, værktøjsorkestrering og talesyntese – og samtidig bevare samtalens flow, mens arbejdet foregår. 1
10
OpenAI's GPT-Live-1 er fortsat en relevant sammenligning, især for teams, der vurderer fuld-dupleks samtaleadfærd. Den nævnte benchmark er imidlertid for snæver til at afgøre et platformvalg. En seriøs evaluering bør bygge på repræsentative samtaler og måle håndtering af afbrydelser, korrekte værktøjskald, flersproget ydeevne, sikkerhedskontroller, genopretning efter fejl, forsinkelse og pris pr. gennemført opgave. 25
Det fremlagte lanceringsmateriale dokumenterer ikke en præcis politik for SynthID-vandmærkning af lyd fra Gemini 3.8 Live eller Extended Thinking. Google oplyser, at SynthID er udvidet til vandmærkning og identifikation af tekst, der er genereret i Gemini-appen og på weboplevelsen. Det bekræfter hverken, at alle lydstrømme fra Live-modellerne får vandmærke, eller hvordan registrering og udrulning fungerer. 59
Den samme forsigtighed gælder integrations- og partneroplysninger, som kan ændre sig hurtigt. Teams, der planlægger en løsning i produktion, bør kontrollere den aktuelle modeldokumentation, priser, platformtilgængelighed og gældende servicevilkår, før de låser sig fast på en arkitektur. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live er rettet mod dialog med lav forsinkelse, stor skala og omkostningseffektivitet, mens Extended Thinking er lavet til komplekse opgaver med flere trin.
Gemini 3.8 Live er rettet mod dialog med lav forsinkelse, stor skala og omkostningseffektivitet, mens Extended Thinking er lavet til komplekse opgaver med flere trin. Med Extended Thinking kan en agent ifølge Google fortsætte med at tale, mens den planlægger, afventer værktøjskald og behandler resultater i baggrunden.