Gemini 3.8 Live er laget for skalerbare og kostnadseffektive talesamtaler, mens Gemini 3.8 Live Extended Thinking er beregnet på komplekse oppgaver der modellen kan resonnere og bruke asynkrone verktøy i bakgrunnen me... Det sentrale løftet er ikke bare raskere svar: Google beskriver en agent som kan holde samtalen...
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google har lansert Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking, to innebygde lyd-til-lyd-modeller for stemmeagenter og samtaler i sanntid. Standardmodellen er rettet mot skala, kostnadseffektivitet, flytende dialog og visuell kontekst. Extended Thinking er laget for vanskeligere oppgaver med flere trinn, der det er nyttig å resonnere i bakgrunnen. 10
2
Hovednyheten ligger i Gemini 3.8 Live Extended Thinking. Ifølge Google kan modellen planlegge, resonnere i bakgrunnen og kalle asynkrone verktøy samtidig som den strømmer et muntlig svar. Dersom et verktøy bruker tid, kan den benytte naturlige samtalefyllord i stedet for å sette hele dialogen på vent. 1
2
Dette er dermed mer enn et løfte om rask turveksling. I Googles opplegg kan talegenerering, bakgrunnsplanlegging og asynkrone verktøykall foregå parallelt. En stemmeagent kan for eksempel forklare neste steg mens den venter på data eller arbeider seg gjennom en oppgave i flere ledd. Om det faktisk gir en bedre brukeropplevelse, avhenger likevel av pålitelige verktøy, god dialogutforming og at det som sies underveis er nyttig – ikke bare fyller stillheten. 1
2
Google plasserer Gemini 3.8 Live som valget for samtaletjenester med lav forsinkelse og stort volum, uten ventetid som skyldes resonnering. Modellen kombinerer live-dialog med visuell kontekst, slik at en agent kan bruke det den ser i tillegg til det som blir sagt. 10
45
Google-representanter har også opplyst at modellen støtter 97 språk og kan bytte språk underveis i en samtale. Utviklere bør likevel teste kvalitet, regional tilgjengelighet og ytelse for aktuelle dialekter og bruksområder før utrulling. 16
Lanseringsomtale oppgir en Speech-to-Speech Quality Index på 76,0 for Gemini 3.8 Live og 82,6 for Gemini 3.8 Live Extended Thinking. Til sammenligning oppgis 81,5 for OpenAIs GPT-Live-1 ved «medium effort». 25
Tallene gjør Extended Thinking til modellen med høyest score i denne rapporterte sammenligningen, men de er ikke en uavhengig, fullstendig dom over produksjonskvalitet. En stemmeagent må også fungere ved avbrytelser, aksenter og flerspråklig tale, verktøykall, høy belastning og feil. Sikkerhet, observerbarhet, svartid og samlet kostnad per løste henvendelse teller også. Resultatene er derfor ett evalueringssignal, ikke bevis på at én plattform er best for alle kundesentre eller assistentløsninger. 25
Googles offisielle pristabell fører begge modellene under Live API. På betalt standardnivå er lydinngang oppgitt til 3,00 amerikanske dollar per million token, eller 0,005 dollar per minutt, mens lydutgang er 12,00 dollar per million token, eller 0,018 dollar per minutt. Tekstinngang er oppgitt til 0,75 dollar per million token, og tekstutgang – inkludert tenketoken – til 4,50 dollar per million token. 37
Det er et viktig skille: Tokenpriser som omtales for Gemini 3.8 Flash, er ikke automatisk prisene for Live-modellene. Ved budsjettering bør virksomheter bruke den gjeldende Live API-pristabellen og modelldokumentasjonen, og deretter teste reelle økter. Kostnaden avhenger av blandingen av innkommende og utgående lyd, visuell kontekst, tekst og eventuelle verktøy. 37
Google DeepMind oppgir begge modellene som generelt tilgjengelige. Den publiserte oversikten omfatter Gemini-appen, Google AI Studio, Gemini API og Google Enterprise Agent Platform for begge modellene. Google Search Live er listet for Extended Thinking, mens Google Workspace er listet for Gemini 3.8 Live. 54
For utviklere betyr dette et valg mellom en standardmodell for direkte, rask dialog og en modell med mer omfattende resonnering i samme lyd-til-lyd-familie. For virksomheter er det ikke nok å se at modellen er tilgjengelig: De må også avklare hvilken produktflate, hvilke datakontroller, hvilken region og hvilken integrasjonsvei som gjelder for den planlagte løsningen. 54
Googles konkurransefortrinn er et mer samlet sanntidsoppsett: tale, visuell kontekst, bakgrunnsresonnering og asynkrone verktøy i én modellfamilie. I teorien kan dette redusere behovet for å koble sammen separate systemer for talegjenkjenning, språkmodell, verktøyorientering og talesyntese. Det kan samtidig bevare flyten i samtalen mens arbeid foregår i bakgrunnen. 1
10
OpenAIs GPT-Live-1 er fortsatt en relevant sammenligning, særlig for team som vurderer heldupleks samtaleatferd. Men den rapporterte benchmarksammenligningen er for smal til å avgjøre et plattformvalg. En solid evaluering bør bruke representative samtaler og måle håndtering av avbrytelser, riktighet i verktøykall, flerspråklig ytelse, sikkerhetskontroller, feilretting, forsinkelse og kostnad per fullførte oppgave. 25
Det forelagte lanseringsmaterialet fastslår ikke en konkret policy for SynthID-vannmerking av lyd fra Gemini 3.8 Live eller Extended Thinking. Google sier at SynthID er utvidet til å vannmerke og identifisere tekst generert i Gemini-appen og nettversjonen, men det bekrefter ikke at alle lydstrømmer fra disse Live-modellene vannmerkes. Det beskriver heller ikke vilkår for påvisning eller utrulling. 59
Den samme forsiktigheten gjelder påstander om integrasjoner og økosystemstøtte, som kan endre seg raskt. Team som planlegger produksjonsbruk, bør kontrollere oppdatert modelldokumentasjon, priser, plattformtilgjengelighet og gjeldende tjenestevilkår før de låser en teknisk arkitektur. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live er laget for skalerbare og kostnadseffektive talesamtaler, mens Gemini 3.8 Live Extended Thinking er beregnet på komplekse oppgaver der modellen kan resonnere og bruke asynkrone verktøy i bakgrunnen me...
Gemini 3.8 Live er laget for skalerbare og kostnadseffektive talesamtaler, mens Gemini 3.8 Live Extended Thinking er beregnet på komplekse oppgaver der modellen kan resonnere og bruke asynkrone verktøy i bakgrunnen me... Det sentrale løftet er ikke bare raskere svar: Google beskriver en agent som kan holde samtalen i gang mens den planlegger, venter på eksterne verktøy og behandler resultatene.