Gemini 3.8 Live är inriktad på skalbarhet, kostnadseffektivitet och flytande röstdialog, medan Extended Thinking är gjord för mer komplexa uppgifter i flera steg. Den stora förändringen är att Extended Thinking enligt Google kan fortsätta tala medan den planerar, resonerar och väntar på asynkrona verktyg.
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google har presenterat Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking, två inbyggda ljud-till-ljud-modeller för röstagenter och direkta samtal. Standardmodellen är avsedd för skalbara och kostnadseffektiva dialoger med visuellt sammanhang, medan Extended Thinking riktar sig till svårare uppgifter i flera steg som kräver mer resonemang i bakgrunden. 10
2
Det utmärkande för Gemini 3.8 Live Extended Thinking är enligt Google att modellen kan planera och anropa asynkrona verktyg i bakgrunden medan den samtidigt strömmar ett talat svar. Den kan använda naturliga utfyllnader i dialogen medan ett verktyg med längre svarstid arbetar, i stället för att låta användaren vänta i tystnad. 1
2
Det handlar alltså inte bara om kortare svarstider. I Googles upplägg kan talgenerering, bakgrundsplanering och asynkront verktygsarbete ske parallellt. En röstagent kan därmed fortsätta förklara nästa steg medan den inväntar data eller arbetar igenom en process med flera led. Hur bra det fungerar i praktiken beror dock på bland annat verktygens tillförlitlighet och hur agentens dialog är utformad. 1
2
Google beskriver vanliga Gemini 3.8 Live som alternativet för hög volym och låg fördröjning, utan de väntetider som mer omfattande resonemang kan föra med sig. Modellen kombinerar löpande dialog med visuellt sammanhang, så att en agent kan använda bild- eller videoinformation tillsammans med samtalet. 10
45
Googleföreträdare uppger också att modellen stöder 97 språk och kan växla språk mitt i ett samtal. Utvecklare bör ändå utvärdera språkstöd, regional tillgänglighet och resultat för de accenter och användningsfall som är relevanta för den egna tjänsten. 16
I lanseringsbevakning rapporteras resultat på Speech-to-Speech Quality Index på 76,0 för Gemini 3.8 Live och 82,6 för Gemini 3.8 Live Extended Thinking. Som jämförelse fick OpenAI:s GPT-Live-1 81,5 med medelhög ansträngningsnivå. 25
I den rapporterade jämförelsen placerar det Extended Thinking över de andra två, men siffrorna är inte ett oberoende granskat omdöme om total produktionskvalitet. En röstagent måste också klara av avbrott, olika språk och accenter, korrekta verktygsanrop, belastning, säkerhet, övervakning och kostnad per faktiskt löst ärende. Benchmarken är därför en indikation, inte ett bevis på att en modell är bäst i varje kontaktcenter eller assistent. 25
Googles officiella prislista samlar båda nyheterna under Live API. I det betalda standardlagret kostar ljudindata 3,00 dollar per miljon token, eller 0,005 dollar per minut, medan ljudutdata kostar 12,00 dollar per miljon token, eller 0,018 dollar per minut. Textindata är prissatt till 0,75 dollar per miljon token och textutdata, inklusive så kallade thinking tokens, till 4,50 dollar. 37
Det är viktigt att skilja dessa priser från generella priser för andra Gemini-modeller, exempelvis Gemini 3.8 Flash. För budgetering bör team använda den aktuella Live API-prislistan och testa verkliga samtal. Totalkostnaden beror på kombinationen av inkommande och utgående ljud, visuellt sammanhang, text och verktyg. 37
Google DeepMind listar båda modellerna som allmänt tillgängliga. I den publicerade tillgänglighetstabellen finns Gemini-appen, Google AI Studio, Gemini API och Google Enterprise Agent Platform för båda modellerna. Google Search Live listas för Extended Thinking, medan Google Workspace listas för Gemini 3.8 Live. 54
För utvecklare innebär det ett val inom samma ljud-till-ljud-familj: en modell för snabba livesamtal och en modell med mer bakgrundsresonemang. För företag räcker det däremot inte att konstatera att en modell finns tillgänglig. De behöver också kontrollera vilken produktmiljö, vilka datakontroller, regioner och integrationsvägar som gäller för den planerade lösningen. 54
Googles konkurrensargument är en mer sammanhållen realtidsstack: talad interaktion, visuellt sammanhang, resonemang i bakgrunden och asynkrona verktyg i samma modellfamilj. I teorin kan det minska behovet av att själv koppla ihop taligenkänning, språkmodell, verktygsorkestrering och talsyntes – samtidigt som dialogen kan hållas igång medan arbete utförs. 1
10
OpenAI:s GPT-Live-1 är fortsatt en viktig jämförelsepunkt, särskilt för team som utvärderar dubbelriktade samtal där systemet kan lyssna och tala samtidigt. Men den rapporterade benchmarkjämförelsen är för smal för att avgöra ett plattformsval. En seriös utvärdering bör bygga på representativa samtal och mäta hantering av avbrott, korrekta verktygsanrop, flerspråkighet, säkerhetskontroller, felåterhämtning, fördröjning och kostnad per slutfört resultat. 25
Det tillgängliga lanseringsmaterialet klargör inte någon exakt policy för SynthID-vattenmärkning av ljud från Gemini 3.8 Live eller Extended Thinking. Google säger att SynthID har utökats för att vattenmärka och identifiera text som genereras i Gemini-appen och webbupplevelsen, men det bekräftar inte att varje ljudström från Live-modellerna vattenmärks eller hur identifiering och utrullning fungerar. 59
Samma försiktighet behövs kring ekosystem och integrationer, som kan förändras snabbt. Organisationer som planerar en produktionssättning bör kontrollera aktuell modellokumentation, prislista, plattformstillgänglighet och tillämpliga tjänstevillkor innan de låser sin arkitektur. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live är inriktad på skalbarhet, kostnadseffektivitet och flytande röstdialog, medan Extended Thinking är gjord för mer komplexa uppgifter i flera steg.
Gemini 3.8 Live är inriktad på skalbarhet, kostnadseffektivitet och flytande röstdialog, medan Extended Thinking är gjord för mer komplexa uppgifter i flera steg. Den stora förändringen är att Extended Thinking enligt Google kan fortsätta tala medan den planerar, resonerar och väntar på asynkrona verktyg.