Gemini 3.8 Live on Googlen kustannus ja skaalautuvuuspainotteinen malli sujuvaan puhedialogiin. Extended Thinking voi Googlen mukaan suunnitella ja tehdä asynkronisia työkalukutsuja taustalla samalla, kun se tuottaa jatkuvaa puhevastetta.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google on julkistanut kaksi natiivia ääni–ääni-mallia reaaliaikaisiin puheagentteihin ja livekeskusteluihin: Gemini 3.8 Liven sekä Gemini 3.8 Live Extended Thinkingin. Perusmalli on suunnattu suuren mittakaavan, kustannustehokkaisiin ja sujuviin keskusteluihin sekä visuaalisen kontekstin hyödyntämiseen. Extended Thinking taas on tarkoitettu mutkikkaisiin, useita vaiheita vaativiin tehtäviin. 10
2
Julkaisun kiinnostavin ominaisuus liittyy Gemini 3.8 Live Extended Thinkingiin. Googlen mukaan malli voi tehdä taustalla päättelyä, suunnitella toimintaa ja käynnistää asynkronisia työkalukutsuja samalla, kun se jatkaa puhevastauksen suoratoistoa. Jos ulkoinen työkalu kestää, malli voi pitää keskustelua yllä luontevilla täytesanoilla sen sijaan, että se vaikenisi tulosta odottaessaan. 1
2
Kyse ei siis ole vain nopeammasta vuorottelusta käyttäjän ja tekoälyn välillä. Googlen kuvaamassa toteutuksessa puheen tuotto, taustasuunnittelu ja asynkroninen työkalutoiminta voivat edetä rinnakkain. Puheagentti voisi esimerkiksi selittää seuraavia vaiheita samalla, kun se hakee tietoa tai käy läpi monivaiheista prosessia. Käytännön hyöty riippuu silti työkalujen luotettavuudesta, keskustelun suunnittelusta ja siitä, onko puhe aidosti hyödyllistä eikä pelkkää hiljaisuuden täyttämistä. 1
2
Google asemoi tavallisen Gemini 3.8 Liven pienempää viivettä ja suurta käyttömäärää vaativiin keskustelukokemuksiin, joissa ei haluta päättelyn aiheuttamaa odotusta. Malli yhdistää live-dialogin ja visuaalisen kontekstin, joten agentti voi hyödyntää keskustelun ohella esimerkiksi kuva- tai videonäkymää. 10
45
Googlen edustaja on lisäksi kertonut mallin tukevan 97 kieltä ja kykenevän vaihtamaan kielestä toiseen kesken keskustelun. Kehittäjien kannattaa silti testata oman käyttötapauksensa kielten, aksenttien, alueellisen saatavuuden ja laadun toimivuus erikseen. 16
Julkaisua käsittelevässä vertailussa Gemini 3.8 Live sai Speech-to-Speech Quality Indexissä tuloksen 76,0 ja Extended Thinking 82,6. OpenAI:n GPT-Live-1:n tulokseksi ilmoitettiin 81,5, kun päättelyasetuksena oli medium effort. 25
Lukujen perusteella Extended Thinking sijoittuu tässä yksittäisessä vertailussa korkeimmalle. Niitä ei kuitenkaan pidä lukea riippumattomasti auditoituna todisteena siitä, että yksi järjestelmä olisi yleisesti muita parempi. Tuotantoon vietävän puheagentin on selviydyttävä myös keskeytyksistä, eri kielistä ja aksenteista, työkalukutsujen oikeellisuudesta, ruuhkatilanteiden viiveestä, turvallisuudesta, valvottavuudesta ja kustannuksista yhtä onnistunutta tehtävänratkaisua kohden. 25
Googlen virallinen hinnasto käsittelee molempia uusia malleja Live API -palvelun alla. Maksullisella Standard-tasolla äänen syöttöhinta on 3,00 dollaria miljoonalta tokenilta eli 0,005 dollaria minuutilta. Äänen ulostulohinta on 12,00 dollaria miljoonalta tokenilta eli 0,018 dollaria minuutilta. Tekstisyöte maksaa 0,75 dollaria miljoonalta tokenilta ja tekstin ulostulo, mukaan lukien ajattelutokenit, 4,50 dollaria miljoonalta tokenilta. 37
Tämä erotus on olennainen: muualla mainitut Gemini 3.8 Flashin tokenhinnat eivät automaattisesti koske Live-malleja. Budjetointi kannattaa tehdä ajantasaisen Live API -hinnaston ja mallidokumentaation perusteella sekä testata oikeilla keskusteluilla. Kustannuksiin vaikuttavat äänen sisään- ja ulostulon lisäksi esimerkiksi teksti, visuaalinen konteksti ja käytetyt työkalut. 37
Google DeepMindin saatavuustaulukon mukaan molemmat mallit ovat yleisesti saatavilla. Molemmat löytyvät Gemini-sovelluksesta, Google AI Studiosta, Gemini API:sta ja Google Enterprise Agent Platformista. Extended Thinking on listattu myös Google Search Liveen, kun taas Gemini 3.8 Live on listattu Google Workspaceen. 54
Kehittäjälle vaihtoehto on käytännössä perusmallin ja enemmän taustapäättelyä tarjoavan mallin välillä. Yrityskäytössä saatavuus ei yksin riitä päätöksentekoon: on varmistettava, mikä tuotepinta, tiedonhallinta, maantieteellinen alue ja integraatiopolku sopivat suunniteltuun käyttöönottoon. 54
Googlen kilpailuvaltti on yhden malliperheen sisään koottu reaaliaikainen puhevuorovaikutus, visuaalinen konteksti, taustapäättely ja asynkroniset työkalut. Periaatteessa tämä voi vähentää tarvetta rakentaa erikseen puheentunnistuksesta, kielimallista, työkalujen orkestroinnista ja puhesynteesistä koostuvaa ketjua. Samalla keskustelun punainen lanka voi säilyä, kun taustalla tehdään työtä. 1
10
GPT-Live-1 on edelleen olennainen vertailukohta etenkin tiimeille, jotka arvioivat kaksisuuntaisen, päällekkäistä puhetta tukevan keskustelun toimivuutta. Yksi vertailuarvo ei silti ratkaise alustavalintaa. Uskottava arviointi vaatii edustavia puheluita ja mittareita esimerkiksi keskeytysten käsittelylle, työkalukutsujen onnistumiselle, monikielisyydelle, turvallisuudelle, virheistä toipumiselle, viiveelle ja kustannukselle per loppuun saatettu tehtävä. 25
Saatavilla olevasta julkaisumateriaalista ei käy tarkasti ilmi, koskeeko SynthID-äänivesileima Gemini 3.8 Liveä tai Extended Thinkingia, miten sen tunnistus toimisi tai millä ehdoilla se otettaisiin käyttöön. Google kertoo laajentaneensa SynthID:n Gemini-sovelluksen ja verkkokokemuksen tuottaman tekstin vesileimaukseen ja tunnistamiseen, mutta tämä ei vahvista, että kaikki Live-mallien äänivirrat vesileimattaisiin. 59
Myös integraatiot, hinnat ja saatavuus voivat muuttua nopeasti. Tuotantoon tähtäävän tiimin kannattaa ennen arkkitehtuuripäätöstä tarkistaa ajantasainen dokumentaatio, hinnasto, alustakohtainen saatavuus ja soveltuvat palveluehdot. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live on Googlen kustannus ja skaalautuvuuspainotteinen malli sujuvaan puhedialogiin.
Gemini 3.8 Live on Googlen kustannus ja skaalautuvuuspainotteinen malli sujuvaan puhedialogiin. Extended Thinking voi Googlen mukaan suunnitella ja tehdä asynkronisia työkalukutsuja taustalla samalla, kun se tuottaa jatkuvaa puhevastetta.