Gemini 3.8 Live míří na škálovatelné a nákladově efektivní hlasové konverzace, zatímco Gemini 3.8 Live Extended Thinking má během hovoru zvládat složitější vícekrokové uvažování a asynchronní nástroje na pozadí. Podstatou není jen rychlejší odpověď: Google popisuje agenta, který dokáže udržet mluvený dialog, zatímco...
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google představil Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking – dva nativní modely typu audio-to-audio pro hlasové agenty a živý dialog. Základní model je určený pro nasazení ve velkém, s důrazem na cenu, plynulou konverzaci a práci s vizuálním kontextem. Varianta Extended Thinking cílí na náročnější vícekrokové úlohy, u nichž se hodí uvažování na pozadí. 10
2
Hlavní novinku přináší Gemini 3.8 Live Extended Thinking. Google uvádí, že model může na pozadí plánovat a volat asynchronní nástroje, zatímco dál průběžně generuje mluvenou odpověď. Když například nástroj potřebuje několik sekund na dokončení, model může udržovat aktivní konverzaci přirozenými průběžnými reakcemi namísto toho, aby celý hovor až do výsledku zablokoval. 1
2
„Souběžné uvažování“ zde tedy neznamená pouze svižnější střídání replik. Podle popsaného návrhu mohou paralelně probíhat generování řeči, plánování na pozadí i práce asynchronních nástrojů. Hlasový agent tak může vysvětlovat další krok, zatímco čeká na data nebo řeší vícekrokový postup. Přínos pro člověka na druhé straně ale bude záviset na spolehlivosti nástrojů, návrhu dialogu a na tom, zda je průběžná řeč skutečně užitečná, a ne jen výplní ticha. 1
2
Google staví standardní Gemini 3.8 Live jako variantu pro nízkou odezvu a velké objemy konverzačních scénářů bez prodlev vyvolaných uvažováním. Kombinuje živý dialog s vizuálním ukotvením, takže agent může vedle konverzace pracovat také s obrazovým kontextem. 10
45
Zástupci Googlu také uvedli podporu 97 jazyků a možnost během jedné konverzace mezi jazyky přepínat. Vývojáři by si však měli v testování ověřit kvalitu jednotlivých jazyků, podporu v daném regionu i chování pro konkrétní přízvuky a scénáře. 16
Podle článku věnovaného uvedení modelů dosáhl Gemini 3.8 Live hodnoty 76,0 a Gemini 3.8 Live Extended Thinking 82,6 v indexu Speech-to-Speech Quality Index. U OpenAI GPT-Live-1 s nastavením „medium effort“ uvádí stejné srovnání 81,5. 25
Extended Thinking je v tomto konkrétním srovnání výše než oba další modely. Tato čísla však nejsou nezávisle auditovaným důkazem celkové kvality pro produkční nasazení. Hlasový agent musí v praxi zvládat také přerušení uživatelem, vícejazyčnou a akcentovanou řeč, přesnost nástrojů, odezvu při zátěži, bezpečnost, monitoring a celkové náklady na úspěšně vyřešený požadavek. Jde o jeden hodnoticí signál, nikoli o univerzální odpověď na otázku, který systém je nejlepší pro každé kontaktní centrum či asistenta. 25
Oficiální ceník Googlu řadí oba nové modely pod Live API. V placené standardní úrovni uvádí vstupní zvuk za 3,00 USD za milion tokenů, respektive 0,005 USD za minutu, a výstupní zvuk za 12,00 USD za milion tokenů, respektive 0,018 USD za minutu. Textový vstup stojí 0,75 USD za milion tokenů a textový výstup včetně tokenů uvažování 4,50 USD za milion tokenů. 37
To je podstatné zejména při plánování rozpočtu. Ceny tokenů, které se mohou vztahovat k modelu Gemini 3.8 Flash, se automaticky nevztahují na modely Live. Pro kalkulaci je vhodné vycházet z aktuální tabulky Live API a dokumentace konkrétního modelu, poté otestovat reálné relace. Náklad hlasového agenta závisí na poměru vstupního a výstupního zvuku, vizuálním kontextu, textu i připojených nástrojích. 37
Google DeepMind uvádí oba modely jako obecně dostupné. Přehled dostupnosti zahrnuje pro oba Gemini aplikaci, Google AI Studio, Gemini API a Google Enterprise Agent Platform. U Extended Thinking je uveden také Google Search Live, zatímco Gemini 3.8 Live je uveden pro Google Workspace. 54
Pro vývojáře to znamená volbu mezi standardním modelem pro živý dialog a verzí s vyšší schopností uvažování v rámci stejné rodiny nativních audio modelů. Firmy vedle samotné dostupnosti modelu musí posoudit i konkrétní produktové prostředí, pravidla práce s daty, geografický region a integrační cestu vhodnou pro zamýšlené nasazení. 54
Konkurenční argument Googlu stojí na integrovaném stacku: mluvené interakci, vizuálním kontextu, uvažování na pozadí a asynchronních nástrojích v jedné modelové rodině. Teoreticky to může omezit množství vlastního propojování mezi rozpoznáváním řeči, textovým modelem, orchestrací nástrojů a syntézou řeči. Zároveň by se měla zachovat kontinuita konverzace i ve chvíli, kdy systém pracuje na výsledku. 1
10
GPT-Live-1 od OpenAI zůstává relevantním bodem srovnání zejména pro týmy hodnotící obousměrné konverzační chování. Uvedený benchmark je ale příliš úzký na to, aby sám rozhodl o volbě platformy. Smysluplné hodnocení by mělo pracovat s reprezentativními hovory a měřit práci s přerušením, správnost volání nástrojů, vícejazyčný výkon, bezpečnostní kontroly, obnovu po chybách, odezvu i cenu za dokončený úkol. 25
Dodané materiály k uvedení modelů neurčují přesnou politiku zvukového vodoznaku SynthID pro Gemini 3.8 Live ani Extended Thinking. Google uvádí rozšíření SynthID pro vodoznakování a identifikaci textu vytvořeného aplikací Gemini a webovým rozhraním, toto sdělení ale nepotvrzuje, že je vodoznakem opatřen každý zvukový stream z modelů Live, ani nepopisuje podmínky detekce či zavádění. 59
Stejná opatrnost platí pro informace o integracích a podpoře v ekosystému, které se mohou rychle měnit. Týmy připravující produkční nasazení by proto před závazným architektonickým rozhodnutím měly ověřit aktuální dokumentaci modelů, ceny, dostupnost v konkrétní platformě a platné smluvní podmínky. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live míří na škálovatelné a nákladově efektivní hlasové konverzace, zatímco Gemini 3.8 Live Extended Thinking má během hovoru zvládat složitější vícekrokové uvažování a asynchronní nástroje na pozadí.
Gemini 3.8 Live míří na škálovatelné a nákladově efektivní hlasové konverzace, zatímco Gemini 3.8 Live Extended Thinking má během hovoru zvládat složitější vícekrokové uvažování a asynchronní nástroje na pozadí. Podstatou není jen rychlejší odpověď: Google popisuje agenta, který dokáže udržet mluvený dialog, zatímco plánuje postup, čeká na výsledek nástroje nebo zpracovává data.