Gemini 3.8 Live jest przeznaczony do skalowalnych, oszczędnych i płynnych rozmów głosowych, także z wykorzystaniem kontekstu wizualnego. Gemini 3.8 Live Extended Thinking ma prowadzić rozmowę, jednocześnie planując wieloetapowe działania i czekając na wyniki asynchronicznych narzędzi.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google zaprezentowało Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking — dwa natywne modele audio-to-audio dla agentów głosowych i rozmów prowadzonych w czasie rzeczywistym. Standardowy model ma stawiać na skalę, koszty, płynność dialogu i rozumienie kontekstu wizualnego. Wersja Extended Thinking jest przeznaczona do trudniejszych, wieloetapowych zadań wymagających rozumowania w tle. 10
2
Najważniejsza funkcja dotyczy Gemini 3.8 Live Extended Thinking. Według Google model może planować i wywoływać asynchroniczne narzędzia w tle, jednocześnie dalej przesyłając odpowiedź głosową. Gdy narzędzie wykonuje dłuższe zadanie, system może podtrzymywać rozmowę naturalnymi wtrąceniami zamiast całkowicie ją zatrzymywać do chwili otrzymania wyniku. 1
2
Nie chodzi więc wyłącznie o szybszą odpowiedź po wypowiedzi użytkownika. W założeniu Google generowanie mowy, planowanie w tle i praca narzędzi mogą przebiegać równolegle. Agent mógłby na przykład wyjaśniać kolejne kroki, podczas gdy sprawdza dane albo realizuje proces wymagający kilku etapów. To, czy będzie to rzeczywiście lepsze doświadczenie, zależy jednak od niezawodności narzędzi, projektu dialogu oraz tego, czy wypowiadane treści są pomocne, a nie tylko wypełniają ciszę. 1
2
Google pozycjonuje podstawowy Gemini 3.8 Live jako model dla aplikacji konwersacyjnych o dużej skali, gdzie istotne są niskie opóźnienia i efektywność kosztowa. Łączy rozmowę na żywo z kontekstem wizualnym, dzięki czemu agent może uwzględniać obraz — na przykład widok z kamery lub udostępnionego ekranu — obok treści rozmowy. 10
45
Przedstawiciel Google przekazał też, że model obsługuje 97 języków i potrafi przełączać się między nimi w trakcie rozmowy. Przy wdrożeniach warto jednak osobno sprawdzić jakość dla konkretnych akcentów, odmian języka, regionów i scenariuszy użycia. 16
W materiałach omawiających premierę podano wyniki Speech-to-Speech Quality Index: 76,0 dla Gemini 3.8 Live, 82,6 dla Gemini 3.8 Live Extended Thinking oraz 81,5 dla OpenAI GPT-Live-1 przy średnim poziomie wysiłku rozumowania. 25
W tym konkretnym porównaniu Extended Thinking uzyskał najwyższy wynik, ale nie należy traktować go jako niezależnie zweryfikowanego dowodu wyższości jednego systemu we wszystkich zastosowaniach. Produkcyjny agent głosowy musi dobrze radzić sobie m.in. z przerywaniem wypowiedzi, mową wielojęzyczną i akcentami, poprawnością wywołań narzędzi, opóźnieniami pod obciążeniem, bezpieczeństwem, obserwowalnością i całkowitym kosztem skutecznie zakończonej sprawy. To jedna wskazówka ewaluacyjna, a nie uniwersalny ranking. 25
W oficjalnej tabeli cen Google oba nowe modele znajdują się w kategorii Live API. W płatnym planie standardowym wejściowe audio kosztuje 3,00 USD za milion tokenów, czyli 0,005 USD za minutę, a wyjściowe audio 12,00 USD za milion tokenów, czyli 0,018 USD za minutę. Dla tekstu Google podaje 0,75 USD za milion tokenów wejściowych oraz 4,50 USD za milion tokenów wyjściowych, wliczając tokeny rozumowania. 37
To istotne rozróżnienie: stawki tokenowe podawane dla Gemini 3.8 Flash nie są automatycznie stawkami modeli Live. Przy planowaniu budżetu należy korzystać z aktualnej tabeli Live API oraz dokumentacji danego modelu, a następnie przetestować rzeczywiste sesje. Koszt agenta zależy od proporcji audio wejściowego i wyjściowego, tekstu, kontekstu wizualnego oraz używanych narzędzi. 37
Google DeepMind oznacza oba modele jako ogólnie dostępne. W opublikowanej tabeli oba są wymienione dla aplikacji Gemini, Google AI Studio, Gemini API oraz Google Enterprise Agent Platform. Dla Extended Thinking wskazano także Google Search Live, a dla Gemini 3.8 Live — Google Workspace. 54
Dla deweloperów oznacza to wybór między modelem zoptymalizowanym pod szybki dialog na żywo a wariantem o większych możliwościach rozumowania, należącymi do tej samej rodziny audio-to-audio. Firmy powinny jednak sprawdzić nie tylko samą dostępność modelu, lecz także właściwy produkt, mechanizmy kontroli danych, obsługiwany region i sposób integracji przed wdrożeniem. 54
Główna propozycja Google to bardziej zintegrowany stos technologiczny: interakcja głosowa, kontekst wizualny, rozumowanie w tle i asynchroniczne narzędzia w jednej rodzinie modeli. Teoretycznie może to ograniczyć potrzebę ręcznego łączenia rozpoznawania mowy, modelu tekstowego, orkiestracji narzędzi i syntezy mowy — oraz pomóc zachować ciągłość rozmowy, gdy system wykonuje pracę w tle. 1
10
GPT-Live-1 pozostaje istotnym punktem odniesienia, zwłaszcza dla zespołów porównujących zachowanie konwersacji full-duplex. Sam przytoczony benchmark jest jednak zbyt wąski, by przesądzać o wyborze platformy. Wiarygodna ocena powinna wykorzystywać reprezentatywne rozmowy i mierzyć obsługę przerwań, poprawność wywołań narzędzi, działanie w wielu językach, zabezpieczenia, odzyskiwanie sprawności po błędach, opóźnienia oraz koszt ukończonego zadania. 25
Dostarczone materiały premierowe nie potwierdzają szczegółowej polityki znakowania audio znakiem wodnym SynthID dla Gemini 3.8 Live ani Extended Thinking. Google informuje o rozszerzeniu SynthID na znakowanie i wykrywanie tekstu generowanego w aplikacji Gemini i wersji internetowej, ale nie wynika z tego, że każda strumieniowana odpowiedź audio z tych modeli jest znakowana ani na jakich zasadach działałoby wykrywanie. 59
Podobna ostrożność dotyczy informacji o integracjach i wsparciu ekosystemu, które mogą szybko się zmieniać. Zespoły planujące wdrożenie produkcyjne powinny przed wyborem architektury zweryfikować aktualną dokumentację modelu, ceny, dostępność na wybranej platformie oraz obowiązujące warunki usługi. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live jest przeznaczony do skalowalnych, oszczędnych i płynnych rozmów głosowych, także z wykorzystaniem kontekstu wizualnego.
Gemini 3.8 Live jest przeznaczony do skalowalnych, oszczędnych i płynnych rozmów głosowych, także z wykorzystaniem kontekstu wizualnego. Gemini 3.8 Live Extended Thinking ma prowadzić rozmowę, jednocześnie planując wieloetapowe działania i czekając na wyniki asynchronicznych narzędzi.