Gemini 3.8 Live орієнтована на масштабні та економні голосові сценарії, а Extended Thinking — на складні багатокрокові завдання з фоновим міркуванням. Ключова ідея Extended Thinking: агент може не замовкати під час планування роботи або очікування на асинхронний інструмент.
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google представила Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking — дві нативні моделі «аудіо-в-аудіо» для голосових агентів і живого діалогу в реальному часі. Базова версія призначена для масштабування, економічності, плавної розмови та роботи з візуальним контекстом. Extended Thinking розрахована на складніші багатокрокові завдання, де потрібне фонове міркування. 10
2
Найпомітніша нова можливість належить Gemini 3.8 Live Extended Thinking. За описом Google, модель здатна планувати дії, міркувати у фоновому режимі й викликати асинхронні інструменти, водночас безперервно передаючи голосову відповідь. Якщо зовнішній інструмент виконується кілька секунд, система може підтримувати природний хід діалогу розмовними репліками, а не залишати співрозмовника в тиші. 1
2
Тобто йдеться не просто про швидшу реакцію. Генерація мовлення, фонове планування та робота інструментів можуть відбуватися паралельно. Наприклад, голосовий агент потенційно зможе пояснювати наступний крок, поки перевіряє дані або виконує послідовність дій через підключені сервіси. Практична користь залежатиме від надійності цих інструментів і того, чи буде розмова змістовною, а не лише заповнюватиме паузу. 1
2
Google позиціонує стандартну Gemini 3.8 Live як варіант для низької затримки та великих обсягів голосових діалогів без пауз, пов’язаних із міркуванням. Вона поєднує живий діалог із візуальною прив’язкою: агент може враховувати візуальний контекст поряд із розмовою. 10
45
Представник Google також заявив про підтримку 97 мов і можливість перемикатися між ними в межах однієї розмови. Утім, розробникам варто окремо перевіряти якість для потрібних мов, акцентів, регіонів і конкретних сценаріїв. 16
У публікаціях про запуск наведено результати Speech-to-Speech Quality Index: 76,0 для Gemini 3.8 Live, 82,6 для Gemini 3.8 Live Extended Thinking і 81,5 для GPT-Live-1 від OpenAI в режимі medium effort. 25
У цьому порівнянні Extended Thinking має найвищий показник, однак ці цифри не слід сприймати як незалежно перевірений вердикт про перевагу в усіх виробничих сценаріях. Для голосового агента не менш важливі обробка перебивань, розпізнавання багатомовного та акцентованого мовлення, правильність викликів інструментів, затримка під навантаженням, безпека, спостережуваність і повна вартість успішно виконаного завдання. 25
В офіційній таблиці Google обидві моделі віднесено до Live API. Для платного стандартного рівня вказано $3,00 за 1 млн токенів, або $0,005 за хвилину аудіовходу, та $12,00 за 1 млн токенів, або $0,018 за хвилину аудіовиходу. Текстовий вхід коштує $0,75 за 1 млн токенів, а текстовий вихід — включно з токенами міркування — $4,50 за 1 млн токенів. 37
Це важливе уточнення: ціни інших моделей Gemini, зокрема Gemini 3.8 Flash, не варто автоматично переносити на Live-моделі. Для планування бюджету слід звіряти поточну таблицю Live API та тестувати реальні сесії: витрати залежать від обсягу вхідного й вихідного аудіо, тексту, візуального контексту та підключених інструментів. 37
Google DeepMind позначає обидві моделі як загальнодоступні. Для Gemini 3.8 Live та Extended Thinking у таблиці доступності зазначено застосунок Gemini, Google AI Studio, Gemini API і Google Enterprise Agent Platform. Окремо для Extended Thinking вказано Google Search Live, а для Gemini 3.8 Live — Google Workspace. 54
Для розробників це вибір між моделлю для швидкого живого діалогу та моделлю з посиленим міркуванням у межах однієї аудіо-в-аудіо лінійки. Для компаній доступність моделі — лише частина рішення: потрібно також перевірити відповідний продукт, регіон, правила роботи з даними та шлях інтеграції. 54
Конкурентна ставка Google — тісніше об’єднати в одному сімействі моделей голосове спілкування, візуальний контекст, фонове міркування та асинхронні інструменти. У теорії це може скоротити обсяг додаткової інтеграції між розпізнаванням мовлення, текстовою моделлю, оркестрацією інструментів і синтезом голосу, а також зберігати безперервність діалогу, поки система працює над відповіддю. 1
10
GPT-Live-1 від OpenAI лишається важливим конкурентним орієнтиром, особливо для команд, які оцінюють повнодуплексну розмовну взаємодію. Проте одного порівняння за бенчмарком недостатньо для вибору платформи. Командам варто проводити власні тести на типових дзвінках і вимірювати роботу з перебиваннями, точність інструментів, багатомовність, контроль безпеки, відновлення після збоїв, затримку та вартість завершеного завдання. 25
Надані матеріали запуску не встановлюють чітку політику щодо аудіоводяних знаків SynthID саме для Gemini 3.8 Live або Extended Thinking. Google повідомляє про розширення SynthID для маркування та виявлення тексту, створеного в застосунку Gemini та вебверсії, але це не підтверджує водяний знак для кожного аудіопотоку Live-моделей і не описує умови його виявлення чи розгортання. 59
Тому перед запуском у продакшені варто перевірити актуальну документацію моделей, тарифи, доступність платформ і застосовні умови сервісу. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live орієнтована на масштабні та економні голосові сценарії, а Extended Thinking — на складні багатокрокові завдання з фоновим міркуванням.
Gemini 3.8 Live орієнтована на масштабні та економні голосові сценарії, а Extended Thinking — на складні багатокрокові завдання з фоновим міркуванням. Ключова ідея Extended Thinking: агент може не замовкати під час планування роботи або очікування на асинхронний інструмент.