Gemini 3.8 Live предназначена для масштабных и экономичных голосовых сценариев, а Gemini 3.8 Live Extended Thinking — для сложных многошаговых задач, где модель может рассуждать и вызывать асинхронные инструменты в фо... Ключевое обещание Google — не просто быстрые ответы, а непрерывный диалог: агент может объяснять...
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — две нативные модели формата «аудио-в-аудио» для голосовых ИИ-агентов и диалога в реальном времени. Базовая версия ориентирована на масштабирование, экономичность, плавную беседу и работу с визуальным контекстом; вариант Extended Thinking предназначен для более трудных многошаговых задач, требующих фонового рассуждения. 10
2
Ключевая функция Gemini 3.8 Live Extended Thinking — способность планировать действия, рассуждать и вызывать асинхронные инструменты в фоновом режиме, одновременно передавая пользователю потоковый голосовой ответ. По данным Google, модель может поддерживать разговор естественными репликами, пока более долгий вызов инструмента ещё не завершён. 1
2
То есть речь идёт не только о быстром переключении между репликами. В заявленной архитектуре одновременно идут генерация речи, фоновое планирование и работа асинхронных инструментов. Например, голосовой агент теоретически сможет пояснять следующий шаг, пока ожидает данные или проходит несколько стадий обработки запроса. Насколько это действительно улучшит пользовательский опыт, будет зависеть от надёжности инструментов, сценария диалога и того, остаётся ли речь содержательной, а не служит заполнением пауз. 1
2
Обычная Gemini 3.8 Live позиционируется как вариант для низколатентных, высоконагруженных голосовых сервисов без задержек, связанных с дополнительным рассуждением. Она объединяет живой диалог с визуальным контекстом — агент может учитывать изображение или видео наряду с разговором. 10
45
Представители Google также заявили поддержку 97 языков и возможность переключаться между ними в ходе одной беседы. Разработчикам всё же стоит отдельно проверять качество конкретных языков, акцентов, региональную доступность и поведение модели в собственных сценариях. 16
В публикациях о запуске приводятся результаты Speech-to-Speech Quality Index: 76,0 у Gemini 3.8 Live и 82,6 у Gemini 3.8 Live Extended Thinking против 81,5 у GPT-Live-1 от OpenAI при среднем уровне усилий. 25
В этой конкретной сравнительной оценке Extended Thinking получила более высокий балл. Но такие цифры не стоит считать независимым доказательством общего превосходства в продакшене. Голосовому агенту необходимо корректно обрабатывать перебивания, речь с разными акцентами и на разных языках, вызовы инструментов, нагрузку, вопросы безопасности, наблюдаемость и стоимость успешно решённой задачи. Бенчмарк — это один сигнал, а не универсальный ответ на вопрос о выборе платформы. 25
В официальной таблице Google обе новинки относятся к Live API. В платном стандартном тарифе указаны следующие цены: аудиовход — 3,00 доллара за 1 млн токенов, или 0,005 доллара в минуту; аудиовыход — 12,00 долларов за 1 млн токенов, или 0,018 доллара в минуту. Текстовый ввод стоит 0,75 доллара за 1 млн токенов, а текстовый вывод, включая токены рассуждения, — 4,50 доллара. 37
Это важное различие: тарифы, которые публикуются для Gemini 3.8 Flash, не следует автоматически переносить на Live-модели. При расчёте бюджета стоит сверяться с актуальной таблицей Live API и документацией, а затем измерять реальные сессии: итоговая цена зависит от доли входного и выходного аудио, визуального контекста, текста и связанных инструментов. 37
Google DeepMind указывает для обеих моделей статус общедоступных. В опубликованной таблице Gemini 3.8 Live и Extended Thinking перечислены для приложения Gemini, Google AI Studio, Gemini API и Google Enterprise Agent Platform. Для Extended Thinking также указан Google Search Live, а для Gemini 3.8 Live — Google Workspace. 54
Для разработчиков это выбор между двумя моделями из одного семейства: более простой для живого диалога и более «думающей» для сложных задач. Для компаний, однако, важно учитывать не только наличие модели, но и конкретный продукт, доступные меры контроля данных, географический регион и способ интеграции. 54
Главная конкурентная идея Google — более цельный стек для общения в реальном времени: голос, визуальный контекст, фоновое рассуждение и асинхронные инструменты в рамках одного семейства моделей. В теории это может уменьшить объём собственной «склейки» между распознаванием речи, текстовой моделью, оркестрацией инструментов и синтезом речи — и при этом не прерывать разговор, пока система выполняет действие. 1
10
GPT-Live-1 от OpenAI остаётся важной точкой сравнения, особенно для команд, оценивающих двусторонний голосовой диалог. Однако одного приведённого бенчмарка недостаточно для решения о платформе. Корректная проверка должна опираться на реальные сценарии и измерять обработку перебиваний, точность вызовов инструментов, многоязычную работу, безопасность, восстановление после сбоев, задержку и стоимость завершённого пользовательского запроса. 25
Предоставленные материалы о запуске не устанавливают точную политику применения аудиоводяных знаков SynthID к Gemini 3.8 Live и Extended Thinking. Google сообщает о расширении SynthID на маркировку и распознавание текста, созданного в приложении Gemini и веб-версии, но это не подтверждает, что каждый аудиопоток новых Live-моделей получает такой знак, и не описывает условия его обнаружения или внедрения. 59
То же правило осторожности применимо к заявлениям об интеграциях и поддержке партнёров: они могут быстро меняться. Перед запуском рабочей системы командам следует проверить актуальную документацию по моделям, цены, доступность платформ и применимые условия обслуживания. 37
54
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Gemini 3.8 Live предназначена для масштабных и экономичных голосовых сценариев, а Gemini 3.8 Live Extended Thinking — для сложных многошаговых задач, где модель может рассуждать и вызывать асинхронные инструменты в фо...
Gemini 3.8 Live предназначена для масштабных и экономичных голосовых сценариев, а Gemini 3.8 Live Extended Thinking — для сложных многошаговых задач, где модель может рассуждать и вызывать асинхронные инструменты в фо... Ключевое обещание Google — не просто быстрые ответы, а непрерывный диалог: агент может объяснять дальнейшие действия, пока ждёт данные от инструмента или выполняет многоэтапную операцию.