Google внедрила прямую генерацию и редактирование изображений в реальном времени в разговорный ИИ сервис Gemini Live [8]. Во время голосового общения пользователи могут активировать режим камеры, показать объект и дать голосовую команду для создания или изменения картинки [8].

Create a landscape editorial hero image for this Studio Global article: What real-time image generation and editing capability has Google added to Gemini Live, how does it work on Android and iOS, what technology. Article summary: ## What Google Added to Gemini Live. Topic tags: general, documentation, general web, user generated, education. Reference image context from search candidates: Reference image 1: visual subject "Google has begun the deployment of Gemini's innovative real-time AI video functionalities, enabling the platform to interpret visual input from a user's device" source context "Google's Gemini update that can tell you live what it sees through your camera is now rolling out - PhoneArena" Reference image 2: visual subject "Smartphones must have user-replaceable batteries by 2027. But not your iPhone. Here's why" source context "Google's Gemini update that can tell you l
Google запустила функцию прямой генерации и редактирования изображений в реальном времени внутри Gemini Live — своего разговорного ИИ-режима . Теперь вам не нужно переключаться между приложениями: во время живого общения с ассистентом достаточно активировать демонстрацию камеры и навести ее на объект. Вы просто говорите, что хотите создать или изменить, и результат появляется прямо на экране в процессе разговора
.
Раньше для работы с изображениями в Gemini приходилось набирать текстовые запросы или загружать файлы. Теперь это можно делать голосом и в моменте — словно вы обсуждаете творческую задачу с живым дизайнером, который сразу вносит правки .
Android. Пользователи могут войти в Gemini Live, запустить потоковую передачу видео с камеры и показать ИИ любой предмет. После этого достаточно дать голосовую команду — например: «Сделай фон за этим стулом в стиле киберпанк» или «Преврати этот набросок в акварельный рисунок». За обработку отвечает модель Gemini 2.5 Flash Image, также известная под кодовым названием nano-banana . Она обеспечивает не только создание изображений с нуля, но и продвинутые трансформации: смешивание нескольких фотографий, сохранение лиц персонажей при редактировании, точечные изменения по текстовому описанию
.
iOS. Та же ключевая возможность описана и для владельцев iPhone: режим Live с камерой плюс генерация и редактирование картинок прямо в диалоге . Отдельного рабочего процесса только для iOS в открытых источниках пока не опубликовано, но функциональность идентична: навел камеру — сказал — получил результат.
Принципиальное отличие от прежних версий в том, что существовавшая ранее генерация изображений через модель Gemini 2.5 Flash Image работала по текстовым или графическим запросам вне режима Live. Новая интеграция переносит тот же творческий процесс в живую голосовую беседу с включенной камерой .
Сердце обновления — модель Gemini 2.5 Flash Image, которую разработчики из Google DeepMind называют своей самой совершенной генеративно-редактирующей ИИ-системой . Ее ключевые возможности:
Вся эта мощь теперь доступна не в текстовом поле, а прямо в разговоре, что для пользователя означает: вы видите объект, говорите, что нужно изменить, и буквально через секунду видите готовое изображение .
На конференции для разработчиков Google I/O 2026 компания представила несколько продуктов, которые развивают ту же идею «творчества в реальном времени».
Главная звезда презентации — Gemini Omni. Если nano-banana умеет создавать и редактировать картинки, то Omni делает то же самое с видео. Google называет это моделью, которая «может создать что угодно из чего угодно — начиная с видео» .
Как это выглядит на практике:
Первая версия — Gemini Omni Flash — уже доступна подписчикам Google AI Plus, Pro и Ultra в приложении Gemini, а также бесплатно в YouTube Shorts и YouTube Create .
Еще один флагманский анонс — модель Gemini 3.5 Flash, которая стала стандартной «рабочей лошадкой» в приложении Gemini и режиме AI Mode в Google Поиске . Google утверждает, что она выдает токены в четыре раза быстрее других передовых моделей своего класса и заточена под агентные задачи: многошаговое программирование, использование инструментов, долгосрочные проекты
.
По бенчмаркам Gemini 3.5 Flash обходит предыдущую модель 3.1 Pro в кодинге и многозадачности, а также конкурирует с GPT-5.5 и Claude Opus 4.7 в сценариях финансового анализа и сложных цепочек действий . Модель поддерживает 1 млн токенов контекста и до 65 тыс. токенов на выходе, что сравнимо с объемом «Войны и мира»
.
Стратегия Google строится на едином конвейере реального времени, который объединяет несколько ключевых элементов:
Главное конкурентное преимущество Google на данный момент — глубина интеграции. Gemini Live закрывает петлю «покажи, что видишь — попроси создать или изменить», а Gemini Omni развивает тот же подход в сторону видео и более широкой мультимодальности . Это переход от разрозненных ИИ-инструментов к единому пространству, где можно творить голосом, камерой и текстом, не переключаясь между сервисами.
Ключевой вопрос, который остается открытым: насколько хорошо эти интегрированные сценарии будут работать в реальных условиях по мере массового развертывания. Но уже сейчас очевидно, что Google делает ставку не на отдельные «фишки», а на переосмысление самого процесса творческого взаимодействия человека с ИИ .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google внедрила прямую генерацию и редактирование изображений в реальном времени в разговорный ИИ сервис Gemini Live [8].
Google внедрила прямую генерацию и редактирование изображений в реальном времени в разговорный ИИ сервис Gemini Live [8]. Во время голосового общения пользователи могут активировать режим камеры, показать объект и дать голосовую команду для создания или изменения картинки [8].
Технологической основой выступает модель Gemini 2.5 Flash Image (известная как nano banana), обеспечивающая продвинутое редактирование и сохранение стиля [2].