O Gemini Live agora permite gerar e editar imagens diretamente na conversa por voz, usando a câmera do celular [8]. Basta ativar o compartilhamento de câmera, mostrar um objeto e dar uma instrução em linguagem natural para criar ou modificar uma imagem na hora [8].

Create a landscape editorial hero image for this Studio Global article: What real-time image generation and editing capability has Google added to Gemini Live, how does it work on Android and iOS, what technology. Article summary: ## What Google Added to Gemini Live. Topic tags: general, documentation, general web, user generated, education. Reference image context from search candidates: Reference image 1: visual subject "Google has begun the deployment of Gemini's innovative real-time AI video functionalities, enabling the platform to interpret visual input from a user's device" source context "Google's Gemini update that can tell you live what it sees through your camera is now rolling out - PhoneArena" Reference image 2: visual subject "Smartphones must have user-replaceable batteries by 2027. But not your iPhone. Here's why" source context "Google's Gemini update that can tell you l
O Google acaba de liberar um recurso que muda a forma como interagimos com inteligência artificial: geração e edição de imagens em tempo real dentro do Gemini Live, o modo de conversa por voz da plataforma .
Na prática, durante uma conversa ao vivo com o Gemini, você pode ativar o compartilhamento de câmera, apontar o celular para algum objeto ou cena e, usando apenas a voz, pedir que a IA crie uma imagem nova ou edite algo que está vendo. O resultado aparece ali mesmo, integrado à experiência de conversa, sem precisar sair do modo Live .
Isso é diferente dos recursos anteriores de geração de imagens do Gemini, que funcionavam por prompts de texto ou upload de arquivos em um chat tradicional. Agora, o processo é mais natural: você fala com a IA enquanto ela enxerga o que você está mostrando.
A experiência é semelhante nos dois sistemas, embora as fontes disponíveis tragam mais detalhes sobre o fluxo no Android.
No Android: Dentro do Gemini Live, o usuário pode iniciar o compartilhamento de câmera e dar comandos falados para gerar ou modificar imagens . O processamento é feito pelo modelo Gemini 2.5 Flash Image, apelidado internamente de nano-banana – o mesmo motor que já vinha sendo usado para criação de imagens nos apps do Gemini
.
No iOS: O recurso foi descrito como “compartilhamento de câmera mais geração e edição conversacional de imagens em tempo real”, mas as fontes não detalham um fluxo exclusivo para o sistema da Apple . A lógica central, contudo, é a mesma: conversa por voz + câmera ao vivo = criação e edição de imagens na hora.
O motor por trás da geração de imagens é o Gemini 2.5 Flash Image, chamado pelos desenvolvedores de nano-banana. O Google o descreve como seu modelo de última geração para criação e edição de imagens . Entre as capacidades destacadas estão:
É como se o nano-banana ganhasse “olhos e ouvidos” dentro do Gemini Live, permitindo que a IA entenda o que você está vendo e traduza isso em comandos de criação ou edição visual.
Esse movimento não é isolado. Durante o Google I/O 2026, a empresa apresentou uma série de atualizações que ampliam a aposta em IA multimodal e conversacional.
Gemini Omni: Foi a grande estrela do evento. Trata-se de um novo modelo que, segundo o Google, pode criar qualquer coisa a partir de qualquer entrada – começando por vídeo . Ele combina a inteligência do Gemini com modelos de mídia generativa para gerar e editar vídeos de forma conversacional. As notas de atualização do app Gemini descrevem o Omni como “algo como o Nano Banana para vídeos”, permitindo misturar texto, fotos e vídeos em criações únicas
. A ideia é que, com o tempo, esse modelo consiga gerar qualquer tipo de saída a partir de qualquer tipo de entrada
.
Gemini 3.5 Flash: O novo modelo padrão do app Gemini e do “Modo IA” da Busca do Google . O Google afirma que ele gera tokens quatro vezes mais rápido que outros modelos de ponta da mesma categoria, sendo otimizado para tarefas de programação, fluxos de múltiplas etapas e trabalhos de longa duração – um perfil típico de uso “agentivo”
.
Outros destaques do I/O 2026:
O que o Google está construindo é uma plataforma multimodal unificada em tempo real – e o Gemini Live com geração de imagens é uma peça-chave nessa estratégia.
A vantagem competitiva do Google, com base nesses anúncios, está na profundidade da integração: o Gemini Live une conversa, visão computacional e geração de imagens em um único fluxo natural, enquanto o Omni leva esse mesmo conceito para o vídeo e, no futuro, para qualquer formato de mídia. A pergunta que fica é como esses fluxos integrados vão performar na vida real conforme forem sendo distribuídos para mais usuários .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
O Gemini Live agora permite gerar e editar imagens diretamente na conversa por voz, usando a câmera do celular [8].
O Gemini Live agora permite gerar e editar imagens diretamente na conversa por voz, usando a câmera do celular [8]. Basta ativar o compartilhamento de câmera, mostrar um objeto e dar uma instrução em linguagem natural para criar ou modificar uma imagem na hora [8].
A tecnologia por trás é o modelo Gemini 2.5 Flash Image, conhecido internamente como “nano banana”, especializado em geração e edição de imagens de última geração [2].