Google ha integrado la generación y edición directa de imágenes dentro de Gemini Live, su modo de IA conversacional en tiempo real [8]. Durante una conversación de voz en vivo, los usuarios activan el uso compartido de cámara para que Gemini vea lo mismo que ellos y luego le piden en lenguaje natural que genere o ed...

Create a landscape editorial hero image for this Studio Global article: What real-time image generation and editing capability has Google added to Gemini Live, how does it work on Android and iOS, what technology. Article summary: ## What Google Added to Gemini Live. Topic tags: general, documentation, general web, user generated, education. Reference image context from search candidates: Reference image 1: visual subject "Google has begun the deployment of Gemini's innovative real-time AI video functionalities, enabling the platform to interpret visual input from a user's device" source context "Google's Gemini update that can tell you live what it sees through your camera is now rolling out - PhoneArena" Reference image 2: visual subject "Smartphones must have user-replaceable batteries by 2027. But not your iPhone. Here's why" source context "Google's Gemini update that can tell you l
Google ha dado un paso de gigante en la interacción con la IA al añadir la capacidad de crear y editar imágenes en tiempo real directamente dentro de Gemini Live, su modo de conversación por voz . Esto significa que ya no necesitas escribir prompts en una caja de texto fría: ahora puedes tener una charla fluida con la IA, activar tu cámara y pedirle que imagine o transforme lo que está viendo.
La magia ocurre en tres simples pasos:
La base de esta funcionalidad es el modelo Gemini 2.5 Flash Image (conocido internamente como "nano-banana"), que Google describe como su modelo de vanguardia para generación y edición de imágenes . Este motor puede combinar múltiples fotos en una sola composición, mantener la consistencia de personajes para crear narrativas visuales y realizar transformaciones muy precisas solo con texto
.
La gran diferencia con el uso anterior de Gemini es el contexto. Antes, pedir una imagen era una acción aislada. Ahora, en Live, la creación y edición son parte de una conversación continua donde la IA entiende lo que ve y lo que le pides en el mismo hilo de diálogo .
La tecnología que lo impulsa, Gemini 2.5 Flash Image, ofrece capacidades únicas :
Esta función no es un experimento aislado. Fue presentada en el Google I/O 2026 junto a otras grandes novedades que muestran la estrategia global de Google :
Gemini Omni: "Nano Banana para videos"
Google presentó su nuevo modelo que puede crear y editar videos de forma conversacional. Piensa en ello como la misma experiencia de Live, pero para clips de video. Combina texto, imágenes, audio y video como entrada, y entiende la física del mundo real para hacer ediciones coherentes .
Gemini 3.5 Flash: Velocidad y agencia
Se convirtió en el nuevo modelo por defecto de la app de Gemini y el buscador. Está diseñado para ser rapidísimo (genera tokens cuatro veces más rápido que otros modelos de su categoría) y manejar tareas complejas y "agentes" (multi-paso, programación, flujos de trabajo largos) sin atascarse .
Otras claves del I/O 2026:
Con Gemini Live, Google cierra el círculo entre mostrarle algo a la IA y pedirle que cree o modifique algo nuevo en tiempo real . Pero la visión es más grande: con Gemini Omni para video, la compañía quiere que esa misma fluidez conversacional aplique para la creación y edición de clips complejos
.
La posición de Google en el panorama competitivo de la IA multimodal no es solo tener el mejor modelo de imagen o video por separado. Es la profundidad de la integración: unir la conversación, la cámara, la generación de imagen y la futura creación de video en un solo flujo de trabajo unificado, potenciado por su conocimiento del mundo real. La gran incógnita, como con toda tecnología que recién se despliega, será comprobar qué tan bien funcionan estas ambiciosas integraciones en el día a día de los usuarios .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google ha integrado la generación y edición directa de imágenes dentro de Gemini Live, su modo de IA conversacional en tiempo real [8].
Google ha integrado la generación y edición directa de imágenes dentro de Gemini Live, su modo de IA conversacional en tiempo real [8]. Durante una conversación de voz en vivo, los usuarios activan el uso compartido de cámara para que Gemini vea lo mismo que ellos y luego le piden en lenguaje natural que genere o edite una imagen [8].
En dispositivos Android, la función usa el modelo Gemini 2.5 Flash Image (apodado 'nano banana') y se integra perfectamente en la aplicación de Gemini [2][8].