A diferencia de los modelos de tubería que convierten las entradas de forma secuencial, Gemini Omni Flash procesa texto, imágenes, audio y vídeo como una única entrada unificada y produce una salida de vídeo, una capacidad denominada 'de cualquier cosa a cualquier cosa' AAB. El modelo genera clips de 3 a 10 segundos en 720p a 24 fotogramas por segundo en relaciones de aspecto 16:9, 9:16 o 1:1, con audio nativo sincronizado creado en la misma pasada HG.
Puedes introducir hasta siete imágenes de referencia, un clip de vídeo y un texto breve en una sola instrucción, y el modelo los fusiona en un resultado coherente BG. Por ejemplo, un usuario podría proporcionar fotos de un producto, un vídeo de fondo y una descripción, y Omni Flash generaría un breve clip promocional.
La capacidad estrella es la edición conversacional de vídeos, posible gracias a la API Interactions AA. En lugar de exportar los clips a una herramienta de edición aparte, los usuarios pueden refinar los resultados de forma iterativa usando lenguaje natural: intercambiar personajes, cambiar productos, transferir estilos, añadir objetos y reiluminar, mientras el modelo conserva las partes del vídeo que el usuario quiere mantener AA. Cada turno en la conversación produce un nuevo vídeo, y el modelo entiende el contexto de las interacciones anteriores A.
El precio de la API se ha fijado en $0.10 por segundo de vídeo generado, lo que equivale a $1 por cada clip de 10 segundos AH. Esta tarifa iguala a Veo 3.1 Fast, posicionando a Omni Flash como una alternativa de menor coste e iteración más rápida para flujos de trabajo de vídeo Y. El precio también es de $1.50 por millón de tokens de entrada y $17.50 por millón de tokens de salida de vídeo H.
Para los consumidores, Gemini Omni Flash es gratuito en YouTube Shorts para usuarios mayores de 18 años AWN. También está incluido en los planes de suscripción Google AI Plus, Pro y Ultra AG.
El límite de 10 segundos es una decisión de producto intencionada en el lanzamiento, con duraciones más largas planificadas para futuras versiones HY. Google ha calificado esta medida como una estrategia de despliegue responsable, que equilibra la capacidad con la seguridad T. Algunos comentaristas señalan que el límite podría ser una limitación del lado del despliegue, más que una limitación de la arquitectura del modelo N.
Cada clip generado o editado con Omni Flash incluye una marca de agua digital invisible SynthID YNN. Los usuarios pueden verificar el contenido generado por IA a través de la app Gemini, Gemini en Chrome y Google Search preguntando, por ejemplo, '¿Este vídeo se creó con Google AI?' NB. En las superficies de Google compatibles, el contenido también lleva Credenciales de Contenido C2PA NC. No hay un parámetro en la API para desactivarla DG.
El 1 de julio de 2026, Adobe añadió Gemini Omni Flash como modelo asociado dentro de Adobe Firefly, permitiendo la edición de vídeo en lenguaje natural usando la interfaz y el sistema de créditos de Firefly D. Tiene un coste de 30 créditos por segundo de vídeo D. Esta integración se enmarca en una asociación más amplia anunciada en el Google I/O para llevar el conector de Adobe a Gemini B. Los usuarios pueden acceder a él desde el menú desplegable de Modelos en el módulo de Texto a Vídeo A.
Lanzado junto con Omni Flash, Nano Banana 2 Lite (ID del modelo: gemini-3.1-flash-lite-image) es el modelo de imagen más rápido y barato de la familia Nano Banana de Google AA. Genera imágenes en menos de 4 segundos a un coste de menos de $0.04 por cada 1.000 imágenes BHB. Su disponibilidad general se anunció el 30 de junio de 2026 en Google Cloud, y está disponible en Google AI Studio, la API de Gemini y la Plataforma de Agentes Empresariales de Gemini HCB.
Google presentó Omni Product Studio en el Google I/O 2026, una aplicación de demostración que convierte imágenes de productos estáticas en vídeos comerciales cinematográficos utilizando Gemini Omni Flash GC.
La edición de vídeos subidos por el usuario está bloqueada para los usuarios del Espacio Económico Europeo (EEE), Suiza y el Reino Unido A. Informes de la comunidad también mencionan bloqueos en India y en algunos estados de EE. UU. A. El modelo también edita de forma fiable únicamente sus propios clips generados —no vídeos de terceros subidos aleatoriamente— como medida de seguridad contra el uso malintencionado para crear deepfakes A. Las capacidades de edición de voz y audio se han retenido deliberadamente en el lanzamiento por las mismas preocupaciones sobre los deepfakes TGL.