Contrairement aux modèles pipeline qui convertissent les entrées de manière séquentielle, Gemini Omni Flash traite le texte, les images, l'audio et la vidéo comme une seule entrée unifiée et produit une sortie vidéo — une capacité appelée « any-to-any » AAB. Le modèle génère des clips de 3 à 10 secondes en 720p à 24 ips dans des formats 16:9, 9:16 ou 1:1, avec un audio natif synchronisé créé en une seule passe HG.
Vous pouvez fournir au modèle jusqu'à sept images de référence, un clip vidéo et un briefing textuel dans une seule invite, et il les fusionne en une sortie cohérente BG. Par exemple, un utilisateur pourrait fournir des photos de produits, une vidéo d'arrière-plan et une description, et Omni Flash générerait un clip promotionnel court.
La capacité phare est l'édition vidéo conversationnelle, rendue possible par l'API Interactions AA. Au lieu d'exporter des clips vers un outil de montage séparé, les utilisateurs peuvent affiner de manière itérative les sorties en langage naturel — échanges de personnages, échanges de produits, transferts de style, ajouts d'objets et rééclairage — tandis que le modèle préserve les parties de la vidéo que l'utilisateur souhaite conserver AA. Chaque tour de conversation produit une nouvelle vidéo, et le modèle comprend le contexte des tours précédents A.
Le prix de l'API est fixé à 0,10 $ par seconde de vidéo générée, soit l'équivalent de 1 $ par clip de 10 secondes AH. Cela correspond à Veo 3.1 Fast, positionnant Omni Flash comme une alternative à moindre coût et à itération plus rapide pour les flux de travail vidéo Y. La tarification est également de 1,50 $ par million de tokens d'entrée et de 17,50 $ par million de tokens de sortie vidéo H.
Pour les consommateurs, Gemini Omni Flash est gratuit sur YouTube Shorts pour les utilisateurs âgés de 18 ans et plus AWN. Il est également inclus dans les abonnements Google AI Plus, Pro et Ultra AG.
Le plafond de 10 secondes est une décision produit intentionnelle au lancement, avec des durées plus longues prévues pour les versions futures HY. Google a présenté cela comme une stratégie de déploiement responsable, équilibrant capacité et sécurité T. Certains commentateurs notent que la limite pourrait être une limitation côté déploiement plutôt qu'une limite de l'architecture du modèle N.
Chaque clip généré ou édité avec Omni Flash comprend un watermark numérique invisible SynthID YNN. Les utilisateurs peuvent vérifier le contenu généré par l'IA via l'application Gemini, Gemini dans Chrome et Google Search en demandant : « Cette vidéo a-t-elle été créée avec Google AI ? » NB. Sur les surfaces Google prises en charge, le contenu porte également des C2PA Content Credentials NC. Il n'y a pas de bouton dans l'API pour le désactiver DG.
Le 1er juillet 2026, Adobe a ajouté Gemini Omni Flash en tant que modèle partenaire dans Adobe Firefly, permettant l'édition vidéo en langage naturel en utilisant l'interface et le système de crédits de Firefly D. Il coûte 30 crédits par seconde de vidéo D. Cela fait suite à un partenariat plus large annoncé au Google I/O pour apporter le connecteur Adobe à Gemini B. Les utilisateurs peuvent y accéder depuis le menu déroulant Modèle dans le module Texte vers Vidéo A.
Sorti en même temps qu'Omni Flash, Nano Banana 2 Lite (ID de modèle : gemini-3.1-flash-lite-image) est le modèle d'image le plus rapide et le moins cher de la famille Nano Banana de Google AA. Il génère des images en moins de 4 secondes à moins de 0,04 $ pour 1 000 images BHB. La disponibilité générale a été annoncée le 30 juin 2026 sur Google Cloud, et il est disponible dans Google AI Studio, l'API Gemini et la plateforme Gemini Enterprise Agent HCB.
Google a présenté Omni Product Studio au Google I/O 2026, une application de démonstration qui transforme des images de produits statiques en vidéos e-cinématographiques en utilisant Gemini Omni Flash GC.
L'édition de vidéos téléchargées est bloquée pour les utilisateurs de l'Espace économique européen (EEE), de la Suisse et du Royaume-Uni A. Des rapports de la communauté notent également des blocages en Inde et dans certains États américains A. Le modèle n'édite de manière fiable que ses propres clips générés — et non des téléchargements tiers arbitraires — comme mesure de sécurité contre l'utilisation abusive des deepfakes A. Les capacités d'édition de la parole et de l'audio sont délibérément retenues au lancement en raison des préoccupations liées aux deepfakes TGL.