Gemini Live ermöglicht jetzt die direkte Generierung und Bearbeitung von Bildern in Echtzeit per Kamera Sharing und Sprachbefehl [8]. Technische Grundlage ist Gemini 2.5 Flash Image, auch bekannt als „Nano Banana“ – Googles aktuell leistungsfähigstes Bildmodell [2].

Create a landscape editorial hero image for this Studio Global article: What real-time image generation and editing capability has Google added to Gemini Live, how does it work on Android and iOS, what technology. Article summary: ## What Google Added to Gemini Live. Topic tags: general, documentation, general web, user generated, education. Reference image context from search candidates: Reference image 1: visual subject "Google has begun the deployment of Gemini's innovative real-time AI video functionalities, enabling the platform to interpret visual input from a user's device" source context "Google's Gemini update that can tell you live what it sees through your camera is now rolling out - PhoneArena" Reference image 2: visual subject "Smartphones must have user-replaceable batteries by 2027. But not your iPhone. Here's why" source context "Google's Gemini update that can tell you l
Google hat Gemini Live – den Konversationsmodus seines KI-Assistenten – um eine direkte Echtzeit-Bildgenerierung und -bearbeitung erweitert . Während eines laufenden Live-Gesprächs können Nutzer den Kamera-Sharing-Modus aktivieren, die Handykamera auf ein Motiv richten und per natürlicher Sprache Anweisungen geben, um Bilder zu erstellen oder zu verändern
. Das Ergebnis erscheint direkt in der Live-Oberfläche, ohne dass man zwischen Apps wechseln muss
.
Der entscheidende Unterschied zu bisherigen Lösungen: Während Gemini 2.5 Flash Image bereits promptbasierte und bildgestützte Transformationen erlaubte, bringt die neue Integration diesen Erstellungs- und Bearbeitungskreislauf in eine echte Sprach-Kamera-Konversation in Echtzeit .
Das zugrundeliegende Bildmodell ist Gemini 2.5 Flash Image (alias „Nano Banana“), das Google als sein leistungsfähigstes Modell für Bildgenerierung und -bearbeitung beschreibt . Zu den Kernfähigkeiten gehören:
Googles Entwicklerkonferenz I/O 2026 brachte mehrere große Ankündigungen, die unmittelbar auf dieser Entwicklung aufbauen:
Gemini Omni – Ein neues Modell, das aus verschiedenen Eingaben (Text, Bild, Video, Audio) kohärente Medieninhalte erzeugen kann. Der Start erfolgt mit Omni Flash für Video . Google beschreibt es als Kombination der Gemini-Intelligenz mit den generativen Medienmodellen des Unternehmens – für verbesserte Multimodalität, Weltverständnis und Bearbeitungsmöglichkeiten
. In den Release Notes der Gemini-App heißt es, Omni mache Videoerstellung und -bearbeitung so einfach wie eine Unterhaltung, „wie Nano Banana für Videos“
. Die Vision: langfristig soll Omni „alles aus jeder Eingabe“ erstellen können
.
Gemini 3.5 Flash – Das neue Standardmodell für die Gemini-App und den KI-Modus von Google Search . Google zufolge gibt es Antworten viermal schneller aus als andere führende Modelle seiner Klasse und ist speziell für agentische Aufgaben, Coding, mehrstufige Workflows und langlaufende Prozesse optimiert
.
Weitere Highlights:
Google positioniert sich mit einer durchgängigen Echtzeit-Pipeline, die Konversation, Kameraeingabe, Bildgenerierung und Videoproduktion in einem einzigen System vereint :
Googles Vorteil liegt – gemessen an diesen Ankündigungen – in der Integrationstiefe: Gemini Live schließt die Lücke zwischen „Zeig mir, was du siehst“ und „Erstelle etwas Neues daraus“, während Omni dasselbe Konversationsprinzip auf Videos und breitere multimodale Anwendungen ausdehnt . Die entscheidende Frage bleibt, wie gut diese integrierten Workflows in der Praxis funktionieren, wenn sie breit ausgerollt werden
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Gemini Live ermöglicht jetzt die direkte Generierung und Bearbeitung von Bildern in Echtzeit per Kamera Sharing und Sprachbefehl [8].
Gemini Live ermöglicht jetzt die direkte Generierung und Bearbeitung von Bildern in Echtzeit per Kamera Sharing und Sprachbefehl [8]. Technische Grundlage ist Gemini 2.5 Flash Image, auch bekannt als „Nano Banana“ – Googles aktuell leistungsfähigstes Bildmodell [2].
Auf Android und iOS verfügbar: Nutzer starten den Kamera Sharing Modus in Gemini Live und geben Anweisungen in natürlicher Sprache [8].