Google har infört direkt bildgenerering och redigering i realtid i Gemini Live, den röststyrda AI läget, genom att aktivera kameradelning och ge instruktioner på vanligt språk [8]. På Android använder funktionen kameraflödet för att visa ett motiv och be Gemini skapa eller redigera en bild – tekniken bakom är Gemini...

Create a landscape editorial hero image for this Studio Global article: What real-time image generation and editing capability has Google added to Gemini Live, how does it work on Android and iOS, what technology. Article summary: ## What Google Added to Gemini Live. Topic tags: general, documentation, general web, user generated, education. Reference image context from search candidates: Reference image 1: visual subject "Google has begun the deployment of Gemini's innovative real-time AI video functionalities, enabling the platform to interpret visual input from a user's device" source context "Google's Gemini update that can tell you live what it sees through your camera is now rolling out - PhoneArena" Reference image 2: visual subject "Smartphones must have user-replaceable batteries by 2027. But not your iPhone. Here's why" source context "Google's Gemini update that can tell you l
Google har rullat ut direkt realtidsbildgenerering och redigering inuti Gemini Live, det konversationsbaserade AI-läget . Under ett pågående röstsamtal kan användare aktivera kameradelning, rikta telefonen mot ett motiv och ge instruktioner på vanligt språk för att skapa eller justera bilder – allt direkt i Live-gränssnittet
.
Den avgörande skillnaden: befintlig bildgenerering och redigering via Gemini 2.5 Flash Image stöder prompt- och bildbaserade transformationer, medan den nya Gemini Live-utrullningen för in skapandet och redigerandet i ett röst- och kameraflöde i realtid .
Den underliggande bildmodellen är Gemini 2.5 Flash Image (internt kallad nano-banana), som Google beskriver som sin toppmoderna modell för bildgenerering och redigering . Viktiga färdigheter:
Ett flertal stora nyheter från årets I/O-konferens bygger direkt på detta momentum:
Gemini Omni – En ny modell som kan skapa output från olika typer av input, med start i video . Google säger att modellen kombinerar Gemini:s intelligens med företagets generativa mediamodeller för bättre multimodalitet, världsförståelse och redigering
. I Gemini-appens release notes beskrivs Omni som ett sätt att göra videoskapande och redigering lika enkelt som en konversation – ”som Nano Banana för video” – med stöd för text, foton och video som underlag
. På sikt är tanken att Omni ska kunna skapa ”vad som helst från vilken input som helst”
.
Gemini 3.5 Flash – Den nya standardmodellen i Gemini-appen och i ”AI Mode” i Google Sök . Google uppger att den levererar tokens fyra gånger snabbare än andra frontlinjemodeller på samma nivå och är byggd för agentiska uppgifter, kodning, flerstegsflöden och långvariga uppdrag
.
Andra viktiga besked:
Google positionerar sig kring en enhetlig realtidspipeline som spänner över konversation, kamerainput, bildgenerering och videoskapande .
Googles fördel, utifrån vad som presenterats, ligger i integrationsdjupet: Gemini Live sluter cirkeln mellan ”visa Gemini vad jag ser” och ”be Gemini att skapa eller redigera något”, medan Omni drar samma konversationsmodell mot video och bredare multimodal produktion . Den stora obesvarade frågan är hur väl dessa integrerade arbetsflöden presterar i praktiken när de rullas ut i större skala
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google har infört direkt bildgenerering och redigering i realtid i Gemini Live, den röststyrda AI läget, genom att aktivera kameradelning och ge instruktioner på vanligt språk [8].
Google har infört direkt bildgenerering och redigering i realtid i Gemini Live, den röststyrda AI läget, genom att aktivera kameradelning och ge instruktioner på vanligt språk [8]. På Android använder funktionen kameraflödet för att visa ett motiv och be Gemini skapa eller redigera en bild – tekniken bakom är Gemini 2.5 Flash Image (även kallad nano banana) [2][8].
På iOS fungerar samma grundfunktion med kameradelning och realtidskonversation, men källorna specificerar ingen separat iOS arbetsflöde [8].