谷歌为 Gemini Live 引入了实时的图像生成与编辑功能,用户在语音对话中开启摄像头共享后,即可用自然语言直接创作或修改图像 [8]。 在安卓端,用户可通过 Gemini Live 的摄像头共享流程展示拍摄对象,并发出图像生成或编辑指令;iOS 端具备同样的核心能力,底层模型均为 Gemini 2.5 Flash Image(内部代号 nano banana)[2][8]。

Create a landscape editorial hero image for this Studio Global article: What real-time image generation and editing capability has Google added to Gemini Live, how does it work on Android and iOS, what technology. Article summary: ## What Google Added to Gemini Live. Topic tags: general, documentation, general web, user generated, education. Reference image context from search candidates: Reference image 1: visual subject "Google has begun the deployment of Gemini's innovative real-time AI video functionalities, enabling the platform to interpret visual input from a user's device" source context "Google's Gemini update that can tell you live what it sees through your camera is now rolling out - PhoneArena" Reference image 2: visual subject "Smartphones must have user-replaceable batteries by 2027. But not your iPhone. Here's why" source context "Google's Gemini update that can tell you l
谷歌已在 Gemini Live 中推出了实时图像生成与编辑功能,这进一步丰富了该对话式 AI 模式的体验 。
在 Live 语音对话过程中,用户只需激活摄像头共享模式,将手机对准想要拍摄的对象,然后用自然语言下达指令,Gemini 就能现场生成或修改图像 。最终生成或编辑好的图片会直接呈现在 Live 对话的界面中,整个过程无需跳出当前对话
。
一句话总结:你可以像和朋友视频通话一样,让 AI 实时“看见”你眼前的画面,再按你的想法当场“画”出或“改”出一张新图。
需要特别注意的一个区别是:此前的图像生成与编辑功能主要基于“输入提示词或上传图片”完成,属于异步操作。而此次更新的关键进步在于,谷歌将这套生成/编辑流程无缝嵌入了实时的语音对话与视频画面交互中,让创作与对话同步发生 。
支撑这一实时创作体验的图像模型是 Gemini 2.5 Flash Image,谷歌内部也叫它 “nano-banana”,谷歌将其定位为目前最先进的图像生成与编辑模型 。
它的几项关键能力包括:
目前,Gemini 2.5 Flash Image 已通过 Gemini API 和 Google AI Studio 向开发者开放,企业用户可通过 Vertex AI 使用,定价为每 100 万输出 token 30 美元,其中每张图片计为 1290 个输出 token 。
这次 Gemini Live 的实时图像功能只是谷歌多模态战略的一个节点。在 Google I/O 2026 大会上,谷歌发布了一系列重磅更新,环环相扣地构建了一个更完整的实时创作生态:
这是 I/O 2026 上最受关注的发布之一。Gemini Omni 被谷歌定义为“一种可以从任何输入生成任何内容的新模型”,它的第一步是从视频开始 。
Omni 系列首个模型 Gemini Omni Flash 已经向 Google AI Plus、Pro 和 Ultra 订阅用户开放,可在 Gemini 应用、Google Flow 和 YouTube Shorts 中使用 。目前 Omni Flash 暂只支持 10 秒短视频,谷歌称这属于算力部署策略的考量
。谷歌还提到,未来 Omni 将陆续支持图像、音频等多种输出形式,最终实现真正的“任意输入到任意输出”
。
谷歌在 I/O 2026 上发布了新模型家族 Gemini 3.5 系列,首发版本 Gemini 3.5 Flash 成为了 Gemini 应用和 Google 搜索“AI 模式”的新默认模型 。
此外,谷歌在 I/O 2026 上还发布了 Gemini Spark 智能体,以及重新设计的 Gemini 应用界面,进一步将对话、图像生成、视频创作等能力整合到更流畅的交互体验中 。
相关背景:Gemini 3.5 Flash 和 Omni 的发布,与 OpenAI 的 GPT 系列、Anthropic 的 Claude 系列在编码、推理、多模态等方向构成了直接竞争关系。谷歌此次强调的“速度快 4 倍”,直指竞争对手在推理延迟方面的痛点
。
总结谷歌当前在 AI 领域的战略,可以清晰地看到一个“统一实时多模态管线”的思路:
谷歌的核心竞争壁垒在于整合深度:它不仅提供模型,更提供从底层模型到终端应用(Gemini 应用、搜索、YouTube、Workspace 系列)的全链路体验 。相比之下,许多竞品虽在单点模型能力上很强,但在端到端消费级实时创作体验的整合上仍有差距。
当然,目前这些体验仍在逐步铺开的过程中,实际表现是否足够稳定、能否真正降低普通用户的创作门槛,还需要更广泛的实际使用来验证 。
此次 Gemini Live 的实时图像生成/编辑更新,并不是一个孤立的 AI 新功能。它和 Google I/O 2026 上发布的 Gemini Omni、Gemini 3.5 Flash 等一起,共同构成了谷歌“多模态 AI 创作工具链”的清晰蓝图:
对于国内用户而言,虽然部分服务可能存在访问限制,但这一系列发布所体现的“让 AI 创作像聊天一样简单”的方向,很可能影响整个行业的产品形态走向。无论是内容创作者、教育工作者,还是普通用户,都可以保持关注。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
谷歌为 Gemini Live 引入了实时的图像生成与编辑功能,用户在语音对话中开启摄像头共享后,即可用自然语言直接创作或修改图像 [8]。
谷歌为 Gemini Live 引入了实时的图像生成与编辑功能,用户在语音对话中开启摄像头共享后,即可用自然语言直接创作或修改图像 [8]。 在安卓端,用户可通过 Gemini Live 的摄像头共享流程展示拍摄对象,并发出图像生成或编辑指令;iOS 端具备同样的核心能力,底层模型均为 Gemini 2.5 Flash Image(内部代号 nano banana)[2][8]。
支撑该功能的是谷歌目前最先进的图像生成与编辑模型 Gemini 2.5 Flash Image,它支持多图融合、角色一致性保持、定向自然语言修改等能力 [2]。