Gemini Liveに何が追加されたか:Googleは会話型AI「Gemini Live」内で、リアルタイムの画像生成・編集機能の提供を開始した [8]。 具体的な使い方:Liveでの音声会話中にカメラ共有を起動し、被写体をスマホで示しながら自然言語で指示を出すと、その場で画像が生成・編集される [8]。

Create a landscape editorial hero image for this Studio Global article: What real-time image generation and editing capability has Google added to Gemini Live, how does it work on Android and iOS, what technology. Article summary: ## What Google Added to Gemini Live. Topic tags: general, documentation, general web, user generated, education. Reference image context from search candidates: Reference image 1: visual subject "Google has begun the deployment of Gemini's innovative real-time AI video functionalities, enabling the platform to interpret visual input from a user's device" source context "Google's Gemini update that can tell you live what it sees through your camera is now rolling out - PhoneArena" Reference image 2: visual subject "Smartphones must have user-replaceable batteries by 2027. But not your iPhone. Here's why" source context "Google's Gemini update that can tell you l
ついに、グーグルの会話型AI「Gemini Live」が、音声対話の中でのリアルタイム画像生成・編集に直接対応しました 。これは、「ちょっとこれを見て」とスマホのカメラをかざし、見えているものについて自然な会話をしながら、その場で画像を生成したり編集したりできるというものです
。生成・編集された画像は、Gemini Liveの画面に直接表示されます
。
例えば、部屋の模様替えを考えているとき、壁の色を変えたイメージをその場で見せてもらったり、手元にある小物をAIに認識させて、それに合う背景画像を生成してもらったりといったことが、音声だけで可能になります。
Androidでは、Gemini Liveの「カメラ共有」機能を使います。会話中にカメラを起動し、被写体をGeminiに見せながら、「この机の上に、花瓶を置いた画像を作って」といった自然な日本語の指示を出すだけで、AIが状況を理解し、画像を生成・編集します 。この裏側で動いているのが、Gemini 2.5 Flash Imageという画像生成モデルです。開発者向けには「nano-banana(ナノバナナ)」という愛称でも知られています
。
中核となる機能は同様で、カメラ共有を使ったリアルタイムでの画像生成・編集が可能です。ただし、現時点で公開されているソース資料では、iOSに特化した詳細な操作フローは明記されていません 。
重要なポイント:これまでもGeminiアプリでは、テキストや画像を使った画像生成・編集(nano-banana 2による機能)が利用できました。今回のGemini Liveのアップデートは、この生成・編集のループを、音声とカメラを使ったリアルタイムの会話の中に完全に溶け込ませたという点が画期的です 。
このリアルタイム画像処理を支える画像モデルが、**Gemini 2.5 Flash Image(通称:nano-banana)**です。グーグルはこれを「最先端の画像生成・編集モデル」と位置づけています 。主な能力は以下の通りです:
この動きをさらに加速させる大型発表が、2026年5月のGoogle I/Oで行われました。核となるのは、以下の3つです。
「あらゆるインプットから、あらゆるアウトプットを生み出す」というコンセプトの新モデルです 。まずは動画生成・編集からスタートし、テキストや画像、音声を組み合わせて、Geminiの世界理解力を背景にした高品質な動画を作れます
。最大の特徴は、ChatGPTと話すように「この部分の背景を変えて」「もっと明るくして」と会話しながら動画を編集できることで、「Nano Banana for Video(動画版ナノバナナ)」とも表現されています
。
GeminiアプリとGoogle検索の「AIモード」のデフォルトモデルが、この「3.5 Flash」に置き換わりました 。グーグルによると、同クラスのフロンティアモデルと比較してトークン出力が4倍高速で、特に複数ステップのツール利用やコーディングといった「エージェント的」なタスクで真価を発揮するよう設計されています
。
今回の一連の発表で改めて明確になったのは、グーグルが「会話・カメラ入力・画像生成・動画生成をシームレスに統合した、リアルタイムのマルチモーダルパイプライン」を圧倒的な強みとして打ち出している点です 。
グーグルが築こうとしている優位性は、「統合の深さ」です。「見せて、話して、作ってもらう」という一連の流れを、複数のアプリやツールを切り替えることなく、一つの会話の中で完結させる。今回のアップデートは、そのビジョンが現実のものとして動き出した瞬間と言えるでしょう。今後の焦点は、この野心的な統合ワークフローが、実際にどこまで実用的でクリエイティブな体験を提供できるかに移っていきます 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Gemini Liveに何が追加されたか:Googleは会話型AI「Gemini Live」内で、リアルタイムの画像生成・編集機能の提供を開始した [8]。
Gemini Liveに何が追加されたか:Googleは会話型AI「Gemini Live」内で、リアルタイムの画像生成・編集機能の提供を開始した [8]。 具体的な使い方:Liveでの音声会話中にカメラ共有を起動し、被写体をスマホで示しながら自然言語で指示を出すと、その場で画像が生成・編集される [8]。
Androidでの仕組み:Gemini Liveのカメラ共有フローを使い、被写体を見せて画像生成や編集を依頼する。広範な画像生成能力は「Gemini 2.5 Flash Image(通称nano banana)」が支える [2][8]。