このアプリは、ブラウザを開かずにAIアシスタントを呼び出せるのが特徴です。
主な機能は以下の通りです。
すでに画面の内容を理解する「コンテキスト対応アシスタント」として機能していますが、現時点では自動でPC操作を行う仕組みではありません。
リーク情報で特に注目されているのが、**「Gemini Spark」**と呼ばれるエージェント機能です。
報道によるとSparkは、ユーザーのPC上で次のような操作を実行できる可能性があります。
もし実装されれば、Geminiは単に回答するAIではなく、実際に作業を代行するコンピューター操作型エージェントに近づくことになります。
さらに、チャットAIとエージェント機能を分けたインターフェースの存在も報告されています。
想定されている構成は次の通りです。
この設計は、AIソフトウェアで増えつつある「質問するAI」と「作業を任せるAI」を明確に分ける流れとも一致します。
もう一つの注目機能が**「Gemini Live」**です。
リークでは、デスクトップ上に音声会話用のフローティングオーバーレイが表示され、次のような使い方が想定されています。
従来のスクリーンショット分析とは違い、画面を見ながら会話し続けるアシスタントになる可能性があります。
開発者向けには、**「Stream to Cursor」**という機能も報告されています。
これは、デスクトップやアプリの状況をCursorコードエディタへストリーミングし、Geminiが開発中のコンテキストを理解したうえでコード提案を行う仕組みとされています。
GoogleはI/O 2026で「エージェント型コーディング」を強調すると予告しており、この機能はその戦略と一致します。
リークには**「Veo4 Omni」**という動画AIモデルも登場しています。
詳細はまだ不明ですが、次のような機能が示唆されています。
ただし、この情報は主にアプリ解析に基づくもので、公式仕様はまだ発表されていません。
これらの機能についてGoogleは正式発表していません。
ただし、**Google I/O 2026(5月19日〜20日)**が最も有力な発表の場とみられています。
考えられる公開方法は次の通りです。
また、これらの機能がGemini AdvancedやGoogle One AIプラン限定になるかどうかも現時点では明らかになっていません。
もしリーク通りの機能が実装されれば、Geminiは**「コンピューター操作AI」**という新しいカテゴリに本格参入することになります。
つまり、AIは次のようなことが可能になります。
一部報道では、こうした動きはClaude系のエージェント機能など競合AIへの対抗とも指摘されています。
一方で、デスクトップAIエージェントには新しいリスクもあります。
例えば次のようなアクセス権が必要になる可能性があります。
これらは便利である一方、機密情報の処理や誤操作によるファイル変更などのリスクも伴います。
現時点では、Googleがどのような権限管理・監査ログ・安全対策を導入するのかは公表されていません。
現在、公式に確認できるのは次の点です。
一方で、以下の機能は主にリーク情報に基づくものです。
これらが実際にどの形で登場するのかは、Google I/O 2026での発表によって明らかになる可能性があります。