目前版本的主要功能包括:
換句話說,Gemini 已經可以理解你正在看的畫面,但它仍然主要是 提供建議的助手,而不是能真正操作電腦的系統工具。
其中一個最受關注的功能叫 Gemini Spark。
根據洩漏報導,Spark 可能是一個 桌面 AI 代理,可以直接在電腦上執行操作,例如:
報導甚至形容它能「幫你整理檔案」,意味著 AI 不再只是回答問題,而是能在電腦上實際完成工作。
如果落實,這將是 Google 助手策略的一大轉變。
另一項傳聞中的設計是 Chat 與 Agent 雙模式介面。
概念大致如下:
這種設計正在不少 AI 軟件中出現,因為「聊天」和「讓 AI 代勞事情」其實是兩種完全不同的使用方式。
另一個洩漏功能叫 Gemini Live。
據稱它會在桌面上提供一個 浮動語音對話層(overlay),讓你可以和 AI 持續語音交流,同時 AI 也能看到你正在做的事情。
這意味著 Gemini 可以:
與只分析單張截圖不同,這種模式會在整個會話過程中持續理解畫面。
對開發者而言,一個名為 Stream to Cursor 的功能也可能登場。
這個功能據稱會把桌面或應用程式的上下文 直接傳送到 Cursor 編輯器,讓 Gemini 能基於目前的開發流程提供更精準的程式建議。
這與 Google 表示 I/O 2026 將重點展示 agentic coding(代理式編程) 的方向一致。
另一個被提及的模型是 Veo4 Omni。
早期消息指它可能是一個整合的影片創作系統,支援:
但由於相關資料主要來自程式碼分析,目前具體能力仍未確定。
Google 尚未正式確認上述功能。
不過 **Google I/O 2026(5 月 19–20 日)**很可能是首次公開展示的場合。Google 已表示活動將集中介紹 Gemini 與新的 AI 能力。
可能的推出方式包括:
目前也未確認是否需要 Gemini Advanced 或 Google One AI 訂閱才能使用。
如果這些功能真的推出,Gemini 將更接近新興的 「AI 電腦代理」類型。
這類系統不只是聊天,而是能:
有報導指出,Google 推動這些功能的部分原因,是為了與其他 AI 代理產品競爭,例如讓 AI 直接控制軟件環境的工具。
不過,AI 代理也帶來新的風險。
如果 AI 可以讀取螢幕或整理檔案,它可能需要取得:
這些權限意味著,如果系統誤判指令或處理敏感資料,可能會出現私隱與安全問題。
目前 Google 尚未公布這些功能的 權限控制、審計機制或安全保護措施。
目前可以確定的只有幾點:
而以下功能仍主要來自洩漏或早期版本發現:
這些功能會否按目前消息所說推出,或者以實驗形式登場,很可能要等 Google 在 I/O 的正式 발표才會揭曉。