Google 在 2026 年 4 月 15 日推出 macOS 原生 Gemini 應用程式,讓使用者可以在電腦上直接呼叫 AI 助手,而不必依賴瀏覽器。
目前版本的重點功能包括:
這些功能已讓 Gemini 具備「螢幕情境理解」能力,但它目前仍主要是一個 上下文感知的聊天助手,而不是能真正操作電腦的系統代理。
最受關注的傳聞功能之一是 Gemini Spark。爆料指出,它可能是一個能直接在電腦上執行操作的 AI 代理。
早期報導指出 Spark 可能具備:
如果這項能力正式推出,Gemini 可能不只回答問題,而是能真正 幫你管理電腦上的工作流程。一些報導甚至提到它可以「整理你的檔案」,顯示 Google 正朝 電腦操作型 AI 代理(computer‑use agents) 發展。
另一項傳聞中的變化是 雙模式介面,把聊天與任務執行分開。
概念大致如下:
這種設計其實反映了 AI 軟體的一個新趨勢:明確區分 「問問題」與「把任務交給 AI 做」。
另一項爆料功能是 Gemini Live。它可能在桌面上提供一個浮動語音介面,讓使用者可以直接與 AI 對話。
如果按照目前的描述,它可能支援:
與只分析單張截圖不同,Gemini Live 可能會在整個工作過程中持續理解畫面內容並回應。
Google 也可能加強 Gemini 與開發工具的整合。
傳聞中的 Stream to Cursor 功能,會把桌面或應用程式的上下文直接傳送到 Cursor 程式碼編輯器,讓 Gemini 能依照開發者目前的工作內容提供建議。
這與 Google 在 I/O 2026 提到的 agentic coding 方向一致:讓 AI 在實際開發流程中協助完成工作,而不只是生成程式碼片段。
另一個被提及的模型是 Veo4 Omni,據稱是一個與 Gemini 整合的影片生成與編輯系統。
目前可見的資訊不多,但傳聞能力包括:
由於這些資訊來自應用程式內部分析,而非官方文件,實際功能仍有很大不確定性。
Google 尚未正式確認上述功能。
不過 Google I/O 2026(5 月 19–20 日) 很可能是這些能力首次公開的舞台。Google 已表示今年活動會聚焦 Gemini 更新與 AI 技術突破。
可能的推出方式包括:
目前也不清楚這些功能是否需要 Gemini Advanced 或 Google One AI 訂閱。
若這些功能真的推出,Gemini 將更接近新興的 AI 電腦代理(AI computer‑use agents)。
這類 AI 的特點是能:
相關報導也指出,部分功能是為了回應競爭對手的代理型 AI 產品,例如能控制軟體環境的 AI 助手實驗。
當 AI 開始操作電腦時,也會帶來新的風險。
例如:
如果 AI 在自動化任務中誤解指令,或處理到敏感資料,就可能產生隱私問題。目前 Google 尚未公布這些傳聞功能的 權限模型、安全機制或審計機制。
目前可以確定的事實包括:
而以下功能仍主要來自爆料或程式碼分析:
這些能力是否會在 I/O 正式亮相,或以實驗功能形式推出,很快就會有答案。