这个版本的核心功能包括:
目前这些能力主要是让 Gemini 成为一个具备上下文理解能力的助手。它能分析屏幕内容,但基本不会主动操作系统。
泄露信息中最受关注的功能之一是 Gemini Spark。
报道称,Spark 被设计为一个能够在电脑上执行动作的 AI 代理,例如:
如果实现,这意味着 Gemini 不只是回答问题,而是能实际完成工作流程,例如整理文件或处理系统任务。
另一项传闻中的变化是 双模式界面设计。
可能的逻辑是:
这种设计正在成为 AI 软件的常见趋势——将“聊天”和“委托 AI 完成任务”明确区分开。
另一个曝光的功能是 Gemini Live。
据称它会在桌面上提供一个浮动语音界面,让 Gemini 能够:
与只分析截图不同,这种模式会在整个会话期间动态理解屏幕内容。
针对开发者,Google 可能推出 Stream to Cursor 功能。
该功能据称可以:
这与 Google 在 I/O 2026 上强调的 “agentic coding” 战略方向一致。
另一个曝光的模型是 Veo4 Omni。
目前信息有限,但泄露内容暗示它可能支持:
需要注意,这些细节来自构建版本分析,并未得到官方确认。
Google 尚未正式公布上述功能。
但最可能的时间点是 Google I/O 2026(5 月 19–20 日),届时 Google 计划公布新的 Gemini 能力以及 AI 产品更新。
可能的发布方式包括:
此外,目前也不清楚这些功能是否需要 Gemini Advanced 或 Google One AI 订阅。
如果这些功能落地,Gemini 将进入一个新的竞争领域:AI 电脑代理(computer‑use agents)。
在这种模式下,AI 可以:
部分报道还将这些功能视为 Google 对其他 AI 代理产品(例如可以直接操作软件环境的系统)的回应。
让 AI 直接操作电脑,也带来了新的隐私与安全挑战。
例如系统可能需要访问:
如果权限管理不清晰,或 AI 误解用户指令,可能会导致敏感信息暴露或错误操作。
目前 Google 尚未公布这些潜在功能的 权限机制、安全策略或审计系统。
目前可以确认的事实包括:
而 Gemini Spark、Chat/Agent 模式、Gemini Live 屏幕感知语音、Stream to Cursor 以及 Veo4 Omni 等功能,目前主要来自泄露信息和早期版本分析。
这些功能是否会按现有描述推出,或以实验形式逐步上线,很可能要等到 Google I/O 2026 才会有更明确的答案。