这种交互方式被谷歌称为一种“展示 + 指令(show and tell)”模式。用户不需要写复杂提示,只需给出简短指令,例如:
Gemini会结合指令和屏幕上下文生成结果。谷歌研究人员认为,这可以减少用户在不同应用之间复制、粘贴和解释内容的步骤,也就是所谓的 “AI detour(AI绕路)”。
Magic Pointer的第一批实际应用将出现在 Chrome 浏览器 中。用户可以直接对网页上的特定内容提问,而不是针对整个页面。
目前报道的功能包括:
某些实现方式还支持一种简单的触发动作:轻轻晃动鼠标光标。系统会根据光标所在内容自动弹出可执行操作。例如,如果光标指向邮件里的日期,系统可能建议创建日历事件。
据报道,这项功能正在桌面版 Chrome(包括 Windows 和 macOS)中逐步推出,但谷歌尚未公布完整的地区或时间表。
Chrome 只是第一步。谷歌同时宣布推出一种新的笔记本类别:Googlebook,这是一个围绕 Gemini AI 构建的设备平台。
这些设备预计将在 2026 年秋季上市,并会把 Magic Pointer 作为系统级功能的一部分。
在操作系统层面,光标可能可以与各种应用中的内容互动。例如:
一些报道认为 Googlebook 的系统可能结合了 Android 与 ChromeOS 的部分技术,但具体架构和应用兼容性仍未完全确认。
Google DeepMind已经发布了两个实验性演示,用来展示AI光标的潜力,这些演示通过 Google AI Studio 提供。
1. 图片编辑演示
用户只需指向图片某个区域,并告诉Gemini进行修改,例如改变颜色或替换对象,而无需传统的编辑工具。
2. 地图推理演示
用户把光标指向地图上的某个位置,然后询问问题或请求推荐,例如寻找附近地点或路线。
这些演示的目标是说明一种更广泛的概念:光标可以成为AI理解屏幕世界的入口。
目前公开信息显示了几个关键节点:
不过具体设备型号、价格、企业管理功能以及地区上线情况,目前仍未完全公布。
尽管演示看起来很流畅,但现实测试显示这项技术仍处于早期阶段。
一些媒体体验后认为,它在演示场景中表现不错,但在复杂网页或真实工作流程中仍然不够稳定。
可能遇到的问题包括:
因此,目前最可靠的使用环境可能仍是谷歌能够清晰解析结构的内容,例如网页、图片、PDF或地图。
Magic Pointer需要理解光标周围的屏幕内容,这意味着系统可能需要读取或分析屏幕显示的信息。
如果未来扩展到整个操作系统,这些内容可能包括:
谷歌目前尚未详细说明这些数据是在本地处理还是上传到云端,也没有公开数据保存时间或隐私控制细节。因此,这一功能的隐私模型仍有待进一步说明。
Magic Pointer背后的真正目标,是探索一种新的计算机界面模式:AI原生交互(AI‑native interface)。
传统软件依赖菜单、按钮和工具栏,而谷歌的设想是让用户只需指向屏幕内容,然后对AI说一句简单的话,例如:
AI负责理解上下文并完成任务。
这种模式是否能在日常电脑使用中足够可靠,现在还无法确定。但它显示出一个明显趋势:科技公司正在重新思考,AI在用户界面中应该扮演什么角色。