Google implementó una capa de interacción por voz mediante presión prolongada para la app Gemini en macOS. Los usuarios pueden hablar con Gemini desde cualquier ventana de su escritorio manteniendo presionada la tecla Fn . La actualización ofrece dos modos distintos.
| Característica | Gemini macOS (29 julio) | ChatGPT Desktop (23 julio) | Apple Intelligence (Siri) |
|---|---|---|---|
| Activación | Mantener presionada tecla Fn | Botón de voz en la app / atajo de teclado | "Oye Siri" o botón |
| Alcance | En todo el sistema, cualquier ventana | Dentro de la app ChatGPT (agentes Work/Codex) | En todo el sistema vía Siri |
| Visión de pantalla | Sí, opcional | Sí (vía agentes Work/Codex, Appshots en macOS) | Limitada (contexto de pantalla en algunas apps) |
| Modelo de voz | Transcripción + razonamiento de Gemini | GPT-Live-1 (bidireccional, interrumpible) | Modelos Siri en el dispositivo |
| Conversación bidireccional | Centrado en dictado; no es dúplex completo | Dúplex completo (habla y escucha simultáneamente) | Consultas de una sola vez |
| Automatización del escritorio | Mediante comandos de Screen Awareness | Control directo de agentes (Codex, Work) | Atajos + intenciones de apps |
| Plataforma | Solo macOS (esta semana) | macOS + Windows | macOS, iOS, iPadOS (ecosistema Apple) |
Diferencias clave: El modo de voz de ChatGPT Desktop con GPT-Live-1 es una verdadera conversación: puede escuchar y hablar al mismo tiempo, gestionar interrupciones y dirigir agentes de IA en tiempo real . El enfoque de Gemini es más orientado a tareas: dictado más comandos que dependen de la pantalla, en lugar de un diálogo fluido. Apple Intelligence funciona completamente en el dispositivo y está integrado en el sistema, pero carece de la profundidad generativa y la autonomía entre aplicaciones de Gemini o ChatGPT.