Google udostępniło warstwę interakcji głosowej w aplikacji Gemini na macOS. Użytkownicy mogą mówić do Gemini z dowolnego okna na pulpicie, przytrzymując klawisz Fn . Aktualizacja oferuje dwa tryby.
| Funkcja | Gemini macOS (29 lipca) | ChatGPT Desktop (23 lipca) | Apple Intelligence (Siri) |
|---|---|---|---|
| Wywołanie | Długie przytrzymanie Fn | Przycisk głosowy / skrót klawiszowy | „Hey Siri” lub przycisk |
| Zasięg | Systemowy, dowolne okno | W aplikacji ChatGPT (Work/Codex) | Systemowy przez Siri |
| Świadomość ekranu | Tak, opcjonalnie | Tak (Work/Codex, Appshots na macOS) | Ograniczona (kontekst w niektórych aplikacjach) |
| Model głosowy | Transkrypcja + wnioskowanie Gemini | GPT-Live-1 (dwukierunkowy, z możliwością przerywania) | Modele Siri na urządzeniu |
| Dwukierunkowa rozmowa | Skupione na dyktandzie, nie pełny dupleks | Pełny dupleks (jednoczesne mówienie i słuchanie) | Pojedyncze zapytania |
| Automatyzacja pulpitu | Polecenia Świadomości Ekranu | Bezpośrednie sterowanie agentami (Codex, Work) | Skróty + intencje aplikacji |
| Platforma | Tylko macOS (w tym tygodniu) | macOS + Windows | macOS, iOS, iPadOS (ekosystem Apple) |
Kluczowe różnice: ChatGPT Desktop z GPT-Live-1 oferuje prawdziwy konwersacyjny tryb głosowy – może słuchać i mówić jednocześnie, obsługiwać przerwy i kierować agentami AI w czasie rzeczywistym . Gemini jest bardziej zadaniowy: dyktando plus polecenia związane z ekranem, bez płynnej konwersacji. Apple Intelligence działa głównie na urządzeniu i jest głęboko zintegrowane z systemem, ale brak mu głębi generatywnej i autonomii międzykrypcyjnej Gemini czy ChatGPT.