Google เพิ่มเลเยอร์การโต้ตอบด้วยเสียงแบบกดค้าง (press-and-hold) ให้กับแอป Gemini บน macOS ช่วยให้ผู้ใช้พูดคุยกับ Gemini จากหน้าต่างใดก็ได้บนเดสก์ท็อปโดยการกด ปุ่ม Fn ค้างไว้ การอัปเดตนี้มีสองโหมดหลัก
| ฟีเจอร์ | Gemini macOS (29 ก.ค.) | ChatGPT Desktop (23 ก.ค.) | Apple Intelligence (Siri) |
|---|---|---|---|
| วิธีเรียกใช้ | กด Fn ค้างไว้ | ปุ่มเสียงในแอป / แป้นพิมพ์ลัด | 'Hey Siri' หรือปุ่ม |
| ขอบเขต | ทั่วทั้งระบบ ทุกหน้าต่าง | ภายในแอป ChatGPT (เอเจนต์ Work/Codex) | ทั่วทั้งระบบผ่าน Siri |
| การมองเห็นหน้าจอ | มี, เลือกเปิดใช้เอง | มี (ผ่านเอเจนต์ Work/Codex, Appshots บน macOS) | จำกัด (บริบทบนหน้าจอในบางแอป) |
| โมเดลเสียง | การถอดเสียง + การใช้เหตุผลของ Gemini | GPT-Live-1 (สองทาง, ขัดจังหวะได้) | โมเดล Siri บนอุปกรณ์ |
| การสนทนาสองทาง | เน้นการป้อนตามคำสั่ง ไม่ใช่ full duplex | Full duplex (พูดและฟังพร้อมกัน) | คำสั่งแบบครั้งเดียว |
| ระบบอัตโนมัติบนเดสก์ท็อป | ผ่านคำสั่ง Screen Awareness | การควบคุมเอเจนต์โดยตรง (Codex, Work) | Shortcuts + app intents |
| แพลตฟอร์ม | macOS เท่านั้น (สัปดาห์นี้) | macOS + Windows | macOS, iOS, iPadOS (ระบบนิเวศ Apple) |
จุดแตกต่างสำคัญ: GPT-Live-1 ของ ChatGPT Desktop เป็นโหมดเสียงสนทนาที่แท้จริง — สามารถฟังและพูดไปพร้อมกัน จัดการการขัดจังหวะ และสั่งงานเอเจนต์ AI แบบเรียลไทม์ แนวทางของ Gemini นั้นเน้นงานมากกว่า: การป้อนตามคำสั่งบวกกับคำสั่งที่รับรู้หน้าจอ มากกว่าการสนทนาแบบเป็นธรรมชาติ Apple Intelligence ทำงานบนอุปกรณ์เป็นหลักและผสานรวมกับระบบได้ดี แต่ขาดความลึกเชิงสร้างสรรค์และความอิสระข้ามแอปเช่น Gemini หรือ ChatGPT