GPT-Live là một họ mô hình giọng nói mới được xây dựng trên kiến trúc song công hoàn toàn — nó có thể vừa nghe vừa nói cùng lúc, thay vì luân phiên nhau theo kiểu "bấm để nói" (push-to-talk) . Hai phiên bản đã được phát hành vào ngày 8/7/2026:
Hệ thống này thay thế hoàn toàn Advanced Voice Mode trước đây . Những thay đổi kiến trúc chính bao gồm:
Advanced Voice Mode trước đây (ra mắt vào giữa năm 2024) là một hệ thống theo lượt, luân phiên giữa nghe và nói. Nó đã được thay thế hoàn toàn bởi GPT-Live vào ngày 8/7/2026 . Tính năng giọng nói trên desktop macOS cũ thậm chí đã bị ngừng sớm hơn — vào ngày 15 tháng 1 năm 2026 — như một phần trong kế hoạch tổng thể nhằm tinh gọn và nâng cao khả năng giọng nói trước khi GPT-Live ra mắt
.
ChatGPT Voice trên desktop cho phép người dùng điều khiển toàn bộ ứng dụng hợp nhất bằng giọng nói qua ba chế độ — Chat, Work và Codex — tất cả đều có thể truy cập từ một giao diện desktop duy nhất .
Người dùng có thể nói các lệnh để chỉ đạo nhiều tác tử đang chạy trong Work hoặc Codex cùng lúc, ví dụ: "Kiểm tra lịch của tôi, soạn thảo một email và chuẩn bị một bản tóm tắt cuộc họp" .
Trên ứng dụng desktop Mac, ChatGPT Voice tích hợp với Appshots, một tính năng ban đầu được phát hành cho Codex vào tháng 5/2026, cho phép AI chụp lại cửa sổ ứng dụng phía trước nhất — bao gồm cả ảnh chụp màn hình và văn bản có thể truy cập — để lấy ngữ cảnh .
ChatGPT Voice trên desktop tận dụng Computer Use (khả năng điều khiển hệ điều hành của OpenAI), các tệp cục bộ và plugin để thực thi các yêu cầu bằng giọng nói . Hệ thống có thể:
Việc ra mắt ChatGPT Voice trên desktop diễn ra sau một đợt hợp nhất sản phẩm lớn hai tuần trước đó, vào ngày 9/7/2026: