Lưu ý: OpenAI vẫn chưa đưa ra thông báo chính thức. Tên cuối cùng của mô hình, hành vi chính xác của các cấp độ và ngày ra mắt vẫn chưa được công ty xác nhận.
Các chế độ giọng nói hiện tại của ChatGPT — Giọng nói Chuẩn (Standard Voice) và Chế độ Giọng nói Nâng cao (Advanced Voice Mode) — hoạt động theo mô hình dạng lượt (turn-based). Mô hình phải đợi người dùng nói xong mới có thể phản hồi. Kiến trúc hai chiều (BiDi) của GPT-Bidi-1 cho phép mô hình xử lý hai luồng âm thanh cùng lúc: luồng của bạn và luồng của chính nó.
Các khác biệt về hành vi chính được báo cáo trong các bản trình diễn:
Mục tiêu nội bộ của OpenAI là thu hẹp khoảng cách giữa ngăn xếp giọng nói của ChatGPT — vốn tụt hậu so với các mô hình văn bản (đã đạt đến khả năng suy luận ngang GPT-5.5) — và mang lại sự tương đồng về trí thông minh hội thoại thời gian thực.
GPT-Bidi-1 là mô hình giọng nói đầu tiên của OpenAI giới thiệu ba cấp độ thông minh và tốc độ có thể chọn cho giọng nói:
| Cấp độ | Mô tả |
|---|---|
| Cao (High) | Suy luận sâu nhất, phản hồi chậm hơn — dành cho các tác vụ phân tích phức tạp |
| Trung bình (Medium) | Cân bằng giữa thông minh và tốc độ |
| Tức thì (Instant) | Phản hồi nhanh nhất có thể, suy luận giảm — dành cho các tương tác thông thường hoặc nhạy cảm về thời gian |
Hệ thống cấp độ cho phép người dùng điều chỉnh độ sâu tương tác so với độ trễ cho từng tác vụ, tương tự như cách các mô hình văn bản của ChatGPT cung cấp các mức độ suy luận khác nhau. Ví dụ, một truy vấn thời tiết nhanh sẽ sử dụng Tức thì, trong khi một buổi động não sâu sẽ chuyển sang Cao.
Khi GPT-Bidi-1 được chọn, biểu tượng bong bóng giọng nói/chỉ báo dạng sóng chuyển sang màu vàng thay vì màu mặc định hiện tại. Mô hình xuất hiện trong bộ chọn mô hình cài đặt dưới dạng một tùy chọn mới có nhãn "Bidi (Mới nhất)" cùng với Giọng nói Chuẩn và Chế độ Giọng nói Nâng cao hiện có, thay vì thay thế chúng.
gpt-bidi-1. Bối cảnh cạnh tranh: Việc thúc đẩy giọng nói hai chiều này đáp trả trực tiếp những tiến bộ từ Google (Gemini Live với khả năng ngắt lời), Anthropic và các tác nhân giọng nói thời gian thực từ các startup. OpenAI đang chạy đua để mang lại sự tương đồng về tương tác giọng nói với trí thông minh văn bản của mình, vốn đã hỗ trợ khả năng suy luận ngang GPT-5.5.