GPT Live 1 được OpenAI phát hành rộng rãi trên API ngày 10/9/2026. Đây là lớp giọng nói song công có thể vừa nghe vừa nói, còn mô hình hậu trường đảm nhiệm suy luận và công cụ.
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT-Live-1 full-duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11. It introduced GPT‑Live‑1 as a generally available, full‑duplex voice layer: a model intended to make voice agents more natural by listening and spe. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
OpenAI công bố GPT-Live-1 có mặt rộng rãi (GA) trên API vào ngày 10/9/2026, không phải ngày 11/9. Bản phát hành này cung cấp cho nhà phát triển một lớp hội thoại giọng nói có thể vừa lắng nghe vừa phản hồi, thay cho kiểu đối thoại theo từng lượt cứng nhắc. 1
16
Nhiều hệ thống trợ lý giọng nói hiện nay hoạt động như một chuỗi nối tiếp: giọng nói được chuyển thành văn bản (speech-to-text), mô hình ngôn ngữ tạo câu trả lời, rồi văn bản được chuyển ngược thành tiếng nói (text-to-speech). GPT-Live-1 được OpenAI định vị là lớp giọng nói thống nhất cho phần hội thoại thời gian thực trong quy trình đó. 1
Khác biệt thiết thực nằm ở cách luân phiên nói. OpenAI cho biết GPT-Live-1 có thể nghe và nói đồng thời, nhận biết khoảng ngừng, thay đổi nhịp nói, rồi quyết định nên trả lời hay tiếp tục lắng nghe. Theo thiết kế này, việc người dùng chen lời hoặc đáp ngắn để thể hiện đang theo dõi cuộc nói chuyện — thường gọi là backchannel — sẽ ít bị xem như lỗi hơn và gần với giao tiếp tự nhiên hơn. 1
9
15
Điều đó không có nghĩa mô hình giọng nói phải tự làm mọi việc. Phiên GPT-Live-1 vẫn có thể tiếp diễn trong khi một mô hình hoặc tác tử ở hậu trường xử lý suy luận sâu hơn hay gọi công cụ. OpenAI hỗ trợ Responses delegation với mô hình OpenAI và client delegation để kết nối hệ thống hậu trường do nhà phát triển tự vận hành. 1
16
GPT-Live-1 đảm nhiệm phần giao tiếp trực tiếp với người dùng: nghe, nói và điều phối nhịp hội thoại. Phần hậu trường có thể phụ trách các việc như suy luận phức tạp, truy xuất thông tin, thực thi quy trình hoặc gọi công cụ. Trong ghi chú sản phẩm của mình, OpenAI nêu GPT-6 Astra là một lựa chọn cho các tác vụ tìm kiếm và suy luận khó hơn; lập trình viên API cũng có thể dùng client delegation để nối với backend riêng. 4
16
Với đội ngũ phát triển, cách tách lớp này dẫn đến một số điểm cần lưu ý:
OpenAI cũng nhấn mạnh khả năng tuân thủ chỉ dẫn tốt hơn, giọng nói tùy chỉnh và hỗ trợ điện thoại (telephony) trong đợt phát hành API này. 13
Một phiên giọng nói GPT-Live-1 có giá 0,05 USD mỗi phút. Việc tính phí theo từng giây, không làm tròn lên phút kế tiếp. 16
18
Đây là mức giá cho phiên giọng nói, chưa hẳn là tổng chi phí của một tác tử giọng nói. Lượng sử dụng mô hình hậu trường và công cụ sẽ được tính riêng. Vì vậy, khi dự toán triển khai thực tế, doanh nghiệp cần tính cả thời lượng cuộc trò chuyện lẫn khối lượng công việc được chuyển cho backend. 16
18
OpenAI cho biết GPT-Live-1 cải thiện 30 điểm phần trăm trên bài đánh giá Full Duplex Bench so với GPT-Realtime-2.1. Công ty cũng nói tổ hợp GPT-Live-1 với GPT-6 Astra ở mức suy luận trung bình đứng đầu trên Tau3. 1
Tuy nhiên, các tài liệu nguồn được cung cấp không xác thực độc lập những số liệu cụ thể về độ trễ chuyển lượt hay tỷ lệ vượt qua Tau3 nêu trong câu hỏi ban đầu. Vì thế, không nên coi những con số chi tiết đó là đã được kiểm chứng trong phạm vi thông tin hiện có.
OpenAI đưa ra một số ví dụ triển khai thực tế để minh họa giá trị của cách luân phiên hội thoại tự nhiên hơn:
Đây là kết quả do các công ty tự báo cáo, không phải đánh giá độc lập. Do đó, chúng phù hợp để tham khảo như các ví dụ triển khai hơn là bảo đảm hiệu năng áp dụng cho mọi sản phẩm.
Nguồn được cung cấp không chứng thực thông tin về quyền truy cập doanh nghiệp thông qua một sản phẩm quản lý mang tên “Presence”. Các nguồn này cũng chưa xác lập một đợt mở rộng cụ thể về giọng vùng miền, phương ngữ hoặc ngôn ngữ cho lần ra mắt API này. Những chi tiết đó nên được kiểm tra trực tiếp trong tài liệu OpenAI mới nhất trước khi dùng làm căn cứ mua sắm hoặc triển khai.
Thay đổi lớn nhất của GPT-Live-1 là về kiến trúc: API nay có một lớp hội thoại giọng nói song công, cho phép tác tử tiếp tục nghe và nói tự nhiên trong khi hệ thống khác ở hậu trường thực hiện suy luận chậm hơn hoặc gọi công cụ. Mức giá 0,05 USD/phút, tính theo giây, giúp chi phí thời gian thoại dễ dự đoán hơn; nhưng tổng hóa đơn vẫn phụ thuộc vào mô hình hậu trường và các công cụ được chọn. 1
16
18
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
GPT Live 1 được OpenAI phát hành rộng rãi trên API ngày 10/9/2026. Đây là lớp giọng nói song công có thể vừa nghe vừa nói, còn mô hình hậu trường đảm nhiệm suy luận và công cụ.
GPT Live 1 được OpenAI phát hành rộng rãi trên API ngày 10/9/2026. Đây là lớp giọng nói song công có thể vừa nghe vừa nói, còn mô hình hậu trường đảm nhiệm suy luận và công cụ. Thay vì buộc người dùng nói hết lượt, GPT Live 1 được thiết kế để xử lý khoảng ngừng, lời chen ngang, tín hiệu đáp lời ngắn và thay đổi hướng hội thoại theo thời gian thực.
Giá lớp giọng nói là 0,05 USD/phút, tính theo từng giây. Chi phí mô hình hậu trường và công cụ được tính riêng; không phải mọi số liệu hiệu năng chi tiết trong câu hỏi ban đầu đều được tài liệu cung cấp xác thực.