GPT Live 1 được đưa vào API ngày 10/9/2026, có giá 0,05 USD mỗi phút cho lớp giọng nói ở phía trước; mô hình suy luận, công cụ và hạ tầng đi kèm được tính riêng. Thiết kế song công toàn phần giúp mô hình có thể nghe trong lúc phát lời nói, từ đó xử lý ngắt lời, khoảng dừng và các tín hiệu đáp lại ngắn tự nhiên hơn s...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GPT-Live-1 là mô hình giọng nói dành cho nhà phát triển của OpenAI, hướng tới các cuộc trò chuyện có cảm giác giống đối thoại trực tiếp hơn là kiểu “bạn nói xong, AI mới trả lời”. Mô hình được cung cấp qua API từ ngày 10/9/2026, với mức giá 0,05 USD/phút cho lớp giọng nói phía trước. Đây chưa phải tổng chi phí của một trợ lý giọng nói hoàn chỉnh: phần suy luận backend, gọi công cụ, điện thoại và các hạ tầng liên quan vẫn tính phí riêng. 3
5
Một trợ lý giọng nói truyền thống thường đi qua ba chặng: chuyển giọng nói thành văn bản (speech-to-text), để mô hình ngôn ngữ xử lý văn bản, rồi chuyển câu trả lời thành tiếng nói (text-to-speech). Cách làm này có thể hiệu quả, nhưng mỗi chặng là một lần bàn giao; ứng dụng phải tự điều phối thời điểm nói, khoảng ngập ngừng, việc người dùng đổi ý hoặc chen ngang. 3
GPT-Live-1 được định vị là một mô hình giọng nói duy nhất xử lý cả âm thanh đi vào lẫn âm thanh phát ra. Với kiến trúc song công toàn phần, nó có thể tiếp tục lắng nghe trong khi đang nói. Mục tiêu là phản ứng linh hoạt khi người dùng ngắt lời, nói một câu xác nhận ngắn như “ừ” hoặc “đúng rồi”, thay vì coi mọi âm thanh, im lặng hay tiếng nói xung quanh là một lượt hội thoại mới bắt buộc phải trả lời. 3
Điểm đáng chú ý vì thế không chỉ là tốc độ tạo âm thanh. Nó là khả năng kiểm soát nhịp hội thoại: nhận biết người dùng còn đang suy nghĩ, thực sự muốn chen vào hay chỉ đưa ra một tín hiệu lắng nghe. OpenAI gọi GPT-Live-1 là lựa chọn cao cấp của họ cho các cuộc trò chuyện giọng nói tự nhiên, giàu biểu cảm và xử lý ngắt lời mượt mà. 2
3
GPT-Live-1 không nhất thiết phải tự đảm nhiệm toàn bộ logic nghiệp vụ. Nó có thể duy trì cuộc trò chuyện thời gian thực, đồng thời chuyển các tác vụ cần suy luận sâu, gọi công cụ hoặc thực hiện hành động sang một mô hình backend và khung agent riêng. 3
Cách tách lớp này cho phép đội ngũ kỹ thuật lựa chọn kiến trúc theo từng tác vụ:
Nói ngắn gọn, GPT-Live-1 phụ trách phần đối thoại bằng giọng nói; backend cung cấp suy luận, dữ liệu nghiệp vụ và hành động. Đổi lại, mức giá 0,05 USD/phút chỉ phản ánh lớp giọng nói, không phản ánh toàn bộ chi phí vận hành agent. 3
5
OpenAI cho biết nhà phát triển có thể định hướng giọng điệu, nhịp độ và phong cách trò chuyện qua system prompt. GPT-Live-1 cũng cung cấp bản chép lời và văn bản phản hồi, hỗ trợ hiểu ký tự chữ–số, ưu tiên từ khóa, cùng tính năng nhận diện lượt nói cho các sản phẩm vẫn cần ranh giới lượt hội thoại rõ ràng. 3
Mô hình được hướng tới các phiên làm việc dài và agent qua điện thoại, như chăm sóc khách hàng hoặc nhận đặt chỗ. Theo OpenAI, GPT-Live-1 có thể xử lý im lặng và tạp âm nền mà không diễn giải thành lời mọi bước xử lý nội bộ — một hành vi quan trọng với cuộc gọi thực tế, nơi môi trường âm thanh khó kiểm soát. 3
Tài liệu được cung cấp chưa xác lập danh sách ngôn ngữ hỗ trợ chính thức, cũng chưa nêu chi tiết các cơ chế điều khiển riêng cho từng giọng địa phương hay phương ngữ. Các nhóm triển khai nên kiểm tra tài liệu API hiện hành trước khi xem đó là yêu cầu kỹ thuật đã được bảo đảm.
OpenAI cho biết GPT-Live-1 tăng 30 điểm phần trăm so với GPT-Realtime-2.1 trên Full Duplex Bench — bài đánh giá tập trung vào hành vi đối thoại tương tác như thay phiên nói, khoảng dừng, ngắt lời, tín hiệu đáp lại và tiếng nói nền. 3
Khi ghép GPT-Live-1 với GPT-6 Astra ở mức nỗ lực suy luận trung bình, OpenAI cũng cho biết cấu hình này xếp hạng số 1 trên Tau3, một benchmark đánh giá năng lực agent giọng nói theo tác vụ đầu-cuối. Phần đánh giá dịch vụ khách hàng của Tau3 bao gồm các tác vụ nói trong lĩnh vực hàng không, bán lẻ và viễn thông. 3
Một số nguồn thứ cấp đưa ra số liệu cụ thể về độ trễ chuyển lượt và điểm Tau3. Tuy nhiên, phần tài liệu nguồn chính được cung cấp ở đây không nêu các giá trị chính xác đó. Kết luận thận trọng hơn là: OpenAI báo cáo mức cải thiện đáng kể về hành vi tương tác và vị trí dẫn đầu Tau3 cho cấu hình GPT-Live-1 kết hợp Astra, chứ không phải mọi cách triển khai đều sẽ tái tạo một con số benchmark cụ thể. 3
7
OpenAI nêu một số ví dụ triển khai agent giọng nói ban đầu:
Những ví dụ này cho thấy song công toàn phần đặc biệt hữu ích trong tình huống người gọi do dự, tự sửa lời, xác nhận giữa chừng hoặc ngắt lời mà không muốn khởi động lại toàn bộ phiên trao đổi.
Không. Mức 0,05 USD/phút áp dụng cho lớp giọng nói phía trước của GPT-Live-1. Nhà phát triển có thể ghép với mô hình backend và khung agent tùy chọn, nhưng suy luận backend, công cụ và dịch vụ liên quan sẽ làm thay đổi tổng chi phí vận hành. 3
5
OpenAI cũng đề cập OpenAI Presence như một cách khác để xây dựng quy trình giọng nói dùng GPT-Live-1 cho tương tác thời gian thực. Tuy vậy, tài liệu được cung cấp không xác định điều kiện tiếp cận doanh nghiệp, điều khoản thương mại, mô hình lưu trữ hay quy trình đăng ký Presence. Không nên suy diễn các chi tiết này chỉ từ thông báo API. 3
Với các đội ngũ đang cân nhắc thử nghiệm, câu hỏi quan trọng không chỉ là giá mỗi phút. Cần đánh giá liệu trải nghiệm thay phiên nói mượt hơn mang lại bao nhiêu giá trị cho quy trình, và kết hợp backend cùng công cụ nào để đạt độ tin cậy cần thiết trong mức tổng chi phí chấp nhận được.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
GPT Live 1 được đưa vào API ngày 10/9/2026, có giá 0,05 USD mỗi phút cho lớp giọng nói ở phía trước; mô hình suy luận, công cụ và hạ tầng đi kèm được tính riêng.
GPT Live 1 được đưa vào API ngày 10/9/2026, có giá 0,05 USD mỗi phút cho lớp giọng nói ở phía trước; mô hình suy luận, công cụ và hạ tầng đi kèm được tính riêng. Thiết kế song công toàn phần giúp mô hình có thể nghe trong lúc phát lời nói, từ đó xử lý ngắt lời, khoảng dừng và các tín hiệu đáp lại ngắn tự nhiên hơn so với chuỗi STT–LLM–TTS truyền thống.
OpenAI cho biết GPT Live 1 cao hơn GPT Realtime 2.1 30 điểm phần trăm trên Full Duplex Bench; khi ghép với GPT 6 Astra ở mức suy luận trung bình, cấu hình này đứng đầu Tau3.