GPT Live 1 tersedia di API sejak 10 September 2026 dengan tarif US$0,05 per menit untuk lapisan suara front end. Desain full duplex membuat model dapat terus mendengarkan saat menghasilkan suara, sehingga interupsi, jeda, dan respons singkat dapat ditangani lebih natural.
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GPT-Live-1 adalah model suara untuk pengembang dari OpenAI yang dirancang agar percakapan terasa seperti dialog langsung, bukan rangkaian giliran rekaman. Model ini tersedia melalui API sejak 10 September 2026 dengan harga US$0,05 per menit untuk lapisan suara front-end. Biaya model penalaran, tool, dan infrastruktur lain yang dipasang di belakangnya tetap dihitung terpisah. 3
5
Banyak agen suara dibangun lewat rangkaian bertahap: audio penelepon diubah menjadi teks oleh speech-to-text (STT), model bahasa menyusun jawaban teks, lalu text-to-speech (TTS) mengubahnya kembali menjadi suara. Pendekatan ini dapat bekerja dengan baik, tetapi setiap tahap merupakan proses serah-terima. Aplikasi perlu mengatur sendiri jeda, perubahan maksud, dan interupsi di antara komponen-komponen tersebut. 3
GPT-Live-1 diposisikan sebagai satu model suara yang memproses audio masuk dan audio keluar. Dalam desain full-duplex, model dapat tetap mendengarkan ketika sedang berbicara. Tujuannya adalah agar ia dapat merespons interupsi atau tanggapan singkat tanpa menganggap setiap suara, keheningan, maupun percakapan di sekitar pengguna sebagai giliran baru yang wajib dijawab. 3
Jadi, manfaatnya bukan sekadar suara yang lebih cepat keluar. Yang ditekankan adalah kontrol percakapan: mengenali saat seseorang masih berpikir, sedang menyela, atau hanya berkata singkat seperti “ya” sebagai tanda mengikuti pembicaraan—bukan meminta jawaban baru. OpenAI menyebut GPT-Live-1 sebagai model andalannya untuk percakapan suara yang alami dan ekspresif, dengan penanganan interupsi yang mulus. 2
3
GPT-Live-1 tidak harus menjalankan seluruh logika bisnis sendirian. Model ini dapat menjaga percakapan suara real-time sambil mendelegasikan penalaran yang lebih berat, pemanggilan tool, atau tindakan ke model backend dan kerangka agen yang dipilih pengembang. 3
Pemisahan ini memberi beberapa pilihan desain:
Dengan kata lain, sistemnya terdiri dari dua bagian: GPT-Live-1 mengelola interaksi suara secara langsung, sedangkan backend menyediakan penalaran, akses data bisnis, dan tindakan. Konsekuensinya, angka US$0,05 per menit bukanlah biaya total agen suara. Inferensi backend, penggunaan tool, teleponi, dan layanan terkait dapat menambah biaya operasional. 3
5
Menurut OpenAI, pengembang dapat mengarahkan nada bicara, tempo, dan gaya percakapan lewat system prompt. GPT-Live-1 juga menyediakan transkrip serta teks respons, mendukung pemahaman karakter alfanumerik dan keyword biasing, serta menawarkan deteksi giliran bicara untuk produk yang tetap memerlukan batas giliran eksplisit. 3
Model ini ditujukan untuk sesi yang lebih panjang dan agen berbasis telepon, termasuk layanan pelanggan serta pemesanan. OpenAI menyatakan model dapat menangani keheningan dan kebisingan latar tanpa menarasikan setiap langkah internalnya—perilaku yang relevan untuk percakapan telepon di lingkungan yang tidak selalu ideal. 3
Dokumentasi yang tersedia dalam materi sumber belum menetapkan daftar bahasa yang didukung secara definitif maupun kontrol khusus untuk aksen dan dialek. Pengembang sebaiknya memeriksa dokumentasi API terbaru sebelum menjadikannya sebagai persyaratan implementasi.
OpenAI melaporkan GPT-Live-1 meningkat 30 poin persentase dibanding GPT-Realtime-2.1 pada Full Duplex Bench. Evaluasi ini menilai perilaku suara interaktif, termasuk pengambilan giliran, jeda, interupsi, respons singkat pendengar, dan suara latar. 3
Saat dipasangkan dengan GPT-6 Astra pada tingkat upaya penalaran menengah, OpenAI juga melaporkan GPT-Live-1 menempati peringkat pertama di Tau3, benchmark agen suara end-to-end. Komponen layanan pelanggannya mencakup tugas lisan dalam konteks maskapai, ritel, dan telekomunikasi. 3
Sejumlah laporan sekunder menyebut angka spesifik untuk latensi pengambilan giliran dan skor Tau3. Namun, materi sumber primer yang tersedia tidak memuat angka presisi tersebut. Kesimpulan yang lebih aman adalah bahwa OpenAI melaporkan peningkatan besar pada perilaku interaktif dan posisi teratas di Tau3 untuk konfigurasi GPT-Live-1 dengan Astra—bukan jaminan bahwa setiap penerapan akan menghasilkan angka benchmark yang sama. 3
7
OpenAI menyoroti beberapa penerapan awal agen suara ini:
Contoh-contoh tersebut memperlihatkan kondisi ketika full-duplex paling bernilai: penelepon ragu-ragu, membetulkan ucapannya sendiri, memberi respons singkat di tengah jawaban agen, atau menyela tanpa ingin mengulang interaksi dari awal.
Tarif GPT-Live-1 adalah US$0,05 per menit untuk lapisan suara front-end. Pengembang dapat memasangkannya dengan model backend dan kerangka agen pilihannya, tetapi pilihan tersebut memengaruhi biaya total karena ditagihkan di luar lapisan suara. 3
5
OpenAI juga menyebut OpenAI Presence sebagai cara lain membangun alur kerja suara menggunakan GPT-Live-1 untuk interaksi suara real-time. Namun, materi yang tersedia tidak menjelaskan kelayakan perusahaan, ketentuan komersial, model hosting, maupun proses akses Presence. Karena itu, detail-detail tersebut tidak seharusnya diasumsikan hanya dari pengumuman API. 3
Bagi tim yang sedang mengevaluasi model ini, pertanyaan utamanya bukan hanya tarif per menit: seberapa besar nilai yang dihasilkan oleh percakapan yang lebih mulus, serta kombinasi model backend dan jalur tool mana yang dapat memberikan keandalan yang dibutuhkan dengan biaya total yang dapat diterima?
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
GPT Live 1 tersedia di API sejak 10 September 2026 dengan tarif US$0,05 per menit untuk lapisan suara front end.
GPT Live 1 tersedia di API sejak 10 September 2026 dengan tarif US$0,05 per menit untuk lapisan suara front end. Desain full duplex membuat model dapat terus mendengarkan saat menghasilkan suara, sehingga interupsi, jeda, dan respons singkat dapat ditangani lebih natural.
Biaya total agen tidak berhenti pada tarif suara: model backend, tool, teleponi, dan infrastruktur lain ditagihkan terpisah.