| GPT-5.6 Terra — tier seimbang | 2 dolar AS | 12 dolar AS | Turun 20% dari 2,50 dolar AS dan 15 dolar AS |
| GPT-5.6 Sol — tier unggulan | 5 dolar AS | 30 dolar AS | Tetap, tetapi mendapat mode Fast |
Token adalah unit teks yang digunakan untuk menghitung pemakaian model AI. Tarif input berlaku untuk teks yang dikirim pengguna, sedangkan tarif output berlaku untuk jawaban yang dihasilkan model.
Jika input dan output dijumlahkan, biaya Luna menjadi 1,40 dolar AS per 1 juta token. Angka ini menempatkannya di antara model frontier—model AI dengan kemampuan terdepan—dengan harga yang sangat rendah . Terra kini memiliki biaya gabungan 14 dolar AS per 1 juta token.
Untuk Sol, mode Fast dapat memproses permintaan hingga 2,5 kali lebih cepat daripada mode Standard dengan tarif dua kali lipat. OpenAI menyatakan tidak ada pengurangan kemampuan atau kecerdasan model dalam mode tersebut .
Bagian paling tidak biasa dari pengumuman ini adalah peran GPT-5.6 Sol dalam mengoptimalkan sistem yang menjalankan model AI.
Pada 29 Juli, OpenAI mengungkap bahwa GPT-5.6 Sol, melalui lingkungan pengembangan Codex, terhubung ke infrastruktur internal perusahaan untuk merancang dan menjalankan ratusan eksperimen arsitektur, memantau penerapan sistem, lalu mengulangi proses berdasarkan hasilnya . Model tersebut juga mempelajari sintaks Triton dan Gluon, dua bahasa pemrograman yang digunakan dalam tumpukan kernel OpenAI .
Kernel GPU adalah kode tingkat rendah yang mengatur bagaimana operasi model dijalankan pada perangkat keras grafis. Perbaikan pada lapisan ini dapat mengurangi waktu komputasi dan penggunaan sumber daya tanpa harus mengganti model utamanya.
OpenAI melaporkan dua hasil utama:
Speculative decoding menggunakan model kecil sebagai “model draf” untuk menebak token berikutnya. Model yang lebih besar kemudian memeriksa tebakan tersebut. Jika tebakan cukup akurat, jawaban bisa dibuat lebih cepat dengan komputasi yang lebih sedikit.
Optimasi juga mencakup lapisan infrastruktur lain. Laporan menyebut OpenAI memperbarui sistem load balancing agar permintaan dapat dibagi secara dinamis berdasarkan lokasi geografis, jenis akselerator, dan ketersediaan cache . Selain itu, prompt caching dengan masa berlaku sekitar 30 menit dapat membuat input yang tersimpan di cache hingga 90% lebih murah daripada input baru .
Kombinasi penghematan ini memberi OpenAI ruang untuk menurunkan harga kepada pelanggan API sembari mempertahankan keekonomian layanan.
Pemangkasan harga yang begitu besar tidak terjadi dalam ruang hampa. Dalam beberapa pekan terakhir, sejumlah model baru membuat pelanggan semakin sulit menerima tarif tinggi tanpa peningkatan kemampuan yang sepadan.
Moonshot AI merilis Kimi K3 pada 17 Juli. Model open-weight—model yang bobotnya tersedia untuk digunakan atau dikembangkan lebih lanjut sesuai ketentuan lisensinya—ini memiliki 2,8 triliun parameter dan berasal dari perusahaan rintisan berbasis Beijing .
Dalam sejumlah pengujian pengodean front-end, Kimi K3 diklaim mampu menyamai atau mengungguli GPT-5.6 Sol dan model Anthropic tertentu . Di papan peringkat Arena untuk Frontend Code, Kimi K3 mencatat 1.679 poin, di atas GPT-5.6 Sol dan Fable 5 .
Studi independen Startrise AI Labs yang diterbitkan pada 30 Juli juga menemukan Kimi K3 imbang dengan Claude Opus 5 dalam pengujian rekayasa front-end tertentu, dengan biaya menjalankan seluruh rangkaian tes 7,17 dolar AS, dibandingkan 21,17 dolar AS untuk Opus 5 .
Microsoft bahkan dilaporkan mempertimbangkan pengujian Kimi K3 di Copilot dan kemungkinan integrasinya ke Azure. Jika terealisasi, langkah itu diperkirakan dapat menghemat hingga 600 juta dolar AS, atau sekitar 60% per token .
Anthropic merilis Claude Opus 5 pada 24 Juli dengan harga input 5 dolar AS per 1 juta token—setengah dari harga Fable 5—seraya mengungguli Fable 5 dalam sejumlah tolok ukur . Kehadiran model ini menambah tekanan di segmen premium tempat GPT-5.6 Sol bersaing.
Google dan Microsoft juga memperkenalkan sejumlah model dengan biaya lebih rendah selama Juli, sehingga persaingan semakin ketat di segmen menengah dan hemat . Dalam kondisi tersebut, OpenAI tampaknya menempatkan Luna sebagai pilihan murah untuk pekerjaan bervolume tinggi dan sensitif terhadap harga, sementara Sol tetap menjadi pembeda premium .
Perubahan harga ini juga mencerminkan perubahan sikap perusahaan terhadap belanja AI. Setelah penggunaan agen AI dan layanan berbasis token meningkatkan tagihan, organisasi mulai menuntut anggaran yang lebih terukur—mirip dengan cara mereka mengelola biaya cloud.
Pada 22 Juli 2026, OpenAI menambahkan batas pengeluaran bulanan yang dapat diberlakukan secara langsung di platform API . Administrator dapat menetapkan batas pada tingkat organisasi atau proyek. Setelah anggaran habis, permintaan API berikutnya akan gagal dengan respons HTTP 429 hingga siklus penagihan berikutnya .
Fitur ini berbeda dari batas lunak yang sebelumnya tersedia untuk ChatGPT Enterprise. Batas lunak terutama berfungsi sebagai alat pemantauan, sedangkan batas keras benar-benar menghentikan permintaan ketika plafon tercapai.
Reuters melaporkan bahwa perusahaan yang lebih berhati-hati terhadap biaya kini memperlakukan AI “seperti cloud”, dengan anggaran khusus, alokasi terbatas, dan persetujuan tingkat direktur teknologi informasi untuk penerapan berskala besar . Amazon dan perusahaan besar lainnya juga dilaporkan menerapkan pembatasan internal maupun pembatasan bagi pelanggan karena mereka semakin menilai pengembalian investasi AI .
Pesannya cukup jelas: era “gunakan AI sebanyak mungkin tanpa memikirkan tagihan” mulai berakhir. Harga per token memang turun, tetapi pengawasan terhadap total pemakaian justru semakin ketat.
Bagi pengembang dan perusahaan, dampak jangka pendeknya menguntungkan:
Pelajaran besarnya adalah perang harga AI mulai bergeser dari sekadar siapa yang memiliki model paling pintar menjadi siapa yang dapat menjalankannya dengan biaya paling efisien. Optimasi kernel, routing, decoding, dan cache kini sama pentingnya dengan peningkatan kemampuan model.
Jika tren ini berlanjut, pelanggan API kemungkinan akan melihat lebih banyak penurunan harga. Namun, mereka juga perlu memasang batas pengeluaran, memantau rasio input-output, dan memilih model berdasarkan jenis tugas—bukan otomatis menggunakan model paling besar untuk setiap permintaan.