| GPT-5.6 Terra — peringkat seimbang | AS$2.00 | AS$12.00 | Turun 20%, daripada AS$2.50 dan AS$15 |
| GPT-5.6 Sol — peringkat utama | AS$5.00 | AS$30.00 | Kekal, tetapi mendapat mod Fast |
Secara gabungan, kos input dan output Luna kini AS$1.40 bagi setiap 1 juta token, menjadikannya antara model kelas frontier paling murah di pasaran . Terra pula berharga AS$14 bagi jumlah input dan output yang sama.
Bagi Sol, mod Fast menawarkan pemprosesan sehingga 2.5 kali lebih pantas berbanding mod Standard pada dua kali ganda harga Standard, tanpa pengurangan dari segi kecerdasan model .
Bahagian paling menarik dalam pengumuman ini ialah cara penjimatan tersebut dicapai. Pada 29 Julai, OpenAI mendedahkan bahawa GPT-5.6 Sol telah membantu menulis semula dan mengoptimumkan kernel GPU produksinya secara autonomi — iaitu kod aras rendah yang menjalankan model pada perkakasan .
Melalui persekitaran pembangunan Codex, GPT-5.6 Sol disambungkan kepada infrastruktur dalaman OpenAI untuk mereka bentuk dan menjalankan ratusan eksperimen seni bina, melancarkan serta memantau penggunaan sistem, kemudian mengulangi proses berdasarkan hasil yang diperoleh . Model itu juga mempelajari sintaks Triton dan Gluon, dua bahasa pengaturcaraan yang digunakan dalam timbunan kernel OpenAI .
Menurut OpenAI, hasil yang diukur termasuk :
Pengoptimuman turut meliputi bahagian lain dalam sistem. Laporan menyebut baik pulih pengimbangan beban, yang mengagihkan permintaan berdasarkan faktor seperti lokasi geografi, jenis pemecut dan ketersediaan cache .
OpenAI juga menggunakan prompt caching. Input yang telah disimpan dalam cache boleh menjadi 90% lebih murah berbanding input baharu, dengan tempoh hayat cache kira-kira 30 minit . Ini amat berguna untuk tugasan yang berulang kali memproses kod atau konteks yang sama.
Potongan harga besar-besaran hanya tiga minggu selepas pelancaran menunjukkan betapa pantasnya persaingan AI berubah.
Moonshot AI melancarkan Kimi K3 pada 17 Julai. Model terbuka dengan 2.8 trilion parameter itu dibangunkan oleh syarikat pemula yang berpangkalan di Beijing dan didakwa sebagai model AI open-weight terbesar di dunia .
Dalam papan pendahulu Frontend Code Arena, Kimi K3 memperoleh 1,679 mata — mengatasi GPT-5.6 Sol dan Fable 5 dalam ujian pengekodan bahagian hadapan . Satu penilaian bebas oleh Startrise AI Labs yang diterbitkan pada 30 Julai pula mendapati Kimi K3 hampir setara dengan Claude Opus 5 dalam ujian kejuruteraan frontend, tetapi kos menjalankan keseluruhan ujian jauh lebih rendah: AS$7.17 berbanding AS$21.17 untuk Opus 5 .
Microsoft juga dilaporkan sedang mempertimbangkan penggunaan Kimi K3 dalam Copilot. Jika dilaksanakan, langkah itu berpotensi menjimatkan sehingga AS$600 juta, atau kira-kira 60% bagi setiap token .
Anthropic melancarkan Claude Opus 5 pada 24 Julai dengan harga input AS$5 bagi setiap 1 juta token — separuh daripada harga Fable 5 — dan model tersebut mengatasi Fable 5 dalam beberapa penanda aras . Ini memberi tekanan secara langsung kepada segmen premium yang turut menjadi medan persaingan GPT-5.6 Sol.
Google dan Microsoft pula memperkenalkan beberapa model berkos efektif sepanjang Julai, sekali gus menekan segmen pertengahan dan bajet .
Dalam keadaan ini, OpenAI nampaknya menggunakan Luna sebagai model “loss leader” untuk tugasan volum tinggi yang sensitif terhadap harga, sambil mengekalkan Sol sebagai pilihan premium untuk kerja yang memerlukan penaakulan kompleks .
Harga API yang lebih rendah hadir ketika syarikat besar semakin serius mengawal bil AI. Banyak perusahaan kini mengurus perbelanjaan AI seperti mereka mengurus kos awan: dengan bajet khusus, had penggunaan dan kelulusan peringkat ketua pegawai maklumat untuk penggunaan berskala besar .
Pada 22 Julai 2026, OpenAI menambah had perbelanjaan bulanan keras untuk platform API . Pentadbir boleh menetapkan had pada peringkat organisasi atau projek. Apabila bajet bulanan habis, permintaan API seterusnya akan gagal dengan ralat HTTP 429 sehingga kitaran bil berikutnya .
Ciri ini berbeza daripada had lembut yang sekadar memaparkan atau memantau penggunaan. Had keras berfungsi sebagai “brek kecemasan” bagi perusahaan yang bimbang kos ejen AI meningkat tanpa kawalan.
Amazon dan perusahaan besar lain juga dilaporkan mengenakan had dalaman serta had untuk pelanggan ketika mereka menilai semula pulangan pelaburan AI . Perubahan ini menandakan berakhirnya pendekatan “belanja sebanyak yang perlu” dalam penggunaan AI perusahaan.
Bagi pelanggan API OpenAI, kesan jangka pendeknya agak jelas:
Namun, mesej yang lebih besar ialah perang harga AI semakin rancak. Harga bukan sahaja dipengaruhi oleh pesaing baharu seperti Kimi K3, tetapi juga oleh peningkatan kecekapan dalaman — termasuk situasi luar biasa apabila model AI membantu mengoptimumkan kod produksi yang menjalankan model itu sendiri.
Bagi perusahaan, ini bermakna kos setiap token mungkin terus menurun. Tetapi pada masa yang sama, penggunaan AI akan semakin memerlukan bajet, had dan pemantauan yang teliti. Dalam perlumbaan AI seterusnya, model terbaik bukan semestinya yang paling berkuasa — tetapi yang memberikan nilai paling tinggi untuk setiap ringgit yang dibelanjakan.