Terminal-Bench 2.1 menguji keupayaan model merancang, menggunakan alatan dan menyelesaikan tugasan melalui terminal baris perintah. Ia dianggap sebagai ujian sukar bagi kebolehan ejen AI beroperasi secara autonomi dalam persekitaran teknikal Y.
| Model | Skor Terminal-Bench 2.1 |
|---|---|
| GPT-5.6 Sol Ultra | 91.9% BI |
| GPT-5.6 Sol | 88.8% B |
| Claude Mythos 5 | 88.0% I |
| GPT-5.5 | 83.4% BI |
Skor 91.9% bagi Sol Ultra meletakkannya kira-kira empat mata peratusan di hadapan model terbaik Anthropic dan lebih lapan mata peratusan mengatasi GPT-5.5 BI.
OpenAI memberikan penarafan “Tinggi” kepada ketiga-tiga model dalam aspek risiko keselamatan siber dan biologi. Namun, tiada satu pun yang melepasi ambang “Kritikal” A.
Harga dikira bagi setiap 1 juta token input dan output. Token ialah unit teks yang diproses oleh model—bukan semestinya bersamaan dengan satu perkataan HOK.
| Model | Input bagi 1 juta token | Output bagi 1 juta token | Kegunaan utama |
|---|---|---|---|
| GPT-5.6 Sol | AS$5.00 | AS$30.00 | Penaakulan kompleks, pengekodan, keselamatan siber dan tugasan ejen jangka panjang |
| GPT-5.6 Terra | AS$2.50 | AS$15.00 | Pilihan seimbang; prestasi setanding GPT-5.5 pada kira-kira separuh kos |
| GPT-5.6 Luna | AS$1.00 | AS$6.00 | Tugas berjumlah besar seperti pengelasan, pengekstrakan dan penghalaan |
Secara ringkas, Sol menyasarkan kerja yang paling berat, Terra cuba mengimbangi prestasi dengan kos, manakala Luna direka untuk kelajuan dan jumlah penggunaan yang tinggi.
OpenAI turut memperkenalkan prompt caching untuk GPT-5.6. Penulisan cache dikenakan bayaran 1.25 kali ganda daripada kadar input biasa model, manakala pembacaan token yang telah dicache menerima diskaun 90%. GPT-5.6 juga menyokong titik henti cache yang ditetapkan secara eksplisit serta tempoh hayat cache minimum 30 minit H.
Sebab utama yang dilaporkan ialah campur tangan langsung kerajaan Amerika Syarikat. Pentadbiran Trump meminta OpenAI mengehadkan akses sebelum pelancaran dengan alasan kebimbangan keselamatan negara TAK. Kira-kira 20 organisasi rakan kongsi yang dipilih kemudiannya diluluskan satu demi satu oleh pegawai Rumah Putih AI.
Pentadbiran itu dikatakan melihat GPT-5.6 sebagai model yang mempunyai keupayaan “seperti Mythos”, merujuk kepada Claude Mythos milik Anthropic. Pendahulunya, Claude Fable 5, dilaporkan digantung di seluruh dunia oleh Jabatan Perdagangan Amerika Syarikat pada 12 Jun 2026 di bawah peraturan kawalan eksport A.
OpenAI pula menyatakan bahawa kawalan kerajaan seperti ini boleh “menjauhkan alat terbaik daripada pengguna, pembangun, perusahaan, pembela siber dan rakan kongsi global yang memerlukannya” A.
OpenAI berkata pihaknya merancang untuk meluaskan ketersediaan “secepat mungkin”, tetapi masih belum mengumumkan tarikh rasmi untuk pelancaran umum H. Sam Altman pula menjangkakan akses yang lebih luas dalam tempoh “beberapa minggu” A.
Kad sistem syarikat turut menyatakan bahawa OpenAI percaya kepada akses meluas dan merancang menjadikan GPT-5.6 Sol, Terra serta Luna tersedia secara umum dalam beberapa minggu akan datang D.
Buat masa ini, pencapaian utama GPT-5.6 bukan sahaja terletak pada skor penanda arasnya. Persoalan yang lebih besar ialah siapa yang dibenarkan menguji dan menggunakan model tersebut—kerana akses awalnya ditentukan melalui tapisan kerajaan, bukan pendaftaran terbuka.