Tidak ada satu peringkat “terbaik secara keseluruhan” yang cukup untuk GPT 6 Astra. Di ARC AGI 3, Astra mencetak 62,7% dengan harness netral penyedia, lalu 99,9% dengan Provider Adapter OpenAI.
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: How did independent evaluations of OpenAI’s GPT-6 Astra, released September 3, 2026, reach conflicting conclusions about its standing versus. Article summary: The claimed rankings are not directly comparable, and several of the precise figures in the question cannot be independently substantiated from the primary evaluation pages available to me. In particular, the available A. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Judul-judul benchmark bisa membuat GPT-6 Astra tampak dominan, imbang, atau tertinggal pada saat yang sama. Ini bukan otomatis berarti ada hasil yang keliru. Penyebab utamanya adalah metodologi: indeks gabungan, pengujian agen interaktif, benchmark matematika formal, dan harga API menilai sistem yang berbeda dalam kondisi yang berbeda pula.
Kesimpulan praktisnya sederhana: tidak ada peringkat model yang universal tanpa menyebut jenis pekerjaan dan cara pengujiannya.
Indeks gabungan merangkum banyak tugas menjadi satu angka. Hasil akhirnya bergantung pada tugas yang dipilih, bobot tiap tugas, konfigurasi model yang diuji, serta aturan untuk penalaran, penggunaan alat, dan biaya. Model yang unggul dalam cakupan kemampuan luas dapat memimpin satu indeks, tetapi tertinggal dalam indeks yang lebih berfokus pada coding atau agen.
Skor juga sensitif terhadap waktu dan konfigurasi. Perbandingan Artificial Analysis yang tersedia, misalnya, mencatat GPT-6 Astra (max) di 55 dan Claude Fable 5.1 di 57—berbeda dari angka 61 dan 66 yang muncul dalam sejumlah artikel perbandingan lebih awal. 3 Perbedaan itu menjadi alasan untuk selalu mencatat tanggal serta konfigurasi evaluasi, alih-alih menganggap satu tangkapan leaderboard sebagai peringkat permanen.
Klaim bahwa Astra berada di posisi pertama pada Capabilities Index Epoch AI dengan 169 poin belum didukung oleh materi sumber primer Epoch yang tersedia. Klaim itu tidak semestinya dijadikan pembanding penentu tanpa leaderboard asli, bobot benchmark, pengaturan model, dan informasi ketidakpastiannya.
ARC-AGI-3 adalah benchmark interaktif, bukan sekadar kumpulan soal statis. Agen harus menjelajahi lingkungan baru, memahami tujuan yang muncul di tengah proses, membangun model dunia yang dapat disesuaikan, lalu mengubah strategi berdasarkan pengalaman. 50
ARC Prize melaporkan dua hasil menonjol GPT-6 Astra pada evaluasi Semi-Private:
| Kondisi evaluasi | Skor terbaik yang dilaporkan | Biaya per run yang dilaporkan |
|---|---|---|
| Standard harness, penalaran max | 62,7% | US$26.098 |
| OpenAI Provider Adapter, penalaran high | 99,9% | US$18.817, atau sekitar US$19 ribu |
Selisih ini bukan catatan teknis kecil. Dalam Standard harness, agen memakai antarmuka minimal yang netral terhadap penyedia dan hanya dapat membawa catatan yang secara eksplisit dipilih untuk disimpan. Sementara itu, Provider Adapter dapat mempertahankan status penalaran internal penyedia di antara permintaan serta memakai pemadatan konteks untuk percakapan yang lebih panjang. 51
53
Karena itu, skor Provider Adapter mengukur performa Astra bersama integrasi pengelolaan konteks bawaan OpenAI. Ini tetap kemampuan produk yang bermakna, tetapi tidak serta-merta sebanding langsung dengan model yang hanya diuji melalui antarmuka netral. ARC Prize sendiri menyatakan kedua harness tersebut menjawab pertanyaan evaluasi yang berbeda. 53
ARC Prize juga melaporkan Astra memakai lebih sedikit tindakan daripada median manusia yang diuji pada 96% level. 52 Ini adalah hasil efisiensi tindakan, bukan klaim bahwa model secara umum lebih baik daripada manusia dalam semua pekerjaan. Metrik itu juga tidak menggantikan perbandingan keberhasilan tugas, keandalan, dan biaya total dalam alur kerja nyata.
FrontierMath Erdős terdiri dari 68 masalah sulit Erdős yang masih terbuka pada Agustus 2026. Untuk menyelesaikan sebuah tugas, sistem harus membuktikan atau membantah konjekturnya dalam Lean, sehingga bukti yang diajukan dapat diperiksa secara mekanis. 33
37
Desain ini membuat benchmark tersebut sangat ketat untuk menilai ketepatan matematika formal. Namun, hasil matematika tidak otomatis menjadi peringkat untuk coding, agen, atau penalaran umum. Yang diukur adalah keberhasilan pada tugas pembuktian formal yang sempit, sangat berat, dan dijalankan dengan anggaran tertentu.
Materi sumber primer yang tersedia tidak mendukung angka total solusi Astra, rincian anggaran run standar versus nonstandar, maupun hasil mana yang dikecualikan dari evaluasi FrontierMath Erdős. Rincian tersebut seharusnya hanya dilaporkan dari tabel hasil atau laporan evaluasi Epoch yang spesifik, lengkap dengan anggaran dan kriteria kelayakannya.
Hal terpisah: halaman Epoch untuk FrontierMath: Open Problems menyebut evaluasi pra-rilis GPT-6 Astra menemukan kurva genus-2 dengan 648 titik rasional. Itu adalah hasil pada benchmark lain, sehingga tidak boleh dicampurkan dengan skor FrontierMath Erdős. 43
OpenAI mencantumkan harga GPT-6 Astra sebesar US$10 per juta token input dan US$50 per juta token output. 19 Pelaporan perbandingan dalam sumber yang tersedia menyebut Claude Fable 5.1 memiliki tarif input dan output utama yang sama, tetapi harga pembacaan input cache sebesar US$0,25 per juta token, dibanding US$1,00 untuk Astra.
4
Dari sini muncul dua pertanyaan biaya yang berbeda:
OpenAI menyatakan Astra mencapai estimasi biaya API per tugas yang lebih rendah dalam beberapa evaluasinya karena menggunakan token output jauh lebih sedikit. 18 Namun, ini adalah bukti yang dilaporkan vendor, bukan jaminan umum. Skor benchmark dan tarif token saja tidak cukup untuk membuktikan model mana yang lebih murah bagi repositori kode atau alur kerja agen tertentu.
Sebelum memilih Astra, Claude Fable 5.1, atau GPT-5.6 Sol, tetapkan dulu tugasnya dan samakan kondisi pengujiannya:
Hasil ARC-AGI-3 Astra melalui Provider Adapter memang mencolok, dan hasilnya pada Standard harness juga kuat. Namun, keduanya tidak membatalkan indeks independen yang mengunggulkan model lain dengan campuran tugas dan konfigurasi berbeda. Pertanyaan yang paling berguna bukan “model mana yang menang?”, melainkan: “setup yang diuji mana yang paling mendekati pekerjaan yang benar-benar harus dilakukan?”
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Tidak ada satu peringkat “terbaik secara keseluruhan” yang cukup untuk GPT 6 Astra.
Tidak ada satu peringkat “terbaik secara keseluruhan” yang cukup untuk GPT 6 Astra. Di ARC AGI 3, Astra mencetak 62,7% dengan harness netral penyedia, lalu 99,9% dengan Provider Adapter OpenAI.
Harga token bukan biaya pekerjaan yang selesai: cache, jumlah output token, panggilan alat, percobaan ulang, dan kebutuhan peninjauan manusia ikut menentukan ongkos nyata.