| GPT-5.5 (Pro) | $30,00 | $180,00 | β | 1 Jt |
| Qwen3.7-Max | $2,50 | $7,50 | $0,25 (diskon 90%) | 1 Jt |
| Kimi K2.6 | $0,60β$0,95 | $3,00β$4,00 | $0,10 | 262 Ribu |
| Gemini 3.5 Flash | $1,50 | $9,00 | $0,15 | 1 Jt |
| Grok 4.3 | $1,25 | $2,50 | $0,30 | 1 Jt |
| DeepSeek V4-Flash | $0,14 | $0,28 | $0,0028 | 1 Jt |
| DeepSeek V4-Pro | $0,435 (diskon permanen) | $0,87 (diskon permanen) | $0,0036 | 1 Jt |
Poin Penting Terkait Harga:
Benchmark hanya berguna dengan konteks. Kami telah mengatur hasilnya berdasarkan apa yang sebenarnya mereka ukurβkecerdasan umum, kemampuan pengkodean, dan kinerja otonom (agentic)βdaripada satu skor gabungan yang sering menyesatkan.
Kategori ini mengukur pengetahuan mentah, matematika, dan penalaran ilmiah.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| Indeks Kecerdasan AA | 61,4 | 60,2 | ~55 | 56,6 | 53 | ~52 |
| GPQA Diamond | 93,6% | β | 90,1% | 92,4% | ||
| AIME / USAMO 2026 (Matematika) | 96,7% | 95,2% | ||||
| HLE (dengan alat) | 57,9% | β | 37,7% | β | β | β |
Claude Opus 4.8 telah membuka celah kecil tapi signifikan di atas GPT-5.5 dalam kecerdasan umum, didukung oleh lompatan besar 27,4 poin dalam performa matematika dibandingkan pendahulunya . Qwen3.7-Max menonjol sebagai model China teratas, hampir menyamai para pemimpin dalam penalaran sains tingkat sarjana (GPQA Diamond) .
Benchmark paling relevan untuk para pengembang.
| Benchmark | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80,6% | 80,2% | 88,7% | 88,6% | 72,5% |
| SWE-bench Pro | ~58% | 58,6% | 58,6% | 69,2% | |
| LiveCodeBench v6 | 93,5% | 89,6% |
Performa pengkodean menciptakan segmentasi yang jelas. Claude Opus 4.8 dan GPT-5.5 imbang di puncak untuk perbaikan bug umum (SWE-bench Verified), tetapi Claude memimpin lebih dari 10 poin pada set Pro yang jauh lebih sulit . Untuk efisiensi pengkodean murni per dolar, DeepSeek V4-Pro tidak tertandingi, menawarkan performa pengkodean setara GPT-5.4 dengan diskon 30x lipat .
Kemampuan model untuk bertindak secara independen di lingkungan nyata.
| Benchmark | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | β | 1500 |
| Terminal-Bench 2.0/2.1 | 82,7% | 76,2% | |||
| ΟΒ²-Bench (Mengikuti Instruksi) | β | β | β | β | 98% |
GPT-5.5 mempertahankan mahkotanya sebagai model terkuat untuk pekerjaan agen berbasis terminal terbuka, tetapi peringkat tugas dunia nyata superior Claude Opus 4.8 (GDPval-AA Elo) menunjukkan mitra otonom yang lebih andal dan siap bisnis . Grok 4.3 menawarkan opsi hemat yang menarik untuk tugas mengikuti instruksi dalam volume tinggi .
Untuk pertama kalinya, model-model China tidak hanya bersaing dalam harga tetapi juga dalam kemampuan. Qwen3.7-Max memimpin semua model pada benchmark pengkodean agen SWE-bench Pro di 60,6% . Kimi K2.6 menyamai performa GPT-5.5 pada tes yang sama dan memimpin semua model lain di Humanity's Last Exam (HLE) dengan alat di 54,0% , menantang dominasi Amerika pada tugas penalaran inti sambil secara drastis memotong harga mereka.
Perbandingan langsung dan penuh di ketujuh model saat ini mustahil dilakukan karena pelaporan benchmark yang selektif oleh vendor . Beberapa faktor kunci meruntuhkan pilihan yang murni didorong oleh angka:
Prioritas Anda harus menentukan pilihan Anda:
Untuk penerapan kritis apa pun, jalankan tes pada beban kerja spesifik Anda sendiri. Benchmark yang dilaporkan vendor memberikan titik awal yang berguna, bukan jawaban pasti.
| β |
| 92,6% |
| β |
| β |
| β |
| β |
| 60,6% |
| β |
| β |
| β |
| 74,6% |
| 69,7% |
| β |