| GPT-5.5 (Pro) | $30.00 | $180.00 | β | 1J |
| Qwen3.7-Max | $2.50 | $7.50 | $0.25 (diskaun 90%) | 1J |
| Kimi K2.6 | $0.60β$0.95 | $3.00β$4.00 | $0.10 | 262K |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | 1J |
| Grok 4.3 | $1.25 | $2.50 | $0.30 | 1J |
| DeepSeek V4-Flash | $0.14 | $0.28 | $0.0028 | 1J |
| DeepSeek V4-Pro | $0.435 (diskaun kekal) | $0.87 (diskaun kekal) | $0.0036 | 1J |
Rumusan Utama Harga:
Penanda aras hanya berguna dengan konteks. Kami telah menyusun keputusan berdasarkan apa yang sebenarnya diukurβkecerdasan am, keupayaan pengekodan, dan prestasi ejenβbukannya satu skor komposit yang sering mengelirukan.
Kategori ini mengukur pengetahuan mentah, matematik, dan penaakulan saintifik.
| Penanda Aras | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| Indeks Kecerdasan AA | 61.4 | 60.2 | ~55 | 56.6 | 53 | ~52 |
| GPQA Diamond | 93.6% | β | 90.1% | 92.4% | ||
| AIME / USAMO 2026 (Math) | 96.7% | 95.2% | ||||
| HLE (dengan alatan) | 57.9% | β | 37.7% | β | β | β |
Claude Opus 4.8 telah membuka jurang kecil tetapi ketara berbanding GPT-5.5 dalam kecerdasan am, disokong oleh lonjakan besar 27.4 mata dalam prestasi matematik berbanding pendahulunya . Qwen3.7-Max menonjol sebagai model Cina teratas, hampir menyaingi peneraju dalam penaakulan sains peringkat siswazah (GPQA Diamond) .
Penanda aras paling relevan untuk pembangun.
| Penanda Aras | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 80.2% | 88.7% | 88.6% | 72.5% |
| SWE-bench Pro | ~58% | 58.6% | 58.6% | 69.2% | |
| LiveCodeBench v6 | 93.5% | 89.6% |
Prestasi pengekodan mewujudkan pembahagian yang jelas. Claude Opus 4.8 dan GPT-5.5 terikat di puncak untuk pembetulan pepijat umum (SWE-bench Verified), tetapi Claude mendahului lebih 10 mata pada set Pro yang jauh lebih sukar . Untuk kecekapan pengekodan per dolar, DeepSeek V4-Pro tiada tandingan, menawarkan prestasi pengekodan setaraf GPT-5.4 pada diskaun 30x ganda .
Keupayaan model untuk bertindak secara bebas dalam persekitaran sebenar.
| Penanda Aras | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | β | 1500 |
| Terminal-Bench 2.0/2.1 | 82.7% | 76.2% | |||
| ΟΒ²-Bench (Mengikut Arahan) | β | β | β | β | 98% |
GPT-5.5 mengekalkan takhtanya sebagai model terkuat untuk kerja ejen berasaskan terminal terbuka, tetapi penarafan tugas dunia sebenar unggul Claude Opus 4.8 (GDPval-AA Elo) mencadangkan rakan ejen yang lebih dipercayai dan sedia untuk perniagaan . Grok 4.3 menawarkan pilihan bajet yang menarik untuk tugas mengikut arahan volum tinggi .
Buat pertama kalinya, model Cina bukan sahaja bersaing dari segi harga tetapi juga keupayaan. Qwen3.7-Max mendahului semua model pada penanda aras pengekodan ejen SWE-bench Pro dengan 60.6% . Kimi K2.6 menyamai prestasi GPT-5.5 pada ujian yang sama dan mendahului semua model lain pada Humanity's Last Exam (HLE) dengan alatan pada 54.0% , mencabar peneraju Amerika dalam tugas penaakulan teras sambil menawarkan harga yang jauh lebih rendah.
Perbandingan penuh secara langsung merentas ketujuh-tujuh model kini mustahil disebabkan pelaporan penanda aras terpilih oleh vendor . Beberapa faktor utama melemahkan pilihan berdasarkan nombor semata-mata:
Keutamaan anda harus menentukan pilihan anda:
Untuk sebarang penggunaan kritikal, jalankan ujian pada beban kerja khusus anda sendiri. Penanda aras yang dilaporkan vendor menyediakan titik permulaan yang berguna, bukan jawapan muktamad.
| β |
| 92.6% |
| β |
| β |
| β |
| β |
| 60.6% |
| β |
| β |
| β |
| 74.6% |
| 69.7% |
| β |