| 80.6 |
| 80.2 |
| SWE-Bench Pro | 60.6 | 55.4 | 58.6 |
| SWE-Bench Multilingual | 78.3 | — | 76.7 |
| Terminal-Bench 2.0-Terminus | 69.7 | 67.9 | 66.7 |
| LiveCodeBench (Pass@1) | — | 93.5 | 89.6 |
| Codeforces Rating | — | 3206 | — |
| SciCode | 53.5 | — | — |
| NL2Repo | 47.2 | — | — |
| MCP-Mark | 60.8 | — | — |
Dalam arena penaakulan, Qwen3.7 Max muncul sebagai pendahulu yang mengejutkan, terutamanya dalam matematik dan sains.
| Penanda Aras | Qwen3.7-Max | DeepSeek V4 Pro Max | Kimi K2.6 Thinking |
|---|---|---|---|
| AA Intelligence Index v4.0 | 56.6 (#5) | 52.0 | — |
| GPQA Diamond | 92.4 | — | — |
| HLE (Humanity's Last Exam) | 41.4 | 37.7 | 54.0 (dengan alatan) |
| HMMT 2026 (Matematik) | 97.1% | 95.2% | |
| AIME 2026 | — | — | 96.4% |
| IMOAnswerBench | 90.0 | 89.8 | — |
| Apex Math Reasoning | 44.5 | — | — |
| SimpleQA Verified | — | 57.9% | — |
| Chinese SimpleQA | — | 84.4 | 75.9 |
| DeepSearchQA (F1) | — | — | 92.5 |
Di sinilah kalkulator anda memainkan peranan penting. Jurang harga antara model ini sangat ketara.
| Komponen Harga | Qwen3.7-Max | DeepSeek V4 Pro | Kimi K2.6 |
|---|---|---|---|
| Input (cache miss) | $2.50 | $0.435 ($1.74 pra-promo) | $0.95 |
| Output | $7.50 | $0.87 ($3.48 pra-promo) | |
| Cache Hit (input) | $0.25 (-90%) | $0.0036 (-99%) | $0.16 (-83%) |
| Tetingkap Konteks | 1J token | 1J token | |
| Output Maksimum | 65,536 token | 384,000 token | — |
| Berat Terbuka | Tidak (API sahaja) | Ya (Hugging Face) | Ya |
Nota mengenai harga DeepSeek: DeepSeek menjalankan promosi pelancaran 75% sehingga 31 Mei 2026, menjadikan kadar Pro kepada $0.435/$0.87 input/output. Kadar standard selepas promosi ialah $1.74/$3.48 . Jadual di atas mencerminkan kadar diskaun yang telah dijadikan kekal.
Pilih pemimpin anda berdasarkan tugas:
Jika fokus anda adalah penaakulan saintifik atau pertandingan matematik, Qwen3.7-Max adalah pilihan jelas. Ia mendahului pada GPQA Diamond (92.4%) dan HMMT (97.1%), menunjukkan kehebatan dalam menyelesaikan masalah kompleks .
Dari segi kos, perbandingan tidak adil. DeepSeek V4 Pro adalah "raja nilai" yang tidak dapat disangkal. Dengan harga output $0.87, ia adalah 8 kali lebih murah daripada Qwen3.7 Max dan hampir 5 kali lebih murah daripada Kimi K2.6. Ditambah dengan pilihan berat terbuka untuk pengehosan sendiri, ia adalah impian pembangun yang mementingkan bajet .
Sebelum anda membuat keputusan muktamad, satu penilaian penting pada Mei 2026 oleh NIST CAISI perlu dipertimbangkan. Laporan itu mendapati penanda aras yang dilaporkan sendiri oleh DeepSeek V4 Pro mungkin melebih-lebihkan keupayaannya. Ujian bebas menunjukkan prestasinya lebih hampir kepada model GPT-5 (dari Ogos 2025) berbanding model terkini seperti Claude Opus 4.6 . Ini adalah peringatan penting untuk sentiasa menguji model dengan kes penggunaan khusus anda sendiri.
| 92.7% |
| $4.00 |
| 256K token |