| GPT-5.5 (Pro) | $30.00 | $180.00 | — | 1M |
| Qwen3.7-Max | $2.50 | $7.50 | $0.25 (%90 indirim) | 1M |
| Kimi K2.6 | $0.60–$0.95 | $3.00–$4.00 | $0.10 | 262K |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | 1M |
| Grok 4.3 | $1.25 | $2.50 | $0.30 | 1M |
| DeepSeek V4-Flash | $0.14 | $0.28 | $0.0028 | 1M |
| DeepSeek V4-Pro | $0.435 (kalıcı indirim) | $0.87 (kalıcı indirim) | $0.0036 | 1M |
Öne Çıkan Fiyat Tespitleri:
Kıyaslama sonuçları yalnızca bağlamlarıyla birlikte anlamlıdır. Sonuçları, genellikle yanıltıcı olan tek bir bileşik puan yerine, gerçekten neyi ölçtüklerine göre — genel zeka, kodlama becerisi ve otonom ajan performansı — kategorilere ayırdık.
Bu kategori ham bilgiyi, matematiği ve bilimsel akıl yürütmeyi ölçer.
| Kıyaslama | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Zeka Endeksi | 61.4 | 60.2 | ~55 | 56.6 | 53 | ~52 |
| GPQA Diamond | %93.6 | — | %90.1 | %92.4 | ||
| AIME / USAMO 2026 (Mat.) | %96.7 | %95.2 | ||||
| HLE (araçlarla) | %57.9 | — | %37.7 | — | — | — |
Claude Opus 4.8, genel zekada GPT-5.5'in az da olsa açık ara önüne geçmeyi başardı. Bu farkın temelinde, bir önceki modele kıyasla matematik performansında kaydedilen devasa 27.4 puanlık sıçrama yatıyor . Çinli modeller arasında Qwen3.7-Max, doktora seviyesindeki bilimsel akıl yürütmede (GPQA Diamond) liderlere neredeyse yetişerek dikkat çekiyor .
Geliştiriciler için en anlamlı kıyaslama sonuçları.
| Kıyaslama | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | %80.6 | %80.2 | %88.7 | %88.6 | %72.5 |
| SWE-bench Pro | ~%58 | %58.6 | %58.6 | %69.2 | |
| LiveCodeBench v6 | %93.5 | %89.6 |
Kodlama performansı net bir ayrışma yaratıyor. Claude Opus 4.8 ve GPT-5.5, genel hata düzeltmede (SWE-bench Verified) zirveyi paylaşıyor, ancak çok daha zorlu Pro setinde Claude 10 puandan fazla bir farkla öne çıkıyor . Kodlama için harcanan her doların karşılığına bakıldığında ise DeepSeek V4-Pro rakipsiz. GPT-5.4-seviyesinde bir kodlama performansını 30 kat daha ucuza sunuyor .
Bir modelin, gerçek bir ortamda bağımsız olarak hareket edebilme yeteneği.
| Kıyaslama | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | %82.7 | %76.2 | |||
| τ²-Bench (Yönerge Takibi) | — | — | — | — | %98 |
GPT-5.5, ucu açık terminal tabanlı ajan işlerinde tahtını koruyor, ancak Claude Opus 4.8'in gerçek dünya görevlerindeki üstün puanı (GDPval-AA Elo), onun işletmeler için daha güvenilir bir ajan ortağı olduğunu gösteriyor . Grok 4.3 ise yüksek hacimli yönerge takip görevleri için cazip bir bütçe seçeneği sunuyor .
İlk kez, Çinli modeller sadece fiyatla değil, yetenekle de rekabet ediyor. Qwen3.7-Max, otonom kodlama kıyaslaması olan SWE-bench Pro'da %60.6 ile tüm modellere liderlik ediyor . Kimi K2.6 ise aynı testte GPT-5.5'in performansını yakalıyor ve İnsanlığın Son Sınavı'nda (HLE) araçlarla %54.0'lık bir skorla diğer tüm modelleri geride bırakarak , Amerikan modellerinin temel akıl yürütme görevlerindeki üstünlüğüne fiyat açısından ciddi bir meydan okuyor.
Satıcıların seçici kıyaslama raporlaması nedeniyle, yedi modelin tamamını doğrudan ve eksiksiz bir şekilde karşılaştırmak şu an için imkansız . Sadece sayılara dayalı bir seçimi baltalayan birkaç kritik unsur var:
Kararınızı önceliğiniz belirlemeli:
Herhangi bir kritik dağıtım için, testleri kendi iş yükünüz üzerinde mutlaka çalıştırın. Satıcı tarafından raporlanan kıyaslama sonuçları faydalı bir başlangıç noktasıdır, ancak kesin bir cevap değildir.
| — |
| %92.6 |
| — |
| — |
| — |
| — |
| %60.6 |
| — |
| — |
| — |
| %74.6 |
| %69.7 |
| — |