Model ayrıca bilgi çalışmaları benchmarklarında da güçlü performans gösteriyor: GDPval, hukuk, finans ve ürün yönetimi dahil olmak üzere düzinelerce mesleği kapsıyor ve GPT‑5.5, karşılaştırmaların yaklaşık %84,9'unda profesyonellerle eşleşiyor veya onları geçiyor.
Tüm bu rakamlar, GPT‑5.5'in özellikle otonom çok adımlı görevler ve ajan iş akışlarında çok güçlü olduğunu gösteriyor.
Anthropic'in Claude Opus 4.7'si, yazılım mühendisliği görevlerinde en güçlü modellerden biri olarak kabul ediliyor.
En belirgin benchmark sonuçları:
SWE‑bench, bir modelin açık kaynak depolardaki gerçek hataları düzeltip düzeltemeyeceğini değerlendiriyor. Opus 4.7'nin SWE‑bench Verified görevlerinin %87,6'sını çözmesi, önceki sürüme göre önemli bir gelişme ve onu kodlama ajanları için en iyi modeller arasına yerleştiriyor.
Terminal‑Bench skoru GPT‑5.5'in gerisinde kalsa da, kodlama odaklı benchmarkları kamuya açık karşılaştırmalarda bildirilen en güçlü sonuçlar arasında yer alıyor.
Google'ın Gemini 3.5 Flash'ı, amiral gemisi bir modelden ziyade hızlı ve uygun maliyetli bir model olarak konumlandırılmasına rağmen, birçok ajan benchmarkında rekabetçi sonuçlar elde etmesiyle dikkat çekiyor.
Raporlanan sonuçlar:
Google, modelin rakip sınır modellerinden yaklaşık dört kat daha hızlı çalıştığını ve birçok ajan ve kodlama benchmarkında önceki Gemini 3.1 Pro'yu geride bıraktığını belirtiyor.
Pratikte Gemini 3.5 Flash'ın en büyük avantajı, hız‑yetenek dengesi: amiral gemisi seviyesinde benchmark sonuçları sunarken düşük gecikme ve üretim iş yüklerini hedefliyor.
DeepSeek V4, şu ana kadar piyasaya sürülen en yetenekli açık ağırlıklı sınır modellerinden biri olarak öne çıkıyor.
Model ailesi iki çeşitten oluşuyor:
Modelin teknik raporuna ve benchmark özetlerine göre, V4‑Pro maksimum akıl yürütme modunda şu sonuçlara ulaşıyor:
Bu sonuçlar, onu bazı kodlama benchmarklarında önde gelen tescilli modellere yaklaştırıyor.
Ancak, ABD Ulusal Standartlar ve Teknoloji Enstitüsü'nün (NIST) CAISI programı tarafından yapılan bağımsız bir değerlendirme, modelin yeteneklerinin sınırın yaklaşık sekiz ay gerisinde olduğunu ortaya koyarak, kendi bildirilen sonuçlar ile bağımsız sonuçlar arasında bir boşluk olduğunu gösteriyor.
xAI'ın Grok 4.3'ü, özellikle ajan görev benchmarklarında önceki Grok modellerine göre büyük bir gelişme temsil ediyor.
Yayınlanan rakamlar:
Önceki Grok sürümlerine kıyasla GDPval‑AA'da 300'den fazla Elo puanı artışı, gerçek dünya görev otomasyonunda önemli bir ilerlemeye işaret ediyor.
Yine de, üçüncü taraf analizleri genellikle modeli, genel yetenek benchmarklarında en yeni OpenAI ve Anthropic sistemlerinin altına yerleştiriyor.
Bu değerlendirmelere baktığımızda tutarlı bir tablo ortaya çıkıyor:
Ancak, her sağlayıcı farklı değerlendirme setlerini öne çıkardığı için bu sonuçlar kesin olmaktan ziyade yön gösterici olarak ele alınmalıdır.
Modern yapay zekada benchmark karşılaştırmaları çeşitli nedenlerle giderek karmaşıklaşıyor:
Bu faktörler nedeniyle, sınır modellerinin gerçek göreceli sıralaması genellikle ancak aylarca süren bağımsız testlerden sonra netleşir.
En son benchmark kanıtları, her alanda tek bir modelin baskın olduğunu göstermiyor.
Bunun yerine, mevcut sınırın uzmanlaşmış olduğu görülüyor:
Bağımsız benchmarklar birleştikçe ve daha fazla elma ile elma karşılaştırması ortaya çıktıkça, bu sistemlerin kesin sıralamasının gelişmeye devam etmesi muhtemel.