Claude 3.5 Sonnet’in SWE bench Verified skoru 2025 başında %49’du; daha sonra Claude Opus 5 için bir liderlik tablosunda %97,0 sonucu raporlandı. SWE bench Verified, 500 halka açık ve büyük ölçüde Python odaklı gerçek GitHub sorunundan oluşuyor.
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude’un kodlama ajanı değerlendirmelerindeki yükselişi çarpıcı: Güncellenmiş Claude 3.5 Sonnet, 2025 başında SWE-bench Verified’da %49’a ulaştı. Birkaç ay sonra Claude 4 ailesi için yaklaşık %72,5-%72,7 sonuçları bildirildi. Sonraki liderlik tablolarında ise skorlar testin tavanına iyice yaklaştı. 23
24
9
Bundan çıkarılacak doğru sonuç, Claude’un yazılım mühendisliğini tamamen çözdüğü değildir. Daha isabetli yorum şudur: Claude, yayımlanmış kodlama ajanı değerlendirmelerinde son derece rekabetçi ve çoğu zaman lider modeller arasında. Halka açık, sonlu bir testte skorlar %100’e yaklaştıkça asıl soru değişiyor: Hangi değerlendirme, ekibinizin kendi kod depoları, araçları ve inceleme sürecindeki sonucu daha iyi öngörür?
| Değerlendirme | Ajandan beklenen | Kapsam ve puanlama | Neden önemli? |
|---|---|---|---|
| SWE-bench Verified | Gerçek bir GitHub sorunu ve depo anlık görüntüsü verilir; ajan bir yama üretir. | İnsanlarca ayıklanmış 500 SWE-bench örneğinden oluşur; ağırlıkla popüler açık kaynak Python depolarındandır. Yama, değerlendirme ortamındaki testleri geçerse sorun çözülmüş sayılır. |
Gerçek kod tabanlarında hata/sorun çözümünü ölçen yaygın bir referanstır. |
| SWE-bench Pro | Standartlaştırılmış bir ajan çerçevesinde daha zor, daha uzun soluklu depo görevlerini çözer. | 41 depodan 123 programlama diline yayılan 1.865 görev olarak raporlanır; yaygın ölçüt Pass@1’dir. |
Verified’ın halka açık, Python ağırlıklı görevlerinin ötesine geçmeyi ve veri sızıntısı riskini azaltmayı amaçlar. |
| Terminal-Bench 4.0 | Terminal ortamında uçtan uca teknik işi tamamlar. | İnceleme, komut çalıştırma, düzenleme, test etme ve başarısızlıktan toparlanma gerektiren görevleri içerir. |
Araç kullanımı ve operasyonel iş akışını da sınar. |
Anthropic, güncellenmiş Claude 3.5 Sonnet’in SWE-bench Verified’da %49,0 elde ettiğini; önceki bildirilen en iyi sonuç olan %45’i geçtiğini açıkladı. Şirket, o tarihte hiçbir modelin testte %50 eşiğini aşmadığını da belirtti. 23
37
Mayıs 2025’te Anthropic, SWE-bench Verified için Claude Opus 4’te %72,5, Claude Sonnet 4’te %72,7 bildirdi. Bu rakamlar genişletilmiş düşünme modu kullanılmadan raporlandı. 24
2026’ya gelindiğinde liderlik tablosu bambaşka bir görünüm kazandı. Vals AI, Claude Opus 5 için %97,0 bildiriyor; değerlendirdiği yedi modelin %95 veya üzerine çıktığını, DeepSeek V4 Pro 0813’ün de %96,4 elde ettiğini belirtiyor. 9 Bu nedenle “Opus 5 yaklaşık %96” ifadesi, yüksek yüzde 90’lardaki bildirilen sonucu anlatan makul bir kısaltma olabilir; ancak tek ve tartışmasız bir rakam değildir. Sonuç; model sürümüne, ajan çerçevesine, süre/jeton bütçesine ve değerlendirme kurulumuna göre değişebilir.
500 görevlik bir testte %97, önde gelen sistemleri birbirinden ayıracak çok az alan bırakır. Daha da önemlisi, Verified halka açık depolardan alınmış halka açık ve sonlu görevlerden oluşur. Değerlendirme rehberleri bu testi veri sızıntısı açısından yüksek riskli ve doygunluğa yaklaşmış olarak nitelendiriyor. 3
Bu, sonucun anlamsız olduğu anlamına gelmez. Sonuç, ajanın açık tanımlı ve testle doğrulanabilen bu tür sorunları çözebildiğine dair güçlü bir işarettir. Buna karşılık, yeni sorunlarla karşılaşan, sürekli değişen özel bir kod tabanındaki başarıyı eksiksiz biçimde tahmin edemez.
SWE-bench Pro, daha zor ve veri sızıntısına daha dayanıklı bir alternatif olarak konumlandırılıyor. Bildirilen kapsam, 41 depoda 123 programlama dilini içeren 1.865 görev. Bu, popüler Python depolarından gelen 500 insan filtresinden geçmiş örnekten oluşan Verified’a göre çok daha geniş bir alan. 12
16
Eylül 2026 tarihli toplu liderlik tablolarında Claude Fable 5.1 %81,2 ile listeleniyor; onu Claude Mythos 5 (%80,3) ve Claude Fable 5 (%80,0) izliyor. 53 Bu tabloda ilk üç sıra Claude modellerine ait.
Yine de önemli bir çekince var: Pro sonuçlarının tümü doğrudan karşılaştırılabilir değil. Bir kaynak, Scale’ın standartlaştırılmış açık veri setindeki lider sonucun %59,1 olduğunu; daha yüksek üretici-toplamı rakamlarının ise farklı raporlama yöntemlerinden geldiğini ayırıyor. Bu fark, ajan çerçevesi ve metodolojinin sonucu ne kadar değiştirebildiğini gösteriyor. 13 Başka bir kaynak da Fable 5.1 için %81,2 sonucunun doğrudan yayımlanmış, modele özgü bir SWE-bench sonucu ile açıkça desteklenmediği; bunun toplulaştırma ya da sürüm ilişkilendirme hatası olabileceği uyarısını yapıyor.
55
Pratik sonuç net: %81,2’yi yayımlanmış bir liderlik tablosu değeri olarak görün; yalnızca temel model hakkında kesinleşmiş ve bağımsız olarak tekrarlanmış bir gerçek olarak değil.
Terminal-Bench, yazılım inşa etme veya makine öğrenmesi modeli eğitme gibi komut satırında yürütülen teknik ajan görevlerini ölçüyor. SWE-bench Verified’ın “sorun ve yama” formatından farklı olarak, daha operasyonel bir iş akışını test ediyor. 38
Atıf yapılan karşılaştırmada Claude Fable 5.1 için %55,8, GPT-5.6 Sol için %37,3 veriliyor; fark 18,5 puan. 44 Bu, raporlanan Claude yapılandırmasının bu değerlendirmede daha iyi sonuç verdiğine dair anlamlı bir kanıt.
Ancak bu tablo Anthropic, OpenAI, Google, Cognition veya AWS için genel bir üstünlük sıralaması kurmaz. Böyle bir iddia için aynı ajan çerçevesi, eşit süre ve jeton bütçeleri, eşleştirilmiş modeller ve birden fazla bağımsız görev seti gerekir. Sunulan kanıtlar böyle kapsamlı bir karşılaştırma sağlamıyor.
Eldeki veriler üç ölçülü iddiayı destekliyor:
Bu veriler, Claude’un haftalar süren projeleri otonom biçimde tamamlayacağını, belgelenmemiş kurum içi sistemleri güvenilir şekilde anlayacağını, isabetli mimari kararlar alacağını ya da insan incelemesi olmadan güvenle canlıya çıkış yapacağını kanıtlamaz. SWE-bench görevleri testlerle doğrulanabilen sonuçlara sahiptir; gerçek yazılım mühendisliği ise gereksinim keşfi, ödünleşimler, entegrasyon, güvenlik, dağıtım ve ekip içi iş birliğini de kapsar.
SWE-bench Verified’ın değeri, kısa kodlama bulmacalarının ötesine geçmesinden gelir: Ajanlar gerçek depolar ve sorun tanımlarıyla çalışır, ürettikleri yamalar testlerle değerlendirilir. 1
38 Ancak Anthropic’in ajan değerlendirmeleri hakkındaki açıklamasına göre modeller bu testte yalnızca bir yılda yaklaşık %40 seviyesinden %80’in üzerine ilerledi.
38
Bu aşamada sağlıklı bir değerlendirme paketi şunları içermeli:
Anthropic, SWE-bench Verified ve Terminal-Bench’i ajan değerlendirmesi örnekleri olarak tanımlıyor; Claude 4 için de uzun süreli görevlerde dayanıklı performansı vurguluyor. 38
42 Buna rağmen, sunulan kaynaklar Anthropic’in resmi olarak SWE-bench’ten daha uzun ufuklu testlere yöneldiğini kanıtlamaya yeterli değil. Bu daha güçlü iddia şimdilik açıkta kalmalı.
Eylül 2026 itibarıyla Claude’un bildirilen sonuçları, onu değerlendirmeye alınacak en güçlü kodlama ajanı seçeneklerinden biri yapıyor. En net dönüm noktası, 2025 başındaki %49 SWE-bench Verified sonucundan, Opus 5 için bildirilen %97,0 liderlik tablosu skoruna geçiş. Buna, SWE-bench Pro’da raporlanan %81,2’lik liderlik değeri eşlik ediyor. 23
9
53
Araç seçimini tek bir manşet rakam üzerinden yapmayın. Bu skorları aday listesini daraltmak için kullanın; ardından kendi depolarınızdaki temsilî görevlerle, kontrollü bir değerlendirme çalıştırın. Doygunluğa yaklaşmış halka açık testler, modellerin bilinen tarzdaki pek çok sorunu çözebildiğini gösterir; üretim ortamında güvenilir otonom yazılım mühendisliğini tek başına kanıtlamaz.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude 3.5 Sonnet’in SWE bench Verified skoru 2025 başında %49’du; daha sonra Claude Opus 5 için bir liderlik tablosunda %97,0 sonucu raporlandı.
Claude 3.5 Sonnet’in SWE bench Verified skoru 2025 başında %49’du; daha sonra Claude Opus 5 için bir liderlik tablosunda %97,0 sonucu raporlandı. SWE bench Verified, 500 halka açık ve büyük ölçüde Python odaklı gerçek GitHub sorunundan oluşuyor.
SWE bench Pro daha geniş ve zor bir ölçüm olarak sunuluyor; Claude Fable 5.1 için bildirilen %81,2 değeri, doğrudan yayımlanmış modele özgü kanıtı net olmadığı için temkinle okunmalı.