Claude 3.5 Sonnet versi peningkatan mencetak 49,0% di SWE bench Verified pada awal 2025; Claude 4 kemudian dilaporkan mencapai sekitar 72,5%–72,7%. Papan peringkat Vals AI mencatat Claude Opus 5 di 97,0% pada SWE bench Verified, tetapi tujuh model sudah berada di 95% atau lebih sehingga benchmark ini makin sulit mem...
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude menunjukkan peningkatan besar dalam benchmark coding. Namun, kesimpulan yang tepat bukanlah bahwa Claude telah “menyelesaikan” rekayasa perangkat lunak. Yang lebih akurat: Claude sangat kompetitif—dan pada sejumlah evaluasi yang dipublikasikan, memimpin—untuk tugas agen pemrograman.
Ketika skor mendekati 100% pada benchmark publik dengan jumlah tugas terbatas, pertanyaan yang lebih penting bagi tim engineering adalah: evaluasi mana yang paling mampu memprediksi kinerja agen pada repositori, toolchain, dan proses code review mereka sendiri?
| Benchmark | Tugas agen | Cakupan dan penilaian | Mengapa penting |
|---|---|---|---|
| SWE-bench Verified | Menerima issue GitHub nyata dan snapshot repositori, lalu membuat patch. | Terdiri dari 500 instance SWE-bench yang telah disaring manusia, terutama dari repositori Python open-source populer. Tugas dinilai selesai bila patch lolos tes benchmark dalam harness evaluasi. |
Salah satu tolok ukur paling dikenal untuk kemampuan menyelesaikan issue pada codebase nyata. |
| SWE-bench Pro | Menyelesaikan tugas repositori yang lebih sulit dan berjangka lebih panjang dalam scaffold agen yang distandardisasi. | Dilaporkan mencakup 1.865 tugas dari 41 repositori dalam 123 bahasa pemrograman; umumnya memakai metrik Pass@1. |
Dirancang untuk melampaui tugas Python publik pada Verified dan mengurangi risiko kontaminasi. |
| Terminal-Bench 4.0 | Menjalankan pekerjaan teknis end-to-end melalui lingkungan terminal. | Mencakup investigasi, menjalankan perintah, mengedit, menguji, dan pulih dari kegagalan—bukan hanya membuat patch untuk satu issue GitHub. |
Menambah tuntutan operasional dan penggunaan tool yang lebih mendekati alur kerja agen. |
Anthropic melaporkan Claude 3.5 Sonnet versi peningkatan mencapai 49,0% pada SWE-bench Verified, melampaui rekor yang sebelumnya dilaporkan sebesar 45%. Saat itu, Anthropic menyatakan belum ada model yang menembus 50% di benchmark tersebut. 23
37
Pada Mei 2025, Anthropic melaporkan skor 72,5% untuk Claude Opus 4 dan 72,7% untuk Claude Sonnet 4 di SWE-bench Verified. Kedua angka tersebut dilaporkan tanpa extended thinking. 24
Memasuki 2026, gambaran papan peringkat berubah tajam. Vals AI mencatat Claude Opus 5 sebesar 97,0%, sementara tujuh model yang dievaluasi mencapai 95% atau lebih; DeepSeek V4 Pro 0813 tercatat di 96,4%. 9 Karena itu, penyebutan “Opus 5 di 96%” masih masuk akal sebagai ringkasan hasil di kisaran 90% tinggi, tetapi bukan satu angka tunggal yang mutlak: skor dipengaruhi versi model, scaffold agen, anggaran token, dan konfigurasi evaluasi.
Pada set berisi 500 tugas, skor 97% menyisakan ruang yang sangat kecil untuk membedakan sistem terdepan. Lebih penting lagi, Verified tersusun dari tugas publik dan terbatas, yang berasal dari repositori publik. Panduan benchmark menilai benchmark ini berisiko tinggi mengalami kontaminasi dan mulai jenuh. 3
Bukan berarti skornya tidak bermakna. Skor tersebut tetap menjadi bukti kuat bahwa sebuah agen bisa menyelesaikan kelas issue yang spesifik dan dapat diverifikasi melalui tes. Namun, skor itu tidak cukup untuk menjadi ramalan lengkap atas kemampuan menghadapi pekerjaan baru di codebase privat yang terus berubah.
SWE-bench Pro diposisikan sebagai alternatif yang lebih sulit serta lebih tahan terhadap kontaminasi. Cakupan yang dilaporkan adalah 1.865 tugas pada 41 repositori dan 123 bahasa pemrograman, dibanding 500 instance pada Verified yang berpusat pada repositori Python populer. 12
16
Papan peringkat agregat yang dipublikasikan pada September 2026 menempatkan Claude Fable 5.1 di 81,2%, di depan Claude Mythos 5 sebesar 80,3% dan Claude Fable 5 sebesar 80,0%. 53 Dalam papan peringkat itu, Claude menempati tiga posisi teratas.
Meski begitu, angka-angka Pro tidak selalu dapat dibandingkan langsung. Satu sumber membedakan skor pemimpin 59,1% pada set publik terstandardisasi milik Scale dari angka agregat vendor yang lebih tinggi. Ini menunjukkan besarnya pengaruh harness agen serta metodologi pelaporan. 13 Sumber lain secara eksplisit memperingatkan bahwa angka 81,2% untuk Fable 5.1 tidak didukung jelas oleh hasil SWE-bench yang dipublikasikan langsung dan spesifik untuk model tersebut; nilainya mungkin merupakan masalah agregasi atau atribusi versi.
55
Implikasi praktisnya sederhana: perlakukan 81,2% sebagai nilai yang dilaporkan oleh papan peringkat, bukan fakta final yang telah direplikasi secara independen mengenai model dasar saja.
Terminal-Bench menguji pekerjaan agen teknis di lingkungan command-line, misalnya membangun perangkat lunak atau melatih model machine learning. Berbeda dari format issue-dan-patch di SWE-bench Verified, benchmark ini menguji alur kerja yang lebih operasional. 38
Perbandingan yang dikutip melaporkan 55,8% untuk Claude Fable 5.1 dan 37,3% untuk GPT-5.6 Sol—selisih 18,5 poin. 44 Ini merupakan bukti berarti bahwa konfigurasi Claude yang dilaporkan tampil lebih baik dalam evaluasi tersebut.
Namun, hasil itu tidak menetapkan peringkat umum Anthropic atas OpenAI, Google, Cognition, atau AWS. Klaim lintas-penyedia memerlukan model yang dipasangkan secara setara, scaffold agen yang sama, anggaran waktu dan token yang sebanding, serta hasil dari beberapa suite tugas independen. Bukti yang tersedia tidak menyediakan perbandingan seperti itu.
Data yang tersedia mendukung tiga pernyataan terukur berikut:
Hasil-hasil ini tidak membuktikan bahwa Claude dapat secara otonom menyelesaikan proyek berminggu-minggu, memahami sistem internal yang tidak terdokumentasi, mengambil keputusan arsitektur dengan baik, atau merilis perangkat lunak secara aman tanpa peninjauan manusia. Tugas SWE-bench memiliki hasil tes yang dapat diverifikasi; rekayasa perangkat lunak nyata juga mencakup penggalian kebutuhan, kompromi desain, integrasi, keamanan, deployment, dan kolaborasi.
SWE-bench Verified penting karena melampaui soal coding singkat: agen bekerja pada repositori dan deskripsi issue nyata, lalu patch-nya dinilai melalui tes. 1
38 Akan tetapi, menurut pembahasan Anthropic tentang evaluasi agen, model berkembang dari sekitar 40% menjadi di atas 80% dalam satu tahun pada evaluasi ini.
38
Pada tahap ini, paket evaluasi yang lebih berguna sebaiknya mencakup:
Anthropic menyebut SWE-bench Verified dan Terminal-Bench sebagai contoh evaluasi agen, serta menekankan kemampuan Claude 4 untuk menangani tugas yang berjalan lama. 38
42 Namun, bukti yang tersedia belum cukup untuk menyatakan bahwa Anthropic secara resmi mengalihkan strategi evaluasinya dari SWE-bench menuju benchmark berjangka lebih panjang. Klaim yang lebih kuat itu masih belum terbukti.
Performa benchmark Claude yang dilaporkan menjadikannya salah satu opsi coding agent terkuat untuk dievaluasi per September 2026. Tonggak paling jelas adalah pergerakan dari 49% di SWE-bench Verified pada awal 2025 ke skor papan peringkat 97,0% untuk Opus 5, disertai keunggulan yang dilaporkan sebesar 81,2% di SWE-bench Pro. 23
9
53
Untuk memilih tool, jangan bergantung pada satu angka utama. Gunakan skor benchmark untuk menyaring kandidat, lalu jalankan evaluasi terkontrol menggunakan tugas yang benar-benar mewakili repositori Anda sendiri. Benchmark publik yang nyaris jenuh menunjukkan bahwa model dapat memperbaiki banyak issue dengan pola yang sudah dikenal; benchmark itu sendiri belum dapat membuktikan kemampuan rekayasa perangkat lunak otonom yang andal dalam organisasi produksi.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Claude 3.5 Sonnet versi peningkatan mencetak 49,0% di SWE bench Verified pada awal 2025; Claude 4 kemudian dilaporkan mencapai sekitar 72,5%–72,7%.
Claude 3.5 Sonnet versi peningkatan mencetak 49,0% di SWE bench Verified pada awal 2025; Claude 4 kemudian dilaporkan mencapai sekitar 72,5%–72,7%. Papan peringkat Vals AI mencatat Claude Opus 5 di 97,0% pada SWE bench Verified, tetapi tujuh model sudah berada di 95% atau lebih sehingga benchmark ini makin sulit membedakan model terdepan.
SWE bench Pro lebih luas dan dirancang lebih tahan terhadap kontaminasi data, tetapi angka 81,2% untuk Claude Fable 5.1 perlu dibaca sebagai nilai papan peringkat yang metodologinya harus diperiksa.