Claude meningkat daripada 49.0% pada SWE bench Verified bagi Claude 3.5 Sonnet yang dinaik taraf kepada 97.0% bagi Opus 5 pada satu papan pendahulu, tetapi skor hampir sempurna pada set 500 tugasan perlu dibaca dengan... SWE bench Verified menguji pembaikan isu GitHub awam yang boleh disahkan melalui ujian; SWE benc...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Skor penanda aras pengekodan Claude memang melonjak dengan ketara: Claude 3.5 Sonnet yang dinaik taraf mencatat 49.0% pada SWE-bench Verified pada awal 2025; Claude 4 kemudian dilaporkan sekitar 72.5%–72.7% beberapa bulan selepas itu; dan papan pendahulu kemudian meletakkan model Claude hampir ke siling penanda aras tersebut. 23
24
9
Namun, kesimpulan yang tepat bukanlah bahawa Claude sudah “menyelesaikan” kerja kejuruteraan perisian. Kesimpulan yang lebih munasabah ialah Claude sangat kompetitif—dan dalam beberapa penilaian, mendahului—bagi tugasan ejen pengekodan yang diterbitkan. Apabila skor menghampiri 100% pada penanda aras awam yang terhad, persoalan lebih penting ialah: ujian manakah yang benar-benar meramal prestasi dalam repositori, alatan dan proses semakan kod organisasi anda sendiri?
| Penanda aras | Apa yang dibuat oleh ejen | Liputan dan pemarkahan | Mengapa penting |
|---|---|---|---|
| SWE-bench Verified | Menerima isu GitHub sebenar serta keadaan repositori, kemudian menghasilkan tampalan kod (patch). | Set 500 contoh SWE-bench yang ditapis manusia, terutamanya daripada repositori Python sumber terbuka yang popular. Tugasan dikira selesai apabila tampalan lulus ujian penanda aras dalam persekitaran penilaian. |
Ujian yang diiktiraf meluas untuk keupayaan menyelesaikan isu dalam pangkalan kod sebenar. |
| SWE-bench Pro | Menyelesaikan tugasan repositori yang lebih sukar dan lebih panjang dengan rangka ejen yang diseragamkan. | Dilaporkan mempunyai 1,865 tugasan daripada 41 repositori merentasi 123 bahasa pengaturcaraan; lazimnya dinilai sebagai Pass@1. |
Bertujuan meluaskan skop melangkaui tugasan Python awam dalam Verified serta mengurangkan risiko pencemaran data. |
| Terminal-Bench 4.0 | Menjalankan kerja teknikal dari hujung ke hujung dalam persekitaran terminal. | Melibatkan penyiasatan, arahan terminal, penyuntingan, ujian dan pemulihan daripada kegagalan—bukan sekadar menghasilkan tampalan bagi isu GitHub. |
Menambah tuntutan operasi dan penggunaan alatan yang lebih hampir dengan aliran kerja ejen sebenar. |
Anthropic melaporkan Claude 3.5 Sonnet yang dinaik taraf mencapai 49.0% pada SWE-bench Verified, mengatasi rekod terdahulu yang dilaporkan sebanyak 45%. Pada ketika itu, Anthropic menyatakan belum ada model yang melepasi 50% dalam penanda aras ini. 23
37
Pada Mei 2025, Anthropic melaporkan 72.5% untuk Claude Opus 4 dan 72.7% untuk Claude Sonnet 4 pada SWE-bench Verified. Angka ini dilaporkan tanpa extended thinking. 24
Menjelang 2026, gambaran papan pendahulu berubah dengan besar. Vals AI melaporkan Claude Opus 5 pada 97.0%, dengan tujuh model yang dinilai berada pada 95% atau lebih dan DeepSeek V4 Pro 0813 pada 96.4%. 9 Jadi, frasa “Opus 5 sekitar 96%” boleh dianggap ringkasan munasabah bagi keputusan dalam julat tinggi 90-an, tetapi bukan satu nombor muktamad yang berdiri sendiri: skor bergantung pada versi model, rangka ejen, belanjawan token/masa dan tetapan penilaian.
Skor 97% pada set 500 tugasan meninggalkan ruang yang sangat kecil untuk membezakan sistem di barisan hadapan. Lebih penting lagi, Verified terdiri daripada tugasan awam yang terhad daripada repositori awam. Panduan penanda aras menyifatkannya sebagai berisiko tinggi terhadap pencemaran dan sedang menghampiri ketepuan. 3
Ini tidak menjadikan skor tersebut tidak bermakna. Sebaliknya, ia menunjukkan skor itu paling berguna sebagai bukti bahawa ejen boleh menyelesaikan kelas isu yang jelas spesifikasinya dan boleh diuji—dan kurang sesuai dijadikan ramalan menyeluruh untuk kerja baharu dalam pangkalan kod persendirian yang sentiasa berubah.
SWE-bench Pro diposisikan sebagai pilihan yang lebih sukar serta lebih tahan pencemaran. Liputan yang dilaporkan ialah 1,865 tugasan daripada 41 repositori dalam 123 bahasa pengaturcaraan, berbanding 500 contoh Verified yang ditapis manusia dan berpusat pada Python. 12
16
Papan pendahulu agregat yang diterbitkan pada September 2026 menyenaraikan Claude Fable 5.1 pada 81.2%, di hadapan Claude Mythos 5 pada 80.3% dan Claude Fable 5 pada 80.0%. 53 Dalam paparan itu, Claude memegang tiga kedudukan teratas.
Tetapi ada kelayakan penting: tidak semua nombor Pro boleh dibandingkan secara terus. Satu sumber membezakan skor pendahulu 59.1% pada set awam Scale yang menggunakan rangka piawai daripada angka agregat vendor yang lebih tinggi. Ini menunjukkan betapa besar kesan rangka ejen dan metodologi pelaporan terhadap keputusan. 13 Satu lagi sumber memberi amaran bahawa angka 81.2% bagi Fable 5.1 tidak disokong dengan jelas oleh keputusan SWE-bench khusus model yang diterbitkan secara langsung, dan mungkin melibatkan isu pengagregatan atau atribusi versi.
55
Bagi pembaca yang menilai alat, rumusannya mudah: anggap 81.2% sebagai nilai yang dilaporkan pada papan pendahulu, bukannya fakta muktamad yang telah disahkan secara bebas tentang model asas sahaja.
Terminal-Bench menilai kerja ejen teknikal dalam persekitaran baris arahan, misalnya membina perisian atau melatih model pembelajaran mesin. Tidak seperti format isu-dan-tampalan dalam SWE-bench Verified, ia menguji aliran kerja yang lebih bersifat operasi. 38
Perbandingan yang dipetik melaporkan 55.8% bagi Claude Fable 5.1 dan 37.3% bagi GPT-5.6 Sol—jurang 18.5 mata peratusan. 44 Ini ialah bukti bermakna bahawa konfigurasi Claude yang dilaporkan berprestasi lebih baik dalam penilaian tersebut.
Namun, ia bukan bukti kedudukan menyeluruh antara Anthropic, OpenAI, Google, Cognition atau AWS. Dakwaan merentas pembekal memerlukan model yang dipadankan, rangka ejen yang sama, belanjawan token dan masa yang setara, serta keputusan daripada beberapa suite tugasan bebas. Bukti yang dibekalkan tidak menyediakan perbandingan itu.
Keputusan yang tersedia menyokong tiga dakwaan terukur:
Keputusan ini tidak membuktikan Claude boleh menyiapkan projek berbilang minggu secara autonomi, memahami sistem dalaman yang tidak didokumenkan dengan andal, membuat keputusan seni bina yang wajar, atau melancarkan perisian dengan selamat tanpa semakan manusia. Tugasan SWE-bench mempunyai hasil ujian yang boleh disahkan; kejuruteraan sebenar turut melibatkan penemuan keperluan, kompromi teknikal, penyepaduan, keselamatan, pelaksanaan ke produksi dan kerjasama pasukan.
SWE-bench Verified bernilai kerana ia melangkaui teka-teki kod ringkas: ejen bekerja dengan repositori sebenar dan huraian isu, manakala tampalan dinilai melalui ujian. 1
38 Namun model telah meningkat pantas daripada sekitar 40% kepada lebih 80% dalam penilaian ini dalam tempoh setahun, menurut perbincangan Anthropic tentang penilaian ejen.
38
Pada tahap ini, susunan penilaian yang lebih berguna patut merangkumi:
Anthropic menggambarkan SWE-bench Verified dan Terminal-Bench sebagai contoh penilaian ejen, dan turut menekankan keupayaan kerja jangka panjang bagi Claude 4. 38
42 Namun, bukti yang dibekalkan tidak mencukupi untuk membuktikan bahawa Anthropic telah membuat perubahan rasmi di seluruh syarikat daripada SWE-bench kepada penilaian yang lebih panjang. Dakwaan yang lebih kuat itu masih belum dapat dipastikan.
Prestasi penanda aras Claude yang dilaporkan menjadikannya antara pilihan ejen pengekodan terkuat untuk dinilai setakat September 2026. Pencapaian paling jelas ialah perubahan daripada 49% pada SWE-bench Verified pada awal 2025 kepada skor papan pendahulu 97.0% bagi Opus 5, di samping pendahuluan 81.2% yang dilaporkan pada SWE-bench Pro. 23
9
53
Untuk memilih alat, jangan bergantung pada satu tajuk utama atau satu papan pendahulu. Gunakan skor ini untuk menyenarai pendek ejen, kemudian jalankan penilaian terkawal menggunakan tugasan yang benar-benar mewakili kerja dalam repositori anda. Penanda aras awam yang hampir tepu menunjukkan model boleh membaiki banyak isu yang menyerupai corak diketahui; ia tidak, dengan sendirinya, membuktikan kejuruteraan autonomi yang boleh diharap dalam organisasi produksi.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude meningkat daripada 49.0% pada SWE bench Verified bagi Claude 3.5 Sonnet yang dinaik taraf kepada 97.0% bagi Opus 5 pada satu papan pendahulu, tetapi skor hampir sempurna pada set 500 tugasan perlu dibaca dengan...
Claude meningkat daripada 49.0% pada SWE bench Verified bagi Claude 3.5 Sonnet yang dinaik taraf kepada 97.0% bagi Opus 5 pada satu papan pendahulu, tetapi skor hampir sempurna pada set 500 tugasan perlu dibaca dengan... SWE bench Verified menguji pembaikan isu GitHub awam yang boleh disahkan melalui ujian; SWE bench Pro pula lebih luas dan direka untuk mengurangkan risiko pencemaran, tetapi skor bergantung kuat pada rangka ejen dan k...
Perbandingan Terminal Bench 4.0 yang dipetik memihak kepada Claude Fable 5.1, 55.8% berbanding 37.3% bagi GPT 5.6 Sol, tetapi ia bukan kedudukan menyeluruh untuk semua pembekal AI.