Claude 3.5 Sonnet nâng cấp đạt 49% trên SWE bench Verified; Claude 4 đạt khoảng 72,5–72,7%, còn một bảng xếp hạng sau đó ghi Claude Opus 5 ở mức 97,0%. SWE bench Verified gồm 500 bài sửa lỗi GitHub công khai, chủ yếu từ kho Python; vì gần bão hòa và có rủi ro nhiễm dữ liệu, nó không thể là thước đo duy nhất cho năng...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude đã có bước tiến rất lớn trên các benchmark lập trình, nhưng cách đọc đúng không phải là “Claude đã giải quyết xong kỹ nghệ phần mềm”. Kết luận thận trọng hơn là: Claude đang cực kỳ cạnh tranh, thậm chí dẫn đầu trong nhiều đánh giá tác tử lập trình được công bố. Khi một benchmark công khai hữu hạn bắt đầu có điểm sát 100%, câu hỏi quan trọng hơn chuyển thành: bài đánh giá nào dự báo tốt nhất hiệu quả trên kho mã, công cụ và quy trình review của chính đội ngũ bạn?
| Benchmark | Tác tử phải làm gì? | Phạm vi và cách chấm | Giá trị tham khảo |
|---|---|---|---|
| SWE-bench Verified | Nhận một issue GitHub thật cùng ảnh chụp trạng thái kho mã, rồi tạo bản vá. | 500 tình huống SWE-bench đã được con người sàng lọc, chủ yếu từ các dự án Python mã nguồn mở phổ biến. Một bài được tính là giải quyết nếu bản vá vượt qua bộ kiểm thử trong harness đánh giá. |
Tín hiệu phổ biến về năng lực sửa issue trong codebase thật. |
| SWE-bench Pro | Xử lý các nhiệm vụ kho mã khó hơn, dài hơi hơn theo scaffold tác tử chuẩn hóa. | Được báo cáo gồm 1.865 nhiệm vụ từ 41 kho mã, trải trên 123 ngôn ngữ; thường chấm theo Pass@1. |
Mở rộng ra ngoài các bài Python công khai của Verified và được thiết kế để giảm rủi ro nhiễm dữ liệu. |
| Terminal-Bench 4.0 | Hoàn thành công việc kỹ thuật đầu-cuối trong môi trường dòng lệnh. | Bao gồm điều tra, chạy lệnh, sửa tệp, kiểm thử và khắc phục khi sai, thay vì chỉ vá một issue GitHub. |
Kiểm tra rõ hơn năng lực vận hành và dùng công cụ của tác tử. |
Scaffold ở đây là lớp thiết kế bao quanh mô hình: cách cấp công cụ, prompt, vòng lặp tác vụ, giới hạn thời gian/token và cơ chế chạy thử. Vì thế, điểm benchmark thường đo cả hệ tác tử, chứ không chỉ riêng mô hình nền.
Anthropic từng báo cáo Claude 3.5 Sonnet bản nâng cấp đạt 49,0% trên SWE-bench Verified, cao hơn kỷ lục được báo cáo trước đó là 45%. Khi ấy, Anthropic lưu ý chưa có mô hình nào vượt mốc 50%. 23
37
Đến tháng 5/2025, Anthropic báo cáo Claude Opus 4 đạt 72,5% và Claude Sonnet 4 đạt 72,7% trên SWE-bench Verified; các kết quả này được công bố không dùng extended thinking. 24
Bức tranh bảng xếp hạng năm 2026 đã khác hẳn. Vals AI ghi nhận Claude Opus 5 đạt 97,0%, đồng thời có bảy mô hình đạt từ 95% trở lên; DeepSeek V4 Pro 0813 đạt 96,4%. 9 Vì vậy, cách nói “Opus 5 đạt khoảng 96%” có thể dùng như một mô tả ngắn cho kết quả thuộc nhóm rất cao, nhưng không phải một con số duy nhất có thẩm quyền tuyệt đối: kết quả thay đổi theo phiên bản mô hình, scaffold, ngân sách và cấu hình đánh giá.
Trên bộ 500 bài, mức 97% để lại rất ít khoảng trống để phân biệt các hệ thống tuyến đầu. Quan trọng hơn, Verified gồm các nhiệm vụ công khai, hữu hạn và lấy từ các kho công khai. Hướng dẫn về benchmark mô tả bộ này có rủi ro nhiễm dữ liệu cao và đang bão hòa. 3
Điều đó không làm điểm số trở nên vô nghĩa. Nó cho thấy tác tử có thể giải quyết rất tốt một lớp issue được mô tả đủ rõ và có kiểm thử xác minh được. Tuy nhiên, nó là dự báo yếu hơn cho công việc mới trong một codebase riêng tư, liên tục thay đổi và nhiều tri thức ngầm.
SWE-bench Pro được định vị là lựa chọn khó hơn và có khả năng chống nhiễm dữ liệu tốt hơn. Phạm vi được báo cáo là 1.865 nhiệm vụ trên 41 kho mã và 123 ngôn ngữ lập trình, thay vì 500 bài đã sàng lọc chủ yếu xoay quanh Python của Verified. 12
16
Các bảng tổng hợp công bố vào tháng 9/2026 liệt kê Claude Fable 5.1 ở mức 81,2%, trước Claude Mythos 5 với 80,3% và Claude Fable 5 với 80,0%. 53 Trên bảng này, Claude chiếm ba vị trí đầu.
Tuy vậy, các con số Pro không phải lúc nào cũng so sánh trực tiếp được. Một nguồn tách biệt mức dẫn đầu 59,1% trên bộ công khai chuẩn hóa của Scale với các số tổng hợp từ nhà cung cấp cao hơn; đây là minh họa rõ cho tác động của harness và phương pháp báo cáo. 13 Một nguồn khác còn cảnh báo con số 81,2% cho Fable 5.1 chưa được hậu thuẫn rõ bởi kết quả SWE-bench công bố trực tiếp theo từng mô hình, và có thể là vấn đề tổng hợp hoặc gán nhầm phiên bản.
55
Do đó, cách dùng phù hợp là coi 81,2% là giá trị được một bảng xếp hạng báo cáo, chưa phải một kết luận độc lập, ổn định về riêng mô hình nền.
Terminal-Bench đánh giá công việc kỹ thuật của tác tử trong môi trường dòng lệnh, chẳng hạn biên dịch phần mềm hoặc huấn luyện mô hình học máy. Khác với định dạng issue-và-bản-vá của SWE-bench Verified, nó kiểm tra quy trình vận hành nhiều bước hơn. 38
So sánh được trích dẫn ghi Claude Fable 5.1 đạt 55,8%, trong khi GPT-5.6 Sol đạt 37,3% — chênh 18,5 điểm phần trăm. 44 Đây là bằng chứng đáng chú ý rằng cấu hình Claude được báo cáo đã thể hiện tốt hơn trong đánh giá cụ thể này.
Nhưng nó không xác lập bảng xếp hạng tổng quát giữa Anthropic, OpenAI, Google, Cognition hay AWS. Một kết luận rộng như vậy cần các mô hình được ghép cặp tương xứng, cùng scaffold tác tử, cùng ngân sách token và thời gian, rồi được kiểm tra trên nhiều bộ nhiệm vụ độc lập. Dữ liệu được cung cấp không có đối chiếu toàn diện đó.
Ba nhận định có cơ sở từ dữ liệu hiện có là:
Các số liệu này không chứng minh Claude có thể tự hoàn thành dự án kéo dài nhiều tuần, hiểu đáng tin cậy các hệ thống nội bộ không có tài liệu, đưa ra quyết định kiến trúc đúng đắn hoặc triển khai sản phẩm an toàn mà không cần review. Công việc kỹ nghệ thực tế còn bao gồm làm rõ yêu cầu, đánh đổi kỹ thuật, tích hợp, bảo mật, triển khai và phối hợp con người — những việc không được bao phủ đầy đủ bởi các bài có kết quả kiểm thử xác định.
SWE-bench Verified vẫn có giá trị vì nó vượt xa dạng câu đố lập trình ngắn: tác tử phải làm việc trên kho mã thật, đọc mô tả issue và được chấm bằng kiểm thử. 1
38 Nhưng theo mô tả của Anthropic về đánh giá tác tử, mô hình đã đi từ khoảng 40% lên trên 80% chỉ trong một năm.
38
Một quy trình đánh giá hữu ích cho doanh nghiệp nên có nhiều lớp:
Anthropic xem cả SWE-bench Verified lẫn Terminal-Bench là ví dụ về đánh giá tác tử, đồng thời nhấn mạnh khả năng xử lý tác vụ dài của Claude 4. 38
42 Tuy nhiên, dữ liệu được cung cấp chưa đủ để khẳng định Anthropic đã chính thức chuyển chiến lược đánh giá từ SWE-bench sang các benchmark dài hạn hơn. Nhận định mạnh hơn đó nên được để ở trạng thái chưa được chứng minh.
Tính đến tháng 9/2026, kết quả benchmark được báo cáo đưa Claude vào nhóm lựa chọn tác tử lập trình mạnh nhất để đánh giá. Mốc dễ thấy nhất là hành trình từ 49% trên SWE-bench Verified đầu năm 2025 đến 97,0% của Opus 5 trên một bảng xếp hạng Verified, đi cùng vị trí dẫn đầu Pro được báo cáo là 81,2%. 23
9
53
Khi chọn công cụ, đừng quyết định chỉ từ một tiêu đề điểm số. Hãy dùng benchmark để lập danh sách rút gọn, rồi chạy thử đối chứng trên các nhiệm vụ đại diện trong chính kho mã của mình. Một benchmark công khai gần bão hòa cho thấy tác tử có thể sửa được nhiều lỗi theo khuôn mẫu đã biết; nó không tự thân chứng minh khả năng kỹ nghệ tự trị, đáng tin cậy trong môi trường production.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Claude 3.5 Sonnet nâng cấp đạt 49% trên SWE bench Verified; Claude 4 đạt khoảng 72,5–72,7%, còn một bảng xếp hạng sau đó ghi Claude Opus 5 ở mức 97,0%.
Claude 3.5 Sonnet nâng cấp đạt 49% trên SWE bench Verified; Claude 4 đạt khoảng 72,5–72,7%, còn một bảng xếp hạng sau đó ghi Claude Opus 5 ở mức 97,0%. SWE bench Verified gồm 500 bài sửa lỗi GitHub công khai, chủ yếu từ kho Python; vì gần bão hòa và có rủi ro nhiễm dữ liệu, nó không thể là thước đo duy nhất cho năng lực kỹ nghệ phần mềm.
SWE bench Pro và Terminal Bench đưa ra các bài toán rộng, dài hơi và giàu thao tác công cụ hơn, nhưng điểm số vẫn phụ thuộc đáng kể vào tác tử, scaffold, ngân sách và cách chạy đánh giá.