Claude ขยับจาก 49.0% บน SWE bench Verified ในต้นปี 2025 ไปสู่ 97.0% ของ Claude Opus 5 ในลีดเดอร์บอร์ดหนึ่งช่วงปี 2026 แต่คะแนนขึ้นกับเวอร์ชันโมเดล เอเจนต์สแคฟโฟลด์ และงบประมาณการรัน SWE bench Verified มี 500 โจทย์จาก GitHub สาธารณะและเน้นรีโป Python จึงเริ่มเข้าใกล้ภาวะคะแนนอิ่มตัว ขณะที่ SWE bench Pro ครอบคลุม 1,86...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
คะแนนด้านการเขียนโค้ดของ Claude พุ่งขึ้นอย่างมาก: Claude 3.5 Sonnet รุ่นอัปเกรดทำได้ 49.0% บน SWE-bench Verified ในช่วงต้นปี 2025; Claude 4 ทำได้ราว 72.5%–72.7% ไม่กี่เดือนถัดมา; และลีดเดอร์บอร์ดภายหลังรายงานคะแนนที่เกือบแตะเพดานของชุดทดสอบ 23
24
9
แต่ข้อสรุปที่ถูกต้องไม่ใช่ “Claude แก้ปัญหาวิศวกรรมซอฟต์แวร์ได้แล้วทั้งหมด” สิ่งที่ข้อมูลบอกได้คือ Claude เป็นหนึ่งในเอเจนต์เขียนโค้ดที่แข่งขันได้สูงมาก และมักอยู่แถวหน้าบนการประเมินแบบเผยแพร่สู่สาธารณะ เมื่อคะแนนเข้าใกล้ 100% สำหรับเบนช์มาร์กที่มีโจทย์จำกัด คำถามสำคัญกว่าคือ การทดสอบแบบใดทำนายผลงานในรีโป เครื่องมือ และขั้นตอนรีวิวโค้ดของทีมเราได้จริง
| เบนช์มาร์ก | สิ่งที่เอเจนต์ต้องทำ | ขอบเขตและการให้คะแนน | เหตุผลที่ควรดู |
|---|---|---|---|
| SWE-bench Verified | รับ issue จริงจาก GitHub พร้อมสแนปช็อตของรีโป แล้วสร้างแพตช์แก้ไข | ชุดโจทย์ 500 รายการที่มนุษย์คัดกรองจาก SWE-bench ส่วนใหญ่มาจากรีโปโอเพนซอร์ส Python ยอดนิยม งานจะนับว่าแก้สำเร็จเมื่อแพตช์ผ่านชุดทดสอบในระบบประเมิน |
เป็นตัววัดที่ได้รับการยอมรับกว้างขวางสำหรับการแก้ issue ในโค้ดเบสจริง |
| SWE-bench Pro | แก้งานในรีโปที่ยากกว่าและใช้เวลาหลายขั้นตอน ภายใต้โครงเอเจนต์มาตรฐาน | มีรายงานว่าครอบคลุม 1,865 งานจาก 41 รีโป ใน 123 ภาษา และมักวัดด้วย Pass@1 |
ออกแบบให้กว้างกว่าโจทย์ Python สาธารณะของ Verified และลดความเสี่ยงจากการปนเปื้อนของข้อมูล |
| Terminal-Bench 4.0 | ทำงานเทคนิคแบบครบวงจรในเทอร์มินัล | โจทย์ต้องสืบค้น รันคำสั่ง แก้ไฟล์ ทดสอบ และกู้สถานการณ์ ไม่ได้จำกัดอยู่ที่การส่งแพตช์ตอบ issue |
เพิ่มโจทย์ด้านการใช้เครื่องมือและการปฏิบัติงาน ซึ่งใกล้เคียงเวิร์กโฟลว์เอเจนต์มากขึ้น |
Anthropic รายงานว่า Claude 3.5 Sonnet รุ่นอัปเกรดทำได้ 49.0% บน SWE-bench Verified แซงสถิติที่รายงานก่อนหน้าซึ่งอยู่ที่ 45% ขณะนั้น Anthropic ระบุว่ายังไม่มีโมเดลใดผ่าน 50% บนการทดสอบนี้ 23
37
เดือนพฤษภาคม 2025 Anthropic รายงาน 72.5% สำหรับ Claude Opus 4 และ 72.7% สำหรับ Claude Sonnet 4 บน SWE-bench Verified โดยตัวเลขดังกล่าวเป็นผลที่ไม่ได้ใช้ extended thinking 24
ภาพของลีดเดอร์บอร์ดในปี 2026 เปลี่ยนไปมาก Vals AI รายงาน Claude Opus 5 ที่ 97.0% และมีโมเดลที่ประเมินแล้ว 7 รุ่นได้คะแนนตั้งแต่ 95% ขึ้นไป ขณะที่ DeepSeek V4 Pro 0813 ได้ 96.4% 9 ดังนั้นการพูดว่า “Opus 5 ได้ราว 96%” จึงพอใช้เป็นการสรุปว่าคะแนนอยู่ระดับ 90% ปลาย ๆ ได้ แต่ไม่ใช่ตัวเลขมาตรฐานเพียงค่าเดียว เพราะผลขึ้นอยู่กับเวอร์ชันโมเดล โครงเอเจนต์ งบโทเค็นหรือเวลา และวิธีตั้งค่าการประเมิน
คะแนน 97% ในชุด 500 งานเหลือพื้นที่น้อยมากสำหรับแยกระบบระดับแนวหน้าออกจากกัน ยิ่งไปกว่านั้น Verified ใช้โจทย์สาธารณะที่มีจำนวนจำกัดจากรีโปสาธารณะ แนวทางอธิบายเบนช์มาร์กระบุว่าชุดนี้มีความเสี่ยงสูงต่อการปนเปื้อนของข้อมูลและกำลังเข้าสู่ภาวะอิ่มตัว 3
ไม่ได้แปลว่าคะแนนนี้ไม่มีความหมาย แต่หมายความว่ามันเหมาะจะใช้เป็นหลักฐานว่าเอเจนต์แก้ issue ที่ระบุโจทย์ชัดและตรวจด้วยเทสต์ได้ดี มากกว่าจะใช้ทำนายอย่างครบถ้วนว่าเอเจนต์จะรับมือกับงานใหม่ในโค้ดเบสส่วนตัวที่เปลี่ยนแปลงตลอดเวลาได้เพียงใด
SWE-bench Pro ถูกวางตำแหน่งให้เป็นทางเลือกที่ยากขึ้นและต้านการปนเปื้อนของข้อมูลได้ดีกว่า มีรายงานว่าครอบคลุม 1,865 งาน ใน 41 รีโป และ 123 ภาษาโปรแกรม เทียบกับ Verified ที่มี 500 งานซึ่งผ่านการคัดกรองโดยมนุษย์และเน้นรีโป Python ยอดนิยม 12
16
ลีดเดอร์บอร์ดแบบรวมข้อมูลที่เผยแพร่ในเดือนกันยายน 2026 ระบุ Claude Fable 5.1 ที่ 81.2% นำหน้า Claude Mythos 5 ที่ 80.3% และ Claude Fable 5 ที่ 80.0% ทำให้ Claude ครองสามอันดับแรกในตารางนั้น 53
อย่างไรก็ดี คะแนน Pro ไม่ได้เทียบกันได้ตรงทั้งหมด แหล่งข้อมูลหนึ่งแยกผลนำที่ 59.1% บนชุดสาธารณะมาตรฐานของ Scale ออกจากตัวเลขแบบรวมจากผู้ให้บริการที่สูงกว่า ซึ่งชี้ให้เห็นว่าโครงเอเจนต์และวิธีรายงานมีผลต่อคะแนนมากเพียงใด 13 อีกแหล่งเตือนโดยตรงว่าค่า 81.2% ของ Fable 5.1 ยังไม่มีผลเฉพาะรุ่นที่เผยแพร่ชัดเจนรองรับ และอาจเกิดจากการรวมข้อมูลหรือระบุเวอร์ชันคลาดเคลื่อน
55
ข้อควรปฏิบัติคือ มอง 81.2% เป็นค่าที่ลีดเดอร์บอร์ดรายงาน ไม่ใช่ข้อเท็จจริงที่ได้รับการยืนยันซ้ำอย่างอิสระเกี่ยวกับโมเดลพื้นฐานเพียงอย่างเดียว
Terminal-Bench ประเมินงานเอเจนต์เชิงเทคนิคผ่านสภาพแวดล้อมบรรทัดคำสั่ง เช่น การสร้างซอฟต์แวร์หรือฝึกโมเดลแมชชีนเลิร์นนิง จึงต่างจากรูปแบบ issue-and-patch ของ SWE-bench Verified เพราะทดสอบกระบวนการทำงานเชิงปฏิบัติการมากกว่า 38
ผลเปรียบเทียบที่อ้างถึงระบุ 55.8% สำหรับ Claude Fable 5.1 เทียบกับ 37.3% สำหรับ GPT-5.6 Sol เป็นช่องว่าง 18.5 จุดเปอร์เซ็นต์ 44 นี่เป็นหลักฐานที่มีนัยว่าในการตั้งค่าที่รายงานนั้น Claude ทำผลงานได้ดีกว่า
แต่ยังไม่ใช่หลักฐานของอันดับรวมระหว่าง Anthropic, OpenAI, Google, Cognition หรือ AWS การอ้างเชิงกว้างแบบนั้นต้องใช้โมเดลที่จับคู่กัน โครงเอเจนต์เดียวกัน งบโทเค็นและเวลาที่เทียบเคียงได้ รวมถึงผลจากชุดทดสอบอิสระหลายชุด ซึ่งข้อมูลที่มีไม่ได้ให้การเปรียบเทียบดังกล่าว
หลักฐานที่มีรองรับข้อสรุปที่วัดได้ 3 ประการ
แต่ผลเหล่านี้ไม่ได้พิสูจน์ว่า Claude จะทำโครงการหลายสัปดาห์ได้เอง เข้าใจระบบภายในที่ไม่มีเอกสาร ตัดสินใจสถาปัตยกรรมได้เหมาะสม หรือปล่อยระบบสู่การใช้งานได้อย่างปลอดภัยโดยไม่ต้องมีคนรีวิว งาน SWE-bench มีผลลัพธ์ที่ตรวจด้วยเทสต์ได้ ขณะที่งานวิศวกรรมจริงยังมีการค้นหาความต้องการ การชั่งน้ำหนักทางเลือก การเชื่อมต่อระบบ ความปลอดภัย การดีพลอย และการทำงานร่วมกับคน
SWE-bench Verified มีคุณค่าเพราะก้าวพ้นโจทย์เขียนโค้ดสั้น ๆ: เอเจนต์ต้องทำงานกับรีโปและคำอธิบาย issue จริง แล้วให้เทสต์ตัดสินแพตช์ 1
38 แต่ตามคำอธิบายของ Anthropic โมเดลก้าวจากประมาณ 40% เป็นมากกว่า 80% บนการประเมินนี้ภายในเวลาเพียงปีเดียว
38
ในระยะนี้ ชุดประเมินที่มีประโยชน์ควรประกอบด้วย
Anthropic ยกทั้ง SWE-bench Verified และ Terminal-Bench เป็นตัวอย่างการประเมินเอเจนต์ และกล่าวถึงความสามารถของ Claude 4 ในงานที่ทำต่อเนื่องยาวนาน 38
42 อย่างไรก็ดี หลักฐานที่ให้มายังไม่พอจะยืนยันว่า Anthropic เปลี่ยนกลยุทธ์อย่างเป็นทางการจาก SWE-bench ไปสู่การประเมินระยะยาวโดยเฉพาะ ข้ออ้างที่แรงกว่านี้จึงยังสรุปไม่ได้
ผลเบนช์มาร์กที่รายงานทำให้ Claude เป็นหนึ่งในตัวเลือกเอเจนต์เขียนโค้ดที่แข็งแกร่งที่สุดซึ่งควรนำมาประเมิน ณ เดือนกันยายน 2026 หมุดหมายที่ชัดที่สุดคือการขยับจาก 49% บน SWE-bench Verified ในต้นปี 2025 ไปสู่ 97.0% ของ Opus 5 ในลีดเดอร์บอร์ดที่รายงาน ควบคู่กับการนำที่รายงาน 81.2% บน SWE-bench Pro 23
9
53
สำหรับการเลือกเครื่องมือ อย่าตัดสินจากพาดหัวคะแนนเดียว ใช้คะแนนเหล่านี้คัดรายชื่อเอเจนต์เบื้องต้น แล้วทดสอบแบบควบคุมกับงานที่เป็นตัวแทนในรีโปขององค์กรเอง เบนช์มาร์กสาธารณะที่เกือบอิ่มตัวบอกได้ว่าโมเดลแก้ปัญหาลักษณะที่คุ้นเคยได้จำนวนมาก แต่ยังพิสูจน์ไม่ได้ด้วยตัวมันเองว่าเอเจนต์จะเป็นวิศวกรอัตโนมัติที่พึ่งพาได้ในระบบผลิตจริง
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Claude ขยับจาก 49.0% บน SWE bench Verified ในต้นปี 2025 ไปสู่ 97.0% ของ Claude Opus 5 ในลีดเดอร์บอร์ดหนึ่งช่วงปี 2026 แต่คะแนนขึ้นกับเวอร์ชันโมเดล เอเจนต์สแคฟโฟลด์ และงบประมาณการรัน
Claude ขยับจาก 49.0% บน SWE bench Verified ในต้นปี 2025 ไปสู่ 97.0% ของ Claude Opus 5 ในลีดเดอร์บอร์ดหนึ่งช่วงปี 2026 แต่คะแนนขึ้นกับเวอร์ชันโมเดล เอเจนต์สแคฟโฟลด์ และงบประมาณการรัน SWE bench Verified มี 500 โจทย์จาก GitHub สาธารณะและเน้นรีโป Python จึงเริ่มเข้าใกล้ภาวะคะแนนอิ่มตัว ขณะที่ SWE bench Pro ครอบคลุม 1,865 งานจาก 41 รีโป และ 123 ภาษา
ผล 55.8% เทียบ 37.3% บน Terminal Bench 4.0 สนับสนุนว่า Claude Fable 5.1 ทำได้ดีกว่า GPT 5.6 Sol ในการตั้งค่านั้น แต่ไม่ใช่อันดับรวมของผู้ให้บริการ AI ทุกค่าย