ข้อสรุปของ OpenAI ชัดเจน: "การปรับปรุงบน SWE-bench Verified ไม่ได้สะท้อนถึงการปรับปรุงที่มีความหมายในความสามารถการพัฒนาซอฟต์แวร์ในโลกจริงของโมเดลอีกต่อไป มันสะท้อนถึงว่าโมเดลถูกเปิดเผยต่อเบนช์มาร์กมากแค่ไหนในระหว่างการฝึก" O
OpenAI แนะนำ SWE-bench Pro อย่างชัดเจนให้เป็นตัวแทน — เบนช์มาร์กที่ใหญ่กว่าซึ่งสร้างโดย Scale AI จาก repositories ส่วนตัวและ copyleft OT
เมื่อวันที่ 8 กรกฎาคม 2026 OpenAI รายงานผลการตรวจสอบ SWE-bench Pro อย่างละเอียด — ซึ่งเป็นเบนช์มาร์กที่เพิ่งโปรโมตว่ามีความแข็งแกร่งกว่า ผลลัพธ์ที่ได้น่าตกใจ TG:
สิ่งนี้บีบให้ OpenAI ต้องถอนคำแนะนำ SWE-bench Pro ทิ้งให้อุตสาหกรรมไร้เบนช์มาร์กตัวใหม่ที่เชื่อถือได้ G
การถอยกลับสองขั้นของ OpenAI ไม่ใช่เหตุการณ์พลาดโดดเดี่ยว มันเป็นส่วนหนึ่งของวิกฤตเชิงระบบในวงการ AI เกี่ยวกับการประเมินความสามารถในการเขียนโค้ด:
การถอยกลับสองครั้งติดต่อกันของ OpenAI — เริ่มจากการทิ้งเบนช์มาร์กของตัวเอง จากนั้นก็ปฏิเสธตัวแทน — ทำให้ภูมิทัศน์การประเมินโค้ด AI ไม่มีผู้นำที่เชื่อถือได้ ชุมชนเริ่มตระหนักมากขึ้นว่าคะแนนเบนช์มาร์กสูงๆ ไม่สามารถทำนายได้อย่างน่าเชื่อถือว่า AI coding agent จะสามารถจัดการงานวิศวกรรมซอฟต์แวร์ในโลกแห่งความจริงได้หรือไม่ GA วิธีการประเมินแบบใหม่ — เช่น เบนช์มาร์กเฉพาะงาน เชิง adversarial หรือที่อัปเดตอย่างต่อเนื่อง — เป็นสิ่งที่จำเป็นอย่างเร่งด่วน แต่ยังไม่สมบูรณ์ GAA
สำหรับตอนนี้ ใครก็ตามที่พยายามประเมิน AI coding agent ไม่มีมาตรฐานเดียวให้เชื่อถือ การล่มสลายของ SWE-bench Verified และ SWE-bench Pro ไม่ใช่แค่เรื่องราวของแบบทดสอบที่มีข้อบกพร่องสองตัว มันเป็นเรื่องราวของอุตสาหกรรมที่สร้างเร็วกว่าที่มันจะวัดได้