ถ้างานของคุณคือแก้บั๊กใน codebase เดิม อ่านเทสต์ที่ล้ม ทำแพตช์ แล้วส่งเป็น PR ให้คนรีวิว ให้เริ่มประเมิน Claude Opus 4.7 ก่อน
แต่ถ้างานคือให้เอเจนต์รันคำสั่ง build, test, lint, อ่าน log แล้วเลือกคำสั่งถัดไปซ้ำ ๆ ผ่านเทอร์มินัล GPT-5.5 เป็นตัวที่ควรลองก่อน
| โจทย์งาน | รุ่นที่ควรลองก่อน | หลักฐานที่เปิดเผย | ข้อควรระวัง |
|---|---|---|---|
| แก้โค้ดในรีโพซิทอรี แก้บั๊ก ทำให้เทสต์ผ่าน | Claude Opus 4.7 | Anthropic ระบุว่า Opus 4.7 นำใน SWE-bench Pro ที่ 64.3% และรายงานอีกชุดสรุป GPT-5.5 ที่ 58.6% เทียบกับ Claude Opus 4.7 ที่ 64.3% | SWE-bench มีหลายเวอร์ชัน และมีข้อสังเกตว่าผู้ให้บริการอาจเลือกเน้นตัวชี้วัดที่เป็นประโยชน์กับตนเอง |
| เอเจนต์เขียนโค้ดผ่านเทอร์มินัลหรือ CLI | GPT-5.5 | ตาราง Terminal-Bench 2.0 ที่ VentureBeat อ้างถึงให้ GPT-5.5 ได้ 82.7 ส่วน Claude Opus 4.7 ได้ 69.4 | Terminal-Bench 2.0 วัดความสามารถด้าน workflow บน command line เช่น การวางแผน การวนลอง และการประสานเครื่องมือ ไม่ใช่ตัวแทนคุณภาพโค้ดทั้งหมด |
| งานผู้ช่วยนักพัฒนาที่มี browsing และ tool calling ปนกัน | ยังไม่ควรฟันธง | ในตารางของ OpenAI, BrowseComp ให้ GPT-5.5 84.4% และ Claude Opus 4.7 79.3% แต่ MCP Atlas ให้ GPT-5.5 75.3% และ Claude Opus 4.7 79.1% | การใช้เครื่องมือเป็นหมวดกว้าง ไม่ได้เท่ากับงานเขียนโค้ดโดยตรง |
| งานเอเจนต์ยาว ๆ ที่ต้องคุมหลายขั้นตอน | Claude Opus 4.7 ก็เป็นตัวเลือกที่แข็ง | Anthropic อธิบาย Opus 4.7 ว่าเป็นโมเดลที่เปิดให้ใช้งานทั่วไปที่เก่งที่สุดของบริษัทสำหรับ complex reasoning และ agentic coding | ผลจริงขึ้นกับ harness, prompt, สิทธิ์เครื่องมือ และสภาพแวดล้อมทดสอบอย่างมาก |
Claude Opus 4.7 น่าสนใจเป็นพิเศษเมื่อโจทย์คือแก้โค้ดในรีโพซิทอรีจริง เช่น อ่านเทสต์ที่ล้ม หาต้นเหตุ ทำแพตช์ขนาดพอดี และทำให้ชุดทดสอบกลับมาผ่าน Anthropic ชูว่า Claude Opus 4.7 ทำคะแนน SWE-bench Pro ได้ 64.3% และรายงานเปรียบเทียบอีกชุดก็สรุปว่า Claude Opus 4.7 อยู่เหนือ GPT-5.5 ในตัวชี้วัดเดียวกัน
ภาพนี้สอดคล้องกับตำแหน่งที่ Anthropic วางให้รุ่นนี้ด้วย ใน release notes วันที่ 16 เมษายน 2026 Anthropic ระบุว่า Claude Opus 4.7 เป็นโมเดลที่เปิดให้ใช้งานทั่วไปที่เก่งที่สุดของบริษัทสำหรับ complex reasoning และ agentic coding
ด้านฟีเจอร์ Claude Opus 4.7 ยังเพิ่ม task budgets แบบเบต้า ซึ่งให้เป้าหมายโทเคนคร่าว ๆ สำหรับ agentic loop ทั้งรอบ ตั้งแต่ thinking, tool calls, tool results ไปจนถึง final output เพื่อให้โมเดลเห็นงบที่เหลือและจัดลำดับความสำคัญของงานได้ดีขึ้น นอกจากนี้ Anthropic ระบุว่าผู้ใช้ Opus 4.7 ถูกตั้งค่าเริ่มต้นเป็น xhigh effort
ดังนั้นงานต่อไปนี้ควรเริ่มจาก Claude Opus 4.7 เป็นอันดับแรก
แต่ข้อสรุปนี้ไม่ได้แปลว่า Claude ชนะทุกอย่างที่เรียกว่า coding เพราะ SWE-bench มีหลายรูปแบบ และมีข้อสังเกตว่าผู้ให้บริการโมเดลอาจเลือกนำเสนอตัวชี้วัดที่ตนทำได้ดีเป็นพิเศษ วิธีอ่านที่ปลอดภัยกว่าคือใช้คะแนนเหล่านี้เป็นจุดเริ่มต้น แล้วทดสอบกับรีโพของทีมเอง
จุดแข็งของ GPT-5.5 ชัดขึ้นเมื่อโจทย์เป็นเอเจนต์ที่ต้องทำงานในเทอร์มินัลเหมือนนักพัฒนาคนหนึ่ง ตาราง Terminal-Bench 2.0 ที่ VentureBeat รายงานให้ GPT-5.5 ได้ 82.7 ขณะที่ Claude Opus 4.7 ได้ 69.4
เหตุผลที่ตัวเลขนี้น่าสนใจคือ Terminal-Bench 2.0 ไม่ได้วัดแค่การสร้าง code snippet สั้น ๆ แต่เป็นการประเมิน workflow บน command line ที่ต้องอาศัยการวางแผน การลองซ้ำ และการประสานเครื่องมือหลายอย่าง งานลักษณะนี้ใกล้กับเอเจนต์ที่รันคำสั่ง อ่าน error log แก้สมมติฐาน แล้วรันเทสต์ใหม่
ถ้า workflow ของคุณเป็นแบบนี้ GPT-5.5 ควรอยู่ในรายชื่อแรก ๆ
อย่างไรก็ตาม คะแนน Terminal-Bench 2.0 ที่สูงกว่าไม่ได้แปลว่า GPT-5.5 จะสร้างแพตช์ที่ดีกว่าในทุกบั๊ก หรือทำ PR ที่พร้อม merge กว่าเสมอ ความสามารถในการทำงานผ่าน CLI กับคุณภาพของแพตช์ขั้นสุดท้ายเกี่ยวข้องกัน แต่ไม่ใช่สิ่งเดียวกัน
เมื่อมองงานที่มี browsing หรือ tool calling ปนกัน ภาพไม่ได้เอนไปทางเดียว ข้อมูลแนะนำ GPT-5.5 ของ OpenAI ระบุว่า BrowseComp ให้ GPT-5.5 84.4% และ Claude Opus 4.7 79.3% แต่ MCP Atlas ให้ GPT-5.5 75.3% และ Claude Opus 4.7 79.1%
ดังนั้นคำว่าใช้เครื่องมือเก่งยังต้องแยกต่อว่าเป็นเครื่องมือแบบไหน ถ้าเป็นการค้นข้อมูลและท่องเว็บ ผลอาจออกแบบหนึ่ง ถ้าเป็นการควบคุมเทอร์มินัลในเครื่องพัฒนา ผลอาจอีกแบบ และถ้าเป็นการแก้โค้ดในรีโพจริงพร้อมชุดทดสอบ ก็ต้องดูอีกชุดหนึ่ง
หนึ่ง: อย่าอ่าน ranking รวมเป็น ranking งานโค้ด
ตัวอย่างเช่น BenchLM overall ranking แสดง GPT-5.4 ที่ 88 คะแนน และ Claude Opus 4.7 ที่ 86 คะแนน แต่ตัวเลขนี้ไม่ใช่ GPT-5.5 และไม่ใช่การประเมินเฉพาะงานโค้ด
สอง: อย่าใช้ SWE-bench Pro เพียงตัวเดียวตัดสินทุกอย่าง
SWE-bench มีหลายเวอร์ชัน และมีข้อสังเกตว่าผู้ให้บริการอาจเลือกเน้นตัวชี้วัดที่ตนได้เปรียบ คะแนนนี้มีประโยชน์มากสำหรับคัดตัวเลือก แต่ยังไม่ควรแทนการทดสอบในรีโพจริง
สาม: อย่าเทียบ benchmark เทอร์มินัลกับคุณภาพโค้ดแบบหนึ่งต่อหนึ่ง
Terminal-Bench 2.0 สะท้อนความสามารถด้าน command-line workflow เช่น การวางแผน การวนแก้ และการใช้เครื่องมือ ส่วนคำถามว่าโค้ดที่ได้เหมาะจะ merge หรือไม่ ยังต้องรีวิวและทดสอบแยกต่างหาก
ถ้าจะเลือกใช้จริงในทีม อย่าเริ่มจากคำถามว่ารุ่นไหนเก่งกว่าโดยรวม ให้เริ่มจาก issue จริงของทีม แล้วทดสอบสองรุ่นภายใต้เงื่อนไขเดียวกันมากที่สุด
เกณฑ์ตัดสินควรเป็นสิ่งที่ทีมใช้จริง ไม่ใช่แค่ผ่านหรือไม่ผ่านในครั้งเดียว
ถ้าเป้าหมายหลักคือแก้ issue, แก้บั๊ก, ทำให้เทสต์ผ่าน และสร้างแพตช์สำหรับ PR ให้เริ่มจาก Claude Opus 4.7 เพราะสัญญาณจาก SWE-bench Pro ที่เปิดเผยต่อสาธารณะเอนมาทาง Claude มากกว่า
ถ้าเป้าหมายหลักคือเอเจนต์ที่สั่งคำสั่งในเทอร์มินัล อ่าน log วน build/test และประสาน CLI หลายตัว ให้เริ่มจาก GPT-5.5 เพราะ Terminal-Bench 2.0 รายงานคะแนน GPT-5.5 สูงกว่า Claude Opus 4.7 ชัดเจน
สรุปแบบใช้งานจริงคือ งานแก้โค้ดในรีโพให้ลอง Claude Opus 4.7 ก่อน งานเอเจนต์ผ่านเทอร์มินัลให้ลอง GPT-5.5 ก่อน แล้วตัดสินขั้นสุดท้ายจากรุ่นที่ทำให้เทสต์ผ่านบ่อยกว่า ใช้ diff น้อยกว่า และส่งโค้ดที่ทีมยอม merge ได้สม่ำเสมอกว่า