ในข้อมูล BenchLM ที่เห็นได้ชัดสำหรับสามโมเดล Claude Opus 4.7 มีคะแนนสูงสุด BenchLM ระบุว่า Claude Opus 4.7 อยู่ provisional leaderboard อันดับ 2 จาก 110 โมเดล ด้วย overall score 97/100 และอยู่ verified leaderboard อันดับ 2 จาก 14 โมเดล .
GPT-5.5 อยู่ provisional leaderboard อันดับ 5 จาก 112 โมเดล ด้วย overall score 89/100 และอยู่ verified leaderboard อันดับ 2 จาก 16 โมเดล . ส่วน Kimi 2.6 ได้ 85/100 บน BenchLM provisional leaderboard อันดับ 12 จาก 115 โมเดล พร้อมคะแนนเบนช์มาร์กที่เผยแพร่ 27 รายการ
.
แต่ต้องย้ำว่า นี่เป็นภาพจาก BenchLM เท่านั้น จำนวนโมเดลที่ใช้เทียบในแต่ละหน้าไม่เท่ากัน และข้อมูลชุดนี้ยังไม่มีคะแนน BenchLM ของ DeepSeek V4 ที่วางเทียบแบบเดียวกันได้ .
ถ้าโจทย์คือการแก้โค้ดหรือช่วยงานวิศวกรรมซอฟต์แวร์ Claude Opus 4.7 มีตัวเลขสาธารณะที่อ่านง่ายที่สุด MindStudio ระบุว่า Claude Opus 4.7 ทำคะแนน SWE-bench Verified ได้ 82.4% เพิ่มขึ้นราว 11 คะแนนจาก Opus 4.6 . แหล่งเดียวกันยังระบุว่าโมเดลนี้ได้ FinanceBench 82.7% และ MathVista เพิ่มขึ้น 9.5 คะแนนในกลุ่มการปรับปรุงด้านวิชัน
.
สำหรับ GPT-5.5 ตัวเลขที่ OpenAI ยกขึ้นมาเด่นในข้อมูลที่มี ไม่ใช่ SWE-bench แต่เป็น GDPval, OSWorld-Verified และ Tau2-bench Telecom . ฝั่ง Kimi K2.6 มีข้อมูลจาก GMI Cloud ที่ระบุว่าโดดเด่นบน SWE-Bench Pro แต่จากสรุปที่มี ยังไม่พอระบุคะแนนที่แน่นอนหรือยืนยันการเทียบแบบเงื่อนไขเดียวกันกับทั้งสี่โมเดล
. ส่วน DeepSeek V4 ในชุดข้อมูลนี้มีตัวเลขด้านเหตุผลและคณิตศาสตร์ที่ชัดกว่าโค้ด
.
สำหรับงานที่คล้ายการทำงานจริงในองค์กร เช่น ผลิตงานความรู้ ใช้คอมพิวเตอร์ หรือจัดการเวิร์กโฟลว์บริการลูกค้า GPT-5.5 มีตัวเลขทางการที่ค่อนข้างเฉพาะเจาะจง OpenAI ระบุว่า GPT-5.5 ได้ 84.9% บน GDPval ซึ่งเป็นการทดสอบความสามารถของเอเจนต์ในการสร้างผลงานความรู้ตามโจทย์ที่กำหนดใน 44 อาชีพ . OpenAI ยังระบุว่า GPT-5.5 ได้ 78.7% บน OSWorld-Verified ซึ่งวัดการทำงานในสภาพแวดล้อมคอมพิวเตอร์จริง และได้ 98.0% บน Tau2-bench Telecom ซึ่งทดสอบเวิร์กโฟลว์บริการลูกค้าที่ซับซ้อน
.
Claude Opus 4.7 ก็มีข้อมูลด้านเอเจนต์เช่นกัน Anthropic ระบุว่าใน research-agent benchmark ภายใน Claude Opus 4.7 ทำคะแนนรวม 0.715 เสมออันดับสูงสุดใน 6 โมดูล และในโมดูล General Finance ได้ 0.813 สูงกว่า Opus 4.6 ที่ได้ 0.767 .
อย่างไรก็ตาม GDPval, OSWorld-Verified และ Tau2-bench ของ GPT-5.5 กับ research-agent benchmark ภายในของ Claude Opus 4.7 เป็นคนละระบบประเมิน . ดังนั้นไม่ควรนำ 84.9% ของ GPT-5.5 ไปเทียบกับ 0.715 ของ Claude เหมือนเป็นสเกลเดียวกัน
.
สำหรับ DeepSeek V4 ตัวเลขที่ชัดที่สุดในข้อมูลนี้มาจากการตั้งค่า V4-Pro-Max DataCamp ระบุว่า ตามผลภายในของ DeepSeek นั้น DeepSeek V4-Pro-Max ได้ MMLU-Pro 87.5%, GPQA Diamond 90.1% และ GSM8K 92.6% . ตัวเลขเหล่านี้เป็นจุดอ้างอิงที่มีประโยชน์ แต่เพราะ DataCamp ระบุว่าอิงผลภายใน จึงไม่ควรให้น้ำหนักเท่ากับลีดเดอร์บอร์ดอิสระโดยอัตโนมัติ
.
เอกสาร DeepSeek-V4-Pro บน Hugging Face มีตารางที่วาง DeepSeek V4-Pro-Max และ Kimi K2.6 Thinking ไว้ร่วมกันบางส่วนในหมวดความรู้และการให้เหตุผล .
| เบนช์มาร์ก | DeepSeek V4-Pro-Max | Kimi K2.6 Thinking | ใครสูงกว่าในตารางนี้ |
|---|---|---|---|
| MMLU-Pro | 87.5 | 87.1 | DeepSeek V4-Pro-Max |
| SimpleQA-Verified | 57.9 | 36.9 | DeepSeek V4-Pro-Max |
| Chinese-SimpleQA | 84.4 | 75.9 | DeepSeek V4-Pro-Max |
| GPQA Diamond | 90.1 | 90.5 | Kimi K2.6 Thinking |
| HLE | 37.7 | 36.4 | DeepSeek V4-Pro-Max |
จากตารางนี้ DeepSeek V4-Pro-Max สูงกว่า Kimi K2.6 Thinking ใน MMLU-Pro, SimpleQA-Verified, Chinese-SimpleQA และ HLE ขณะที่ Kimi K2.6 Thinking สูงกว่าเล็กน้อยใน GPQA Diamond . แต่ตารางเดียวกันไม่ได้ใช้ Claude Opus 4.7 และ GPT-5.5 เป็นคู่เทียบโดยตรง หากแต่มีโมเดลอื่นอย่าง Opus-4.6 Max และ GPT-5.4 xHigh จึงยังสรุปอันดับรวมของทั้งสี่โมเดลไม่ได้
.
ข้อมูลจาก Vals AI ระบุว่า GPT-5.5 มี Accuracy 67.76% ± 1.79, Latency 409.09s และ context window 1M . ส่วน Kimi K2.6 มี Accuracy 63.94% ± 1.97, Latency 373.57s และ Cost/Test $0.21
. ถ้าเทียบเฉพาะสองรายการนี้ คะแนน accuracy ของ GPT-5.5 สูงกว่า ขณะที่ latency ที่แสดงของ Kimi K2.6 ต่ำกว่า
.
Kimi K2.6 ยังมีความหมายสำหรับคนที่มองหาโมเดลกลุ่มโอเพนเวต Artificial Analysis เรียก Kimi K2.6 ของ Moonshot ว่าเป็น leading open weights model และให้ Artificial Analysis Intelligence Index 54 พร้อมอันดับรวมที่ 4 . อย่างไรก็ตาม Artificial Analysis, Vals และ BenchLM เป็นคนละระบบประเมิน จึงไม่ควรนำคะแนน 54, Vals Accuracy 63.94% และ BenchLM 85/100 มารวมเหมือนเป็นคะแนนเดียวกัน
.
จากหลักฐานสาธารณะที่มี Claude Opus 4.7 โดดเด่นด้านโค้ดและลีดเดอร์บอร์ด BenchLM, GPT-5.5 มีจุดแข็งในงานเอเจนต์ งานความรู้ และการใช้คอมพิวเตอร์, DeepSeek V4-Pro-Max มีตัวเลขด้านเหตุผลและคณิตศาสตร์ที่น่าสนใจ และ Kimi K2.6 เด่นในมุมโอเพนเวต ต้นทุน และ latency .
แต่ข้อมูลยังไม่สม่ำเสมอพอที่จะจัดอันดับแบบเด็ดขาดตั้งแต่ที่ 1 ถึงที่ 4 วิธีที่ปลอดภัยกว่าคือใช้ตารางเบนช์มาร์กเป็นจุดตั้งต้น แล้วทดสอบซ้ำด้วยงานจริงของคุณเอง เช่น งานโค้ด งานวิเคราะห์เอกสารการเงิน งานควบคุมเบราว์เซอร์หรือคอมพิวเตอร์ งานบริการลูกค้า หรือการรันเอเจนต์ระยะยาว .