所以,今次比較嘅重點唔係硬排 1 至 4,而係拆開睇:你要寫 code、做知識工作、跑 agent、處理金融文件、做科學推理,抑或想控制成本?答案會唔同。
2026 年嘅 AI benchmark 更似一籃子能力測試。Kili Technology 將 MMLU、MMLU-Pro、GPQA Diamond、SWE-Bench、Terminal-Bench、GAIA、WebArena、GDPval、安全性評估等分成不同能力軸去理解 。Stanford HAI 的 AI Index 亦將技術性能分開看,例如 MMLU、MATH、GPQA Diamond、MMMU、OSWorld、AIME、SWE-bench Verified 等
。
尤其係 MMLU 這類一般知識測試,對頂尖模型嘅分辨力已經下降。Nanonets 解釋,MMLU 以 5-shot 方式計分,而到 2026 年,頂級模型大多擠在 88% 以上,差距變得難以拉開 。換句話講,淨係睇一個總分,好容易睇錯重點;揀模型之前,應該先問清楚自己實際要佢做咩
。
只看提供資料中有 BenchLM 頁面的三個模型,Claude Opus 4.7 位置最前。BenchLM 顯示 Claude Opus 4.7 在 provisional leaderboard 110 個模型中排第 2,overall score 97/100;在 verified leaderboard 亦是 14 個模型中第 2 。
GPT-5.5 在 BenchLM provisional leaderboard 112 個模型中排第 5,overall score 89/100;verified leaderboard 則是 16 個模型中第 2 。Kimi 2.6 在 BenchLM provisional leaderboard 115 個模型中排第 12,overall score 85/100,並顯示有 27 個公開 benchmark 分數
。
如果焦點係軟件工程、修 bug、改 repo,Claude Opus 4.7 的 SWE-bench Verified 數字最清楚。MindStudio 指 Claude Opus 4.7 在 SWE-bench Verified 達 82.4%,比 Opus 4.6 約升 11 個百分點 。同一資料亦列出 Claude Opus 4.7 的 FinanceBench 為 82.7%,並提到視覺相關改善中 MathVista 上升 9.5 分
。
GPT-5.5 方面,OpenAI 介紹資料重點列出的不是 SWE-bench,而是 GDPval、OSWorld-Verified、Tau2-bench Telecom 等工作型指標 。Kimi K2.6 方面,GMI Cloud 資料聲稱其在 SWE-Bench Pro 有領先表現,但現有公開摘要未足以確認精確分數,亦未能證明四模型是在同一條件下比較
。DeepSeek V4 在這批資料中,較具體可見的是推理同數學相關數字,而非 coding 橫向比較
。
如果你關心嘅係「模型可唔可以自己完成知識工作、操作電腦環境、處理客戶支援流程」,GPT-5.5 的官方數字相對最集中。OpenAI 表示 GPT-5.5 在 GDPval 得 84.9%,而 GDPval 測試 agent 在 44 個職業中產出規格化知識工作的能力 。OpenAI 亦列出 GPT-5.5 在 OSWorld-Verified 得 78.7%,以及在測試複雜客戶服務流程的 Tau2-bench Telecom 得 98.0%
。
Claude Opus 4.7 亦有 agent 型資料。Anthropic 指,在其內部 research-agent benchmark 中,Claude Opus 4.7 於 6 個模組總分為 0.715,並列最高;在 General Finance 模組中,它由 Opus 4.6 的 0.767 升至 0.813 。
但要留神:GPT-5.5 的 GDPval、OSWorld-Verified、Tau2-bench,同 Claude Opus 4.7 的 Anthropic 內部 research-agent benchmark,評估體系唔同 。GPT-5.5 的 84.9% 同 Claude 的 0.715,唔可以當成同一分數表直接比較
。
DeepSeek V4 較具體的公開數字,主要見於 V4-Pro-Max 設定。DataCamp 指,根據 DeepSeek 內部結果,DeepSeek V4-Pro-Max 在 MMLU-Pro 得 87.5%、GPQA Diamond 得 90.1%、GSM8K 數學得 92.6% 。這些數字有參考價值,但既然 DataCamp 明確指出是基於內部結果,就唔應同獨立 leaderboard 當成同等證據重量
。
| Benchmark | DeepSeek V4-Pro-Max | Kimi K2.6 Thinking | 表內較高者 |
|---|---|---|---|
| MMLU-Pro | 87.5 | 87.1 | DeepSeek V4-Pro-Max |
| SimpleQA-Verified | 57.9 | 36.9 | DeepSeek V4-Pro-Max |
| Chinese-SimpleQA | 84.4 | 75.9 | DeepSeek V4-Pro-Max |
| GPQA Diamond | 90.1 | 90.5 | Kimi K2.6 Thinking |
| HLE | 37.7 | 36.4 | DeepSeek V4-Pro-Max |
單看這張表,DeepSeek V4-Pro-Max 在 MMLU-Pro、SimpleQA-Verified、Chinese-SimpleQA、HLE 較高;Kimi K2.6 Thinking 則在 GPQA Diamond 略高 。但同表比較對象不是 Claude Opus 4.7 同 GPT-5.5,而是 Opus-4.6 Max、GPT-5.4 xHigh 等其他模型,所以唔足以推出四模型總排名
。
Vals AI 顯示 GPT-5.5 的 Accuracy 為 67.76% ± 1.79,Latency 為 409.09s,Context Window 為 1M 。Kimi K2.6 則顯示 Accuracy 為 63.94% ± 1.97,Latency 為 373.57s,Cost/Test 為 0.21 美元
。只比較這兩條 Vals 紀錄,準確率顯示值是 GPT-5.5 較高,延遲顯示值則是 Kimi K2.6 較低
。
Kimi K2.6 對重視開放權重的使用者亦有另一層意義。Artificial Analysis 形容 Moonshot 的 Kimi K2.6 是 leading open weights model,並列出 Artificial Analysis Intelligence Index 54、整體第 4 的排名 。但 Artificial Analysis、Vals、BenchLM 都是不同評估體系,Kimi 的 54 分、Vals Accuracy 63.94%、BenchLM 85/100 不應加埋變成一個總分
。
以現有公開根據計,Claude Opus 4.7 的優勢較明顯在 coding 與 BenchLM 綜合榜;GPT-5.5 較突出在知識工作、電腦使用同工作型 agent 指標;DeepSeek V4-Pro-Max 有較具體的推理與數學公開數字;Kimi K2.6 則在開放權重、成本與延遲指標上較值得留意 。