下表的 — 代表來源片段未有可比數字,唔代表該模型零分。
| Benchmark/來源 | GPT-5.5 | Claude Opus 4.7 | Kimi K2.6 | DeepSeek V4 | 重點 |
|---|---|---|---|---|---|
| ARC-AGI-2,DocsBot | 85% | 75.8% | — | — | GPT-5.5 高 Claude 9.2 個百分點。 |
| ARC-AGI-1,DocsBot | 95% | 93.5% | — | — | GPT-5.5 輕微領先。 |
| Artificial Analysis leaderboard | 57,GPT-5.5 medium | 52,Claude Opus 4.7 non-reasoning high | 54 | — | 呢個切面是 GPT-5.5 高過 Kimi,高過該 Claude 模式;DeepSeek V4 在可見片段沒有同列。 |
| HLE 無工具,VentureBeat | 41.4% | 46.9% | — | 37.7% | 三個可比基礎行入面 Claude 最高。 |
| HLE 有工具,VentureBeat | 52.2%;GPT-5.5 Pro 57.2% | 54.7% | — | 48.2% | Claude 高過基礎 GPT-5.5,但 GPT-5.5 Pro 單獨行高過 Claude。 |
| Terminal-Bench 2.0,VentureBeat | 82.7% | 69.4% | — | 67.9% | GPT-5.5 在這張表優勢最明顯。 |
| SWE-Bench Pro,DataCamp | 58.6% | 64.3% | — | 55.4%,DeepSeek V4 Pro | Claude 高過 GPT-5.5 同 DeepSeek V4 Pro。 |
| SWE-Bench Verified,Verdent | — | 87.6% | 80.2% | — | Claude 高過 Kimi。 |
| Coding benchmark,AkitaOnRails | 96,GPT-5.5 xHigh/Codex | 97 | 87 | 78,V4 Flash;69,V4 Pro | Claude 同 GPT-5.5 接近;Kimi 高過兩條 DeepSeek V4 行。 |
最大問題不是某個結果信唔信得過,而是張張表的設定唔同。Artificial Analysis 用 GPT-5.5 medium、Kimi K2.6、Claude Opus 4.7 non-reasoning high;AkitaOnRails 用 GPT-5.5 xHigh/Codex,並將 DeepSeek V4 Flash 同 DeepSeek V4 Pro 分開;VentureBeat 亦將 GPT-5.5 同 GPT-5.5 Pro 分開列。
就算只比較 GPT-5.5 同 Claude Opus 4.7,結果都不是一面倒。LLM Stats 指,在兩間供應商都有報的 10 個 benchmark 入面,Opus 4.7 領先 6 個,GPT-5.5 領先 4 個;Claude 的優勢集中於重推理同 review-grade 測試,GPT-5.5 的優勢集中於長時間 tool-use 同 shell-driven 任務。
所以這比較更似分科成績表,而不是一個總平均分。你要先問自己:模型是用來解推理題、寫 code、做 terminal agent,還是大量低成本試稿?答案會不同。
GPT-5.5 最有說服力的優勢,集中在 ARC 同 Terminal-Bench。DocsBot 的 ARC-AGI-2 列出 GPT-5.5 85%,Claude Opus 4.7 75.8%;ARC-AGI-1 則是 GPT-5.5 95%,Claude 93.5%。
在 Terminal-Bench 2.0,GPT-5.5 取得 82.7%,明顯高過 Claude Opus 4.7 的 69.4% 同 DeepSeek 的 67.9%。 這亦同 LLM Stats 的觀察一致:GPT-5.5 的領先項目較集中於 long-running tool-use 同 shell-driven 任務。
Artificial Analysis 亦將 GPT-5.5 medium 列為 57,高過 Kimi K2.6 的 54,以及 Claude Opus 4.7 non-reasoning high 的 52。 但這不是所有模式、所有任務的總排名;同一批資料亦顯示 Claude 在部分推理和 software-engineering 測試有優勢。
Claude Opus 4.7 最強的訊號,來自 HLE(Humanity’s Last Exam)同 SWE-Bench Pro。VentureBeat 列出 HLE 無工具時,Claude Opus 4.7 是 46.9%,GPT-5.5 是 41.4%,DeepSeek 是 37.7%;開工具後,Claude 是 54.7%,GPT-5.5 是 52.2%,DeepSeek 是 48.2%。同一張表亦有 GPT-5.5 Pro 單獨行 57.2%,高過 Claude,所以若你可用 Pro 模式,也應納入測試。
在 SWE-Bench Pro,DataCamp 列出 Claude Opus 4.7 為 64.3%,GPT-5.5 為 58.6%,DeepSeek V4 Pro 為 55.4%。 LLM Stats 亦指出 Claude 在 GPQA、HLE 無工具、HLE 有工具、SWE-Bench Pro、MCP Atlas 和 FinanceAgent v1.1 領先 GPT-5.5。
簡單講,如果任務涉及深推理、複雜 code review、或者錯一個 hidden bug 成本很高,Claude Opus 4.7 應該排在首批測試名單。
Kimi K2.6 比較難放入一張完整總榜,因為它不一定出現在 GPT-5.5、Claude Opus 4.7、DeepSeek V4 同場的表。Artificial Analysis 的可見片段中,Kimi K2.6 是 54,低過 GPT-5.5 medium 的 57,但高過 Claude Opus 4.7 non-reasoning high 的 52。
在 AkitaOnRails coding benchmark,Kimi K2.6 是 87,低過 Claude Opus 4.7 的 97 同 GPT-5.5 xHigh/Codex 的 96,但高過 DeepSeek V4 Flash 的 78 同 DeepSeek V4 Pro 的 69。 Verdent 的 SWE-Bench Verified 比較則列出 Kimi K2.6 80.2%,Claude Opus 4.7 87.6%。
Kimi 的另一個重點是 open-weight 路線。Verdent 指 K2.6 weights 可在 Hugging Face 取得,並可用 vLLM、SGLang 或 KTransformers 跑;在縮減 context 的 INT4 版本下,最小可行硬件配置為 4× H100。
Hugging Face README 亦列出 Kimi K2.6 的 agentic 指標,例如 HLE-Full 有工具 54.0、BrowseComp 83.2、DeepSearchQA f1-score 92.5、Toolathlon 50.0、MCPMark 55.9。不過,該表主要同 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 比較,而不是本文四款模型完整同場比較。
在這批來源入面,DeepSeek V4 較多時候是 price-performance 選項,而不是最高 raw score 選項。VentureBeat 列出的 HLE 無工具、HLE 有工具、Terminal-Bench 2.0,DeepSeek 都低過 GPT-5.5 和 Claude Opus 4.7 的對應行。 DataCamp 的 SWE-Bench Pro 亦列出 DeepSeek V4 Pro 55.4%,低過 GPT-5.5 的 58.6% 和 Claude Opus 4.7 的 64.3%。 AkitaOnRails coding benchmark 中,DeepSeek V4 Flash 78、DeepSeek V4 Pro 69,也低過 Kimi K2.6、GPT-5.5 xHigh/Codex 同 Claude Opus 4.7。
但價錢會改變產品決策。Mashable 列出 DeepSeek V4 每 100 萬 input tokens US$1.74、每 100 萬 output tokens US$3.48;GPT-5.5 是 US$5/US$30,Claude Opus 4.7 是 US$5/US$25。 這不會令 DeepSeek 變成 benchmark 冠軍,但如果你做大量草稿、低風險任務、內部 eval,較低每次嘗試成本可能比多幾個百分點更實際。
只睇 benchmark,最上層的對決仍然是 GPT-5.5 對 Claude Opus 4.7:GPT-5.5 在 ARC 同 Terminal-Bench 更突出,Claude Opus 4.7 在 HLE 同 SWE-Bench Pro 更亮眼。 Kimi K2.6 是強 coding/agentic 候選,尤其當你重視開放權重和自架路線,但直接同場比較較少。 DeepSeek V4 在這些資料中 raw score 通常較低,不過 API 價格令它在 price-performance pilot 上很有存在感。
最穩陣做法不是照抄排行榜,而是按你的任務類型、錯誤成本、延遲要求同 token 預算,自己做一個小型 eval。