| GPT-5.5 (專業版) | $30.00 | $180.00 | — | 1M |
| Qwen3.7-Max | $2.50 | $7.50 | $0.25 (九折) | 1M |
| Kimi K2.6 | $0.60–$0.95 | $3.00–$4.00 | $0.10 | 262K |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | 1M |
| Grok 4.3 | $1.25 | $2.50 | $0.30 | 1M |
| DeepSeek V4-Flash | $0.14 | $0.28 | $0.0028 | 1M |
| DeepSeek V4-Pro | $0.435 (永久折扣) | $0.87 (永久折扣) | $0.0036 | 1M |
收費重點分析:
基準測試要有 Context 先有用。我哋唔係用一個(成日會誤導人嘅)綜合分數,而係按佢哋實際量度緊乜嘢——通用智能、編碼能力同代理性能——嚟整理結果。
呢一類量度嘅係純知識、數學同科學推理。
| 基準測試 | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index | 61.4 | 60.2 | ~55 | 56.6 | 53 | ~52 |
| GPQA Diamond | 93.6% | — | 90.1% | 92.4% | ||
| AIME / USAMO 2026 (數學) | 96.7% | 95.2% | ||||
| HLE (使用工具) | 57.9% | — | 37.7% | — | — | — |
Claude Opus 4.8 喺通用智能方面稍微領先 GPT-5.5,差距唔大但關鍵,而佢嘅數學表現比上一代勁升 27.4 個百分點,更加印證咗呢點 。Qwen3.7-Max 就係表現最好嘅中國模型,喺研究生級別嘅科學推理(GPQA Diamond)上幾乎追到頂尖水平 。
對開發者嚟講最相關嘅基準測試。
| 基準測試 | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 80.2% | 88.7% | 88.6% | 72.5% |
| SWE-bench Pro | ~58% | 58.6% | 58.6% | 69.2% | |
| LiveCodeBench v6 | 93.5% | 89.6% |
編碼性能好明顯咁劃分出幾個唔同層次。Claude Opus 4.8 同 GPT-5.5 喺一般嘅錯誤修復(SWE-bench Verified)方面打成平手,一齊排喺最頂,但 Claude 喺難好多嘅 Pro 級別測試中,領先超過 10 個百分點 。純粹講編碼效率,DeepSeek V4-Pro 冇得輸,佢以平 30 倍嘅價錢,提供咗拍得住 GPT-5.4 級別嘅編碼性能 。
考驗模型喺真實環境中獨立行動嘅能力。
| 基準測試 | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82.7% | 76.2% | |||
| τ²-Bench (指令遵循) | — | — | — | — | 98% |
GPT-5.5 喺冇明確指引嘅終端機代理工作方面,依然保持住王者地位,但 Claude Opus 4.8 喺真實世界任務評分(GDPval-AA Elo)中更高,顯示佢係一個更可靠、更適合商業應用嘅代理夥伴 。對於要處理大量指令遵循任務嘅情況,Grok 4.3 提供咗一個好有吸引力嘅平價選擇 。
中國模型第一次唔單止喺價錢上競爭,仲喺能力上較勁。Qwen3.7-Max 喺 SWE-bench Pro 代理編碼基準測試中,以 60.6% 嘅成績領先所有模型 。Kimi K2.6 喺同一個測試度同 GPT-5.5 睇齊,並喺「人類最後嘅考試」(HLE,使用工具)中以 54.0% 嘅成績領先其他所有模型 ,喺核心推理任務上挑戰美國嘅前沿地位,同時價錢仲要平一大截。
要喺七個模型之間做一個直接、全面嘅比較,目前係冇可能嘅,因為啲供應商會揀嚟報告佢哋嘅基準測試成績 。有幾個關鍵因素,會令到純睇數字做決定嘅做法變得好唔穩陣:
你嘅優先次序決定你嘅選擇:
對於任何關鍵嘅部署,記住喺你自己嘅特定工作流程上做測試。供應商報告嘅基準測試,只係一個有用嘅起點,而唔係一個終極答案。
| — |
| 92.6% |
| — |
| — |
| — |
| — |
| 60.6% |
| — |
| — |
| — |
| 74.6% |
| 69.7% |
| — |