| Claude Opus 4.7 | 2026 年 4 月 16 日 | $15.00 | ~$75.00(估計值) | ~67–78 | 20 萬 |
| GPT-5.5 | 2026 年 4 月 23 日 | $5.00 | $30.00 | ~71 | 40 萬 |
| Gemini 3.5 Flash | 2026 年 5 月 19 日 | $1.50 | $9.00 | 289 | 100 萬 |
| Grok 4.3 | 2026 年 4 月 30 日 | $1.25–1.50 | ~$6.00–8.00(估計值) | ~159–207 | 100 萬 |
| DeepSeek V4 Pro | 2026 年 4 月 24 日 | ~$0.50–2.00(估計值) | ~$2.00–8.00(估計值) | ~80–100(估計值) | 100 萬 |
重點觀察:Gemini 3.5 Flash 的速度與成本優勢極為顯著——每秒輸出將近 300 個 tokens,是 GPT-5.5 的四倍,且每百萬輸出 tokens 收費僅 $9.00,遠低於 Claude Opus 4.8 的 $25.00 或 GPT-5.5 的 $30.00。
下表為截至 2026 年 5 月下旬最全面的交叉比較。請注意:不同供應商可能使用不同的測試框架,部分分數因來源而異。
| 基準測試 | Claude Opus 4.8 | Claude Opus 4.7 | GPT-5.5 | Gemini 3.5 Flash | Grok 4.3 | DeepSeek V4 Pro |
|---|---|---|---|---|---|---|
| SWE-Bench Pro(代理式編碼) | 69.2% | 64.3% | 58.6% | ~21.4%* | ~19.4%* | ~18.1%* |
| SWE-Bench Verified | ~83%(估計值) | 87.6% | 85.0% | 82.1% | ||
| Terminal-Bench 2.0/2.1 | 74.6% | 66.1–69.4% | ||||
| OSWorld-Verified(電腦操控) | 83.4% | 82.8% | 78.7% | |||
| GDPval-AA(知識工作/代理式 Elo) | 1,890 | 1,753 | 1,620–1,769 | |||
| Humanity's Last Exam(使用工具) | 57.9% | 54.7% | — | — | — | — |
| Humanity's Last Exam(不使用工具) | 49.8% | — | — | — | — | — |
| GPQA Diamond | ~94%(估計值) | 94.2% | 96.0% | 92.4% | ||
| ARC-AGI-2 | ~80%(估計值) | 80.2% | 85.0% | 75.8% | ||
| MCP Atlas(工具使用可靠度) | — | 77.3% | 79.1% | 83.6% | ||
| AA Intelligence Index (v4.0) | ~59–60(估計值) | 59 | 60 | 57 | ||
| Finance Agent v2 | 53.9% | 51.5% | — | — | — | — |
| LiveCodeBench (Pass@1) | — | — | ~91–92%(估計值) | — | — | 93.5% |
| Codeforces ELO | — | ~3,050(估計值) | 3,168 | — | — | 3,206 |
| FrontierMath Tier 1–3 | — | 43.8% | 51.7% | — | — | — |
| MMLU-Pro | — | — | — | — | — | 87.5% |
| AIME 2025(數學) | — | — | 95.2% | — | — | — |
| BrowseComp | — | 79.3% | 84.4% | — | — | — |
* Gemini 3.5 Flash、Grok 4.3 和 DeepSeek V4 Pro 在 SWE-Bench Pro 的分數來自單一第三方測試 ——Google 自家的模型卡顯示數字有所不同,文末說明。
甫於 2026 年 5 月 28 日亮相,立即在多個關鍵領域奪魁:
Anthropic 稱 Opus 4.8 在「高努力」(high effort)模式下預設開啟,token 消耗與前代差不多,但快速模式速度提升約 2.5 倍、費用降為三分之一 。在 BenchLM 暫定排行榜上,Opus 4.8 綜合得分 93/100,位列全球 119 個模型中的第 2 名 。
OpenAI 的 GPT-5.5 在特定面向展現壓倒性優勢:
對於需要多步驟規劃、工具協調的複雜終端工作流,GPT-5.5 是首選。其上下文窗口為 40 萬 tokens,定價策略與 Claude Opus 4.8 相當 。
Google 在 2026 年 I/O 大會上推出的 Gemini 3.5 Flash 是一款「效率優先」的模型,卻展現出越級打怪的實力:
雖然在 Humanity's Last Exam 和 ARC-AGI-2 等純推理測試上略遜於 Gemini 3.1 Pro,但 Gemini 3.5 Flash 是處理大量代理式工作流、對成本與延遲敏感的場景下的理想方案 。
DeepSeek 的 V4 Pro 以極具破壞力的定價,在編碼領域交出亮眼成績單:
V4 Pro 的弱項在於需多檔案協作的代理式編碼(SWE-Bench Pro 約 18.1%)以及部分事實性問答,但它以極低價格提供近乎前沿模型的競爭力,是預算有限但對程式品質要求高的開發者福音 。
xAI 的 Grok 4.3 定位為高性價比的泛用型模型:
Grok 4.3 在 AA 智慧指數獲 53 分,屬中上梯隊,但在多數代理式基準測試(如 SWE-Bench Pro、OSWorld)仍明顯落後第一集團 。
| 使用場景 | 首選模型 | 理由 |
|---|---|---|
| 複雜自主編碼、多步驟專案 | Claude Opus 4.8 | SWE-Bench Pro 王者,多檔案修改能力最強 |
| 終端命令列操作、長文本理解 | GPT-5.5 | Terminal-Bench 最高分,MRCR v2 大幅領先 |
| 高吞吐量代理工作、預算敏感 | Gemini 3.5 Flash | 速度最快、價格最低,MCP Atlas 稱冠 |
| 競技程式、程式碼生成 | DeepSeek V4 Pro | Codeforces ELO 與 LiveCodeBench 雙冠,性價比高 |
| 日常泛用、快速互動 | Grok 4.3 | 速度快、價格低,多數任務表現夠用 |
| 81.0% |
| 80.6% |
| 78.2–82.7% |
| 76.2% |
| 68.5% |
| 65.0% |
| 75.0% |
| 72.1% |
| 70.5% |
| 1,656 |
| 1,500–1,570 |
| 1,550 |
| 90.1–91.5% |
| 95.1% |
| 76.1% |
| 74.0% |
| 74.2% |
| 71.5% |
| 53 |
| 55 |