Claude Fable 5 嘅編碼基準測試分數最高,SWE bench Verified 達 95.0%,SWE bench Pro 達 80.3%,收費為每百萬 tokens 輸入 $10 / 輸出 $50。 模型價錢差距可達 40 倍,最平係 Grok 4.3(每百萬輸入 tokens 只需 $1.25),最貴係 GPT 5.5 Pro(每百萬輸出 tokens 高達 $180)。
研究答案

Create a landscape editorial hero image for this Studio Global article: Research benchmarks & pricing of Claude Sonnet 5, Claude Fable 5, Claude Opus 4.8, GPT 5.5, Grok 4.3, Gemini 3.5, DeepSeek V4 Pro. Compare t. Article summary: # Frontier AI Model Comparison: Benchmarks & Pricing (Mid-2026). Topic tags: deepresearch, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
喺 2026 年中呢個時間點,想揀啱 AI 模型,真係要喺基準測試分數同 API 成本之間搵個平衡。市面上嘅選擇越來越多,由 Anthropic、OpenAI、xAI 同 Google 各自有唔同定位嘅模型。以下會根據已確認嘅來源,詳細比較 Claude Fable 5、Claude Opus 4.8、Claude Sonnet 5、GPT-5.5、Grok 4.3 同 Gemini 3.5 Flash 呢六款模型。
注意:DeepSeek V4 Pro 因為所提供嘅資料入面冇佢嘅收費同基準測試數據,所以今次冇辦法直接比較。
以下係每個模型嘅 raw token 成本。留意 Claude Fable 5 嘅收費係 Claude Opus 4.8 嘅一倍,而 Grok 4.3 就以超大優勢成為最平嘅封閉模型選擇。
Claude Sonnet 5 有首發優惠價,去到 2026 年 8 月 31 號為止:每百萬輸入 tokens 收 $2,每百萬輸出 tokens 收 $10。 之後就會回復正價 $3 / $15。
以下係主要嘅基準測試分數,記住只係列出喺提供嘅資料入面有提及嘅數據:
| 基準測試 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 | Grok 4.3 |
|---|---|---|---|---|
| SWE-bench Verified | 95.0% | — | — | — |
| SWE-bench Pro | 80.3% | 69.2% | ~58% | — |
| AA Intelligence Index | — | — | — | 53 |
| τ²-Bench (代理任務) | — | — | — | 98% |
了解每個模型嘅推出時間,有助判斷分數嘅領先地位係咪合理:
Claude Fable 5 喺今次比拼入面有最高嘅編碼基準測試分數:SWE-bench Verified 達 95.0%,SWE-bench Pro 達 80.3%。 雖然佢每百萬 tokens 收 $10/$50,係 Opus 4.8 嘅一倍,但喺 SWE-bench Pro 嘅表現就高出 16%(80.3% vs 69.2%)。
最啱啲需要極致編碼效能、又俾得起錢嘅團隊。
Opus 4.8 每百萬 tokens 收 $5/$25,喺有關 Fable 5 嘅資料入面成日被拎嚟做比較對象。 佢喺 SWE-bench Pro 拎到 69.2%,以呢個價位嚟講表現非常出色。
新推出嘅 Fast Mode 速度快 2.5 倍,收費為每百萬 tokens $10/$50。
最啱啲想用 Opus 級數但又唔想俾 Fable 溢價嘅用戶。
Sonnet 5 嘅基準測試分數好接近 Claude Opus 4.8。 佢有首發優惠價 $2/$10 去到 2026 年 8 月 31 號,係 Claude 系列入面最抵用嚟做大規模工作嘅選擇。
完咗之後會變 $3/$15,但仍然好有競爭力。最啲想用接近旗艦級效能但成本只係幾分之一嘅團隊。
GPT-5.5 每百萬 tokens 收 $5/$30,另外有個高精準度嘅 Pro 版本 $30/$180。 已確認嘅資料有佢嘅 API 收費,但就冇支援到一啲聲稱嘅基準測試分數(例如 Terminal-Bench 2.0 或 AA Intelligence Index)。最啱已經用開 OpenAI 生態系統嘅團隊。
Grok 4.3 每百萬 tokens 只係收 $1.25/$2.50,係呢個表入面最平嘅封閉模型。 佢喺 Artificial Analysis Intelligence Index 拎到 53 分,喺 τ²-Bench(代理工具使用)更拎到 98%。
呢次大幅減價,輸入平 37.5%,輸出平 58.3%,令佢成為成本敏感型工作嘅首選。最啱啲需要大量使用代理工具、budget 又有限嘅項目。
Gemini 3.5 Flash 每百萬 tokens 收 $1.50/$9.00,係追求速度同埋有根有據嘅前沿智能選擇。 快取輸入嘅成本更低至 $0.15。
最啱啲需要快速推理、但唔想俾旗艦級價錢嘅應用。
由於已提供嘅資料入面冇 DeepSeek 嘅收費同基準測試數據,所以任何關於 DeepSeek V4 Pro 嘅宣稱,最好另外搵專門來源核實。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Claude Fable 5 嘅編碼基準測試分數最高,SWE bench Verified 達 95.0%,SWE bench Pro 達 80.3%,收費為每百萬 tokens 輸入 $10 / 輸出 $50。
Claude Fable 5 嘅編碼基準測試分數最高,SWE bench Verified 達 95.0%,SWE bench Pro 達 80.3%,收費為每百萬 tokens 輸入 $10 / 輸出 $50。 模型價錢差距可達 40 倍,最平係 Grok 4.3(每百萬輸入 tokens 只需 $1.25),最貴係 GPT 5.5 Pro(每百萬輸出 tokens 高達 $180)。