| 你的優先順序 | 優先評估 | 為什麼 |
|---|---|---|
| 綜合能力、複雜代理工作流、終端機類編碼任務 | GPT-5.5 | Artificial Analysis 將 GPT-5.5 xHigh 評為 60、GPT-5.5 High 評為 59,高於 Claude Opus 4.7 的 57;VentureBeat 匯總的 Terminal-Bench 2.0 中,GPT-5.5 為 82.7%。 |
| 長文檔研究、多步分析、金融或文件紀律要求高的工作 | Claude Opus 4.7 | Anthropic 稱 Opus 4.7 在內部研究代理基準中總分為 0.715,並在 General Finance 模組達到 0.813,高於 Opus 4.6 的 0.767。 |
| 高吞吐、預算敏感、希望接近前沿能力但壓低單價 | DeepSeek V4 | Mashable 匯總 DeepSeek V4 API 價格為每百萬輸入 token 1.74 美元、輸出 token 3.48 美元,低於同表的 GPT-5.5 與 Claude Opus 4.7。 |
| 開放權重生態、圖像/影片輸入、256K 長上下文 | Kimi K2.6 | Artificial Analysis 稱 Kimi K2.6 是新的領先開放權重模型,並稱其支援圖像、影片輸入與 256K 最大上下文。 |
目前公開資料沒有提供一份同時涵蓋四個模型、由同一評測方、在同一時間、同一推理預算與同一工具權限下完成的完整橫向評測。可用證據分散在廠商發布頁、第三方榜單、媒體整理、API 文件、模型路由頁與個人實測,口徑並不完全一致。
這一點很重要,因為設定不同,排名就可能變。Artificial Analysis 區分 GPT-5.5 xHigh、GPT-5.5 High 與 Claude Opus 4.7 Adaptive Reasoning Max Effort;OpenAI API 文件也列出 GPT-5.5 支援 none、low、medium、high、xhigh 等 reasoning effort。 換句話說,某個模型在公開榜單領先,不代表它一定會在你的提示詞、工具鏈、延遲預算與人工覆核流程中領先。
| 指標 | GPT-5.5 | Claude Opus 4.7 | DeepSeek V4/V4 Pro | Kimi K2.6 | 怎麼讀 |
|---|---|---|---|---|---|
| Artificial Analysis Intelligence Index | xHigh 60;High 59 | 57 | 本輪資料未提供同表精確分數 | OpenRouter 匯總的 AA Intelligence 為 53.9 | 綜合榜單上 GPT-5.5 領先;Kimi K2.6 是開放權重高位候選。 |
| Terminal-Bench 2.0 | 82.7% | 69.4% | 67.9% | ||
| SWE-Bench Pro | 58.6% | 可見資料未給出可覆核同源數值 | 55.4% | 部分 Kimi 資料主要對比 GPT-5.4 或 Opus 4.6,不能直接等同於本四模型橫評 | |
| Humanity’s Last Exam,無工具 | 41.4%;GPT-5.5 Pro 為 43.1% | 46.9% | 37.7% | ||
| Humanity’s Last Exam,有工具 | 52.2%;GPT-5.5 Pro 為 57.2% | 54.7% | 48.2% | ||
| BrowseComp | 84.4% | 未見同源公開分數 | V4 Pro-Max 83.4% | 83.2% | |
| Kimi K2.6 AA 子項 | 不適用 | 不適用 | 不適用 | Intelligence 53.9;Coding 47.1;Agentic 66.0 | Kimi 的代理能力值得關注,但仍應放進真實工具鏈重測。 |
OpenAI 發布頁顯示 GPT-5.5 與 GPT-5.5 Pro 已在 2026 年 4 月 24 日更新為可用;OpenAI API 文件將 gpt-5.5 描述為面向編碼與專業工作的模型,並列出 1M 上下文、128K 最大輸出、函式呼叫、網頁搜尋、檔案搜尋與電腦使用等能力。
從公開基準看,GPT-5.5 最適合當作高性能基準線。Artificial Analysis 的綜合榜單給 GPT-5.5 xHigh 60、High 59;VentureBeat 匯總顯示 GPT-5.5 在 Terminal-Bench 2.0 為 82.7%,高於 Claude Opus 4.7 的 69.4% 與 DeepSeek V4 的 67.9%。
它的主要代價是價格。OpenAI API 文件列出 GPT-5.5 為每百萬輸入 token 5 美元、每百萬輸出 token 30 美元;如果你的任務包含長報告、多輪代理循環或大量輸出,輸出 token 成本會成為關鍵變數。
**適合優先測試的場景:**複雜編碼代理、終端機自動化、跨工具研究、需要函式呼叫與網頁/檔案搜尋組合的專業工作流。
Claude Opus 4.7 的公開定位更偏向長程、多步驟與嚴謹輸出。Anthropic 稱它在內部研究代理基準中 tied for the top overall score,分數為 0.715,並稱其長上下文表現最一致;在 General Finance 模組中,Opus 4.7 為 0.813,高於 Opus 4.6 的 0.767。
在 VentureBeat 匯總的 Humanity’s Last Exam 中,Claude Opus 4.7 無工具分數為 46.9%,高於 GPT-5.5 的 41.4% 與 DeepSeek V4 的 37.7%;有工具時,Claude 為 54.7%,高於 GPT-5.5 base 的 52.2%,但低於 GPT-5.5 Pro 的 57.2%。
不過,Claude 並不是所有硬指標都壓過 GPT-5.5。至少在 Terminal-Bench 2.0 中,GPT-5.5 的 82.7% 明顯高於 Claude Opus 4.7 的 69.4%。 另有第三方資料稱 Opus 4.7 在 SWE-bench Verified 為 82.4%,但這不是四模型同源橫評,不能與 SWE-Bench Pro 或其他榜單直接混成一個總分。
**適合優先測試的場景:**長文檔研究、金融資料處理、需要披露依據與資料紀律的分析任務、多步推理與覆核要求高的工作流。
DeepSeek V4 的核心賣點是價格。Mashable 匯總稱 DeepSeek V4 API 為每百萬輸入 token 1.74 美元、輸出 token 3.48 美元;同一匯總中,GPT-5.5 為 5/30 美元,Claude Opus 4.7 為 5/25 美元。
性能上,DeepSeek V4 接近前沿,但沒有在這些公開匯總中全面領先。VentureBeat 匯總顯示,DeepSeek V4 在 HLE 無工具為 37.7%、有工具為 48.2%,低於 GPT-5.5、GPT-5.5 Pro 與 Claude Opus 4.7 的對應分數;在 Terminal-Bench 2.0 中,DeepSeek 的 67.9% 接近 Claude 的 69.4%,但低於 GPT-5.5 的 82.7%。
因此,DeepSeek V4 更適合作為成本敏感生產系統的第一輪候選,而不是無條件替代所有閉源前沿模型。真正要問的是:它在你的任務裡是否達到可接受品質線,以及低單價是否足以抵銷重試、人工覆核與延遲成本。
**適合優先測試的場景:**批次處理、高吞吐推理、低毛利應用、可接受一定品質覆核但需要顯著降低 token 成本的系統。
Kimi K2.6 的看點是開放權重、多模態與長上下文。Artificial Analysis 稱其為新的領先開放權重模型,並稱它原生支援圖像與影片輸入、文字輸出,最大上下文長度為 256K。 OpenRouter 頁面則列出 Kimi K2.6 的 Artificial Analysis Intelligence 為 53.9、Coding 為 47.1、Agentic 為 66.0,並顯示最大 token 為 256K、最大輸出為 66K。
在網頁研究類指標上,DocsBot 匯總顯示 Kimi K2.6 的 BrowseComp 為 83.2%,GPT-5.5 為 84.4%。 這說明 Kimi 在該匯總中接近 GPT-5.5,但仍要注意:一些 Kimi K2.6 資料主要把它與 GPT-5.4、Claude Opus 4.6 比較,而不是與 GPT-5.5、Claude Opus 4.7、DeepSeek V4 做完整同源橫評。
**適合優先測試的場景:**開放權重生態、需要更強部署自主性的團隊、長上下文處理、圖像或影片輸入、希望在成本與可控性之間尋找平衡的工作流。
| 模型 | 公開價格與容量資訊 | 選型影響 |
|---|---|---|
| GPT-5.5 | 每百萬輸入 token 5 美元、輸出 token 30 美元;1M 上下文;128K 最大輸出;支援函式呼叫、網頁搜尋、檔案搜尋與電腦使用 | 適合高價值複雜任務,但輸出很長或代理輪次很多時,成本壓力較大。 |
| Claude Opus 4.7 | Mashable 匯總為每百萬輸入 token 5 美元、輸出 token 25 美元,並稱其為 1M 上下文 | 輸出單價低於 GPT-5.5;適合重視長程一致性與文件紀律的任務。 |
| DeepSeek V4 | Mashable 匯總為每百萬輸入 token 1.74 美元、輸出 token 3.48 美元,並稱其為 1M 上下文 | 高吞吐、批次處理、預算敏感應用最應優先測試。 |
| Kimi K2.6 | OpenRouter 頁面列出某路由為每百萬輸入 token 0.7448 美元、輸出 token 4.655 美元;最大 token 為 256K、最大輸出為 66K | 適合開放權重、長上下文與多模態輸入評估;路由價格不應等同於所有供應商的統一標價。 |
API 單價只是總成本的一部分。OpenAI 的 GPT-5.5 API 指南建議,在工具密集或長時間工作流中,應按準確率、token 消耗與端到端延遲,與其他模型做基準測試;OpenAI 模型文件也顯示 GPT-5.5 的 reasoning effort 可在 none 到 xhigh 之間調整。
公開基準適合縮小候選名單,但不能取代私有評測。採購或技術選型至少應記錄四類指標:任務成功率、失敗類型、端到端延遲、token 與重試成本。OpenAI 文件也明確建議,工具密集或長時間工作流要與其他模型比較準確率、token 消耗與端到端延遲。
個人實測可以作為補充訊號,但不應當作標準排行榜。AkitaOnRails 的 2026 年 4 月編碼測試中,Claude Opus 4.7 得分 97,GPT-5.5 xHigh Codex 得分 96,Kimi K2.6 得分 87,DeepSeek V4 Pro 得分 69;同一表也記錄估算成本,例如 Claude Opus 4.7 約 1.10 美元、GPT-5.5 xHigh Codex 約 10 美元、Kimi K2.6 約 0.30 美元、DeepSeek V4 Pro 約 0.50 美元。
這類結果的價值,在於提醒團隊:模型選型最後取決於真實程式碼庫、真實工具權限、提示流程、覆核標準與失敗重試成本,而不是某個孤立分數。
如果只能先選一個模型進入評測,選 GPT-5.5。它在 Artificial Analysis 綜合榜單與 VentureBeat 匯總的 Terminal-Bench 2.0 中都顯示出明顯優勢。
如果任務更像長文檔研究、金融資料處理、複雜多步分析,或需要更強資料紀律,Claude Opus 4.7 應進入第一梯隊。Anthropic 的內部研究代理資料與 VentureBeat 匯總的 HLE 資料,都支持它在這些方向上的競爭力。
如果最大限制是呼叫量與預算,DeepSeek V4 是最值得優先做成本—品質曲線測試的模型。公開價格匯總顯示,它的輸入與輸出單價顯著低於 GPT-5.5 與 Claude Opus 4.7。
如果你需要開放權重生態、多模態輸入或 256K 上下文,Kimi K2.6 是目前公開資料中值得重點評估的候選之一;但它與 GPT-5.5、Claude Opus 4.7、DeepSeek V4 的完整同源橫評仍然不足。
最穩妥的結論是:用公開基準決定從哪裡開始,用自己的真實任務決定生產環境最終用誰。排行榜能幫你縮小範圍,但不能替你承擔品質、成本與延遲的實際取捨。
| 未見同源公開分數 |
| 代理式終端機任務上,GPT-5.5 的優勢最清楚。 |
| GPT-5.5 與 DeepSeek V4 可在同一媒體匯總中比較;Kimi 需要謹慎跨源解讀。 |
| 未見同源公開分數 |
| Claude Opus 4.7 在這個設定下領先。 |
| 未見同源公開分數 |
| Claude 高於 GPT-5.5 base,但低於 GPT-5.5 Pro。 |
| 網頁瀏覽理解任務上,GPT-5.5、DeepSeek V4 Pro-Max 與 Kimi K2.6 的公開匯總分數很接近。 |