| 你最重視 | 優先評估 | 點解 |
|---|---|---|
| 綜合能力、複雜代理工作流、終端類編碼任務 | GPT-5.5 | Artificial Analysis 將 GPT-5.5 xHigh 記為 60、GPT-5.5 High 記為 59,高過 Claude Opus 4.7 嘅 57;VentureBeat 匯總嘅 Terminal-Bench 2.0 入面,GPT-5.5 為 82.7%。 |
| 長文檔研究、多步分析、金融或文件紀律 | Claude Opus 4.7 | Anthropic 稱 Opus 4.7 喺內部研究代理基準總分為 0.715,General Finance 模組達 0.813,高過 Opus 4.6 嘅 0.767。 |
| 高吞吐、預算敏感、想接近前沿能力但壓低單價 | DeepSeek V4 | Mashable 匯總 DeepSeek V4 API 價格為每 100 萬輸入 token 1.74 美元、輸出 token 3.48 美元,低過同表嘅 GPT-5.5 同 Claude Opus 4.7。 |
| 開權重生態、圖像或影片輸入、256K 長上下文 | Kimi K2.6 | Artificial Analysis 稱 Kimi K2.6 係新一代領先開權重模型,並指佢支援圖像、影片輸入同 256K 最大上下文。 |
目前公開資料未有一個完整橫向評測,可以同時覆蓋四個模型、同一評測方、同一時間、同一推理預算、同一工具權限。可用證據分散喺廠商發布頁、第三方榜單、媒體匯總、API 文件、模型路由頁同個人實測;口徑唔完全一致。
呢點好重要。Artificial Analysis 會分開 GPT-5.5 xHigh、GPT-5.5 High 同 Claude Opus 4.7 Adaptive Reasoning Max Effort;OpenAI API 文件亦列明 GPT-5.5 支援 none、low、medium、high、xhigh 等 reasoning effort。 所以,一個模型喺某個公開榜領先,唔等於佢喺你公司嘅提示詞、工具鏈、延遲預算同覆核流程入面一定領先。
| 指標 | GPT-5.5 | Claude Opus 4.7 | DeepSeek V4 / V4 Pro | Kimi K2.6 | 點樣解讀 |
|---|---|---|---|---|---|
| Artificial Analysis Intelligence Index | xHigh 60;High 59 | 57 | 本輪資料未有同表精確分數 | OpenRouter 匯總 AA Intelligence 為 53.9 | 綜合榜上 GPT-5.5 領先;Kimi K2.6 係開權重高位候選。 |
| Terminal-Bench 2.0 | 82.7% | 69.4% | 67.9% | ||
| SWE-Bench Pro | 58.6% | 可見資料未有可覆核同源數值 | 55.4% | 部分 Kimi 資料主要對比 GPT-5.4 或 Opus 4.6,唔應直接當成本四模型橫評 | |
| Humanity’s Last Exam,無工具 | 41.4%;GPT-5.5 Pro 為 43.1% | 46.9% | 37.7% | ||
| Humanity’s Last Exam,有工具 | 52.2%;GPT-5.5 Pro 為 57.2% | 54.7% | 48.2% | ||
| BrowseComp | 84.4% | 未見同源公開分數 | V4 Pro-Max 83.4% | 83.2% | |
| Kimi K2.6 AA 子項 | 不適用 | 不適用 | 不適用 | Intelligence 53.9;Coding 47.1;Agentic 66.0 | Kimi 代理能力值得關注,但仍要放入真實工具鏈再測。 |
OpenAI 發布頁顯示 GPT-5.5 同 GPT-5.5 Pro 已喺 2026 年 4 月 24 日更新為可用;OpenAI API 文件將 gpt-5.5 描述為面向編碼同專業工作嘅模型,並列出 1M 上下文、128K 最大輸出、函數調用、網頁搜尋、文件搜尋同電腦使用等能力。
從公開基準睇,GPT-5.5 最適合先拎嚟做高性能 baseline。Artificial Analysis 綜合榜單畀 GPT-5.5 xHigh 60、High 59;VentureBeat 匯總顯示 GPT-5.5 喺 Terminal-Bench 2.0 為 82.7%,高過 Claude Opus 4.7 嘅 69.4% 同 DeepSeek V4 嘅 67.9%。
代價係貴,尤其輸出貴。OpenAI API 文件列出 GPT-5.5 為每 100 萬輸入 token 5 美元、每 100 萬輸出 token 30 美元;如果你嘅任務會產生長報告、多輪代理循環或者大量輸出,輸出 token 成本會好快變成關鍵變數。
**適合優先測試:**複雜 coding agent、終端自動化、跨工具研究、需要函數調用加網頁或文件搜尋嘅專業工作流。
Claude Opus 4.7 嘅公開定位更偏向長程、多步同嚴謹輸出。Anthropic 稱佢喺內部 research-agent benchmark 入面 tied for the top overall score,分數為 0.715,並指佢長上下文表現最一致;喺 General Finance 模組,Opus 4.7 為 0.813,高過 Opus 4.6 嘅 0.767。
喺 VentureBeat 匯總嘅 Humanity’s Last Exam 入面,Claude Opus 4.7 無工具分數為 46.9%,高過 GPT-5.5 嘅 41.4% 同 DeepSeek V4 嘅 37.7%;有工具時,Claude 為 54.7%,高過 GPT-5.5 base 嘅 52.2%,但低過 GPT-5.5 Pro 嘅 57.2%。
不過,Claude 唔係每個硬指標都壓過 GPT-5.5。至少喺 Terminal-Bench 2.0,GPT-5.5 嘅 82.7% 明顯高過 Claude Opus 4.7 嘅 69.4%。 另有第三方資料稱 Opus 4.7 喺 SWE-bench Verified 為 82.4%,但呢個唔係四模型同源橫評,唔應同 SWE-Bench Pro 或其他榜單直接混成一個總分。
**適合優先測試:**長文檔研究、金融資料處理、需要披露依據同數據紀律嘅分析任務、多步推理同覆核要求高嘅工作流。
DeepSeek V4 最硬嘅賣點係價錢。Mashable 匯總指 DeepSeek V4 API 為每 100 萬輸入 token 1.74 美元、輸出 token 3.48 美元;同一匯總入面,GPT-5.5 為 5/30 美元,Claude Opus 4.7 為 5/25 美元。
性能方面,DeepSeek V4 接近前沿,但喺呢批公開匯總入面未見全面領先。VentureBeat 匯總顯示,DeepSeek V4 喺 HLE 無工具為 37.7%、有工具為 48.2%,低過 GPT-5.5、GPT-5.5 Pro 同 Claude Opus 4.7 對應分數;喺 Terminal-Bench 2.0,DeepSeek 嘅 67.9% 接近 Claude 嘅 69.4%,但低過 GPT-5.5 嘅 82.7%。
所以 DeepSeek V4 更適合作為成本敏感生產系統嘅第一輪候選,而唔係無條件替代所有閉源前沿模型。真正要問係:佢喺你嘅任務入面有冇達到可接受質量線?低單價又係咪足以抵消重試、人工覆核同延遲成本?
**適合優先測試:**批處理、高吞吐推理、低毛利應用、可以接受一定覆核但需要明顯降低 token 成本嘅系統。
Kimi K2.6 嘅看點係開權重、多模態同長上下文。Artificial Analysis 稱佢係新嘅領先開權重模型,並指佢原生支援圖像同影片輸入、文字輸出,最大上下文長度為 256K。 OpenRouter 頁面則列出 Kimi K2.6 嘅 Artificial Analysis Intelligence 為 53.9、Coding 為 47.1、Agentic 為 66.0,並顯示最大 token 為 256K、最大輸出為 66K。
喺網頁研究類指標上,DocsBot 匯總顯示 Kimi K2.6 嘅 BrowseComp 為 83.2%,GPT-5.5 為 84.4%。 呢個數字說明 Kimi 喺該匯總入面貼近 GPT-5.5,但仍然要留意:部分 Kimi K2.6 資料主要將佢同 GPT-5.4、Claude Opus 4.6 比較,而唔係同 GPT-5.5、Claude Opus 4.7、DeepSeek V4 做完整同源橫評。
**適合優先測試:**開權重生態、需要更高部署自主性嘅團隊、長上下文處理、圖像或影片輸入、想喺成本同可控性之間搵平衡嘅工作流。
| 模型 | 公開價格與容量資訊 | 對選型有咩影響 |
|---|---|---|
| GPT-5.5 | 每 100 萬輸入 token 5 美元、輸出 token 30 美元;1M 上下文;128K 最大輸出;支援函數調用、網頁搜尋、文件搜尋同電腦使用 | 適合高價值複雜任務,但輸出好長或代理輪次好多時,成本壓力大。 |
| Claude Opus 4.7 | Mashable 匯總為每 100 萬輸入 token 5 美元、輸出 token 25 美元,並稱其為 1M 上下文 | 輸出單價低過 GPT-5.5;適合重視長程一致性同文件紀律嘅任務。 |
| DeepSeek V4 | Mashable 匯總為每 100 萬輸入 token 1.74 美元、輸出 token 3.48 美元,並稱其為 1M 上下文 | 高吞吐、批處理、預算敏感應用最值得優先測。 |
| Kimi K2.6 | OpenRouter 頁面列出某路由為每 100 萬輸入 token 0.7448 美元、輸出 token 4.655 美元;最大 token 為 256K、最大輸出為 66K | 適合開權重、長上下文同多模態輸入評估;但路由價格唔應等同所有供應商統一標價。 |
API 單價只係總成本一部分。OpenAI 嘅 GPT-5.5 API 指南建議,工具密集或者長時間工作流,應該按準確率、token 消耗同端到端延遲同其他模型做基準測試;OpenAI 模型文件亦顯示 GPT-5.5 嘅 reasoning effort 可由 none 調到 xhigh。
公開基準適合用嚟縮細候選名單,但唔可以取代私有評測。比較穩陣嘅採購或技術選型流程,最少要記錄四類指標:任務成功率、失敗類型、端到端延遲、token 同重試成本。OpenAI 文件亦明確建議,工具密集或長時間工作流要同其他模型比較準確率、token 消耗同端到端延遲。
個人實測可以做補充訊號,但唔應當成標準排行榜。AkitaOnRails 2026 年 4 月編碼測試入面,Claude Opus 4.7 得分 97,GPT-5.5 xHigh Codex 得分 96,Kimi K2.6 得分 87,DeepSeek V4 Pro 得分 69;同一表亦記錄估算成本,例如 Claude Opus 4.7 約 1.10 美元、GPT-5.5 xHigh Codex 約 10 美元、Kimi K2.6 約 0.30 美元、DeepSeek V4 Pro 約 0.50 美元。
呢類結果嘅價值,唔係話邊個一定贏,而係提醒團隊:模型選型最後取決於你自己嘅真實代碼庫、工具權限、提示流程、覆核標準同失敗重試成本,而唔係某個孤立分數。
如果只可以先揀一個模型入評測,先揀 GPT-5.5。佢喺 Artificial Analysis 綜合榜單同 VentureBeat 匯總嘅 Terminal-Bench 2.0 都顯示出明顯優勢。
如果任務更似長文檔研究、金融資料處理、複雜多步分析,或者需要更強數據紀律,Claude Opus 4.7 應該放入第一梯隊。Anthropic 嘅內部研究代理數據同 VentureBeat 匯總嘅 HLE 數據,都支持佢喺呢啲方向有競爭力。
如果最大限制係調用量同預算,DeepSeek V4 係最值得優先做成本—質量曲線測試嘅模型。公開價格匯總顯示,佢輸入同輸出單價明顯低過 GPT-5.5 同 Claude Opus 4.7。
如果你需要開權重生態、多模態輸入或 256K 上下文,Kimi K2.6 係目前公開資料入面值得重點評估嘅候選之一;但佢同 GPT-5.5、Claude Opus 4.7、DeepSeek V4 之間,完整同源橫評仍然不足。
最穩陣嘅做法係:用公開基準決定由邊度開始,用自己嘅真實任務決定生產環境最後用邊個。排行榜可以幫你收窄範圍,但唔會幫你承擔質量、成本同延遲之間嘅實際取捨。
| 未見同源公開分數 |
| 代理式終端任務上,GPT-5.5 優勢最清楚。 |
| GPT-5.5 同 DeepSeek V4 可喺同一媒體匯總中比較;Kimi 要小心跨源解讀。 |
| 未見同源公開分數 |
| 呢個設定下 Claude Opus 4.7 領先。 |
| 未見同源公開分數 |
| Claude 高過 GPT-5.5 base,但低過 GPT-5.5 Pro。 |
| 網頁瀏覽理解任務上,GPT-5.5、DeepSeek V4 Pro-Max、Kimi K2.6 公開匯總分數好接近。 |