另一個重要測試 GDPval 模擬法律、金融、醫療、產品管理等44種職業任務。GPT‑5.5喺大約 84.9%案例中與專業人士打和或更好。
整體而言,呢啲數據顯示 GPT‑5.5 特別擅長 多步任務、自主代理(agentic tasks)同工具使用。
Anthropic 推出嘅 Claude Opus 4.7 通常被視為最強編程模型之一。
代表性基準包括:
SWE‑bench 專門測試模型是否可以修復真實開源軟件問題。Opus 4.7 成功解決 87.6% 任務,係公開比較中最高水平之一。
雖然佢喺Terminal‑Bench分數低過GPT‑5.5,但喺軟件工程相關測試中仍然屬於頂級水平。
Google 嘅 Gemini 3.5 Flash 有啲特別——佢其實定位為 高速、低成本模型,但基準表現仍然相當強。
公開數據包括:
Google 表示,呢個模型 輸出速度約為同級模型4倍,同時喺多個代理與編程測試超越舊版 Gemini 3.1 Pro。
因此 Gemini 3.5 Flash 最大優勢係:
速度與能力之間嘅平衡——接近旗艦級表現,但延遲更低、成本更友善。
中國AI公司 DeepSeek 推出嘅 DeepSeek V4 最大特色係:開放權重(open‑weight)。
模型分為兩個版本:
官方技術報告顯示,V4‑Pro 在最高推理模式下可達:
這些數字令它在某些編程測試上接近甚至逼近頂級閉源模型。
不過,美國 NIST(國家標準與技術研究院)CAISI 計劃 的獨立評估指出:
DeepSeek V4 能力大約落後前沿模型約8個月。
即是說,官方數據與第三方評估之間仍然存在差距。
Elon Musk 創立嘅 xAI 推出 Grok 4.3,相對前代進步相當大,尤其係代理任務測試。
公開數據包括:
與上一代 Grok 相比,GDPval‑AA 提升超過300 Elo,代表模型喺實際任務自動化方面有明顯進步。
不過多數第三方分析仍然認為,其整體能力 仍稍低於 OpenAI 同 Anthropic 最新模型。
綜合目前公開測試,大致趨勢如下:
不過呢啲結論都只可以當作 方向性觀察,而唔係絕對排名。
AI基準比較之所以不斷變動,主要原因包括:
因此真正可靠嘅排名,往往要等 數月後大量第三方測試 才會比較清晰。
2026年AI競爭格局其實並唔係「一個模型全勝」。
相反,前沿模型開始出現明顯專長分工:
隨著更多獨立測試出現,未來一年這些模型的真正排名仍可能持續變化。