獨立與官方報告均顯示,Kimi K3 的表現已達到或接近前沿水準。
| 指標/基準 | Kimi K3 得分 | 比較對象 | 來源 |
|---|---|---|---|
| Artificial Analysis 智能指數 | 57 | Claude Fable 5 為 60(領先 3 分);超越 Claude Opus 4.8 和 GPT-5.5 | |
| 整體排名(獨立評測) | 186–189 個模型中的第 4 名 | 領先 Claude Opus 4.8 和 GPT-5.5 | |
| Frontend Code Arena(Elo 評分) | 1,679 Elo | 直接擊敗 Claude Fable 5 | |
| 代理型基準測試(Program Bench, SWE Marathon, SpreadsheetBench 2, Automation Bench, BrowseComp) | 8 項中有 4 項排名第一 | 唯一在代理型基準中領先的開源模型 | |
| Moonshot 內部評測 | 優於其他受測模型 | 但仍落後於 Claude Fable 5 和 GPT-5.6 Sol |
關鍵細節: Moonshot 本身也承認,Kimi K3 在整體表現上「仍落後於最強大的專有模型 Claude Fable 5 和 GPT 5.6 Sol」,但強調它是目前唯一達到此效能等級的開源權重模型 。
採用統一的隨用隨付(pay-as-you-go)定價,不依上下文長度分級 :
| Token 類型 | 每百萬 tokens 價格 |
|---|---|
| 輸入(快取錯失, cache-miss) | 3.00 美元 |
| 輸入(快取命中, cached) | 0.30 美元 |
| 輸出 | 15.00 美元 |
這使得 Kimi K3 的每項任務成本,大約僅為同等級美國封閉源碼前沿模型的一半 。此極具侵略性的定價是其競爭策略的核心。
基礎設施門檻:
市場挑戰:
Kimi K3 堪稱里程碑式的發布——它是史上最大的開源權重模型,效能已逼近美國最強的封閉模型,但每項任務成本僅約其一半。若其於 7 月 27 日以寬鬆授權如期兌現開放權重的承諾,將進一步加速 AI 能力的去中心化。然而,主要的制約因素包括自架模型所需的龐大硬體需求、持續存在的中美晶片出口限制,以及其基準測試成績能否經得起持續的獨立驗證。