無論係獨立測試定係廠商自己公布嘅數據,Kimi K3 嘅表現都貼近頂尖水平。
| 指標 / 基準 | Kimi K3 | 對比 | 來源 |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 57 | Claude Fable 5 拎 60(領先 3 分);贏 Claude Opus 4.8 同 GPT-5.5 | |
| 整體排名(獨立測試) | #4(共 186–189 個模型) | 贏 Claude Opus 4.8 同 GPT-5.5 | |
| Frontend Code Arena(Elo) | 1,679 Elo | 直接贏咗 Claude Fable 5 | |
| 代理任務基準(Program Bench、SWE Marathon、SpreadsheetBench 2、Automation Bench、BrowseComp) | 喺 8 個中有 4 個排第一 | 係唯一一個喺任何代理任務基準領先嘅開源模型 | |
| Moonshot 內部評估 | 表現優於其他測試模型 | 但仍然落後 Claude Fable 5 同 GPT-5.6 Sol |
重點要留意:Moonshot 自己都承認 Kimi K3「仍然落後最強大嘅封閉源碼模型 Claude Fable 5 同 GPT 5.6 Sol」,但強調佢係唯一一個達到呢個性能水平嘅開源權重模型 。
採用劃一嘅按量收費,唔會因為上下文長度而分級 :
| Token 類型 | 每百萬個 token 收費 |
|---|---|
| 快取未命中輸入 | US$3.00 |
| 快取命中輸入 | US$0.30 |
| 輸出 | US$15.00 |
呢個定價大約係同等級美國封閉源碼模型嘅 一半成本 ,係 K3 競爭策略嘅核心部分。
基礎設施限制:
市場挑戰:
Kimi K3 係一個里程碑式嘅發布 — 史上最大嘅開源權重模型,性能貼近最佳嘅美國封閉源碼模型,但成本大約係佢哋嘅一半。如果如期開放權重(2026 年 7 月 27 日),並採用寬鬆嘅授權條款,將會進一步加速 AI 能力嘅去中心化。不過要留意嘅係,自行託管需要好高嘅硬件要求、中美晶片出口限制持續存在,以及需要持續獨立驗證基準測試嘅結果。