本文將深入探討這次發布的始末——Kimi K3 的真正實力、其成本效益,以及為何它代表了美中 AI 競爭中的一個重要里程碑。
Kimi K3 在獨立機構 Artificial Analysis 的 Intelligence Index v4.1 中獲得了 57.1 分,在全球排名第三,僅次於 Claude Fable 5(60 分)和 GPT-5.6 Sol(59 分)。約 3 分的差距以歷史標準來看相當接近,但這也明確表明,在最廣泛的智慧測試中,頂尖的美國模型仍然佔有優勢。Moonshot 官方也坦承,K3 在整體綜合性能上「仍落後於 Anthropic 和 OpenAI 最強大的專有模型」。
然而,K3 在特定、真實世界的代理(Agentic)基準測試中展現了領先實力:
| 基準測試 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| DeepSWE | 73.0 | 70.0 | 67.5 | 59.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 75.6 | — | — | — |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 |
在包含 Program Bench (77.8) 在內的這六項代理基準測試中,K3 直接贏得了其中 5 項,在這些特定測試上擊敗了 Fable 5 和 GPT-5.6 Sol。更值得注意的是,它在所有已發布的基準測試上都大幅超越了 Claude Opus 4.8——這是一個重要的結果,因為 Opus 4.8 的定價為每百萬輸入 tokens 5 美元、輸出 tokens 25 美元,是直接的價格競爭對手。
在由 UC Berkeley 研究人員建立的 Arena 盲測平台上,K3 在發布後不久便登上了程式碼排行榜的頂端。該平台的群眾比較評估顯示,K3 在前端網頁開發領域以 1,679 分奪冠,領先 Fable 5(1,631 分)和 GPT-5.6 Sol(1,618 分)。
在 GPU 核心優化方面——這是一項改善 AI 模型與硬體互動的關鍵技術——Moonshot 報告指出 K3 的表現「大幅超越」了 Opus 4.8、GPT-5.6 Sol 和 GPT-5.5。這在商業上意義重大,因為更好的核心優化意味著在相同硬體上可以實現更低的延遲和更高的吞吐量。
K3 採用了一種稀疏 MoE 架構,擁有 896 個專家(Experts),但每個 token 僅激活其中 16 個,這使其推理成本與 GPT-5.6 Sol 大致相當,儘管其總參數高達 2.8 兆。同時,它還引入了 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes),這些是旨在增強長上下文推理能力的新型架構組件。
Kimi K3 最具市場顛覆性的方面之一是其 API 定價,與頂級美國模型相比具有顯著優勢:
| 模型 | 輸入 (每百萬 tokens) | 輸出 (每百萬 tokens) |
|---|---|---|
| Kimi K3 | $3.00 | $15.00 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
以官方牌價計算,Kimi K3 的價格比 GPT-5.6 Sol 便宜約 40%,比 Claude Fable 5 便宜約 70%。這三個模型的價格形成了一個清晰的 3.3 倍階梯:Fable 5 的輸入和輸出價格都是 Kimi K3 的 3.3 倍,而 GPT-5.6 Sol 則幾乎正好落在兩者之間。
此外,K3 的快取命中(Cache-hit)輸入價格為每百萬 tokens 0.30 美元——比其快取未命中(Cache-miss)價格便宜 10 倍——適用於已處理過的上下文查詢。按單一任務計算,K3 的成本估計比美國旗艦模型低 50-65%。
Moonshot 對 K3 的定價策略是一個顯著的轉變:它現在的定價更像是一個前沿模型,而不是一個經濟實惠的選擇。之前的 Kimi 模型如 K2.5 和 K2.6,定價分別為輸入 $0.60 / 輸出 $2.50-$4.00,這使得 K3 比其前代產品貴了大約 3-4 倍。儘管如此,與提供同等或更佳性能(尤其是在特定代理任務上)的頂級美國模型相比,它仍然更便宜。
2026 年 7 月 19 日——大約在發布後 48 小時——Moonshot AI 宣布暫停 Kimi K3 的新用戶訂閱。該公司在 X 平台上發文表示:「Kimi K3 收到的喜愛遠超我們預期,我們的 GPU 已經感受到了壓力。在過去的 48 小時裡,需求已接近我們當前容量的極限」。
該公司表示,將優先為現有用戶提供算力,並以最快速度擴充容量,計劃分批重新開放訂閱。現有用戶的完整訪問權限不受影響,企業和 API 服務也將繼續運行。
多家媒體指出,此事件凸顯了中國 AI 實驗室因美國晶片出口限制而面臨的持續算力困境。《南華早報》評論道,這種情況「突顯了中國 AI 實驗室在向全球用戶提供服務時所面臨的挑戰」。由於模型的完整權重預計要到 7 月 27 日才開放,這使得 Moonshot 在發布初期成為唯一提供推理服務的供應商。
Moonshot 利用此次暫停,將其會員制度拆分為兩個方案:Kimi Membership(面向網頁、App 和 Work)和 Kimi Code Membership(面向程式開發工作流程),此舉旨在更好地分配算力資源。
Kimi K3 的發布在 AI 基準測試之外也產生了漣漪效應。《海峽時報》直接報導 K3「引發了科技股拋售」,多家媒體也將此次發布與美國半導體和 AI 股票的下跌聯繫起來。雖然在現有資料集中無法獨立確認費城半導體指數或輝達(Nvidia)股價的具體走向,但此次拋售的市場背景已廣為報導。
在企業方面,路透社於 2026 年 7 月 20 日報導,此次訂閱暫停「正值該公司尋求新一輪融資之際,有消息人士稱其正籌備在香港進行首次公開募股(IPO)」。不過,現有資料中沒有來源能確認其估值目標為 300 億美元的股東決議。路透社的報導提到了 IPO 的推動,但未具體說明估值目標。
Kimi K3 的完整模型權重預計於 2026 年 7 月 27 日 公開釋出。這是一個關鍵細節,因為這意味著開發者和組織最終可以下載、運行、檢查、微調和擁有這個模型,而不僅僅是通過 API 租用。先發布 API,11 天後再開源權重——這種兩階段的發布策略,正是這次公告的全貌。
在開源權重釋出之前,開發者可以通過 kimi.com、Kimi API 或 OpenRouter 訪問 K3。該模型相容 OpenAI SDK,支援工具調用(Tool Calling)、結構化輸出(Structured Output)和自動上下文快取(Automatic Context Caching),並擁有 100 萬 token 的上下文視窗,且無需為長上下文支付額外費用。
話雖如此,要在本地運行一個 2.8 兆參數的模型並非易事。其檔案大小估計約為 1.5 TB,推薦的硬體配置包括 64 張以上的企業級 NVIDIA H100 GPU。對於大多數團隊而言,API 仍然是最實用的訪問方式。
Kimi K3 並非一個在整體智慧上超越 GPT-5.6 Sol 或 Claude Fable 5 的模型——Moonshot 官方也這麼說。但它的意義在於,它證明了開源模型可以在特定、具有商業價值的任務上與前沿專有模型競爭,同時價格僅為後者的幾分之一。它是史上最大的開源模型,而且甫一推出,其真實世界的需求就在兩天內壓垮了一家公司 的 GPU 基礎設施。
這種組合——在代理基準測試上達到前緣水準的性能、侵略性的定價、開源權重,以及清晰的市場需求信號——使得 K3 成為 AI 領域一個重要的里程碑,無論它在任何單一排行榜上的位置如何。