Kimi K3 的核心主張是:前沿 AI 必須同時擴大部署前的模型容量,以及部署後用於推理、工具調用與代理任務的運算量。 K3 是原生多模態 MoE 模型,總參數達 2.78 兆,但每個 token 約啟用 1,042 億參數,目標是在不承擔稠密 2.8 兆模型推論成本下提高容量。[1] 報告宣稱模型可原生外推至 100 萬 token 上下文;其 KDA、Gated MLA、AttnRes 與 MoE 系統設計,都是為長上下文與大規模代理式推論降低成本。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI 在 Kimi K3 技術報告裡要說的,並不只是「參數越多越好」。它的論點是,前沿 AI 的能力要靠兩種可互補的擴張共同推動:部署前的模型容量,以及部署後、在實際解題時投入的推理運算。
前者是把模型做得更有容量,讓它儲存更廣泛的知識與技能;後者則是讓模型在面對複雜任務時,有餘裕進行較長的思考、規劃、瀏覽、寫程式、使用工具與自我修正。K3 的架構與訓練系統,都是為了讓這兩件事不至於因成本與延遲而失去實用性。1
Kimi K3 是一個原生多模態的 Mixture-of-Experts(MoE,專家混合)模型:總參數為 2.78 兆,但每處理一個 token,約只啟用 1,042 億參數,並支援最長 100 萬 token 的上下文。1
這正是 K3 的第一層擴張策略。MoE 可把大量能力分散存放在不同「專家」之中,再依輸入內容挑選部分專家參與計算。換言之,模型能擁有接近兆級的總容量,卻不必在每個 token 上支付一個稠密 2.78 兆參數模型的完整運算帳單。1
不過,1,042 億個啟用參數本身仍是相當龐大的推論負載;K3 的主張不是讓大型模型變得沒有成本,而是試圖讓更大容量的模型可被實際訓練與服務。
報告的一個關鍵數字是 100 萬 token,而不是 10 萬 token。K3 起初以 8K 上下文訓練,後續延伸至 64K,並宣稱可原生外推到 100 萬 token。1
為了做到這件事,Moonshot 採用 Kimi Delta Attention(KDA)與 Gated MLA 的混合注意力架構。KDA 以固定大小的循環狀態取代大部分傳統二次方成本的注意力計算,因此隨著上下文變長,每個 token 的狀態與解碼成本不會像完整 KV cache 那樣持續線性攀升;Gated MLA 則保留選擇性全域資訊擷取能力。1
在骨幹網路中,K3 以「3 層 KDA 加 1 層 Gated MLA」的 3:1 比例反覆交錯。簡單說,KDA 負責較便宜而持續的序列處理,MLA 則在需要時補回跨全局找資訊的能力。1
報告也指出,K3 沒有採用顯式位置嵌入;其看法是,KDA 的循環閘門與衰減機制足以承載位置訊息,從而不必透過修改 RoPE 來延伸位置編碼。1
K3 的 Attention Residuals(AttnRes)針對的是另一個問題:當模型有 93 層深、且大量採用線性注意力時,資訊若只能一層層往下傳遞,早期有用的表示可能難以被後段層直接利用。
AttnRes 的設計,是讓後面的層能從先前深度區塊擷取壓縮後的表示。這形成一條跨深度的資訊檢索路徑,而不必強迫所有重要內容都嚴格逐層傳遞。Moonshot 的目標,是在以 KDA 取代大量昂貴全域注意力的同時,盡量維持模型品質。1
K3 的 Stable LatentMoE 使用 896 個路由專家,每個 token 採 top-16 路由。這可提高條件式容量,但也帶來現實的系統難題:不同 token 對專家的需求不均,資料必須跨裝置送往被選中的專家;若流量失衡,網路等待時間就可能主宰整體延遲。
報告提出的量化平衡方法,將訓練時的專家路由視為平衡指派問題,並在其批次層級假設下推導出精確最適解。到了部署推論階段,路由器則使用固定專家偏置與一般 top-k 選擇,而不是每次都執行平衡求解器。1
這種做法比傳統輔助損失的負載平衡更強,但「完美平衡」應限於論文設定的路由最佳化結果,不能延伸解讀為每一個真實部署批次都必然完全均衡。
此外,MoonEP 的角色是平衡 MoE 路由所引發的 all-to-all 通訊。這並非與模型架構互相獨立的賣點:若專家模型無法有效率地將 token 送至目標專家,龐大的條件式容量就難以轉化為可接受的訓練與推論成本。1
K3 的另一條主線,是把能力擴張延伸到模型部署後。報告描述以輕量虛擬機組成的沙盒叢集,來產生大量可驗證、長時程的強化學習(RL)軌跡;快照機制則讓任務分支與續跑的成本降低。1
這類基礎設施的意義在於,模型可被訓練去使用更多測試時運算:例如規劃、多步瀏覽、程式執行、工具調用與錯誤修正,而不只依賴一個部署後固定不變的預訓練模型。報告也提到將多個領域與推理教師模型蒸餾至單一系統,藉此轉移專門技能,避免線上服務時必須同時運行多個模型。1
因此,K3 想推進的並非單純「更大的基礎模型」,而是更大的模型容量加上更可負擔的代理式推論流程。
第三方排行榜在 2026 年 9 月 2 日列出 Kimi K3 的 BrowseComp 成績為 91.2%;該榜單同時顯示 GPT-5.6 Sol 為 92.2%、Claude Opus 5 為 90.8%。BrowseComp 著重衡量長時程、資訊搜尋型的網路研究行為。4
若該成績可被重現,它確實會支持 K3 在長鏈資訊尋找與代理任務上的整體競爭力。但它無法單獨證明 KDA、AttnRes、MoE 路由、RL 環境、蒸餾或測試時運算之中,究竟是哪一項帶來多少增益;這是整套模型與系統堆疊的端到端結果。4
至於「K3 成本只有 GPT-5.6 Sol 一半」,或「在特定程式基準僅落後 Claude Fable 5 四個百分點、成本卻只有 38%」等精確說法,現有技術報告與所提供的高權威獨立資料不足以核實。
一份比較資料反而估計,K3 每完成一項任務約為 0.94 美元,GPT-5.6 Sol 約為 1.04 美元;這與相差 50% 並不一致。8 任務成本高度取決於提示長度、推理設定、工具使用、計費日期與評測流程,若沒有完整的測試框架與成本計算,不宜把單一價格數字當成普遍結論。
K3 報告較有力的訊息,或許不是它必然在哪個價格點勝出,而是 Moonshot AI 正在押注一套架構與系統策略:以兆級 MoE 擴張預部署容量,再以長上下文、RL 環境與可承受的測試時運算,將容量轉化為可用的代理能力。至於開源模型是否普遍停滯在約 1 兆參數、或其與其他特定模型的直接比較,並非這份 K3 報告本身已充分證實的結論。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Kimi K3 的核心主張是:前沿 AI 必須同時擴大部署前的模型容量,以及部署後用於推理、工具調用與代理任務的運算量。
Kimi K3 的核心主張是:前沿 AI 必須同時擴大部署前的模型容量,以及部署後用於推理、工具調用與代理任務的運算量。 K3 是原生多模態 MoE 模型,總參數達 2.78 兆,但每個 token 約啟用 1,042 億參數,目標是在不承擔稠密 2.8 兆模型推論成本下提高容量。[1]
報告宣稱模型可原生外推至 100 萬 token 上下文;其 KDA、Gated MLA、AttnRes 與 MoE 系統設計,都是為長上下文與大規模代理式推論降低成本。