Kimi K3 將前沿 AI 進步歸納為兩條要一齊擴展嘅軸:部署前嘅模型容量,同部署後用於長鏈推理、工具調用及代理式 rollout 嘅算力。 K3 共有 2.78 萬億個參數,但每個 token 只啟動約 1,042 億個參數;目標係保留超大模型容量,同時避免按 2.78 萬億稠密模型嘅成本做每 token 推理。[1] 報告聲稱 K3 可原生外推至 100 萬 token 上下文,而唔係 10 萬 token;訓練先由 8K token 開始,之後擴至 64K token。[1]
研究答案

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Kimi K3 最核心嘅論點係:要推進前沿 AI,唔可以只係喺部署前不斷加大模型;仲要擴展部署後、即係模型實際執行任務時可動用嘅運算,包括長鏈推理、瀏覽與工具使用、寫程式、規劃,以及自我修正等代理式 rollout。Moonshot AI 嘅設計方向,係令呢兩種資源都較可負擔:用超大 MoE(Mixture-of-Experts,專家混合)模型儲存更多能力,但每次處理 token 時只啟動一部分參數;再用注意力、路由、通訊及強化學習基建,降低將呢些能力真正用喺推理階段嘅成本。1
K3 被描述為原生多模態 MoE 模型,總參數量為 2.78 萬億,但每個 token 啟動嘅參數約 1,042 億,並支援最高 100 萬 token 上下文。1
呢個分別係理解 K3 路線嘅關鍵。總參數代表模型可容納嘅能力容量;活躍參數則較接近每次生成或理解一個 token 時嘅實際計算負擔。MoE 做法係由路由機制揀選少數「專家」處理當前 token,所以毋須以一個 2.78 萬億參數稠密模型嘅成本去做每一步推理。1
報告有一點需要釐清:K3 聲稱可原生外推到 100 萬 token,並非 10 萬 token。它最初以 8K token 訓練,之後延長至 64K token;系統無用顯式位置嵌入。Moonshot AI 認為,KDA 入面嘅循環閘門與衰減機制已足以編碼位置資訊,因此可以毋須修改 RoPE(旋轉位置編碼)而向更長上下文外推。1
K3 報告提出幾個互相配合嘅元件,而唔係靠單一技術就做到。
KDA + Gated MLA: KDA 將大部分原本具二次成本嘅注意力運算,換成固定大小嘅循環狀態。換言之,隨住前文愈來愈長,每 token 嘅狀態與解碼成本唔會好似完整 KV cache 咁隨歷史上下文線性膨脹。K3 每三層 KDA 插入一層 Gated MLA:前者負責平價而持續嘅序列處理,後者補回選擇性全局檢索能力。1
衰減率下限唔只係模型技巧: 報告提到 KDA 衰減率嘅下限,主要係避免過細衰減值造成數值問題,同時令分塊運算更適合 tensor core 執行;所以呢項設計亦關乎工程效率。1
Attention Residuals(AttnRes): 93 層、而且大量採用線性注意力嘅網絡,若資訊只可以逐層傳遞,較早層嘅有用表徵容易被隔離。AttnRes 讓後面層數可以檢索早前深度區塊壓縮咗嘅表徵,等跨層資訊有另一條取用路徑。Moonshot AI 嘅主張係:咁做有助喺以 KDA 取代大量昂貴全局注意力時,仍保存品質。1
Stable LatentMoE: 系統有 896 個專家,採用 top-16 路由,即每個 token 會選 16 個專家處理。其分位數平衡方法,將路由視為平衡分配問題,並喺指定嘅批次層面假設下推導出精確最優解;但真正部署推理時,並唔會即時跑平衡求解器,而係採用固定專家偏差加一般 top-k 選擇。1
呢個機制比傳統輔助損失(auxiliary loss)平衡更強,但「完美平衡」只適用於報告所述嘅路由優化設定,唔代表每一個真實部署批次都必然完全平均。
MoonEP: 大型 MoE 要經由 all-to-all 通訊,將 token 送去被選中嘅專家;如果個別專家需求不均,網絡延遲同拖尾效應可以抵銷 MoE 原本嘅成本優勢。MoonEP 嘅作用係平衡呢種通訊負載,令 896 專家設計能夠喺大規模訓練及服務時運作。換句話講,模型架構同系統設計係一套組合拳,唔應該當成各自獨立解釋跑分嘅因素。1
K3 唔係將部署後運算視為單純「答耐啲」而已。報告描述嘅輕量 VM 沙盒叢集,目標係可大量產生可驗證、長時程嘅強化學習軌跡;透過快照,任務可以較低成本地分支或續跑。呢類訓練素材,正正係讓模型學會喺實際任務中花更多步數去規劃、瀏覽、寫碼、調用工具同檢查自己答案嘅基礎。1
報告亦提到,系統會把多個領域與推理教師模型蒸餾到單一模型內,藉此轉移專門行為,而唔需要服務端同時部署九個不同模型。1
若結果可以獨立重現,K3 喺 BrowseComp 得到 91.2%,會支持它在長時程資訊搜尋代理任務上特別強嘅說法;截至 2026 年 9 月 2 日,一個第三方排行榜亦列出 K3 為 91.2%。4
不過,呢個係端到端成績,唔能夠單靠一個分數就分辨 KDA、AttnRes、MoE 路由、RL 環境、蒸餾,定係測試時運算,各自究竟貢獻咗幾多。榜單反映最終系統表現,唔係逐一元件嘅因果驗證。
技術報告同現有高權威獨立來源,未足以核實「K3 成本只係 GPT-5.6 Sol 一半」,或者它喺 Kimi Code Bench 比「Claude Fable 5」低剛好四分、但成本只佔 38% 呢類精確講法。有一項比較反而估計,每完成一項任務,K3 約為 0.94 美元,GPT-5.6 Sol 約為 1.04 美元,兩者遠非相差 50%。8
因此,任何價格或任務成本對比,都應視為受模型設定、提示詞、推理長度、定價日期,以及是否完整計入基建成本影響;除非有公開評測框架與完整成本計算,否則不宜當成固定結論。
Moonshot AI 想提出嘅策略,較似係一套架構與系統路線:要跨過萬億參數級別,同時將長上下文、代理式推理轉化為實用能力,開放權重模型需要模型設計、分散式系統、後訓練與推理機制一齊升級。
至於「其他開放模型停滯喺接近 1 萬億參數」或與「DeepSeek V4 Pro」相比嘅說法,現有 K3 論文提供嘅證據本身並不足以確立;呢些應與 K3 自己提出及支持嘅技術主張分開看待。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Kimi K3 將前沿 AI 進步歸納為兩條要一齊擴展嘅軸:部署前嘅模型容量,同部署後用於長鏈推理、工具調用及代理式 rollout 嘅算力。
Kimi K3 將前沿 AI 進步歸納為兩條要一齊擴展嘅軸:部署前嘅模型容量,同部署後用於長鏈推理、工具調用及代理式 rollout 嘅算力。 K3 共有 2.78 萬億個參數,但每個 token 只啟動約 1,042 億個參數;目標係保留超大模型容量,同時避免按 2.78 萬億稠密模型嘅成本做每 token 推理。[1]
報告聲稱 K3 可原生外推至 100 萬 token 上下文,而唔係 10 萬 token;訓練先由 8K token 開始,之後擴至 64K token。[1]