Moonshot AI 對 Kimi K3 嘅核心主張係「雙軸擴展」:預部署時擴大模型容量,部署後再投入更多算力做推理、工具調用、瀏覽同長流程任務。 K3 雖然有 2.8 萬億總參數,但每個 token 約只啟用 1,040 億參數;MoE 稀疏架構嘅目的,就係令超大容量唔使每次生成都付出完整稠密模型嘅成本。[1][17] 91.2% BrowseComp 成績反映整套系統喺長流程資訊搜尋任務上表現強勁,但唔能夠單靠一個分數,就拆解出 KDA、AttnRes、路由、RL 或提示設定各自貢獻幾多。[1][18]
研究答案

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI 發表 Kimi K3 時,重點唔係單純話「參數愈大愈好」,而係提出一套 雙軸擴展(two-axis scaling) 思路:
真正難題始終係成本。假如模型愈大、上下文愈長,就連每次回應都貴到難以實用,所謂 agent 能力便未必落到地。K3 嘅設計目標,正正係在增加整體容量之餘,控制每個生成 token 所需嘅運算同記憶體負擔。1
Kimi K3 被描述為原生多模態嘅 Mixture-of-Experts(MoE,專家混合)模型,擁有 2.8 萬億總參數、每個 token 約 1,040 億個啟用參數,上下文視窗最高可達 100 萬 token。1
17
呢兩個數字講緊兩回事:
MoE 嘅吸引力就喺呢度:K3 可以有接近 2.8 萬億參數嘅整體容量,但毋須每次生成一個 token,都跑一次完整 2.8 萬億參數嘅稠密網絡。當然,1,040 億啟用參數本身仍然非常大,唔代表推理成本低;但至少避開咗將 2.8 萬億參數全部逐 token 付費嘅做法。1
換句話講,Moonshot 想講嘅唔係「堆參數就會贏」,而係用條件式運算,令前所未見嘅大容量模型仍有機會處理長時間任務。
長上下文最麻煩嘅地方,唔只在訓練。傳統注意力機制隨序列增長,記憶體與運算開支可以愈滾愈大。K3 採用混合式注意力架構,結合 Kimi Delta Attention(KDA) 與 Gated Multi-head Latent Attention(Gated MLA)。報告指其 93 層骨幹網絡中,有 69 層 KDA、24 層 Gated MLA,主要按「3 層 KDA 配 1 層 MLA」嘅節奏編排。1
12
KDA 屬於模型嘅線性注意力部分。相比在每一層保存會隨歷史不斷增長嘅傳統 key-value cache,KDA 使用固定大小嘅循環狀態;設計用意係令記憶體狀態同解碼工作量,唔會隨已讀上下文以同一種方式膨脹。1
報告亦為 KDA 嘅衰減率設下下限。呢個唔只係建模選擇:避免衰減值細到造成數值運算問題,同時可配合分塊實作,較適合 tensor core 執行。1
不過,單靠線性循環未必做到全注意力機制那種「喺超長內容中精準翻出相關資料」嘅效果。因此,K3 在網絡中持續保留 Gated MLA 層:KDA 負責較便宜、持續嘅序列處理;MLA 則定期提供全局檢索。1
呢個設計反映一個很實際嘅觀點:長上下文唔只係架構規格,更係系統問題。視窗標榜得再大,如果模型檢索唔到有用內容,或者生成成本高到無法接受,實際價值都會打折。
K3 另一個核心組件係 Attention Residuals(AttnRes)。報告指出,K3 有 93 層,AttnRes 讓較後層可以從較早嘅深度區塊取回壓縮後表徵,而唔係逼所有資訊只能逐層、一步一步向後傳遞。1
可以咁理解:
對一個大部分層數都採用線性注意力嘅深層模型而言,呢個配搭尤其重要。用較平嘅長上下文處理方式取代昂貴全局注意力,前提係資訊唔會喺深層傳遞途中失散或被隔離。1
K3 嘅 MoE 層據報設有 896 個路由專家,每個 token 選擇其中 16 個專家。1
6 呢個機制,就係「2.8 萬億總參數」與「每 token 啟用約 1,040 億參數」之間巨大差距嘅來源。
Moonshot 提出嘅 Stable LatentMoE,焦點在於令專家路由保持穩定同均衡。報告將一個批次內嘅專家分配視為最佳化問題,並引入以分位數為基礎嘅平衡方式;在其假設下,報告推導出一個精確最優解。
但要留意,部署時並唔係每一批推理都重新求解呢個平衡問題;實際路由採用固定專家偏置配合一般 top-k 選擇。1 所以,「完美平衡均衡點」係特定路由數學設定下嘅結果,唔等於每個真實生產工作負載都必然平均分派到每位專家。
大型 MoE 模型唔只係模型問題,亦係網絡問題。被選中嘅 token 經常要跨裝置傳送去對應專家;若個別專家特別繁忙,最慢嗰條通訊路徑就可能拖累整體延遲。
Moonshot 將 MoonEP 定位為專家並行通訊層,用來減輕稀疏路由造成嘅 all-to-all 通訊失衡,令大規模專家池可以較實際地訓練與部署。1
所以,K3 嘅性能主張唔應該將架構、路由同通訊分開睇。要將理論上嘅稀疏容量,變成實際吞吐量,三者缺一不可。
K3 嘅另一條擴展軸,係預訓練完成之後嘅世界。Moonshot 描述咗用於強化學習軌跡嘅基建,涵蓋長流程任務、工具使用、程式開發、網頁瀏覽與反覆解難;報告亦提到,會把多個領域與推理教師模型蒸餾到同一個系統內。1
支援這些訓練嘅,是一套輕量虛擬機沙盒系統,用來大規模建立、快照及恢復任務環境。報告列出嘅數字包括:5,120 萬個沙盒實例、133 毫秒快照及 49 毫秒恢復。1
其策略意義不難明白:如果模型目標係喺測試或部署時,花更多步驟去規劃、調工具、核對結果或持續完成一項長任務,訓練過程就需要見過足夠多類似軌跡。可以低成本地暫停、分支及恢復環境,就令更多這類 RL rollout 變得可行。
呢個唔代表每次回應都會無限量消耗推理算力;K3 報告真正主張係,系統應有能力將額外步驟與額外上下文,轉化為更好任務表現,而唔係只靠一個更大嘅預訓練模型。
Kimi K3 據報喺 BrowseComp 取得 91.2%。BrowseComp 主要測試長流程資訊搜尋能力;截至 2026 年 9 月 2 日,一個第三方排行榜亦把 K3 列為 91.2%,但排行榜名次與測試設定可隨時間改變。18
這個結果與 K3 嘅產品方向相符:一個主打長上下文、agent 後訓練與測試時推理嘅模型,理應在複雜資訊搜尋任務上接受檢驗。
但單一分數唔係逐件零件嘅拆解報告。它無法告訴讀者,91.2% 入面有幾多來自 KDA、AttnRes、專家路由、通訊基建、RL 環境、蒸餾、提示方式,抑或推理時設定。較穩妥嘅解讀係:整套系統作為一個整合堆疊表現不錯,而唔係某一項架構創新單獨造成分數。1
18
K3 常被放進大型開放模型競爭脈絡,亦包括與 DeepSeek 系統比較。不過,從技術報告可穩妥得出嘅結論,唔係一張已塵埃落定嘅開放模型排名表,而係 Moonshot 選擇咗另一種設計重點:把超大稀疏容量、高效長上下文處理,以及 agent 後訓練基建放進同一套方案。1
17
K3 論文支持其規格與設計選擇,但單靠論文本身,未能證明其他開放模型「停滯」,亦無法單獨確立它對特定競爭對手有決定性架構優勢。這類市場層面判斷,仍需要一致而可獨立重現嘅比較。
每 token 價格或每任務成本特別容易被過度解讀。提示長度、推理強度、上下文大小、快取、工具使用、吞吐假設、定價日期與評測框架,都會改變結果。
現有材料引用嘅一項公開比較,估算 K3 每完成一項任務約 0.94 美元,GPT-5.6 Sol 約 1.04 美元。20 呢個結果最多只可反映該特定設定下 K3 略有優勢,並不足以支持「K3 一律只需 Sol 一半成本」嘅講法。
較耐用嘅結論係:K3 嘗試令超長上下文與 agent 能力,在更大總模型規模下仍具經濟可行性。最終是否真有部署優勢,仍要視乎可重現評測與個別部署情境下嘅完整成本核算。
Kimi K3 技術報告提出嘅,其實係一個全棧式擴展論點:
KDA、Gated MLA、AttnRes、Stable LatentMoE、MoonEP 同 RL 沙盒基建,都服務於同一個命題:要做到前沿級 agent 行為,唔止需要更大模型,還需要一套令更多上下文與更多推理工作真正可用嘅設計。現有 benchmark 成績為這個整合方向提供正面訊號,但仍應視為系統級成果,而唔係每個組件功勞嘅最終證明。1
18
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Moonshot AI 對 Kimi K3 嘅核心主張係「雙軸擴展」:預部署時擴大模型容量,部署後再投入更多算力做推理、工具調用、瀏覽同長流程任務。
Moonshot AI 對 Kimi K3 嘅核心主張係「雙軸擴展」:預部署時擴大模型容量,部署後再投入更多算力做推理、工具調用、瀏覽同長流程任務。 K3 雖然有 2.8 萬億總參數,但每個 token 約只啟用 1,040 億參數;MoE 稀疏架構嘅目的,就係令超大容量唔使每次生成都付出完整稠密模型嘅成本。[1][17]
91.2% BrowseComp 成績反映整套系統喺長流程資訊搜尋任務上表現強勁,但唔能夠單靠一個分數,就拆解出 KDA、AttnRes、路由、RL 或提示設定各自貢獻幾多。[1][18]