Kimi K3の主張は、AIの最前線を伸ばすには、配備前のモデル容量と、配備後の推論時計算という二つの資源を同時に拡大する必要がある、というものです。 K3は総パラメータ数2.78兆のMoEモデルでありながら、各トークンで活性化するのは1042億パラメータ。巨大な容量を持ちつつ、密な2.8兆パラメータモデル相当の推論コストを避ける設計です。[1] 長文脈、専門家ルーティング、通信、強化学習用サンドボックスを組み合わせ、長い推論、ツール利用、自己修正を実用的なコストで行わせることを狙います。
研究の答え

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Kimi K3の技術報告が打ち出す中心的な考え方は明快です。AIの能力を前進させるには、配備前にモデルへ蓄える能力(モデル容量)だけでなく、配備後にモデルが長く考え、ツールを使い、途中で検証・修正するための推論時計算も拡大しなければならない――というものです。
Moonshot AIは、この二つを別々の課題とは扱っていません。巨大なMixture-of-Experts(MoE)モデルで能力を蓄えつつ、長文脈処理、専門家の選択、GPU間通信、強化学習(RL)の実行環境まで最適化し、その能力を推論時に引き出せるようにする。K3は、そうしたモデル設計とシステム設計を一つのスタックとして提案しています。1
K3は、ネイティブなマルチモーダルMoEとして、総パラメータ数2.78兆、トークン当たりの活性化パラメータ数1042億、最大100万トークンのコンテキストウィンドウを掲げます。1
ここで重要なのは、2.78兆という数字が毎トークンで全て計算される「密なモデル」の規模ではない点です。MoEでは、入力トークンごとに多数の専門家(expert)のうち一部を選んで使います。つまり、モデル全体には広い知識・機能の受け皿を持たせながら、1回の推論で動かす部分を1042億パラメータ程度に抑える、という発想です。
これは「事前学習で大きくする」ことを否定せず、むしろ大きな容量を維持したまま、実際の応答コストを管理しようとする設計です。K3の論点は、能力の保存先を増やすことと、その能力を呼び出すコストを下げることを両立させる点にあります。1
K3が主張するコンテキスト長は10万トークンではなく、ネイティブな外挿で100万トークンです。学習は当初8K、後段では64Kトークンで行われ、明示的な位置埋め込みを使わず、KDAの再帰的なゲートと減衰によって位置情報を扱えるため、RoPEの変更なしに長文脈へ外挿できると説明されています。1
通常のフルアテンションでは、過去のトークンを参照するためのKVキャッシュが長文脈に伴って大きくなり、デコード時の負担も増えやすくなります。K3の**Kimi Delta Attention(KDA)**は、多くの処理を固定サイズの再帰状態へ置き換えることで、トークンごとの状態量やデコードコストを、フルKVキャッシュと同じ形では増やさないことを目指します。1
ただし、再帰的・線形的な処理だけでは、任意の過去情報を選択的に探し出す能力が弱くなり得ます。そこでK3は、KDA 3層に対してGated MLA 1層という比率で交互に配置します。KDAが低コストで長い系列を処理し、Gated MLAがより選択的なグローバル検索を補う、という分担です。1
報告書が触れるKDAの減衰率への下限設定も、単なる精度上の工夫ではありません。極端に小さい減衰率に起因する数値計算上の問題を防ぎ、テンソルコアに適したブロック計算を可能にする実装上の目的があります。1
K3は93層の深いネットワークです。こうした構成で線形的な注意機構を多用すると、有用な情報が層から層へ順送りされる過程で薄れたり、隔離されたりするリスクがあります。
この問題に対するのが**Attention Residuals(AttnRes)**です。後段の層が、以前の深さのブロックで圧縮された表現を参照できるようにし、情報が厳密に隣接層だけを経由しなければならない状態を避けます。報告書の主張では、これにより高価なグローバルアテンションの多くをKDAへ置き換えつつ、品質を保つことを狙います。1
MoEの利点は条件付きで大容量を使えることですが、運用上の難しさもあります。K3は896の専門家を用意し、各トークンで上位16専門家へルーティングします。1
Stable LatentMoEの量子位バランシングは、ルーティングをバランスの取れた割り当て問題として扱い、バッチ単位の仮定の下で厳密な最適解を導く手法として説明されています。一方、実際の配備時には、この最適化ソルバーを毎回動かすのではなく、固定した専門家バイアスと通常のtop-k選択を使います。1
ここでいう「完全な均衡」は、あくまで記述されたルーティング最適化問題の条件下での性質です。実際のサービスのあらゆる入力バッチで、常に完全な負荷均衡が保証されるという意味ではありません。
また、選ばれた専門家へトークンを送る際にはGPU間のall-to-all通信が生じます。専門家の人気に偏りがあれば、遅い通信が全体のレイテンシーを支配しかねません。MoonEPは、この通信の偏りをならし、896専門家のMoEを訓練・推論で経済的に動かすための運用面の要素です。1
つまり、アーキテクチャだけでベンチマーク性能を説明するのでは不十分です。KDA、AttnRes、MoEルーティングと、通信基盤は補完関係にあります。
K3のもう一つの軸は、ポストトレーニングと推論時計算です。軽量VMによるサンドボックス群を使い、検証可能な長期RL軌跡を数多く生成し、スナップショットによって分岐や再開を低コストに行えるようにします。1
これは、テスト時により多くのステップを使うモデルの学習基盤です。計画を立てる、ウェブを調べる、コードを書く、ツールを呼び出す、結果を見て自己修正する――こうした一連の行動は、単に事前学習済みモデルを大きくしただけでは十分に引き出せません。
報告書は、複数の領域・推論教師モデルを一つのシステムへ蒸留することにも言及しています。専門的な振る舞いを移し替え、推論時に9個の別モデルを提供する必要を減らす狙いです。1
第三者リーダーボードでは、K3はBrowseCompで**91.2%**と掲載されています。BrowseCompは、単なる内在知識ではなく、長期的なウェブ調査行動を測るベンチマークとして位置付けられており、この成績は情報探索型エージェントとしての強さを示す材料になります。4
ただし、この数字だけで「KDAが何点分効いた」「AttnResが決定打だった」「RL環境や推論時計算がどれだけ寄与した」とは判断できません。これは各要素を分離した実験ではなく、モデルとシステムを統合したエンドツーエンドの結果だからです。
「K3はGPT-5.6 Solの半額」といった厳密な比較や、「Claude Fable 5より4ポイント低いがコストは38%」とする主張は、技術報告書または信頼性の高い独立ソースからは確認できませんでした。
参照された別の比較では、完了タスク当たりの推定コストはK3が約0.94ドル、GPT-5.6 Solが約1.04ドルとされており、50%差とは整合しません。8 コストはプロンプト長、推論設定、ツール利用、料金改定日、評価ハーネス、完了の定義によって大きく変わります。評価条件と完全なコスト内訳が公開されない限り、単純な価格優位の結論は避けるべきです。
K3が提示する戦略的含意は、単純な低価格競争というより、大規模なオープンモデルを実用的なエージェント能力へ変換するための設計競争にあります。
総パラメータ数を増やして能力を蓄積する。MoE、注意機構、通信最適化で、その能力を現実的な推論コストで取り出す。そして、RL環境と推論時計算によって、モデルに長く考え、調査し、行動し、修正させる。Moonshot AIは、この全体を次世代のスケーリング則として描いています。1
一方で、「オープンモデルが約1兆パラメータ付近で停滞している」といった業界全体についての比較や、特定モデルとの優劣までを、K3の論文単独から確立することはできません。報告書が強く裏付けるのは、巨大な事前学習モデルと豊富な推論時計算を両立させるための、具体的な技術的アプローチです。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Kimi K3の主張は、AIの最前線を伸ばすには、配備前のモデル容量と、配備後の推論時計算という二つの資源を同時に拡大する必要がある、というものです。
Kimi K3の主張は、AIの最前線を伸ばすには、配備前のモデル容量と、配備後の推論時計算という二つの資源を同時に拡大する必要がある、というものです。 K3は総パラメータ数2.78兆のMoEモデルでありながら、各トークンで活性化するのは1042億パラメータ。巨大な容量を持ちつつ、密な2.8兆パラメータモデル相当の推論コストを避ける設計です。[1]
長文脈、専門家ルーティング、通信、強化学習用サンドボックスを組み合わせ、長い推論、ツール利用、自己修正を実用的なコストで行わせることを狙います。