Kimi K3の主張は、事前学習段階でモデル容量を拡大することと、運用時に推論・ツール利用・長期タスクへ追加コンピュートを投じることを両立させる「二軸スケーリング」にある。 総パラメータは2.8兆、トークンごとの活性化パラメータは約1040億。MoEにより巨大な総容量を持ちながら、毎トークンで2.8兆すべてを計算する必要を避ける設計だ。
研究の答え

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AIがKimi K3で提示するのは、二軸のスケーリングという考え方だ。ひとつは配備前にモデルそのものを大規模化すること。もうひとつは配備後、そのモデルが推論、ツール利用、ウェブ閲覧、コーディング、誤りの修正に十分な計算資源を使えるようにすることである。
ただし、核心には経済性の問題がある。モデルを単純に高密度・多層化するだけでは、長文脈での提供コストが膨らみ、能力を実用的に使えなくなりかねない。K3の設計は、総容量を大きくしつつ、生成トークン当たりの計算量とメモリ使用量を抑えることを狙っている。 1
Kimi K3は、ネイティブなマルチモーダル対応のMixture-of-Experts(MoE)モデルで、総パラメータ数は2.8兆、トークン当たりの活性化パラメータ数は約1040億、コンテキスト長は最大100万トークンと説明されている。 1
17
この2種類のパラメータ数は、意味が異なる。
MoEの実務的な利点はここにある。K3は、トークンごとの計算規模が近い密なモデルより、総体としてははるかに大きくできる。もちろん1040億の活性化パラメータも軽量ではない。それでも、密な2.8兆パラメータモデルの推論コストを毎トークンで支払わずに済む。 1
したがってMoonshotの主張は、単に「パラメータは多いほどよい」というものではない。条件付き計算によって、より大きなモデル容量を長時間のタスクで使える形にする、という主張だ。
100万トークンのコンテキストは、学習時だけでなく推論時にも難題となる。通常の注意機構では、系列が長くなるほどメモリと計算の負担が積み上がるためだ。
K3は、**Kimi Delta Attention(KDA)とGated Multi-head Latent Attention(Gated MLA)**を組み合わせる。報告されているバックボーンは、KDA 69層とGated MLA 24層で、主に「KDA 3層にMLA 1層」という比率で構成される。 1
12
KDAは線形注意の要素である。こうした層では、履歴全体にわたって増え続ける通常のキー・バリュー(KV)キャッシュを持つ代わりに、固定サイズの再帰的状態を用いる。狙いは、従来のフル注意のように、過去の文脈が長くなるほどメモリ状態とデコード作業が同じ形で増大しないようにすることだ。 1
技術報告書は、KDAの減衰率に下限を設けることも説明している。これは単なるモデリング上の好みではない。極端に小さい減衰値による数値計算上の問題を避け、Tensor Coreで実行しやすいブロック化実装を可能にするための設計でもある。 1
一方で、線形再帰だけでは、文脈全体から特定の情報を選択的に探し出すという、フル注意に近い振る舞いを十分に担えない可能性がある。そこでK3はネットワーク全体にGated MLA層を残している。
報告されたハイブリッド構成では、KDAが低コストで継続的な系列処理を担い、MLAが定期的なグローバル検索を担う。 1
この構成が示すのは、長文脈はアーキテクチャだけの問題ではなく、システム設計の問題でもあるということだ。公称のコンテキスト長が大きくても、必要な情報を取り出せず、実用的なコストで生成できなければ価値は限られる。
K3のもうひとつの構成要素が、**Attention Residuals(AttnRes)**だ。K3は93層からなり、技術報告書では、後段の層が初期の深さブロックから圧縮表現を参照できるようにしている。これにより、情報を厳密に1層ずつだけ受け渡す必要を減らす。 1
概念的には、KDAが系列長方向の情報フローを扱い、AttnResがネットワークの深さ方向の情報フローを扱う。この組み合わせは、線形注意を多く使う深いモデルでは重要になる。高コストなグローバル注意を置き換えるなら、層を通過する過程で有用な情報が失われたり孤立したりしないことも必要になるからだ。 1
K3のMoE層は、896のルーティング対象エキスパートを持ち、各トークンで16エキスパートを選ぶと報告されている。 1
6
これが、総パラメータ数と活性化パラメータ数の大きな差を生む仕組みだ。
技術報告書のStable LatentMoEは、ルーティングを安定かつ均衡的に保つことに焦点を当てる。バッチ単位のエキスパート割り当てを最適化問題として扱い、分位点ベースの負荷分散を導入する。報告書は、一定の仮定の下で厳密な最適解を導いている。ただし実運用時には、推論バッチごとに最適化を解き直すのではなく、固定されたエキスパートバイアスと通常のtop-k選択を使う。 1
この区別は重要だ。「完全な均衡」という主張は、報告書が定義したルーティング問題における結果であり、実際のあらゆる本番ワークロードでトークンが完全に均等配分される保証ではない。
大規模MoEにはネットワーク上の課題もある。選ばれたトークンは、割り当てられたエキスパートがあるデバイスへ送らなければならないことが多い。特定のエキスパートに需要が偏れば、最も遅い通信経路がレイテンシを決める可能性がある。
Moonshotは、MoonEPをエキスパート並列通信のための補完的なシステム層として位置づける。疎なルーティングにより生じるall-to-all通信の不均衡を抑え、大規模なエキスパート群を学習・提供可能な状態に保つ役割を担う。 1
これはK3の広い主張の重要な部分である。アーキテクチャ、ルーティング、通信は、性能をそれぞれ独立して説明するものではない。理論上の疎な容量を実際のスループットへ変えるには、3者すべてが必要になる。
K3の二つ目の軸は、事前学習の後にある。Moonshotは、長期タスク、ツール利用、コーディング、ブラウジング、反復的な問題解決を含む強化学習(RL)の軌跡を扱うためのインフラを説明している。また、複数の領域・推論教師モデルを単一システムへ蒸留することも記載している。 1
その基盤となるのが、タスク環境を大規模に生成・スナップショット・再開できるよう設計された軽量仮想マシンのサンドボックスシステムだ。報告値は、5120万のサンドボックスインスタンス、スナップショット133ミリ秒、復元49ミリ秒である。 1
狙いは分かりやすい。モデルにテスト時コンピュートを多く使わせ、計画、ツール呼び出し、検証、長期タスクの継続をさせたいなら、学習側もそうした軌跡に触れさせる必要がある。環境を安価に停止・分岐・復元できれば、そのような学習ロールアウトをより多く実行しやすくなる。
もちろん、K3の単発の応答が自動的に無制限の推論計算を使うという意味ではない。むしろ報告書は、より大きい事前学習モデルだけに頼るのではなく、追加のステップとコンテキストをタスク性能の改善へ変換できるシステムを目指している。
Kimi K3は、長期の情報探索を対象とするベンチマーク**BrowseCompで91.2%**を記録したと報告されている。第三者のリーダーボードにも91.2%として掲載されているが、順位や測定設定は時間とともに変わり得る。 18
この結果は、長文脈、エージェント向け事後学習、テスト時推論を重視するモデルが、複雑な情報探索タスクで評価されるべきだという製品目標と整合する。しかし、これは個別要素のクリーンな切り分け実験ではない。
単一のベンチマークスコアからは、KDA、AttnRes、エキスパートルーティング、通信インフラ、RL環境、蒸留、プロンプト、推論時設定のどれがどの程度寄与したかは分からない。最も慎重で妥当な読み方は、報告されたシステムが統合スタックとして良好に機能したということだ。ひとつのアーキテクチャ上の新機軸だけが結果を説明した、と結論づけることはできない。 1
18
K3は、DeepSeek系を含む他の大規模なオープンモデルへの挑戦として語られることがある。ただし報告書から確実に読み取れるのは、オープンモデルの進歩について確定した順位表を示すことではない。
Moonshotが打ち出すのは、非常に大きな疎な容量、効率的な長文脈処理、そしてエージェントのための事後学習インフラを組み合わせる別の設計重点である。 1
17
論文はK3の仕様と設計選択を裏づけるが、それだけで他のオープンモデルが「停滞している」とは示さない。また、特定の競合モデルに対して決定的なアーキテクチャ上の優位性を単独で立証するものでもない。こうした市場全体の主張には、条件をそろえた独立再現可能な比較が必要だ。
トークン単価やタスク当たりのコストは、とりわけ過大解釈されやすい。プロンプト、推論の強さ、コンテキスト長、キャッシュ、ツール使用、スループット前提、価格改定時点、タスク実行環境によって変わる。
利用可能な資料にある比較のひとつは、完了タスク当たりのコストをK3が約0.94米ドル、GPT-5.6 Solが約1.04米ドルと見積もっている。この特定条件ではK3がわずかに有利である可能性を示すが、「Solの半額」という一般的な主張を裏づける数字ではない。 20
より堅実な結論はこうだ。K3は、長文脈かつエージェント的な能力を、さらに大きな総モデル規模で経済的に成立させようとする試みである。その優位性が実運用でどこまで実現するかは、再現可能な評価と、配備条件ごとのコスト算定にかかっている。
Kimi K3の技術報告書は、フルスタックのスケーリング論を提示している。配備前のスケールは、2.8兆パラメータのMoEとトークン当たり約1040億の活性化パラメータによって得る。配備後のスケールは、長文脈、ツール、推論ステップ、エージェント型ロールアウトを使えるよう訓練・提供することで得る。 1
17
KDA、Gated MLA、AttnRes、Stable LatentMoE、MoonEP、そしてRLサンドボックス基盤は、いずれも同じ命題の構成要素だ。すなわち、最先端級のエージェント能力には、より大きなモデルだけでなく、より多くの文脈と推論時の作業を実用可能にする設計が必要だという命題である。ベンチマークの主張はこの統合アプローチを支持する有望な材料だが、各要素の寄与を最終的に証明したものではなく、報告されたシステム全体の結果として読むべきだ。 1
18
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Kimi K3の主張は、事前学習段階でモデル容量を拡大することと、運用時に推論・ツール利用・長期タスクへ追加コンピュートを投じることを両立させる「二軸スケーリング」にある。
Kimi K3の主張は、事前学習段階でモデル容量を拡大することと、運用時に推論・ツール利用・長期タスクへ追加コンピュートを投じることを両立させる「二軸スケーリング」にある。 総パラメータは2.8兆、トークンごとの活性化パラメータは約1040億。MoEにより巨大な総容量を持ちながら、毎トークンで2.8兆すべてを計算する必要を避ける設計だ。
BrowseCompの91.2%は統合システムとしての有望な結果だが、個々のアーキテクチャ要素の寄与を単独で証明するものではない。コスト比較も設定依存で読む必要がある。