Moonshot AI popisuje pokrok v AI jako škálování dvou zdrojů: kapacity modelu před nasazením a výpočetního výkonu využitého až při odpovědi. Kimi K3 má 2,78 bilionu parametrů celkem, ale na token aktivuje 104,2 miliardy parametrů; jde o architekturu MoE s kontextem až 1 milion tokenů.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI ve 47stránkové technické zprávě ke Kimi K3 nepředkládá jen tezi „větší model je lepší“. Její hlavní argument zní, že špičkový pokrok vyžaduje škálovat dvě navazující věci:
Architektura K3 má obě formy škálování zpřístupnit za přijatelnější cenu: model typu Mixture-of-Experts (MoE) uchovává mimořádně velkou celkovou kapacitu, ale pro každý token zapíná jen část parametrů. Současně má systémová infrastruktura zlevnit využití této kapacity v dlouhých agentních úlohách. 1
Kimi K3 je uváděn jako nativně multimodální MoE model s 2,78 bilionu parametrů celkem a 104,2 miliardy aktivních parametrů na token. Podporuje kontextové okno až 1 milion tokenů. 1
To je podstata kompromisu MoE: model může mít velmi rozsáhlou celkovou kapacitu, aniž by při každém generovaném tokenu prováděl výpočet odpovídající hustému modelu o 2,78 bilionu parametrů. I aktivních 104,2 miliardy je ovšem velmi vysoká hodnota; nejde o levný model v běžném smyslu, ale o snahu oddělit celkovou kapacitu od výpočetní ceny jednoho kroku inference.
Zpráva zároveň mluví o nativní extrapolaci až k 1 milionu tokenů, nikoli o 100 tisících. Trénink začíná na délce 8 tisíc tokenů a později přechází na 64 tisíc tokenů. Model nepoužívá explicitní poziční embeddingy; Moonshot tvrdí, že poziční informaci pro extrapolaci zachycují rekurentní brány a útlum v KDA, bez úprav RoPE. 1
Kimi Delta Attention (KDA) nahrazuje velkou část kvadratické pozornosti rekurentním stavem pevné velikosti. Prakticky to znamená, že stav na token a náklady při dekódování nerostou s předchozím kontextem stejným způsobem jako u plné KV cache.
Moonshot střídá tři vrstvy KDA s jednou vrstvou Gated MLA, tedy v poměru 3:1. KDA má zajišťovat levné průběžné zpracování sekvence, zatímco Gated MLA doplňuje selektivní globální vyhledávání relevantních informací v kontextu. 1
Zpráva také uvádí dolní mez rychlosti útlumu v KDA. Nejde jen o změnu modelovacího chování: má bránit numericky problematickým velmi malým hodnotám útlumu a umožnit blokový výpočet vhodný pro tensorová jádra. 1
Další prvek, Attention Residuals neboli AttnRes, má řešit riziko, že se velmi hluboká síť s převahou lineární pozornosti začne informačně izolovat po jednotlivých vrstvách. Pozdější vrstvy mohou získávat komprimované reprezentace z dřívějších bloků hloubky, místo aby se každá užitečná informace musela předávat výhradně vrstvu po vrstvě.
V 93vrstvé síti tak vzniká cesta pro vyhledávání informací napříč hloubkou. Deklarovaným cílem je zachovat kvalitu při nahrazení značné části dražší globální pozornosti KDA. 1
MoE uspořádání K3 používá 896 expertů a pro token volí 16 expertů. Tím zvyšuje podmíněnou kapacitu modelu: různé tokeny a úlohy mohou využívat různé specializované části sítě. 1
Metoda Stable LatentMoE pracuje s vyvažováním směrování tokenů k expertům jako s úlohou vyváženého přiřazování. Zpráva odvozuje přesné optimum za svých předpokladů na úrovni dávky. Při nasazení však router nepouští vyvažovací řešič znovu: pracuje s pevnými biasy expertů a běžným výběrem top-k. 1
Proto je vhodné číst tvrzení o „dokonalé rovnováze“ opatrně. Jde o výsledek pro popsanou optimalizační úlohu, ne o příslib, že každá skutečná produkční dávka bude dokonale vyvážená.
Důležitou roli má také MoonEP, systém pro expert-paralelní komunikaci. Velký MoE je ekonomický jen tehdy, pokud se tokeny mohou dostat ke zvoleným expertům, aniž by latenci začaly určovat síťové prodlevy a nejpomalejší uzly. MoonEP má vyvažovat all-to-all komunikaci, kterou vyvolává nerovnoměrná poptávka po expertech. 1
Architektura a systémová vrstva se tedy nedají rozumně oddělit: samotných 896 expertů by bez efektivního směrování a komunikace automaticky neznamenalo prakticky použitelný model.
Zpráva spojuje modelovou kapacitu s post-tréninkovou přípravou na náročnější inferenci. Flotila odlehčených virtuálních sandboxů má umožnit vytvářet mnoho ověřitelných trajektorií pro reinforcement learning (RL), včetně dlouhodobých úloh. Snímky stavu mají zlevnit větvení a obnovování běhů. 1
To vytváří tréninkový základ pro systém, který může při reálné úloze investovat více kroků do plánování, prohlížení webu, psaní kódu, volání nástrojů a sebekontroly – namísto spoléhání výhradně na větší, ale jednorázově použitý předtrénovaný model.
Moonshot dále popisuje destilaci více učitelů zaměřených na různé domény a typy uvažování do jediného systému. Smyslem je přenést specializované chování, aniž by bylo nutné v provozu obsluhovat devět samostatných modelů. 1
Kimi K3 dosahuje v aktuálním žebříčku BrowseCompu 91,2 %. BrowseComp měří chování při webovém výzkumu a vyhledávání informací v náročnějších dlouhodobých úlohách; takový výsledek proto podporuje tvrzení, že systém je silný právě v agentním získávání informací. 4
Samotné skóre ale neizoluje vliv jednotlivých součástí. Neříká, jaký podíl na výsledku mají KDA, AttnRes, MoE router, komunikační vrstva, RL prostředí, destilace nebo dodatečný výpočet při inferenci. Je to výsledek celého systému, nikoli samostatný důkaz účinnosti každé komponenty.
Z dostupné technické zprávy ani z vysoce autoritativního nezávislého zdroje nelze ověřit přesné tvrzení, že by K3 stál „polovinu ceny GPT-5.6 Sol“, ani tvrzení o přesně čtyřbodové ztrátě za „Claude Fable 5“ v Kimi Code Bench při 38 % nákladů.
Jedno z citovaných srovnání naopak uvádí odhadované náklady na dokončený úkol zhruba 0,94 USD pro K3 a 1,04 USD pro GPT-5.6 Sol – tedy rozdíl, který rozhodně neodpovídá poloviční ceně. 8 Taková čísla závisejí na konfiguraci, promtech, délce výstupu, cenách v daném období i metodice započítání nákladů. Bez zveřejněného evaluačního harnessu a úplného nákladového účetnictví je nelze brát jako univerzální srovnání.
Strategický vzkaz Kimi K3 je spíše architektonický než čistě cenový. Moonshot AI tvrdí, že otevřené modely potřebují nový společný návrh modelu a systémů, aby překročily hranici bilionových parametrů a proměnily dlouhý kontext i agentní inferenci v prakticky použitelnou schopnost.
Technická zpráva tak nestaví proti sobě „větší model“ a „více uvažování při odpovědi“. Tvrdí, že jde o komplementární zdroje: obří MoE kapacita má rozšířit potenciál modelu a efektivní architektura, infrastruktura pro RL i nástroje mají umožnit tento potenciál skutečně využít. Tvrzení o tom, že otevřené modely obecně stagnují poblíž 1 bilionu parametrů nebo že K3 překonává konkrétní modely, však samotná zpráva na dostupných důkazech neprokazuje.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Moonshot AI popisuje pokrok v AI jako škálování dvou zdrojů: kapacity modelu před nasazením a výpočetního výkonu využitého až při odpovědi.
Moonshot AI popisuje pokrok v AI jako škálování dvou zdrojů: kapacity modelu před nasazením a výpočetního výkonu využitého až při odpovědi. Kimi K3 má 2,78 bilionu parametrů celkem, ale na token aktivuje 104,2 miliardy parametrů; jde o architekturu MoE s kontextem až 1 milion tokenů.
Hybridní pozornost KDA a Gated MLA, Attention Residuals, řízení expertů a komunikační systém MoonEP mají snížit náklady na využití této kapacity.