Kimi K3 staví na dvou typech škálování: na větší kapacitě modelu před nasazením a na větším množství výpočtů pro uvažování, nástroje a dlouhé agentní úlohy při používání. Model má 2,8 bilionu parametrů celkem, ale pro jeden token aktivuje zhruba 104 miliard parametrů.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI představuje Kimi K3 jako sázku na škálování ve dvou osách. První osou je výrazně větší model před nasazením. Druhou je dostatek výpočetního výkonu při samotném použití, aby model mohl déle uvažovat, používat nástroje, procházet web, psát kód a opravovat vlastní chyby.
Nejde přitom jen o co nejvyšší počet parametrů. Hlavním problémem je ekonomika provozu: velmi velký model musí zůstat použitelný i pro dlouhý kontext a vícefázové úlohy. K3 má proto navyšovat celkovou kapacitu, ale omezovat výpočetní a paměťové nároky na každý generovaný token. 1
Kimi K3 je nativně multimodální model typu Mixture-of-Experts (MoE). Moonshot uvádí 2,8 bilionu parametrů celkem, přibližně 104 miliard aktivovaných parametrů na token a kontextové okno až jeden milion tokenů. 1
17
Tato dvě čísla popisují odlišné věci:
To je praktický smysl MoE. K3 může mít v souhrnu mnohem větší kapacitu než hustý model s podobnou výpočetní stopou na token, aniž by při každém kroku musel počítat přes celý 2,8bilionový model. Provoz rozhodně není levný — 104 miliard aktivních parametrů je stále velmi vysoké číslo — ale náklady neodpovídají husté síti o 2,8 bilionu parametrů. 1
Moonshot tedy netvrdí pouze, že „více parametrů je lepší“. Jeho teze zní, že podmíněný výpočet může učinit novou úroveň kapacity prakticky použitelnou i v dlouhých úlohách.
Kontext o milionu tokenů je náročný nejen při tréninku. U běžné attention se s rostoucí délkou sekvence kumulují paměťové i výpočetní náklady. K3 proto kombinuje Kimi Delta Attention (KDA) a Gated Multi-head Latent Attention (Gated MLA). Uváděná skladba páteře modelu je 69 vrstev KDA a 24 vrstev Gated MLA, převážně ve vzoru tři vrstvy KDA na jednu vrstvu MLA. 1
12
KDA je lineární složka attention. Namísto klasické rostoucí cache klíčů a hodnot pro celou historii používá v těchto vrstvách rekurentní stav pevné velikosti. Zamýšleným přínosem je, že paměťový stav i práce při dekódování nerostou s předchozím kontextem stejným způsobem jako u plné attention. 1
Report dále popisuje dolní mez rychlosti vyhasínání v KDA. Nejde jen o modelovací volbu: má zabránit extrémně malým hodnotám, které komplikují efektivní numerické výpočty, a umožnit blokovou implementaci vhodnou pro tensorová jádra GPU. 1
Lineární rekurence sama o sobě nemusí nabídnout stejně přesné selektivní vyhledávání napříč celým kontextem jako plná attention. K3 proto ponechává vrstvy Gated MLA v celé síti. V hybridním návrhu KDA zajišťuje levnější průběžné zpracování a MLA periodicky obnovuje možnost globálního vyhledávání relevantních informací. 1
To je důležité i z praktického hlediska. Velké kontextové okno má hodnotu tehdy, když model dokáže relevantní informace z dlouhé historie nejen uchovat, ale také najít — a přitom generovat odpověď za použitelnou cenu.
Druhou architektonickou složkou jsou Attention Residuals (AttnRes). K3 má 93 vrstev a AttnRes má pozdějším vrstvám umožnit získávat komprimované reprezentace z dřívějších hloubkových bloků, místo aby vše muselo postupovat jen vrstvu po vrstvě. 1
Zjednodušeně: KDA řeší tok informací podél délky vstupní sekvence, zatímco AttnRes řeší tok informací podél hloubky modelu. V hluboké síti, kde velkou část stacku tvoří lineární attention, je to podstatné. Nahrazení drahé globální attention pomůže jen tehdy, pokud se užitečné informace cestou vrstvami neztratí nebo neodříznou. 1
MoE vrstva K3 podle reportu používá 896 směrovaných expertů a pro každý token vybírá 16 expertů. 1
6 Právě tento mechanismus vytváří rozdíl mezi celkovým a aktivním počtem parametrů.
Přístup nazvaný Stable LatentMoE se soustředí na stabilní a vyvážené směrování tokenů mezi experty. Rozdělení expertů na úrovni dávky formuluje jako optimalizační problém a zavádí vyvažování založené na kvantilech. Report za svých předpokladů odvozuje přesné optimum; při nasazení se však nepřepočítává optimalizace pro každou inferenční dávku. Router používá pevné biasy expertů a běžný výběr top-k. 1
To je důležitá nuance: „dokonalá rovnováha“ je teoretický výsledek pro danou formulaci směrování, ne záruka, že každý produkční provoz rozdělí tokeny mezi experty dokonale rovnoměrně.
U velkých MoE vzniká i síťový problém. Vybrané tokeny je často nutné přenést mezi zařízeními, aby se dostaly k přiděleným expertům. Pokud je poptávka po některých expertech nevyrovnaná, latenci může určovat nejpomalejší komunikační cesta.
Moonshot za doplňkovou systémovou vrstvu označuje MoonEP, určenou pro expert-paralelní komunikaci. Jejím úkolem je omezovat nerovnováhu v komunikaci typu all-to-all, kterou řídké směrování vyvolává, a pomoci tak velký fond expertů trénovat i obsluhovat v praxi. 1
Architektura, routing a komunikace zde nejsou nezávislé části příběhu. Model potřebuje všechny tři, aby se teoretická řídká kapacita proměnila ve skutečnou propustnost.
Druhá část strategie K3 začíná po pretrénování. Moonshot popisuje infrastrukturu pro trajektorie reinforcement learningu u dlouhých úloh zahrnujících nástroje, programování, procházení webu a iterativní řešení problémů. Report také uvádí destilaci více učitelů pro doménové a rozumové schopnosti do jednoho systému. 1
Podpůrné prostředí tvoří lehký sandbox s virtuálními stroji, navržený pro hromadné vytváření, ukládání snímků a obnovování úkolových prostředí. Uváděná čísla jsou 51,2 milionu sandboxových instancí, snímek za 133 ms a obnova za 49 ms. 1
Smysl je přímočarý: má-li model při inferenci věnovat více kroků plánování, volání nástrojů, ověřování výsledků či pokračování v dlouhém úkolu, musí se s podobnými trajektoriemi setkávat už při tréninku. Levné pozastavení, větvení a obnovení prostředí umožňuje vytvořit více takových tréninkových rolloutů.
Neznamená to, že každá odpověď automaticky dostane neomezený výpočetní rozpočet. Teze reportu je spíše taková, že systém má umět proměnit další kroky a další kontext v lepší výkon — místo aby spoléhal výhradně na větší předtrénovaný model.
Pro Kimi K3 je uváděno 91,2 % v benchmarku BrowseComp, který se zaměřuje na dlouhodobé vyhledávání a zpracování informací. Stejnou hodnotu uvádí i leaderboard třetí strany, přičemž pořadí a konfigurace reportování se mohou v čase měnit. 18
Výsledek odpovídá zaměření produktu: model navržený pro dlouhý kontext, agentní post-training a uvažování při inferenci dává smysl hodnotit na komplexních úlohách hledání informací. Nejde však o čistou ablační studii jednotlivých součástí.
Jediné skóre benchmarku neřekne, jak velkou část výsledku přinesly KDA, AttnRes, routing expertů, komunikační infrastruktura, RL sandboxy, destilace, prompting nebo konkrétní nastavení inference. Nejsilnější výklad tedy zní: reportovaný integrovaný systém funguje dobře — nikoli že výsledek vysvětluje jedna architektonická novinka. 1
18
Cena za token i cena za dokončenou úlohu se snadno přeceňují. Liší se podle promptu, intenzity uvažování, délky kontextu, cachování, používání nástrojů, předpokladů propustnosti, data ceníku i samotného vyhodnocovacího scénáře.
Jedno publikované srovnání odhaduje náklady na dokončený úkol zhruba na 0,94 USD pro K3 a 1,04 USD pro GPT-5.6 Sol. Může to ukazovat mírnou výhodu v konkrétním nastavení, ale nepodporuje to obecné tvrzení, že K3 stojí polovinu oproti Sol. 20
Trvalejší závěr je méně efektní, ale užitečnější: K3 je pokus učinit dlouhý kontext a agentní schopnosti ekonomicky věrohodnými při výrazně větším celkovém měřítku modelu. Zda se tato výhoda potvrdí v praxi, bude záviset na reprodukovatelných evaluacích a na účtování nákladů pro konkrétní nasazení.
Technický report Kimi K3 nabízí argument pro škálování celého stacku. Škálování před nasazením přináší MoE model s 2,8 bilionu parametrů a zhruba 104 miliardami aktivovaných parametrů na token. Škálování po nasazení znamená trénovat a provozovat model, který umí zužitkovat dlouhý kontext, nástroje, dodatečné kroky uvažování a agentní rollouty. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP i infrastruktura RL sandboxů jsou části jedné teze: špičkové agentní chování nevyžaduje jen větší model, ale také návrh, díky němuž jsou více kontextu a více inferenční práce skutečně použitelné. Benchmarkové výsledky jsou slibným dokladem tohoto integrovaného přístupu, nikoli definitivním důkazem přínosu každé jednotlivé komponenty. 1
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3 staví na dvou typech škálování: na větší kapacitě modelu před nasazením a na větším množství výpočtů pro uvažování, nástroje a dlouhé agentní úlohy při používání.
Kimi K3 staví na dvou typech škálování: na větší kapacitě modelu před nasazením a na větším množství výpočtů pro uvažování, nástroje a dlouhé agentní úlohy při používání. Model má 2,8 bilionu parametrů celkem, ale pro jeden token aktivuje zhruba 104 miliard parametrů.
Výsledek 91,2 % v benchmarku BrowseComp je slibný systémový výsledek, nikoli důkaz přínosu jedné konkrétní techniky.