Kimi K3s hovedpåstand er at sterke AI systemer må skalere både kapasitet før utrulling og regnekraft under faktisk bruk. Modellen oppgis å ha 2,78 billioner parametere totalt, men aktiverer 104,2 milliarder parametere per token gjennom en MoE arkitektur.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AIs argument i Kimi K3-rapporten er i bunn og grunn todelt: AI-fremskritt krever både større modellkapasitet før utrulling og mer regnekraft ved inferens – altså når modellen løser faktiske oppgaver. Den første delen gir modellen mer kunnskap og flere mulige ferdigheter. Den andre lar den bruke disse ferdighetene over flere steg, gjennom resonnering, søk, verktøykall, koding og selvkorrigering. 1
K3 er konstruert for å gjøre begge skaleringsretningene økonomisk mulige. I stedet for å kjøre en tett modell med 2,78 billioner parametere for hvert token, bruker den en Mixture-of-Experts-arkitektur (MoE): modellen har 2,78 billioner parametere totalt, men aktiverer 104,2 milliarder per token. Det gir betydelig større lagret kapasitet uten at hver eneste genererte tekstbit får kostnaden til en tett 2,78-billionersmodell. K3 beskrives dessuten som naturlig multimodal og med et kontekstvindu på opptil én million token. 1
En viktig presisering er at rapporten hevder naturlig ekstrapolering til én million token, ikke 100 000. Treningen startet ved 8 000 token og ble senere utvidet til 64 000. K3 bruker ikke eksplisitte posisjonsinnleiringer; Moonshot argumenterer i stedet for at rekurrente porter og forfall i Kimi Delta Attention (KDA) bærer nok posisjonsinformasjon til å utvide konteksten uten å endre RoPE-posisjonering. 1
KDA erstatter mye av den kvadratiske oppmerksomhetsberegningen med en rekurrent tilstand med fast størrelse. I praktiske ord betyr det at tilstanden og dekodekostnaden per token ikke vokser med tidligere kontekst på samme måte som en full KV-cache gjør. Men Moonshot erstatter ikke global oppmerksomhet helt: arkitekturen veksler mellom tre KDA-lag og ett Gated MLA-lag. KDA skal gi billig, vedvarende behandling av sekvenser, mens MLA-lagene skal bevare evnen til selektivt å hente relevant informasjon på tvers av hele konteksten. 1
Den rapporterte nedre grensen for KDAs forfallsrate er heller ikke bare en modellidé. Den skal hindre numerisk problematiske, svært små forfall og muliggjøre blokkvise beregninger som passer bedre for tensor-kjerner i akseleratorer. 1
Med 93 lag kan en arkitektur med mye lineær oppmerksomhet risikere at nyttig informasjon blir for isolert i dybden. Derfor bruker K3 Attention Residuals (AttnRes). Ideen er at senere lag kan hente komprimerte representasjoner fra tidligere blokker i nettverket, fremfor at all relevant informasjon må sendes strengt fra ett lag til det neste.
Dette er rapportens argument for at mye dyr global oppmerksomhet kan erstattes av KDA uten at modellen mister for mye kvalitet: KDA håndterer effektiv sekvensbehandling, mens AttnRes gir en snarvei på tvers av nettverksdybden. 1
K3s Stable LatentMoE har 896 eksperter og velger de 16 mest relevante for hvert token. Det øker den betingede kapasiteten: ulike token kan bruke ulike deler av det enorme modellnettverket. Rapporten beskriver en kvantilbasert metode for å balansere rutingen som et balansert tildelingsproblem, med en eksakt optimumsløsning under modellens antakelser på batchnivå. Ved utrulling brukes imidlertid faste ekspertbiaser og vanlig topp-k-valg, ikke selve balanseringsløseren. 1
Det er en viktig nyanse. «Perfekt likevekt» gjelder resultatet for det spesifiserte rutingsproblemet, ikke en garanti for at hver eneste batch i reell drift blir perfekt balansert.
Kommunikasjonen mellom ekspertene blir også en flaskehals når modellen er så stor. MoonEP skal balansere all-til-all-kommunikasjonen som oppstår når token rutes ujevnt til eksperter. Poenget er operativt: Hvis nettverksforsinkelser og etterslep dominerer, blir en stor MoE-modell dyr og treg selv om bare en liten del av parameterne aktiveres per token. Arkitektur- og systemgrepene må derfor ses som utfyllende deler av samme påstand, ikke som uavhengige forklaringer på resultatene. 1
Rapportens andre hovedbudskap handler om hva modellen gjør etter at den er ferdig trent. Moonshot beskriver en flåte av lette virtuelle maskiner som kan produsere mange verifiserbare RL-forløp over lang tid. Øyeblikksbilder gjør det mulig å forgrene eller gjenoppta oppgaver billigere. Det skal gi treningsgrunnlag for modeller som bruker flere steg ved testtid – for eksempel planlegging, nettlesing, programmering, verktøykall og kontroll av eget arbeid – fremfor bare å svare fra en større, men statisk forhåndstrent modell. 1
Rapporten beskriver også destillering fra flere lærermodeller for domene- og resonneringsoppgaver til ett samlet system. Målet er å overføre spesialiserte ferdigheter uten å måtte kjøre ni separate modeller i produksjon. 1
K3 har 91,2 prosent på BrowseComp hos en tredjepartslederliste per 2. september 2026. BrowseComp er laget for å måle krevende, langvarig informasjonsinnhenting på nettet, ikke bare faktakunnskap modellen allerede har lært. En slik score støtter at systemet kan være sterkt i agentlignende nettsøk over flere steg. 4
Men en benchmarkscore er et resultat for hele systemet. Den forteller ikke hvor mye som skyldes KDA, AttnRes, MoE-ruting, MoonEP, RL-miljøene, destillering eller ekstra regnekraft ved testtid. For å fastslå det trengs replikerte ablasjonsstudier og sammenligninger der én komponent om gangen endres.
Den tekniske rapporten og kildene her dokumenterer ikke sikkert påstanden om at K3 koster «halvparten av GPT-5.6 Sol», eller at den ligger nøyaktig fire poeng bak «Claude Fable 5» på Kimi Code Bench til 38 prosent av kostnaden. Én sammenligning anslår i stedet kostnad per fullførte oppgave til omtrent 0,94 dollar for K3 og 1,04 dollar for GPT-5.6 Sol – ikke en forskjell på 50 prosent. 8
Slike tall avhenger uansett av oppsett, promptlengde, antall resonneringssteg, valgt modellmodus, prisliste og dato. Uten en offentlig evalueringstest og full kostnadsregnskap bør de behandles som betingede anslag, ikke som tidløse fasiter.
Den strategiske konklusjonen er dermed først og fremst arkitektonisk. Moonshot hevder at svært store, åpne modeller trenger en ny kombinasjon av modell- og systemdesign for å passere billion-parametergrensen og samtidig gjøre lang kontekst og agentisk inferens anvendelig. Rapporten underbygger denne visjonen med K3s design, men etablerer ikke alene bredere påstander om at andre åpne modeller har stagnert nær én billion parametere.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3s hovedpåstand er at sterke AI systemer må skalere både kapasitet før utrulling og regnekraft under faktisk bruk.
Kimi K3s hovedpåstand er at sterke AI systemer må skalere både kapasitet før utrulling og regnekraft under faktisk bruk. Modellen oppgis å ha 2,78 billioner parametere totalt, men aktiverer 104,2 milliarder parametere per token gjennom en MoE arkitektur.
KDA, Gated MLA, Attention Residuals, ekspertstyring og kommunikasjonssystemet MoonEP skal gjøre lang kontekst og stor betinget kapasitet mer praktisk å bruke.