Kimi K3’s hovedpointe er, at AI fremskridt kræver skalering af både modelkapacitet før udrulning og beregning efter udrulning. MoE designet rummer 2,78 billioner parametre, men aktiverer 104,2 mia.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI’s centrale argument med Kimi K3 er, at AI-kapabilitet skal skaleres på to komplementære akser:
K3’s arkitektur er designet til at gøre begge dele mere overkommelige. Modellen er en multimodal Mixture-of-Experts-model (MoE) med 2,78 billioner parametre i alt, men kun 104,2 mia. aktive parametre pr. token. Ideen er dermed at få meget af kapaciteten fra en ekstremt stor model uden at betale beregningsprisen for en tæt model med 2,78 billioner parametre for hvert token. 1
Rapporten angiver en kontekstlængde på op til 1 million tokens. Træningen begynder ved 8.000 tokens og udvides senere til 64.000 tokens. K3 bruger ikke eksplicitte positionsindlejringer; Moonshot AI argumenterer i stedet for, at KDA’s tilbagevendende gates og henfaldsmekanismer bærer tilstrækkelig positionsinformation til at ekstrapolere til langt længere kontekster uden ændringer af RoPE. 1
Det er vigtigt for argumentet om inferensberegning: En agent, der skal undersøge et komplekst emne, planlægge over mange trin eller håndtere et stort kodeprojekt, har ikke kun brug for en stærk model. Den skal også kunne bevare og arbejde med meget information over lang tid.
Kimi Delta Attention (KDA) erstatter størstedelen af den kvadratiske attention med en tilbagevendende tilstand af fast størrelse. Det betyder, at tilstanden og afkodningsomkostningen pr. token ikke vokser lineært med hele den forudgående kontekst, sådan som en fuld KV-cache gør.
K3 blander tre KDA-lag med ét Gated MLA-lag. KDA skal levere vedvarende, billig sekvensbehandling, mens MLA-laget genindfører mulighed for selektiv global hentning af information. 1
Rapportens nedre grænse for KDA’s henfaldsrate er ikke kun en modelleringsdetalje. Den skal forhindre numerisk problematiske, meget små henfaldsværdier og muliggøre en blokeret beregning, der passer bedre til tensor-kerner. 1
K3 har 93 lag, og en stor del af dem anvender den billigere, lineære attention-variant. Attention Residuals, eller AttnRes, skal modvirke, at information bliver isoleret i en sådan meget dyb stak.
Mekanismen giver senere lag mulighed for at hente komprimerede repræsentationer fra tidligere dybdeblokke. Modellen behøver altså ikke overføre al relevant information strengt lag for lag. Moonshot AI’s påstand er, at dette bevarer kvaliteten, samtidig med at en stor del af dyr global attention kan erstattes af KDA. 1
På modelkapacitetsaksen bruger K3 en MoE-struktur med 896 eksperter og top-16-routing. Det øger den betingede kapacitet: forskellige tokens kan sendes til forskellige dele af modellen.
Rapporten beskriver en kvantilbaseret balancering af routingen som et balanceret tildelingsproblem med en eksakt optimumsløsning under de angivne antagelser på batchniveau. Ved udrulning anvender routeren dog faste ekspertbiaser og almindeligt top-k-valg – ikke balanceringsløseren direkte ved hver inferens. 1
Det er derfor værd at læse formuleringen om “perfekt ligevægt” med præcision: Den gælder det beskrevne routing-optimeringsproblem og er ikke en garanti for, at enhver virkelig produktionsbatch fordeles perfekt mellem eksperter.
En MoE-model er kun økonomisk, hvis tokens kan flyttes til de valgte eksperter uden, at ujævn netværkstrafik skaber flaskehalse. MoonEP skal balancere den all-to-all-kommunikation, som opstår, når ekspertbehovet varierer mellem tokens. Dermed er systemdesignet en nødvendig del af argumentet for, at en model med 896 eksperter kan trænes og serveres i stor skala. 1
Arkitektur og infrastruktur bør dog ikke ses som uafhængige forklaringer på benchmarkgevinster. De er dele af det samme ende-til-ende-system.
Rapportens posttræningsdel knytter modellen til en bredere tese om inferensberegning. En flåde af letvægts-VM-sandkasser skal gøre det muligt at producere mange verificerbare RL-forløb med lang horisont og at forgrene eller genoptage dem billigt via snapshots. 1
Det giver træningsgrundlag for en model, der ved brug kan anvende flere trin på planlægning, browsing, kodning, værktøjskald og korrektion af egne fejl. Pointen er ikke blot at gøre en fastfrosset, større grundmodel stærkere, men at træne et system til at udnytte mere beregning, når opgaven kræver det. Rapporten beskriver også destillation fra flere domæne- og ræsonneringslærere til ét samlet system, så specialiseret adfærd kan overføres uden at skulle afvikle ni separate modeller. 1
K3 står til 91,2 % på BrowseComp på en aktuel tredjepartsrangliste, mens GPT-5.6 Sol står til 92,2 %. BrowseComp måler webresearch og langvarig informationssøgning, så resultatet understøtter, hvis det kan reproduceres, påstanden om stærk agentisk informationssøgning. 4
Men et benchmarktal kan ikke alene vise, hvor meget der skyldes KDA, AttnRes, MoE-routing, RL-miljøer, destillation eller ekstra beregning ved testtid. Det er et samlet resultat for hele systemet.
De præcise påstande om, at K3 skulle koste “halvdelen af GPT-5.6 Sol”, eller at modellen skulle ligge præcist fire point efter “Claude Fable 5” til 38 % af prisen, kan ikke bekræftes i den tekniske rapport eller af en uafhængig kilde med høj autoritet i materialet her.
En citeret sammenligning anslår i stedet en pris pr. fuldført opgave på cirka 0,94 dollar for K3 mod 1,04 dollar for GPT-5.6 Sol. Det er ikke tæt på en forskel på 50 %. 8 Sådanne sammenligninger afhænger under alle omstændigheder af opsætning, prompts, prisdato og af, hvad der tælles med i det samlede regnskab.
Den strategiske pointe i K3-rapporten er derfor først og fremmest arkitektonisk: Moonshot AI argumenterer for, at modeller over billion-parameterniveauet og brugbar agentisk inferens kræver en samlet stak af modeldesign, routing, kommunikation og posttræning – ikke kun flere parametre eller lavere API-priser.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3’s hovedpointe er, at AI fremskridt kræver skalering af både modelkapacitet før udrulning og beregning efter udrulning.
Kimi K3’s hovedpointe er, at AI fremskridt kræver skalering af både modelkapacitet før udrulning og beregning efter udrulning. MoE designet rummer 2,78 billioner parametre, men aktiverer 104,2 mia. pr.
KDA, Gated MLA, Attention Residuals, ekspert routing og kommunikationssystemet MoonEP skal gøre meget lang kontekst og stor modelkapacitet praktisk anvendelig.