Moonshot AI's hovedpåstand er, at avancerede AI systemer skal skaleres på to fronter: større kapacitet før lancering og mere beregning til ræsonnement, værktøjer og agentopgaver, når modellen bruges. Kimi K3 har 2,8 billioner parametre, men aktiverer omkring 104 mia.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI fremstiller Kimi K3 som et bud på skalering i to retninger: Først bygges en markant større model, og derefter får den tilstrækkelig beregningskraft under brug til at ræsonnere, anvende værktøjer, browse, kode og rette egne fejl. Den afgørende udfordring er økonomien. En model kan ikke bare gøres tættere og dybere, hvis prisen for at betjene lange kontekster gør funktionerne upraktiske. K3 er derfor designet til at løfte den samlede kapacitet, mens beregnings- og hukommelsesforbruget pr. genereret token holdes nede. 1
Kimi K3 beskrives som en multimodal mixture-of-experts-model (MoE) med 2,8 billioner parametre i alt, cirka 104 mia. aktiverede parametre pr. token og et kontekstvindue på op til 1 mio. tokens. 1
17
De to parametertal dækker over vidt forskellige ting:
Det er den praktiske styrke ved MoE-arkitekturen: K3 kan være langt større samlet set end en tæt model med nogenlunde samme beregningsforbrug pr. token. Det gør ikke driften billig – 104 mia. aktive parametre er stadig meget – men modellen undgår at betale inferensprisen for et tæt netværk på 2,8 billioner parametre ved hvert token. 1
Moonshots pointe er dermed ikke blot, at flere parametre altid er bedre. Argumentet er, at betinget beregning kan gøre en ny størrelsesorden af modelkapacitet brugbar til lange, sammenhængende opgaver.
En kontekst på en million tokens er svær, ikke kun i træningen, men også fordi almindelig attention kan få hukommelsesforbrug og beregning til at vokse kraftigt med sekvensens længde. K3 anvender en hybridarkitektur, der kombinerer Kimi Delta Attention (KDA) med Gated Multi-head Latent Attention (Gated MLA). Ifølge rapporten består rygraden af 69 KDA-lag og 24 Gated MLA-lag, hovedsageligt i et mønster med tre KDA-lag for hvert MLA-lag. 1
12
KDA er modellens komponent for lineær attention. I stedet for at fastholde en traditionelt voksende key-value-cache gennem hele historikken i hvert sådant lag bruger den en tilbagevendende tilstand af fast størrelse. Den tilsigtede gevinst er, at hukommelsestilstanden og arbejdet med at afkode nye tokens ikke vokser med den foregående kontekst på samme måde som ved fuld attention. 1
Rapporten beskriver også en nedre grænse for KDA's henfaldsrate. Det er ikke kun et modelvalg: Grænsen forhindrer ekstremt små henfaldsværdier, som er problematiske i effektiv numerisk beregning, og muliggør en blokbaseret implementering, der passer til tensor cores på GPU'er. 1
Lineær recurrence alene giver ikke nødvendigvis samme evne til selektivt at slå noget op i hele konteksten som attention over den fulde tekst. Derfor beholder K3 Gated MLA-lag gennem netværket. I den beskrevne hybrid leverer KDA billig, vedvarende behandling af sekvensen, mens MLA med mellemrum giver global genfinding af relevant information. 1
Det bemærkelsesværdige er, at designet behandler lang kontekst som et systemproblem såvel som et arkitekturproblem. Et stort annonceret kontekstvindue har først for alvor værdi, når modellen fortsat kan finde relevant information og generere svar til en anvendelig pris.
K3's anden arkitekturkomponent er Attention Residuals (AttnRes). Modellen har 93 lag, og rapporten anvender AttnRes, så sene lag kan hente komprimerede repræsentationer fra tidligere dybdeblokke i stedet for at tvinge al information til at bevæge sig strengt ét lag ad gangen. 1
Forenklet sagt handler KDA om informationsflow på tværs af sekvenslængden, mens AttnRes handler om informationsflow på tværs af dybden i modellen. Det er væsentligt i en dyb model, hvor store dele af stakken bruger lineær attention: Det hjælper kun at erstatte dyr global attention, hvis nyttig information ikke går tabt eller isoleres, når aktiveringer passerer gennem netværket. 1
K3's MoE-lag bruger ifølge rapporten 896 routede eksperter og vælger 16 eksperter pr. token. 1
6 Det er mekanismen bag den store forskel mellem samlede og aktiverede parametre.
Rapportens Stable LatentMoE-metode fokuserer på at holde routingen stabil og balanceret. Den betragter fordelingen af eksperter på batchniveau som et optimeringsproblem og indfører kvantilbaseret balancering. Rapporten udleder et eksakt optimum under sine angivne forudsætninger. Ved drift bruger routingen imidlertid faste ekspert-bias og almindelig top-k-udvælgelse frem for at løse balanceringsproblemet på ny for hver inferensbatch. 1
Den forskel er vigtig. Et påstået optimalt ligevægtspunkt gælder rapportens routingformulering – det er ikke en garanti for, at tokens i enhver reel produktionsopgave fordeles helt jævnt mellem eksperterne.
Store MoE-modeller skaber et netværksproblem: Udvalgte tokens skal ofte sendes mellem enheder for at nå de eksperter, de er tildelt. Hvis nogle eksperter får uforholdsmæssigt stor efterspørgsel, kan den langsomste kommunikationsvej bestemme svartiden.
Moonshot placerer MoonEP som systemlaget, der supplerer ekspertparallel kommunikation. Formålet er at reducere ubalance i den all-to-all-kommunikation, som den sparsomme routing skaber, så den store ekspertpulje kan trænes og betjenes i praksis. 1
Det er en central del af K3's bredere påstand. Arkitektur, routing og kommunikation kan ikke vurderes som helt uafhængige forklaringer på ydelsen; modellen har brug for alle tre for at omsætte teoretisk sparsom kapacitet til reel gennemløbshastighed.
Den anden akse i K3's strategi handler om, hvad der sker efter prætræningen. Moonshot beskriver infrastruktur til reinforcement learning-forløb med langvarige opgaver, værktøjer, kodning, browsing og iterativ problemløsning. Rapporten beskriver også destillation af flere domæne- og ræsonnementsmodeller til ét samlet system. 1
Det understøttende miljø er et letvægts-sandkassesystem med virtuelle maskiner, udviklet til at oprette, gemme øjebliksbilleder af og genoptage opgavemiljøer i stor skala. De rapporterede tal er 51,2 mio. sandkasseinstanser, 133 ms for snapshots og 49 ms for gendannelse. 1
Det strategiske formål er enkelt: Hvis en model skal bruge mere beregning ved svartid på at planlægge, kalde værktøjer, kontrollere sit arbejde eller fortsætte en lang opgave, skal træningen også udsætte den for den type forløb. Når miljøer kan sættes på pause, forgrenes og gendannes billigt, bliver flere sådanne træningsforløb mulige.
Det betyder ikke, at et enkelt modelsvar automatisk får ubegrænset beregningskraft. K3-rapporten argumenterer derimod for et system, som kan omsætte ekstra skridt og mere kontekst til bedre opgaveløsning i stedet for alene at være afhængigt af en større prætrænet model.
Kimi K3 opgives til 91,2 % på BrowseComp, en benchmark rettet mod langvarig informationssøgning. En tredjepartsrangliste anfører også K3 til 91,2 %, selv om placeringer og evalueringsopsætninger kan ændre sig over tid. 18
Resultatet passer med produktmålet: En model, der er designet til lang kontekst, agentisk eftertræning og ræsonnement ved svartid, bør vurderes på komplekse opgaver med informationssøgning. Men det er ikke en ren isoleret test af de enkelte komponenter.
En enkelt benchmarkscore kan ikke fortælle, hvor stor en del af resultatet der skyldes KDA, AttnRes, ekspertrouting, kommunikationsinfrastruktur, RL-miljøer, destillation, prompting eller inferensindstillinger. Den stærkeste tolkning er, at det rapporterede system klarer sig godt som en integreret helhed – ikke at én arkitektonisk innovation alene forklarer scoren. 1
18
K3 omtales ofte som en udfordrer til andre store åbne modeller, herunder DeepSeek-systemer. Den holdbare konklusion fra rapporten er ikke en endeligt afgjort rangliste over åbne modellers udvikling, men en anden designprioritet: Moonshot argumenterer for en samlet stak af meget stor sparsom kapacitet, effektiv behandling af lange kontekster og eftertræningsinfrastruktur til agenter. 1
17
Artiklen understøtter selv K3's specifikationer og designvalg. Den dokumenterer ikke i sig selv, at andre åbne modeller er gået i stå, og den isolerer heller ikke en afgørende arkitektonisk fordel over for en navngiven konkurrent. Det er bredere markedspåstande, der kræver ensartede og uafhængigt reproducerede sammenligninger.
Sammenligninger af pris pr. token eller pr. opgave er særligt lette at overfortolke. De kan afhænge af prompt, ræsonnementsniveau, kontekstlængde, caching, værktøjsbrug, antagelser om gennemløbshastighed, prisdato og testmiljø.
En offentliggjort sammenligning i det tilgængelige materiale anslår prisen pr. afsluttet opgave til cirka 0,94 dollar for K3 og 1,04 dollar for GPT-5.6 Sol. Det kan pege på en beskeden fordel i netop den opsætning, men det underbygger ikke en generel påstand om, at K3 koster det halve af Sol. 20
Den mindre dramatiske, men mere holdbare konklusion er, at K3 er et forsøg på at gøre lang kontekst og agentisk funktionalitet økonomisk troværdig i en langt større modelskala. Om fordelen holder i praksis, afhænger af reproducerbare evalueringer og omkostningsregnskaber for den konkrete drift.
Kimi K3's tekniske rapport argumenterer for skalering af hele systemet. Skala før lancering kommer fra en MoE-model på 2,8 billioner parametre, hvor cirka 104 mia. parametre aktiveres pr. token. Skala efter lancering kommer fra at træne og betjene en model, der kan bruge lang kontekst, værktøjer, ræsonnementstrin og agentiske forløb. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP og RL-infrastrukturen med sandkasser er dele af samme idé: AI-systemer på frontniveau kræver ikke blot en større model, men et design, der gør mere kontekst og mere beregning ved inferens anvendelig. Benchmarkresultaterne er lovende tegn for den integrerede tilgang, men de bør læses som rapporterede systemresultater – ikke som endeligt bevis for hver enkelt komponents bidrag. 1
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Moonshot AI's hovedpåstand er, at avancerede AI systemer skal skaleres på to fronter: større kapacitet før lancering og mere beregning til ræsonnement, værktøjer og agentopgaver, når modellen bruges.
Moonshot AI's hovedpåstand er, at avancerede AI systemer skal skaleres på to fronter: større kapacitet før lancering og mere beregning til ræsonnement, værktøjer og agentopgaver, når modellen bruges. Kimi K3 har 2,8 billioner parametre, men aktiverer omkring 104 mia. pr.
Prisudsagn bør læses med varsomhed: En offentlig sammenligning anslår cirka 0,94 dollar pr.