Kimi K3 koppelt twee vormen van schaalvergroting: meer modelcapaciteit vóór uitrol en meer rekenwerk tijdens gebruik voor redeneren, tools en agentische taken. De Mixture of Experts architectuur telt 2,78 biljoen parameters, maar activeert gemiddeld 104,2 miljard parameters per token.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI presenteert Kimi K3 als een argument voor twee complementaire vormen van schaalvergroting. Aan de ene kant is er capaciteit vóór uitrol: een groter model kan meer kennis en vaardigheden opslaan. Aan de andere kant is er rekentijd ná uitrol: het systeem moet tijdens gebruik extra stappen kunnen zetten voor lang redeneren, programmeren, browsen, toolgebruik en zelfcorrectie. K3 is ontworpen om beide betaalbaarder te maken. 1
Kimi K3 is volgens het rapport een native multimodaal Mixture-of-Experts-model (MoE) met 2,78 biljoen parameters in totaal, waarvan 104,2 miljard parameters per token actief zijn. Het ondersteunt een contextvenster van maximaal 1 miljoen tokens. 1
Dat onderscheid is cruciaal. De 2,78 biljoen parameters vormen de totale capaciteit van het model, maar een MoE-model kiest per token slechts een deel van zijn gespecialiseerde experts. Moonshot probeert dus de opslagcapaciteit van een zeer groot model te combineren met inferentiekosten die niet gelijk zijn aan die van een volledig dicht model met 2,8 biljoen parameters.
De contextclaim gaat nadrukkelijk over 1 miljoen tokens, niet over 100.000. K3 wordt eerst op sequenties van 8K tokens getraind en later op 64K. Het rapport stelt dat expliciete positionele embeddings niet nodig zijn: de terugkerende gates en vervalmechanismen van Kimi Delta Attention (KDA) zouden genoeg positie-informatie dragen om naar langere contexten te extrapoleren, zonder aanpassingen aan RoPE. 1
Een groot deel van K3’s technische verhaal draait om de kosten van lange contexten. Klassieke volledige attention kan duur worden doordat de benodigde toestand bij het genereren groeit met de eerdere context. KDA vervangt veel daarvan door een recurrente toestand met vaste omvang. Daardoor hoeven toestand en decodeerkosten per token niet op dezelfde manier mee te groeien als bij een volledige KV-cache. 1
Moonshot combineert dit met Gated MLA: per blok volgen drie KDA-lagen op één Gated-MLA-laag, een verhouding van 3:1. KDA moet goedkope, doorlopende verwerking van de sequentie leveren; de MLA-lagen moeten juist selectieve, globale informatie-ophaling behouden. 1
De ondergrens voor de vervalsnelheid in KDA is daarbij niet alleen een keuze voor modelgedrag. Volgens het rapport voorkomt die extreem kleine, numeriek lastige vervalwaarden en maakt zij een geblokkeerde berekening mogelijk die goed aansluit op tensorcores. 1
Met Attention Residuals, of AttnRes, wil Moonshot voorkomen dat informatie verloren gaat in een diepe architectuur die grotendeels op lineaire attention steunt. Latere lagen kunnen samengeperste representaties uit eerdere diepteblokken opnieuw ophalen. 1
Dat geeft het 93-laags netwerk in theorie een extra route naast de gewone laag-voor-laag-doorstroming. De beoogde winst: veel dure globale attention vervangen door KDA zonder dat de kwaliteit te veel achteruitgaat.
K3 gebruikt 896 experts en selecteert er 16 per token. Die conditionele capaciteit moet specialisatie mogelijk maken, maar creëert ook een praktisch probleem: tokens moeten naar de gekozen experts worden gestuurd zonder dat een paar drukke experts of netwerkverbindingen de hele verwerking vertragen. 1
Moonshot noemt zijn aanpak Stable LatentMoE. De quantile-balancingmethode behandelt de routering als een gebalanceerd toewijzingsprobleem en leidt onder aannames op batchniveau een exacte oplossing af. Tijdens inferentie draait die optimalisatie niet steeds opnieuw: de router gebruikt vaste expertbiases en gewone top-k-selectie. 1
Dat is belangrijk voor de interpretatie. De claim over een optimaal evenwicht geldt voor de beschreven routeringsoptimalisatie en de bijbehorende aannames; het is geen garantie dat elke productie-batch altijd perfect verdeeld is.
MoonEP richt zich op de communicatie tussen experts. Bij een groot MoE-model is die infrastructuur geen detail: als de all-to-all-communicatie door ongelijke expertvraag vertraging oploopt, verdwijnt een belangrijk deel van het efficiëntievoordeel. Architectuur en systeemsoftware zijn hier dus twee delen van dezelfde claim, niet losstaande verklaringen voor betere benchmarks. 1
De bredere stelling van Moonshot is dat een groter vooraf getraind model alleen niet genoeg is. Het rapport beschrijft een vloot lichte virtuele machines als sandboxomgeving voor reinforcement learning (RL). Die omgeving moet veel lange, verifieerbare trajecten mogelijk maken en maakt het goedkoper om trajecten via snapshots te vertakken of te hervatten. 1
Dat vormt de trainingsbasis voor een systeem dat tijdens gebruik meer stappen kan nemen: plannen, zoeken op het web, code uitvoeren, tools aanroepen en eerdere keuzes corrigeren. Ook beschrijft Moonshot distillatie van meerdere domein- en redeneermodellen naar één systeem, zodat gespecialiseerde vaardigheden niet als negen afzonderlijke modellen hoeven te worden aangeboden. 1
De kern is dus niet louter: “maak het basismodel groter.” K3 probeert een model te bouwen dat zowel veel capaciteit heeft als die capaciteit kan inzetten via langere en actievere inferentietrajecten.
Kimi K3 staat op 91,2% op BrowseComp volgens een actuele externe ranglijst. BrowseComp is bedoeld om gedrag bij webonderzoek te meten en is daarmee relevant voor langdurige, informatiezoekende agenttaken. 4
Die score ondersteunt de gedachte dat K3 sterk kan zijn in dit soort taken. Maar een eindscore is geen uitsplitsing van oorzaken. Op basis daarvan valt niet afzonderlijk vast te stellen hoeveel winst afkomstig is van KDA, AttnRes, MoE-routering, RL-sandboxen, distillatie of extra rekentijd tijdens inferentie.
Ook prijsvergelijkingen vragen om voorzichtigheid. De technische rapportage en de beschikbare hoogwaardige onafhankelijke bronnen onderbouwen niet de precieze bewering dat K3 de helft zou kosten van GPT-5.6 Sol, of dat het bij een specifieke codebenchmark exact vier punten achter een ander model zou liggen tegen 38% van de kosten. Een aangehaalde vergelijking schat de kosten per voltooide taak op ongeveer $0,94 voor K3 en $1,04 voor GPT-5.6 Sol — geen verschil van 50%. 8 Zulke bedragen hangen af van configuratie, prompts, prijsdatum en de volledige kostenberekening.
De strategische boodschap is vooral architectonisch. Moonshot stelt in feite dat modellen voorbij de biljoen parameters niet bruikbaar worden door alleen meer parameters toe te voegen. Er is ook een nieuwe combinatie nodig van attentionmechanismen, expertroutering, communicatiesoftware en trainingsinfrastructuur, zodat lange contexten en agentische inferentie praktisch inzetbaar worden. 1
De stelling dat andere open modellen rond 1 biljoen parameters zouden zijn vastgelopen, of een directe vergelijking met een specifiek concurrerend model, volgt echter niet uit het K3-rapport zelf op basis van de beschikbare onderbouwing. Wat het rapport wel onderbouwt, is Moonshots eigen ontwerpkeuze: schaal vóór uitrol en rekenwerk tijdens gebruik moeten samen worden opgeschaald.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3 koppelt twee vormen van schaalvergroting: meer modelcapaciteit vóór uitrol en meer rekenwerk tijdens gebruik voor redeneren, tools en agentische taken.
Kimi K3 koppelt twee vormen van schaalvergroting: meer modelcapaciteit vóór uitrol en meer rekenwerk tijdens gebruik voor redeneren, tools en agentische taken. De Mixture of Experts architectuur telt 2,78 biljoen parameters, maar activeert gemiddeld 104,2 miljard parameters per token.
Moonshot claimt een contextvenster tot 1 miljoen tokens, met een hybride aandachtarchitectuur die lange contexten goedkoper moet verwerken.