Kimi K3:s huvudtes är att AI på toppnivå behöver skalas på två sätt: större modellkapacitet före driftsättning och mer beräkning för resonemang, verktyg och agentuppgifter vid användning. Modellen uppges ha 2,78 biljoner parametrar totalt, men aktiverar 104,2 miljarder per token – ett sätt att öka kapaciteten utan k...
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI:s argument i den 47-sidiga Kimi K3-rapporten är att framsteg i toppmodeller kräver två resurser som kompletterar varandra:
K3:s konstruktion är tänkt att göra båda delarna ekonomiskt möjliga. Det är en MoE-modell (Mixture of Experts), där bara en del av parametrarna används för varje token. Därmed kan modellen vara mycket stor utan att inferensen behöver motsvara kostnaden för en tät modell med 2,8 biljoner parametrar. 1
K3 beskrivs som en multimodal MoE-modell med 2,78 biljoner parametrar totalt och 104,2 miljarder aktiva parametrar per token, med ett kontextfönster på upp till en miljon tokens. 1 Poängen är att den totala modellen kan rymma bredare och mer specialiserad kapacitet, medan varje enskilt genereringssteg bara använder en begränsad del av nätverket.
Det innebär inte att 104,2 miljarder aktiva parametrar är litet – det är fortfarande en mycket stor inferensprofil – men det är väsentligt mindre än att köra alla 2,78 biljoner parametrar för varje token.
En viktig rättelse i diskussionen om modellen är att rapporten hävdar naturlig extrapolering till en miljon tokens, inte 100 000. Träningen börjar vid 8 000 tokens och utökas senare till 64 000 tokens. Modellen använder inga explicita positionsinbäddningar; rapportens argument är i stället att KDA:s återkommande grindar och avklingning kan bära tillräcklig positionsinformation för extrapolering utan modifierad RoPE. 1
För svenska läsare kan det enklast förstås som ett mycket stort arbetsminne: modellen kan i princip hålla och bearbeta innehållet i mycket långa dokument, omfattande kodbaser eller flerledade agentuppgifter inom samma kontext.
Kimi Delta Attention, KDA, ersätter merparten av den kvadratiskt växande uppmärksamhetsberäkningen med ett återkommande tillstånd av fast storlek. Det innebär att tillståndet per token och kostnaden vid generering inte växer på samma sätt som en full KV-cache när tidigare kontext blir längre. 1
K3 blandar tre KDA-lager med ett Gated-MLA-lager. KDA ska ge billig, uthållig bearbetning av sekvenser, medan MLA-lagret återinför mer selektiv global hämtning av information. 1 Den nedre gränsen för KDA:s avklingningshastighet beskrivs som en praktisk systemåtgärd: den undviker numeriskt problematiskt små avklingningar och möjliggör blockberäkningar som passar tensorprocessorer bättre.
1
Modellen har 93 lager. Attention Residuals, eller AttnRes, ska hindra ett mycket djupt nätverk med huvudsakligen linjär attention från att bli informationsmässigt isolerat lager för lager. Senare lager kan i stället hämta komprimerade representationer från tidigare djupblock. 1
Tanken är alltså inte bara att effektivisera lång kontext, utan att behålla kvaliteten när dyr global attention till stor del ersätts av KDA.
K3 använder 896 experter och väljer de 16 högst rankade för routing. Stable LatentMoE är avsett att öka den villkorade kapaciteten samtidigt som belastningen mellan experter hålls under kontroll. Rapportens metod för kvantilbalansering formulerar routingen som ett balanserat tilldelningsproblem och härleder ett exakt optimum under sina antaganden på batchnivå. Vid driftsättning används däremot fasta expertbiaser och vanlig top-k-selektion, inte själva balanseringslösaren. 1
Det är en starkare formulering än traditionell balansering med hjälpförluster, men den bör läsas med försiktighet: ett teoretiskt optimum för det specificerade routingproblemet innebär inte att varje verklig produktionsbatch automatiskt blir perfekt balanserad.
MoonEP hanterar den andra sidan av problemet: kommunikationen mellan expertservrar. En stor MoE är bara kostnadseffektiv om tokens kan skickas till valda experter utan att ojämn efterfrågan och nätverksfördröjningar blir flaskhalsar. 1 Arkitektur och systemdesign är därför inte oberoende förklaringar till resultatet, utan delar av samma upplägg.
Den mest strategiska delen av rapporten gäller postträning och inferens. Moonshot beskriver en infrastruktur med lätta virtuella maskiner som ska göra det möjligt att generera många verifierbara RL-trajektorier med lång tidshorisont. Genom ögonblicksbilder kan uppgifter förgrenas eller återupptas billigare. 1
Det ger träningsunderlag för modeller som kan lägga fler steg på en uppgift när de används: planera, söka information, skriva och testa kod, använda verktyg och rätta egna misstag. Modellen ska alltså inte enbart bli bättre genom att vara större vid förträning, utan också genom att kunna använda mer beräkningskraft när en svår uppgift kräver det.
Rapporten beskriver även destillering från flera domän- och resonemangslärare till ett enda system. Syftet är att överföra specialiserade beteenden utan att behöva köra nio olika modeller i produktion. 1
K3 har enligt en aktuell tredjepartslista 91,2 procent på BrowseComp, ett benchmark för långsiktigt informationssökande agenter. 4 Om resultatet kan reproduceras stärker det bilden av att systemet är särskilt kapabelt på uppgifter som kräver flera steg av informationsinhämtning.
Men siffran isolerar inte effekten av KDA, AttnRes, MoE-routing, RL-miljöerna, destilleringen eller extra beräkning vid testtid. Det är ett resultat för hela systemet, inte ett bevis för hur mycket varje komponent bidrar.
De precisa påståendena om att K3 skulle kosta “hälften av GPT-5.6 Sol”, eller ligga exakt fyra poäng bakom “Claude Fable 5” på Kimi Code Bench till 38 procent av kostnaden, kan inte bekräftas i den tekniska rapporten eller i ett oberoende primärunderlag här. En jämförelse anger i stället uppskattade kostnader per slutförd uppgift på omkring 0,94 dollar för K3 och 1,04 dollar för GPT-5.6 Sol – långt ifrån en skillnad på 50 procent. 8
Sådana kostnader beror dessutom på konfiguration, promptlängd, arbetssätt, prisdatum och hur en utvärderingsmiljö räknar verktygsanrop och misslyckade försök.
Slutsatsen är därför främst arkitektonisk, inte ett fast prisargument: Moonshot AI hävdar att modeller över biljonparameternivån kräver en ny kombination av modellarkitektur, routing, kommunikationssystem och RL-infrastruktur för att långt sammanhang och agentbaserad inferens ska bli praktiskt användbara. Däremot fastslår inte den tillgängliga rapporten i sig att öppna modeller generellt har stannat vid omkring en biljon parametrar eller att jämförelsen med “DeepSeek V4 Pro” är etablerad.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3:s huvudtes är att AI på toppnivå behöver skalas på två sätt: större modellkapacitet före driftsättning och mer beräkning för resonemang, verktyg och agentuppgifter vid användning.
Kimi K3:s huvudtes är att AI på toppnivå behöver skalas på två sätt: större modellkapacitet före driftsättning och mer beräkning för resonemang, verktyg och agentuppgifter vid användning. Modellen uppges ha 2,78 biljoner parametrar totalt, men aktiverar 104,2 miljarder per token – ett sätt att öka kapaciteten utan kostnaden för inferens i en helt tät modell av samma storlek.
Rapporten anger ett kontextfönster på upp till en miljon tokens, inte 100 000, och kombinerar Kimi Delta Attention med Gated MLA för att hantera långa sammanhang.