Her er historien om den lanseringen – hva modellen faktisk kan, hva den koster, og hvorfor den markerer et vendepunkt i den pågående KI-kappløpet mellom USA og Kina.
Kimi K3 oppnådde 57,1 på den uavhengige Artificial Analysis Intelligence Index v4.1, noe som plasserer den på 3. plass globalt, bak Claude Fable 5 (60) og GPT-5.6 Sol (59) . Forskjellen er på omtrent 3 poeng – trangt etter historiske mål, men tydelig: den bredeste tilgjengelige intelligenstesten favoriserer fortsatt de beste amerikanske modellene
. Moonshot erkjente selv offentlig at K3 «fortsatt ligger bak de kraftigste proprietære modellene» fra Anthropic og OpenAI når det gjelder samlet ytelse
.
Men på spesifikke, virkelighetsnære agent-benchmarks trekker K3 seg foran:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| DeepSWE | 73,0 | 70,0 | 67,5 | 59,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| Automation Bench | 75,6 | — | — | — |
| SpreadsheetBench 2 | 34,8 | 34,7 | 32,4 | 31,6 |
På disse fem agent-benchmarks pluss Program Bench (77,8) vant K3 5 av 6 rent, og slo både Fable 5 og GPT-5.6 Sol på de spesifikke testene . Den utkonkurrerte også Claude Opus 4.8 betydelig på samtlige publiserte benchmarks – et viktig resultat ettersom Opus 4.8 er priset til 5 USD input / 25 USD output per million tokens, noe som gjør den til en direkte kostnadskonkurrent
.
På Arena, den blinde, menneskelige preferanseplattformen utviklet av UC Berkeley-forskere, toppet K3 kode-ledertavlen kort tid etter lansering . Arenas crowd-baserte evalueringer viste K3 på førsteplass i frontend-utvikling med en poengsum på 1 679, foran Fable 5 (1 631) og GPT-5.6 Sol (1 618)
.
På GPU-kerneloptimalisering – teknikkene som forbedrer hvordan KI-modeller samhandler med maskinvare – rapporterte Moonshot at K3 «betydelig utkonkurrerte» Opus 4.8, GPT-5.6 Sol og GPT-5.5 . Dette er kommersielt viktig fordi bedre kerneloptimalisering gir lavere latens og høyere gjennomstrømning på samme maskinvare.
Modellen bruker en sparsom MoE-arkitektur med 896 eksperter, hvorav bare 16 aktiveres per token, noe som gjør den omtrent sammenlignbar med GPT-5.6 Sols inferenskostnad til tross for 2,8 billioner parametere totalt . Den introduserer også Kimi Delta Attention (KDA) og Attention Residuals (AttnRes) – nye arkitektoniske komponenter designet for å forbedre resonnering over lange kontekster
.
Et av de mest markedsforstyrrende aspektene ved Kimi K3 er API-prisen, som underbyr de beste amerikanske modellene med god margin:
| Modell | Input (per 1M tokens) | Output (per 1M tokens) |
|---|---|---|
| Kimi K3 | 3,00 USD | 15,00 USD |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD |
| Claude Fable 5 | 10,00 USD | 50,00 USD |
| Claude Opus 4.8 | 5,00 USD | 25,00 USD |
Kimi K3 koster omtrent 40 % mindre enn GPT-5.6 Sol og omtrent 70 % mindre enn Claude Fable 5 til listepris . De tre modellene danner en tydelig 3,3× stige: Fable 5 koster 3,3 ganger Kimi K3 på både input og output, med GPT-5.6 Sol omtrent midt imellom
.
I tillegg har K3 en cache-hit input-pris på 0,30 USD per million tokens – 10 ganger billigere enn cache-miss-prisen – for spørringer som allerede er behandlet . Per oppgave er K3 estimert til å koste 50–65 % mindre enn de amerikanske flaggskipene
.
Moonshots prising for K3 representerer et markant skifte: den er nå priset som en frontlinjemodell snarere enn et budsjettalternativ . Tidligere Kimi-modeller som K2.5 og K2.6 ble priset til 0,60 USD input / 2,50–4,00 USD output, noe som gjør K3 omtrent 3–4 ganger dyrere enn sine egne forgjengere
. Likevel forblir den billigere enn de beste amerikanske modellene samtidig som den leverer sammenlignbar eller bedre ytelse på spesifikke agentoppgaver.
Selskapet sa de ville prioritere datakraft for eksisterende abonnenter mens de bygget ut kapasiteten så raskt som mulig, og planla å gjenåpne abonnementsplasser i puljer . Eksisterende brukere beholdt full tilgang, og bedrifts-/API-tjenester fortsatte som normalt
.
Flere nyhetsmedier påpekte at denne hendelsen understreker Kinas pågående datakraftbegrensninger som følge av amerikanske eksportrestriksjoner på brikker . South China Morning Post skrev at situasjonen «understreker utfordringene kinesiske KI-laboratorier står overfor når de skal levere produktene sine til globale brukere»
. Modellens fulle vekter, som ville tillate tredjeparter å kjøre den på egen maskinvare, var ikke planlagt før 27. juli – noe som gjorde Moonshot til den eneste leverandøren av inferenskapasitet under lanseringsvinduet
.
Moonshot brukte pausen til å dele medlemskapet i to planer: Kimi Membership (for nett, app og Work) og Kimi Code Membership (for kodearbeidsflyter) – en omstrukturering designet for å bedre allokere datakraftressurser .
Lanseringen av Kimi K3 fikk ringvirkninger utover KI-benchmarks. The Straits Times rapporterte direkte at K3 «utløste et teknologisk stup», og flere medier koblet utgivelsen til et salg i amerikanske halvleder- og KI-aksjer . Selv om spesifikke tall for Philadelphia Semiconductor Index’ retning eller Nvidias aksjebevegelse ikke kunne bekreftes uavhengig innenfor tilgjengelige kilder, er det bredere markedsbildet av utsalget veldokumentert.
På bedriftssiden rapporterte Reuters 20. juli 2026 at abonnementsstansen «kommer mens selskapet søker frisk kapital, med kilder som sier det beveger seg mot en børsnotering i Hongkong» . Ingen kilde innenfor tilgjengelig bevis bekreftet imidlertid en spesifikk aksjonærresolusjon om en verdsettelse på 30 milliarder USD. Reuters-rapporten nevner et IPO-fremstøt uten å spesifisere en målverdi
.
Fullstendige modellvekter for Kimi K3 er planlagt for offentlig utgivelse 27. juli 2026 . Dette er en kritisk detalj fordi det betyr at utviklere og organisasjoner til slutt kan laste ned, kjøre, inspisere, finjustere og eie modellen i stedet for bare å leie den gjennom et API
. Den todelte utrullingen – API først, åpne vekter elleve dager senere – danner formen på hele kunngjøringen
.
Før utgivelsen av åpne vekter kan utviklere få tilgang til K3 via kimi.com, Kimi API eller OpenRouter . Modellen snakker OpenAI SDK, støtter verktøykalling, strukturert output og automatisk kontekstbufring, og har et kontekstvindu på 1 million tokens uten tillegg for lang kontekst
.
Det sagt, å kjøre en modell med 2,8 billioner parametere lokalt er ikke trivielt. Filstørrelsen er estimert til omtrent 1,5 TB, og anbefalt maskinvare inkluderer 64+ enterprise NVIDIA H100 GPUer . For de fleste team vil APIet forbli det praktiske tilgangspunktet.
Kimi K3 er ikke modellen som styrter GPT-5.6 Sol eller Claude Fable 5 når det gjelder generell intelligens – det sier Moonshot selv. Men det er modellen som beviser at et åpent system kan konkurrere med proprietære frontlinjemodeller på spesifikke, kommersielt verdifulle oppgaver til en brøkdel av prisen. Det er den største åpne modellen noensinne, og den ankom med nok reell etterspørsel til å krasje et selskaps GPU-infrastruktur på to dager.
Den kombinasjonen – frontlinjeytelse på agent-benchmarks, aggressiv prising, åpne vekter og et tydelig etterspørselssignal – gjør K3 til en betydelig milepæl i KI-landskapet, uavhengig av hvor den havner på en enkelt ledertavle.