Dit is het verhaal van die lancering: wat het model werkelijk kan, wat het kost en waarom dit een cruciaal moment is in de voortdurende AI-competitie tussen de VS en China.
Kimi K3 scoorde 57,1 op de onafhankelijke Artificial Analysis Intelligence Index v4.1, goed voor een 3e plaats wereldwijd, achter Claude Fable 5 (60) en GPT-5.6 Sol (59) . Dat verschil is ongeveer 3 punten — klein in historisch perspectief, maar duidelijk: de breedste intelligentietest geeft nog steeds de voorkeur aan de beste Amerikaanse modellen
. Moonshot gaf dit zelf ook toe en stelde dat K3 'nog steeds achterloopt op de krachtigste propriëtaire modellen' van Anthropic en OpenAI wat betreft algemene prestaties
.
Waar K3 echt uitblinkt, is op specifieke, realistische agentische benchmarks:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| DeepSWE | 73,0 | 70,0 | 67,5 | 59,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| Automation Bench | 75,6 | — | — | — |
| SpreadsheetBench 2 | 34,8 | 34,7 | 32,4 | 31,6 |
Op deze vijf agentische benchmarks plus Program Bench (77,8) won K3 5 van de 6 ronden, waarbij het zowel Fable 5 als GPT-5.6 Sol versloeg op die specifieke tests . Ook presteerde K3 aanzienlijk beter dan Claude Opus 4.8 op elke gepubliceerde benchmark — een belangrijk resultaat, aangezien Opus 4.8 met $5 input / $25 output per miljoen tokens geprijsd is en daarmee een directe kostenconcurrent is
.
Op de Arena, een blinde menselijke voorkeursplatform van UC Berkeley-onderzoekers, stond K3 kort na de lancering bovenaan de codeerleaderboard . De crowd-comparison-evaluaties van Arena toonden aan dat K3 de eerste plaats innam in front-end webontwikkeling met een score van 1.679, voor Fable 5 (1.631) en GPT-5.6 Sol (1.618)
.
Wat betreft GPU-kerneloptimalisatie — de technieken die de interactie tussen AI-modellen en hardware verbeteren — meldde Moonshot dat K3 'substantieel beter presteerde' dan Opus 4.8, GPT-5.6 Sol en GPT-5.5 . Dit is commercieel significant omdat betere kerneloptimalisatie leidt tot lagere latentie en hogere doorvoer op dezelfde hardware.
Het model maakt gebruik van een spaarse MoE-architectuur met 896 experts, waarvan er slechts 16 per token worden geactiveerd. Dit maakt de inferentiekosten ruwweg vergelijkbaar met die van GPT-5.6 Sol, ondanks de 2,8 biljoen parameters . Het introduceert ook Kimi Delta Attention (KDA) en Attention Residuals (AttnRes) — nieuwe architecturale componenten die zijn ontworpen om redeneringen over lange contexten te verbeteren
.
Een van de meest marktverstorende aspecten van Kimi K3 is de API-prijsstelling, die de topmodellen uit de VS met een aanzienlijke marge onderbiedt:
| Model | Input (per 1M tokens) | Output (per 1M tokens) |
|---|---|---|
| Kimi K3 | $3,00 | $15,00 |
| GPT-5.6 Sol | $5,00 | $30,00 |
| Claude Fable 5 | $10,00 | $50,00 |
| Claude Opus 4.8 | $5,00 | $25,00 |
Kimi K3 is ~40% goedkoper dan GPT-5.6 Sol en ~70% goedkoper dan Claude Fable 5 tegen de lijsttarieven . De drie modellen zitten op een duidelijke 3,3×-ladder: Fable 5 kost 3,3 keer zoveel als Kimi K3 voor zowel input als output, met GPT-5.6 Sol precies in het midden
.
Daarnaast heeft K3 een cache-hit inputtarief van $0,30 per miljoen tokens — 10 keer goedkoper dan de cache-miss rate — voor contextaanvragen die al eerder zijn behandeld . Op taakbasis wordt geschat dat K3 50-65% goedkoper is dan de Amerikaanse vlaggenschepen
.
De prijsstelling van Moonshot voor K3 betekent een opmerkelijke verschuiving: het wordt nu geprijsd als een frontiermodel in plaats van een budgetoptie . Eerdere Kimi-modellen zoals K2.5 en K2.6 waren geprijsd op $0,60 input / $2,50-4,00 output, waardoor K3 ongeveer 3-4× duurder is dan zijn eigen voorgangers
. Het blijft echter goedkoper dan de topmodellen uit de VS en levert vergelijkbare of betere prestaties op specifieke agentische taken.
Op 19 juli 2026 — ongeveer 48 uur na de lancering — kondigde Moonshot AI aan dat het tijdelijk nieuwe abonnementen voor Kimi K3 opschortte. Het bedrijf plaatste op X: 'Kimi K3 heeft veel meer liefde gekregen dan we hadden verwacht, en onze GPU's voelen dat. In de afgelopen 48 uur is de vraag bijna tegen de grenzen van onze huidige capaciteit aangelopen' .
Het bedrijf zei dat het rekenkracht zou prioriteren voor bestaande abonnees en zo snel mogelijk capaciteit zou toevoegen, met de bedoeling om in batches nieuwe abonnementsplaatsen te openen . Bestaande gebruikers behielden volledige toegang, en enterprise-/API-diensten werden voortgezet
.
Meerdere nieuwsmedia merkten op dat dit incident de aanhoudende rekenkrachtbeperkingen van China benadrukt als gevolg van Amerikaanse chipexportbeperkingen . De South China Morning Post schreef dat de situatie 'de uitdagingen onderstreept waarmee Chinese AI-laboratoria worden geconfronteerd bij het leveren van hun producten aan wereldwijde gebruikers'
. De volledige modelgewichten, die derden in staat zouden stellen het model op hun eigen hardware te draaien, zouden pas op 27 juli beschikbaar komen — waardoor Moonshot tijdens het lanceringsvenster de enige aanbieder van inferentiecapaciteit was
.
Moonshot gebruikte de pauze om zijn lidmaatschap op te splitsen in twee plannen: Kimi Membership (voor web, app en Work) en Kimi Code Membership (voor codeerworkflows), een herstructurering die bedoeld was om rekenbronnen beter toe te wijzen .
De lancering van Kimi K3 had rimpeleffecten die verder gingen dan AI-benchmarks. De Straits Times meldde rechtstreeks dat K3 'een technologievlucht aanwakkerde', en meerdere nieuwsmedia koppelden de release aan een verkoopgolf in Amerikaanse halfgeleider- en AI-aandelen .
Aan de bedrijfskant meldde Reuters op 20 juli 2026 dat de abonnementspauze 'komt op een moment dat het bedrijf op zoek is naar nieuwe financiering, waarbij bronnen zeggen dat het zich voorbereidt op een beursgang in Hongkong' .
De volledige modelgewichten van Kimi K3 staan gepland voor openbare release op 27 juli 2026 . Dit is een cruciaal detail omdat het betekent dat ontwikkelaars en organisaties het model uiteindelijk kunnen downloaden, uitvoeren, inspecteren, finetunen en bezitten in plaats van het alleen via een API te huren
. De tweetraps-uitrol — eerst de API, elf dagen later de open gewichten — is de vorm van de hele aankondiging
.
Vóór de open-weight release kunnen ontwikkelaars K3 benaderen via kimi.com, de Kimi API of OpenRouter . Het model spreekt de OpenAI SDK, ondersteunt tool calling, gestructureerde output en automatische contextcaching, en heeft een contextvenster van 1 miljoen tokens zonder toeslag voor lange context
.
Het lokaal draaien van een model met 2,8 biljoen parameters is echter niet triviaal. De bestandsgrootte wordt geschat op ongeveer 1,5 TB, en aanbevolen hardware omvat 64+ enterprise NVIDIA H100 GPU's . Voor de meeste teams blijft de API het praktische toegangspunt.
Kimi K3 is niet het model dat GPT-5.6 Sol of Claude Fable 5 van de troon stoot op het gebied van algemene intelligentie — Moonshot zegt dat zelf. Maar het is het model dat bewijst dat een open-weight systeem kan concurreren met propriëtaire frontiermodellen op specifieke, commercieel waardevolle taken, terwijl het een fractie van de prijs kost. Het is het grootste open-weight model ooit uitgebracht, en het arriveerde met genoeg vraag om de GPU-infrastructuur van een bedrijf in twee dagen te laten crashen.
Die combinatie — frontier-prestaties op agentische benchmarks, agressieve prijzen, open gewichten en een duidelijk signaal van vraag — maakt van K3 een belangrijke mijlpaal in het AI-landschap, ongeacht waar het op een bepaalde leaderboard staat.