Kimi K3:n keskeinen väite on, että huipputason tekoäly edellyttää kahden toisiaan täydentävän resurssin skaalaamista: mallikapasiteetin ennen käyttöönottoa sekä laskennan, jota käytetään pitkään päättelyyn, työkaluihi... K3 on 2,78 biljoonan parametrin multimodaalinen MoE malli, mutta se aktivoi tokenia kohden 104,2...
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI:n Kimi K3 -raportin pääväite ei ole vain se, että suurempi malli on parempi. Sen mukaan kehitys huipputason tekoälyssä edellyttää kahden eri resurssin kasvattamista yhtä aikaa:
K3:n arkkitehtuuri on rakennettu tekemään molemmista edullisempia. Sen Mixture-of-Experts-rakenne (MoE) tarjoaa valtavan kokonaiskapasiteetin, mutta aktivoi vain osan mallista kutakin tokenia varten. Samalla huomio-, reititys-, tiedonsiirto- ja vahvistusoppimisratkaisuilla pyritään alentamaan pitkän päättelyn ja agenttimaisten työnkulkujen kustannuksia. 1
K3:n ilmoitettu koko on 2,78 biljoonaa parametria, mutta tokenia kohden aktivoituu 104,2 miljardia parametria. Kyse on natiivisti multimodaalisesta MoE-mallista, jonka konteksti-ikkuna on enintään miljoona tokenia. 1
Ero kokonaisparametrien ja aktiivisten parametrien välillä on raportin taloudellinen perusajatus. Malli voi säilyttää paljon enemmän erikoistunutta kyvykkyyttä kuin vastaavan laskennan tiheä malli, mutta jokaisella päättelyaskeleella ei tarvitse laskea kaikkia 2,78 biljoonaa parametria.
Raportin mukaan K3 pystyy natiivisti ekstrapoloimaan miljoonaan tokeniin. Tämä on eri asia kuin 100 000 tokenin konteksti. Koulutus alkoi 8 000 tokenin mittaisilla jaksoilla ja siirtyi myöhemmin 64 000 tokeniin. 1
Mallissa ei käytetä eksplisiittisiä sijaintiupotuksia. Moonshotin perustelu on, että KDA:n toistuvat portit ja vaimeneminen koodaavat sijaintitietoa riittävästi, jolloin pitkään kontekstiin voidaan laajentaa ilman RoPE-sijaintikoodauksen muokkausta. 1
Kimi Delta Attention eli KDA korvaa suuren osan neliöllisesti kasvavasta huomiolaskennasta kiinteänkokoisella toistuvalla tilalla. Käytännössä tokenikohtainen tila ja dekoodauskustannus eivät kasva aiemman kontekstin mukana samalla tavalla kuin täydellä KV-välimuistilla toimivassa huomiomekanismissa. 1
KDA ei kuitenkaan ole mallin ainoa huomiorakenne. Moonshot käyttää rytmiä, jossa on kolme KDA-kerrosta ja yksi Gated MLA -kerros. KDA hoitaa edullista, jatkuvaa sekvenssinkäsittelyä, kun taas MLA-kerros palauttaa valikoivan globaalin haun. 1
Raportissa mainittu KDA:n vaimenemisnopeuden alaraja on ennen kaikkea toteutustekninen ratkaisu: sillä vältetään numeerisesti hankalat hyvin pienet vaimenemiset ja mahdollistetaan tensoriytimille sopiva lohkolaskenta. Kyse ei siis ole pelkästä mallinnuksellisesta hienosäädöstä. 1
Attention Residuals eli AttnRes pyrkii ehkäisemään tilannetta, jossa hyvin syvä ja pääosin lineaariseen huomioon nojaava verkko eristää hyödyllistä tietoa kerrosten sisään. Myöhemmät kerrokset voivat hakea tiivistettyjä esityksiä aiemmista syvyyslohkoista sen sijaan, että kaiken merkityksellisen tiedon pitäisi kulkea tiukasti kerros kerrokselta.
Tavoitteena on säilyttää laatu, vaikka kallista globaalia huomiota korvataan suurelta osin KDA:lla. 1
K3:n Stable LatentMoE -ratkaisussa on 896 asiantuntijaa, joista reititys valitsee tokenille 16. 1 Tämä kasvattaa ehdollista kapasiteettia: eri tokenit voidaan ohjata eri asiantuntijoille.
Raportin kvantiilitasapainotus käsittelee reititystä tasapainotettuna sijoitteluongelmana ja johtaa tarkan optimin tietyillä erätason oletuksilla. Käyttöönotossa reititin ei kuitenkaan aja tätä tasapainotusratkaisijaa jokaisella pyynnöllä, vaan käyttää kiinteitä asiantuntijaharhoja ja tavallista top-k-valintaa. 1
Väite on vahvempi kuin perinteinen apuhäviöön perustuva kuormantasapainotus, mutta sitä ei pidä tulkita lupauksena siitä, että jokainen tuotantoliikenteen erä olisi täydellisesti tasapainossa.
Suuri MoE on taloudellinen vain, jos reititetyt tokenit saadaan niiden valitsemille asiantuntijoille ilman, että verkkoviiveet ja hitaimmat solmut määräävät koko järjestelmän nopeuden. MoonEP:n tehtävä on tasata epätasaisesta asiantuntijakysynnästä syntyvää all-to-all-tiedonsiirtoa, jotta 896 asiantuntijan rakenne olisi koulutettavissa ja palveltavissa mittakaavassa. 1
Tässä arkkitehtuuri ja järjestelmäoptimointi ovat saman väitteen osia. Pelkkä tehokas reititys ei selitä tuloksia ilman toimivaa laskentainfrastruktuuria – eikä suuri asiantuntijamalli ole hyödyllinen, jos sen tiedonsiirto muodostuu pullonkaulaksi.
Raportin toinen suuri teesi koskee koulutuksen jälkeistä vaihetta ja päättelyä käytön aikana. Kevyisiin virtuaalikoneisiin perustuvan sandbox-verkon tarkoitus on tuottaa paljon todennettavia, pitkäkestoisia vahvistusoppimisen trajektoreja. Tilannevedosten avulla suorituksia voidaan haaroittaa tai jatkaa edullisemmin. 1
Tämä tarjoaa koulutuspohjan malleille, jotka voivat käyttää enemmän testiaikaisia askeleita: suunnitella, selata verkkoa, kirjoittaa koodia, käyttää työkaluja ja korjata itseään. Näin suorituskyky ei nojaa vain suurempaan, valmiiksi koulutettuun malliin.
Moonshot kuvaa myös useiden toimialaan tai päättelyyn erikoistuneiden opettajamallien distillointia yhdeksi järjestelmäksi. Ajatus on siirtää erikoistuneita toimintatapoja yhteen malliin sen sijaan, että palvelussa pitäisi ajaa yhdeksää erillistä mallia. 1
K3:n 91,2 prosentin BrowseComp-tulos tukisi, jos se toistuu, väitettä mallin vahvuudesta pitkäkestoisessa tiedonhaussa. Syyskuun 2026 kolmannen osapuolen tulostaulukossa K3 on 91,2 prosentissa. 4
Yksittäinen vertailutulos ei silti kerro, kuinka suuri osuus tuloksesta johtuu KDA:sta, AttnResistä, MoE-reitityksestä, RL-ympäristöistä, distilloinnista tai käytönaikaisesta lisälaskennasta. Se on kokonaisjärjestelmän tulos, ei yksittäisen teknisen ratkaisun eristetty mittaus.
Teknisestä raportista tai vahvasta riippumattomasta lähteestä ei ole varmennettavissa täsmällistä väitettä, jonka mukaan K3 maksaisi puolet GPT-5.6 Solin kustannuksesta. Myöskään väitettä täsmälleen neljän pisteen erosta Claude Fable 5:een Kimi Code Benchissä 38 prosentilla kustannuksista ei voi vahvistaa tämän aineiston perusteella.
Yksi vertailu arvioi valmiiksi suoritetun tehtävän kustannukseksi K3:lle noin 0,94 dollaria ja GPT-5.6 Solille noin 1,04 dollaria. Ero ei ole lähelläkään 50 prosenttia. 8 Kustannusluvut riippuvat asetuksista, kehotteista, hinnoittelupäivästä ja siitä, mitä kokonaiskustannuksiin sisällytetään. Ilman avointa arviointikehikkoa niitä ei pidä lukea yleispätevinä.
K3:n strateginen viesti onkin uskottavimmin arkkitehtuurinen, ei pelkkä hintaväite: avoimilla malleilla tarvitaan uudenlainen malli- ja järjestelmäsuunnittelun kokonaisuus, jotta biljoonaluokan kapasiteetti voidaan yhdistää käyttökelpoiseen pitkän kontekstin ja agenttimaiseen päättelyyn. Raportin perusteella ei kuitenkaan voi vahvistaa laajempaa väitettä siitä, että muut avoimet mallit olisivat pysähtyneet noin biljoonan parametrin tasolle tai että K3:n asema suhteessa DeepSeek V4 Prohon olisi tällä perusteella ratkaistu. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3:n keskeinen väite on, että huipputason tekoäly edellyttää kahden toisiaan täydentävän resurssin skaalaamista: mallikapasiteetin ennen käyttöönottoa sekä laskennan, jota käytetään pitkään päättelyyn, työkaluihi...
Kimi K3:n keskeinen väite on, että huipputason tekoäly edellyttää kahden toisiaan täydentävän resurssin skaalaamista: mallikapasiteetin ennen käyttöönottoa sekä laskennan, jota käytetään pitkään päättelyyn, työkaluihi... K3 on 2,78 biljoonan parametrin multimodaalinen MoE malli, mutta se aktivoi tokenia kohden 104,2 miljardia parametria.
Raportin mukaan konteksti ikkuna yltää natiivisti miljoonaan tokeniin, ei 100 000 tokeniin.