Questa è la storia di quel lancio: cosa può fare realmente il modello, quanto costa e perché rappresenta un momento significativo nella competizione AI tra Cina e Stati Uniti.
Kimi K3 ha ottenuto un punteggio di 57,1 sull'indipendente Artificial Analysis Intelligence Index v4.1, posizionandosi al 3° posto globale dietro Claude Fable 5 (60) e GPT-5.6 Sol (59) . Il divario è di circa 3 punti, un margine ristretto per gli standard storici, ma che indica chiaramente come il test di intelligenza più ampio favorisca ancora i modelli USA di punta
. La stessa Moonshot ha riconosciuto pubblicamente che K3 'è ancora indietro rispetto ai modelli proprietari più potenti' di Anthropic e OpenAI per quanto riguarda le prestazioni aggregate complessive
.
Il punto di forza di K3 emerge invece in specifici benchmark agentici del mondo reale:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| DeepSWE | 73.0 | 70.0 | 67.5 | 59.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 75.6 | — | — | — |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 |
In questi cinque benchmark agentici, più Program Bench (77.8), K3 ha vinto 5 su 6, superando sia Fable 5 che GPT-5.6 Sol in quei test specifici . Ha inoltre superato ampiamente Claude Opus 4.8 in ogni benchmark pubblicato, un risultato significativo perché Opus 4.8 costa 5 dollari per milione di token in input e 25 in output, diventando un diretto competitor sul prezzo
.
Sulla piattaforma Arena di preferenza umana 'cieca' sviluppata dall'Università di Berkeley, K3 ha raggiunto il primo posto nella classifica di coding subito dopo il lancio . Le valutazioni comparative di Arena hanno mostrato K3 al primo posto nello sviluppo web front-end con un punteggio di 1.679, davanti a Fable 5 (1.631) e GPT-5.6 Sol (1.618)
.
Nell'ottimizzazione dei kernel GPU — le tecniche che migliorano l'interazione dei modelli AI con l'hardware — Moonshot ha riferito che K3 'ha superato sostanzialmente' Opus 4.8, GPT-5.6 Sol e GPT-5.5 . Questo è commercialmente rilevante perché una migliore ottimizzazione del kernel significa minore latenza e maggiore throughput sulla stessa dotazione hardware.
Il modello utilizza un'architettura MoE sparsa con 896 esperti, di cui solo 16 attivati per token, il che lo rende paragonabile a GPT-5.6 Sol in termini di costo di inferenza, nonostante i 2,8 trilioni di parametri totali . Introduce inoltre Kimi Delta Attention (KDA) e Attention Residuals (AttnRes), componenti architetturali innovativi progettati per migliorare il ragionamento su contesti lunghi
.
Uno degli aspetti più dirompenti di Kimi K3 è il prezzo della sua API, che sottocosta in modo significativo i migliori modelli USA:
| Modello | Input (per 1M token) | Output (per 1M token) |
|---|---|---|
| Kimi K3 | 3,00 $ | 15,00 $ |
| GPT-5.6 Sol | 5,00 $ | 30,00 $ |
| Claude Fable 5 | 10,00 $ | 50,00 $ |
| Claude Opus 4.8 | 5,00 $ | 25,00 $ |
Kimi K3 costa circa il 40% in meno di GPT-5.6 Sol e circa il 70% in meno di Claude Fable 5 a tariffe listino . I tre modelli si posizionano su una scala 3,3 volte: Fable 5 costa 3,3 volte Kimi K3 sia in input che in output, con GPT-5.6 Sol quasi esattamente a metà
.
Inoltre, K3 ha un costo di input su cache hit di 0,30 $ per milione di token — 10 volte inferiore rispetto alla tariffa cache-miss — per query di contesto già servite in precedenza . A parità di attività, si stima che K3 costi dal 50% al 65% in meno rispetto ai modelli USA di punta
.
La politica dei prezzi di Moonshot per K3 rappresenta un cambiamento notevole: ora è prezzato come un modello di frontiera, non più come un'opzione economica . I modelli Kimi precedenti, come K2.5 e K2.6, costavano tra 0,60 $ e 4,00 $ per milione di token, rendendo K3 dalle 3 alle 4 volte più caro dei suoi predecessori
. Tuttavia, rimane più economico dei modelli USA di prima fascia, offrendo prestazioni comparabili o superiori in compiti agentici specifici.
Il 19 luglio 2026 — circa 48 ore dopo il lancio — Moonshot AI ha annunciato di aver sospeso temporaneamente le nuove sottoscrizioni per Kimi K3. L'azienda ha pubblicato su X: 'Kimi K3 ha ricevuto molto più amore di quanto ci aspettassimo, e le nostre GPU lo stanno sentendo. Nelle ultime 48 ore, la domanda si è avvicinata ai limiti della nostra capacità attuale' .
L'azienda ha dichiarato che avrebbe dato priorità alla potenza di calcolo per gli abbonati esistenti, aggiungendo capacità il più rapidamente possibile e prevedendo di riaprire i posti per le nuove sottoscrizioni a lotti . Gli utenti esistenti hanno mantenuto l'accesso completo, mentre i servizi API e aziendali hanno continuato a funzionare
.
Numerosi organi di stampa hanno osservato che questo episodio mette in luce i vincoli di calcolo che la Cina deve affrontare a causa delle restrizioni all'esportazione di chip USA . Il South China Morning Post ha scritto che la situazione 'sottolinea le sfide che i laboratori AI cinesi devono affrontare per offrire i loro prodotti agli utenti globali'
. I pesi completi del modello, che consentirebbero a terze parti di eseguirlo sul proprio hardware, non erano previsti prima del 27 luglio, lasciando Moonshot come unico fornitore di capacità di inferenza durante la finestra di lancio
.
Moonshot ha approfittato della pausa per dividere il suo abbonamento in due piani: Kimi Membership (per web, app e Work) e Kimi Code Membership (per i flussi di lavoro di programmazione), una ristrutturazione progettata per allocare meglio le risorse di calcolo .
Il lancio di Kimi K3 ha avuto ripercussioni che vanno oltre i benchmark AI. Il Straits Times ha direttamente riportato che K3 'ha alimentato un crollo tecnologico', e diverse testate hanno collegato il rilascio a una svendita di titoli azionari USA nel settore dei semiconduttori e dell'AI . Sebbene non sia stato possibile confermare in modo indipendente dati specifici sull'andamento dell'indice dei semiconduttori di Philadelphia o sul calo del 2% di Nvidia all'interno del set di fonti disponibili, il contesto di mercato più ampio del selloff è ben documentato.
Sul fronte aziendale, Reuters ha riportato il 20 luglio 2026 che la sospensione degli abbonamenti 'arriva mentre l'azienda cerca nuovi finanziamenti, con fonti che dicono che si sta muovendo verso un'offerta pubblica iniziale a Hong Kong' . Tuttavia, nessuna fonte tra quelle disponibili ha confermato una specifica risoluzione degli azionisti per un target di valutazione di 30 miliardi di dollari. Il rapporto Reuters menziona una spinta verso l'IPO senza specificare una valutazione obiettivo
.
I pesi completi del modello Kimi K3 sono programmati per il rilascio pubblico il 27 luglio 2026 . Questo è un dettaglio cruciale perché significa che sviluppatori e organizzazioni potranno eventualmente scaricare, eseguire, ispezionare, mettere a punto e possedere il modello, anziché semplicemente noleggiarlo tramite un'API
. Il rollout in due fasi — prima l'API, poi i pesi aperti undici giorni dopo — è la forma dell'intero annuncio
.
Prima del rilascio open-weight, gli sviluppatori possono accedere a K3 tramite kimi.com, l'API Kimi o OpenRouter . Il modello parla l'SDK di OpenAI, supporta il tool calling, l'output strutturato e la cache automatica del contesto, e ha una finestra di contesto di 1 milione di token senza sovrapprezzo per contesti lunghi
.
Detto questo, eseguire localmente un modello da 2,8 trilioni di parametri non è una cosa da poco. La dimensione del file è stimata in circa 1,5 TB, e l'hardware consigliato include 64 o più GPU NVIDIA H100 di livello enterprise . Per la maggior parte dei team, l'API rimarrà il punto di accesso pratico.
Kimi K3 non è il modello che detronizza GPT-5.6 Sol o Claude Fable 5 nell'intelligenza complessiva — lo dice la stessa Moonshot. Ma è il modello che dimostra che un sistema open-weight può competere con i modelli proprietari di frontiera in compiti specifici e commercialmente preziosi, costando una frazione del prezzo. È il più grande modello open-weight mai rilasciato, ed è arrivato con una domanda reale così forte da mandare in crash l'infrastruttura GPU di un'azienda in due giorni.
Questa combinazione — prestazioni di livello frontiera nei benchmark agentici, prezzi aggressivi, pesi aperti e un chiaro segnale di domanda — rende K3 una tappa fondamentale nel panorama dell'AI, indipendentemente dalla sua posizione in una qualsiasi classifica.