Voici l'histoire de ce lancement — ce que le modèle peut réellement faire, combien il coûte, et pourquoi il représente un moment clé dans la compétition sino-américaine en matière d'IA.
Kimi K3 a obtenu un score de 57,1 sur l'indice indépendant Artificial Analysis Intelligence Index v4.1, se classant 3ᵉ mondial derrière Claude Fable 5 (60) et GPT-5.6 Sol (59) . Cet écart d'environ 3 points est serré par rapport aux standards historiques, mais il reste clair : le test d'intelligence le plus large favorise encore les meilleurs modèles américains
. Moonshot lui-même l'a reconnu, déclarant publiquement que K3 "reste encore derrière les modèles propriétaires les plus puissants" d'Anthropic et d'OpenAI sur les performances globales
.
Là où K3 prend l'avantage, c'est sur des benchmarks agentiques spécifiques et concrets :
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| DeepSWE | 73.0 | 70.0 | 67.5 | 59.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 75.6 | — | — | — |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 |
Sur ces cinq benchmarks agentiques, plus Program Bench (77.8), K3 a remporté 5 des 6 tests, battant à la fois Fable 5 et GPT-5.6 Sol sur ces évaluations spécifiques . Il a également largement surpassé Claude Opus 4.8 sur tous les benchmarks publiés — un résultat significatif, car Opus 4.8 est facturé 5 $ en entrée et 25 $ en sortie par million de tokens, ce qui en fait un concurrent direct en termes de coût
.
Sur la plateforme Arena de préférence humaine en aveugle développée par des chercheurs de l'UC Berkeley, K3 a atteint la première place du classement de codage peu après son lancement . Les évaluations comparatives de la foule d'Arena ont montré K3 en tête pour le développement web front-end avec un score de 1 679, devant Fable 5 (1 631) et GPT-5.6 Sol (1 618)
.
En matière d'optimisation des noyaux GPU — les techniques qui améliorent l'interaction des modèles d'IA avec le matériel — Moonshot a rapporté que K3 "a substantiellement surpassé" Opus 4.8, GPT-5.6 Sol et GPT-5.5 . Ceci est commercialement significatif, car une meilleure optimisation des noyaux GPU se traduit par une latence plus faible et un meilleur débit sur le même matériel.
Le modèle utilise une architecture MoE (Mixture of Experts) parcimonieuse avec 896 experts, dont seulement 16 sont activés par token, ce qui le rend comparable en coût d'inférence à GPT-5.6 Sol malgré ses 2,8 billions de paramètres . Il introduit également le Kimi Delta Attention (KDA) et les Attention Residuals (AttnRes) — de nouveaux composants architecturaux conçus pour améliorer le raisonnement sur de longs contextes
.
L'un des aspects les plus perturbateurs pour le marché de Kimi K3 est sa tarification API, qui sous-cote significativement les meilleurs modèles américains :
| Modèle | Entrée (par million de tokens) | Sortie (par million de tokens) |
|---|---|---|
| Kimi K3 | 3,00 $ | 15,00 $ |
| GPT-5.6 Sol | 5,00 $ | 30,00 $ |
| Claude Fable 5 | 10,00 $ | 50,00 $ |
| Claude Opus 4.8 | 5,00 $ | 25,00 $ |
Kimi K3 coûte ~40 % de moins que GPT-5.6 Sol et ~70 % de moins que Claude Fable 5 aux tarifs catalogues . Les trois modèles s'alignent sur une échelle claire de 3,3× : Fable 5 coûte 3,3 fois plus que Kimi K3, tant en entrée qu'en sortie, GPT-5.6 Sol se situant presque exactement entre les deux
.
De plus, K3 a un taux de cache-hit de 0,30 $ par million de tokens — 10 fois moins cher que son taux de cache-miss — pour les requêtes de contexte déjà servies . Par tâche, K3 est estimé coûter 50 à 65 % de moins que les modèles américains phares
.
La tarification de K3 par Moonshot représente un changement notable : il est désormais pricingé comme un modèle de pointe plutôt que comme une option économique . Les modèles Kimi précédents, comme K2.5 et K2.6, étaient tarifés à 0,60 $ en entrée et 2,50-4,00 $ en sortie, rendant le K3 environ 3 à 4 fois plus cher que ses prédécesseurs
. Cependant, il reste moins cher que les modèles américains de premier plan tout en offrant des performances comparables ou supérieures sur des tâches agentiques spécifiques.
Le 19 juillet 2026 — environ 48 heures après le lancement — Moonshot AI a annoncé la suspension temporaire des nouvelles souscriptions pour Kimi K3. L'entreprise a publié sur X : "Kimi K3 a reçu bien plus d'amour que prévu, et nos GPU le ressentent. Au cours des 48 dernières heures, la demande s'est approchée des limites de notre capacité actuelle" .
L'entreprise a déclaré qu'elle prioriserait la puissance de calcul pour les abonnés existants tout en augmentant sa capacité aussi rapidement que possible, prévoyant de rouvrir les places de souscription par lots . Les utilisateurs existants ont conservé un accès complet, et les services API/entreprise ont continué
.
Plusieurs médias ont noté que cet incident met en évidence les contraintes persistantes de la Chine en matière de calcul, dues aux restrictions américaines à l'exportation de puces . Le South China Morning Post a écrit que la situation "souligne les défis auxquels les laboratoires chinois d'IA sont confrontés pour fournir leurs produits aux utilisateurs mondiaux"
. Les poids complets du modèle, qui permettraient à des tiers de l'exécuter sur leur propre matériel, n'étaient pas prévus avant le 27 juillet — laissant Moonshot comme le seul fournisseur de capacité d'inférence pendant la fenêtre de lancement
.
Moonshot a profité de la pause pour diviser son abonnement en deux formules : Kimi Membership (pour le web, l'application et Work) et Kimi Code Membership (pour les workflows de codage), une restructuration conçue pour mieux allouer les ressources de calcul .
Le lancement de Kimi K3 a eu des répercussions au-delà des benchmarks d'IA. Le Straits Times a directement rapporté que K3 "a alimenté une déroute technologique", et plusieurs médias ont lié cette sortie à une vente massive des valeurs américaines des semi-conducteurs et de l'IA . Bien que des chiffres spécifiques concernant la direction de l'indice Philadelphia Semiconductor ou le mouvement de l'action Nvidia n'aient pas pu être confirmés de manière indépendante à partir de l'ensemble des sources disponibles, le contexte plus large du marché de cette vente massive est bien documenté.
Côté entreprise, Reuters a rapporté le 20 juillet 2026 que la suspension des abonnements "intervient alors que l'entreprise recherche de nouveaux financements, des sources indiquant qu'elle se prépare à une introduction en bourse à Hong Kong" . Cependant, aucune source parmi les preuves disponibles n'a confirmé une résolution spécifique des actionnaires pour un objectif de valorisation de 30 milliards de dollars. Le rapport de Reuters mentionne un projet d'introduction en bourse sans préciser de valorisation cible
.
Les poids complets du modèle Kimi K3 sont prévus pour une publication publique le 27 juillet 2026 . C'est un détail crucial car cela signifie que les développeurs et les organisations pourront éventuellement télécharger, exécuter, inspecter, affiner et posséder le modèle, plutôt que de simplement le louer via une API
. Ce déploiement en deux étapes — API d'abord, poids ouverts onze jours plus tard — donne sa forme à l'ensemble de l'annonce
.
Avant la sortie des poids ouverts, les développeurs peuvent accéder à K3 via kimi.com, l'API Kimi ou OpenRouter . Le modèle parle le SDK OpenAI, prend en charge l'appel d'outils, la sortie structurée et la mise en cache automatique du contexte, et dispose d'une fenêtre de contexte d'un million de tokens sans supplément pour les longs contextes
.
Cela dit, exécuter un modèle de 2,8 billions de paramètres localement n'est pas une mince affaire. La taille du fichier est estimée à environ 1,5 To, et le matériel recommandé comprend 64 GPU NVIDIA H100 ou plus . Pour la plupart des équipes, l'API restera le point d'accès pratique.
Kimi K3 n'est pas le modèle qui détrône GPT-5.6 Sol ou Claude Fable 5 en matière d'intelligence générale — Moonshot lui-même le dit. Mais c'est le modèle qui prouve qu'un système à poids ouverts peut rivaliser avec les modèles propriétaires de pointe sur des tâches spécifiques et commercialement précieuses, tout en coûtant une fraction du prix. C'est le plus grand modèle à poids ouverts jamais publié, et il est arrivé avec une demande réelle suffisante pour faire planter l'infrastructure GPU d'une entreprise en deux jours.
Cette combinaison — des performances de niveau supérieur sur les benchmarks agentiques, une tarification agressive, des poids ouverts, et un signal clair de la demande — fait de K3 une étape importante dans le paysage de l'IA, quelle que soit sa position sur un quelconque classement.