Oto historia tej premiery – co model potrafi, ile kosztuje i dlaczego stanowi przełom w trwającej rywalizacji AI między USA a Chinami.
Kimi K3 uzyskał 57,1 punktu w niezależnym indeksie Artificial Analysis Intelligence v4.1, co daje mu 3. miejsce na świecie – za modelem Claude Fable 5 (60 pkt) i GPT-5.6 Sol (59 pkt) . Różnica wynosi zaledwie około 3 punktów, co jest bardzo wyrównanym wynikiem jak na standardy branży. Mimo to najszerszy dostępny test inteligencji wciąż faworyzuje czołowe modele amerykańskie
. Sam Moonshot przyznał to publicznie, oświadczając, że K3 „wciąż ustępuje najpotężniejszym zastrzeżonym modelom” Anthropic i OpenAI w ogólnej łącznej ocenie
.
Tam, gdzie K3 wysuwa się na prowadzenie, są konkretne, praktyczne benchmarki agentowe:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| DeepSWE | 73,0 | 70,0 | 67,5 | 59,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| Automation Bench | 75,6 | — | — | — |
| SpreadsheetBench 2 | 34,8 | 34,7 | 32,4 | 31,6 |
W tych pięciu benchmarkach agentowych oraz Program Bench (77,8) Kimi K3 wygrał 5 z 6 – pokonując zarówno Fable 5, jak i GPT-5.6 Sol . Co więcej, znacznie przewyższył Claude Opus 4.8 na każdym opublikowanym benchmarku – to istotny wynik, ponieważ Opus 4.8 wyceniany jest na 5 USD za wejście i 25 USD za wyjście na milion tokenów, co czyni go bezpośrednim konkurentem cenowym
.
Na platformie Arena, która wykorzystuje oceny preferencji przez ludzi (stworzonej przez naukowców z UC Berkeley), K3 wkrótce po premierze objął prowadzenie w rankingu kodowania . Oceniający uznali K3 za najlepszy w tworzeniu front-endu stron internetowych z wynikiem 1 679 punktów, wyprzedzając Fable 5 (1 631) i GPT-5.6 Sol (1 618)
.
W zakresie optymalizacji jądra GPU – technik poprawiających interakcję modeli AI ze sprzętem – Moonshot poinformował, że K3 „znacznie przewyższył” Opus 4.8, GPT-5.6 Sol i GPT-5.5 . Ma to istotne znaczenie komercyjne, ponieważ lepsza optymalizacja jądra przekłada się na mniejsze opóźnienia i wyższą przepustowość na tym samym sprzęcie.
Model wykorzystuje rzadką architekturę MoE z 896 ekspertami, z których tylko 16 jest aktywowanych dla każdego tokena, co sprawia, że koszt wnioskowania jest zbliżony do GPT-5.6 Sol, pomimo aż 2,8 biliona parametrów . Wprowadza także Kimi Delta Attention (KDA) i Attention Residuals (AttnRes) – nowatorskie elementy architektoniczne mające na celu poprawę rozumowania przy długich kontekstach
.
Jednym z najbardziej rynkotwórczych aspektów Kimi K3 jest cennik API, który znacząco odbiega od cen topowych modeli z USA:
| Model | Wejście (za 1M tokenów) | Wyjście (za 1M tokenów) |
|---|---|---|
| Kimi K3 | 3,00 USD | 15,00 USD |
| GPT-5.6 Sol | 5,00 USD | 30,00 USD |
| Claude Fable 5 | 10,00 USD | 50,00 USD |
| Claude Opus 4.8 | 5,00 USD | 25,00 USD |
Kimi K3 kosztuje ~40% mniej niż GPT-5.6 Sol i ~70% mniej niż Claude Fable 5 według cenników podstawowych . Te trzy modele układają się w czystą drabinę 3,3 raza: Fable 5 jest 3,3 razy droższy od Kimi K3, a GPT-5.6 Sol plasuje się prawie dokładnie pomiędzy
.
Co więcej, K3 oferuje stawkę za trafienie w pamięć podręczną (cache hit) wynoszącą 0,30 USD za milion tokenów – czyli 10 razy taniej niż w przypadku braku trafienia – dla zapytań kontekstowych, które już były obsłużone . Szacuje się, że na jedno zadanie K3 jest o 50–65% tańszy od amerykańskich flagowców
.
Warto zauważyć, że cennik K3 oznacza znaczącą zmianę w polityce Moonshot: model jest teraz wyceniany jak model graniczny, a nie jak budżetowa opcja . Poprzednie modele, jak K2.5 i K2.6, kosztowały 0,60 USD wejście / 2,50–4,00 USD wyjście, więc K3 jest około 3–4 razy droższy od swoich poprzedników z tej samej rodziny
. Mimo to pozostaje tańszy od najwyższej klasy modeli amerykańskich, oferując porównywalną lub lepszą wydajność w konkretnych zadaniach agentowych.
19 lipca 2026 roku – około 48 godzin po premierze – Moonshot AI ogłosił tymczasowe wstrzymanie nowych subskrypcji dla Kimi K3. Firma napisała na platformie X: „Kimi K3 otrzymał o wiele więcej miłości, niż się spodziewaliśmy, a nasze procesory GPU to odczuwają. W ciągu ostatnich 48 godzin popyt zbliżył się do granic naszej obecnej przepustowości” .
Firma oświadczyła, że priorytetowo potraktuje moc obliczeniową dla istniejących subskrybentów, jednocześnie starając się jak najszybciej zwiększyć przepustowość, i planuje stopniowo otwierać nowe miejsca subskrypcyjne partiami . Dotychczasowi użytkownicy zachowali pełny dostęp, a usługi API i dla przedsiębiorstw działały bez zakłóceń
.
Wiele mediów podkreślało, że ta sytuacja uwidacznia bieżące ograniczenia Chin w zakresie mocy obliczeniowej, wynikające z amerykańskich ograniczeń eksportowych na układy GPU . South China Morning Post napisał, że sytuacja ta „unaocznia wyzwania, przed jakimi stoją chińskie laboratoria AI w obsłudze swoich produktów dla użytkowników na całym świecie”
. Pełne wagi modelu, które umożliwiłyby stronom trzecim uruchomienie go na własnym sprzęcie, nie były planowane przed 27 lipca – przez co Moonshot pozostawał jedynym dostawcą mocy obliczeniowej dla wnioskowania w oknie premierowym
.
Moonshot wykorzystał tę przerwę do podziału swojej subskrypcji na dwa plany: Kimi Membership (dla sieci web, aplikacji i Wok) oraz Kimi Code Membership (dla przepływów pracy związanych z kodowaniem). Restrukturyzacja miała na celu lepsze zarządzanie zasobami obliczeniowymi .
Premiera Kimi K3 odbiła się szerokim echem nie tylko w świecie benchmarków AI. The Straits Times wprost poinformował, że K3 „napędził technologiczną wyprzedaż”, a wiele mediów powiązało premierę z przeceną amerykańskich akcji spółek półprzewodnikowych i AI . Choć dokładnych danych o zmianach indeksu Philadelphia Semiconductor Index czy kursie Nvidii nie udało się niezależnie potwierdzić w dostępnym zbiorze źródeł, szerszy kontekst rynkowy wyprzedaży jest dobrze udokumentowany.
Na froncie korporacyjnym agencja Reuters podała 20 lipca 2026 roku, że wstrzymanie subskrypcji „następuje, gdy firma poszukuje świeżego finansowania, a źródła podają, że zmierza w kierunku pierwszej oferty publicznej w Hongkongu” . Żadne źródło w dostępnych dowodach nie potwierdziło jednak konkretnej uchwały akcjonariuszy o wycenie na 30 miliardów dolarów. Raport Reutersa wspomina o dążeniu do IPO, ale bez określania docelowej wyceny
.
Pełne wagi modelu Kimi K3 mają zostać publicznie udostępnione 27 lipca 2026 roku . To kluczowy szczegół, ponieważ oznacza, że programiści i organizacje będą mogli pobrać, uruchomić, sprawdzić, dostroić i być właścicielem modelu, a nie tylko wynajmować go przez API
. Dwuetapowe wdrożenie – najpierw API, a jedenaście dni później wagi open-weight – to kształt całego ogłoszenia
.
Do czasu udostępnienia wag programiści mogą uzyskać dostęp do K3 za pośrednictwem kimi.com, API Kimi lub OpenRouter . Model obsługuje SDK OpenAI, wywołania narzędzi, ustrukturyzowane dane wyjściowe i automatyczne buforowanie kontekstu, a także okno kontekstowe o długości 1 miliona tokenów – bez dodatkowych opłat za długi kontekst
.
Należy jednak mieć świadomość, że uruchomienie modelu z 2,8 biliona parametrów lokalnie nie jest proste. Szacowany rozmiar pliku to około 1,5 TB, a zalecany sprzęt to 64 lub więcej korporacyjnych procesorów graficznych NVIDIA H100 . Dla większości zespołów API pozostanie praktycznym punktem dostępu.
Kimi K3 nie jest modelem, który detronizuje GPT-5.6 Sol lub Claude Fable 5 w ogólnej inteligencji – mówi to samo Moonshot. Jest to jednak model, który udowadnia, że system open-weight może konkurować z zastrzeżonymi modelami granicznymi w konkretnych, komercyjnie wartościowych zadaniach, kosztując przy tym ułamek ich ceny. Jest to największy kiedykolwiek wydany model open-weight, który dotarł z takim realnym popytem, że w dwa dni przeciążył infrastrukturę GPU swojej firmy.
Ta kombinacja – wydajność na poziomie granicznym w benchmarkach agentowych, agresywna wycena, otwarte wagi i wyraźny sygnał popytu – sprawia, że K3 stanowi znaczący kamień milowy w krajobrazie AI, niezależnie od tego, gdzie plasuje się na danym liście rankingowej.