Kryzys był krótkotrwały, ale wiele mówiący. Obnażył nie tylko surowy apetyt na zaawansowaną sztuczną inteligencję typu open-weight, ale także strukturalne ograniczenia GPU, z jakimi borykają się chińskie laboratoria AI, nawet gdy produkują modele światowej klasy.
Moonshot AI ogłosiło wstrzymanie subskrypcji 19 lipca za pośrednictwem wpisu na X na koncie Kimi: „Kimi K3 otrzymało o wiele więcej miłości, niż się spodziewaliśmy, a nasze GPU to odczuwają. W ciągu ostatnich 48 godzin popyt zbliżył się do granic naszej obecnej wydajności” . Post w ciągu jednego dnia zgromadził ponad 7,2 miliona wyświetleń .
Dotychczasowi subskrybenci nie zostali dotknięci. Moonshot skierował wszystkie dostępne moce obliczeniowe do obecnych członków, jednocześnie gorączkowo zwiększając wydajność, i zapowiedział, że będzie stopniowo wznawiał subskrypcje w partiach tak szybko, jak to możliwe . Firma podzieliła również członkostwo na dwa poziomy – Kimi Membership do ogólnego użytku i Kimi Code Membership do zadań programistycznych – aby lepiej alokować GPU do wnioskowania .
Reuters i South China Morning Post zauważyły, że pauza zbiegła się w czasie z poszukiwaniem przez Moonshot nowego finansowania i przygotowaniami do potencjalnego debiutu giełdowego w Hongkongu, co podkreśla, że kryzys GPU był zarówno szokiem popytowym, jak i symptomem szerszych ograniczeń chipowych w Chinach .
Dwa czynniki sprawiły, że Kimi K3 stał się z dnia na dzień globalnym fenomenem.
Liderstwo w benchmarkach. Kimi K3 zdobył 1679 Elo w rankingu Frontend Code Arena na Arena.ai, pokonując Anthropica Claude Fable 5 (1631) i OpenAI GPT-5.6 Sol (1618) – to pierwszy raz, kiedy chiński model stanął na czele dużego rankingu kodowania . W szerszym indeksie Artificial Analysis Intelligence Index K3 uzyskał 57,1 punktu, znajdując się w zasięgu uderzenia Claude Fable 5 (60 punktów) . Model prowadził również w benchmarkach Program Bench (77,8) i SWE Marathon (42,0), a w Terminal-Bench 2.1 zbliżył się do GPT-5.6 Sol (88,3 wobec 88,8) .
Agresywna strategia otwartych wag. Moonshot opublikował pełne wagi modelu 27 lipca na licencji Modified MIT, udostępniając zaawansowane możliwości do darmowego pobrania i samodzielnego hostowania . Było to bezpośrednie wyzwanie dla strategii zamkniętych wag stosowanych przez OpenAI i Anthropica . W połączeniu z cenami API niższymi niż w przypadku porównywalnych modeli amerykańskich, K3 stał się domyślnym wyborem dla oszczędnych programistów i przedsiębiorstw na całym świecie.
Ta kombinacja sprawiła, że w ciągu kilku dni K3 był konsumowany nie tylko przez własne API Moonshot, ale także przez routery stron trzecich, takie jak OpenRouter – co dodatkowo zwiększyło popyt daleko poza możliwości rezerw GPU Moonshot.
Premiera Kimi K3 była kropką nad „i” w trendzie, który już narastał.
Na OpenRouter, największym neutralnym routerze LLM:
Sam DeepSeek stał się największym pojedynczym dostawcą na OpenRouter z 17,6% kierowanych tokenów, przetwarzając 5,13 biliona tokenów tygodniowo – więcej niż jakiekolwiek pojedyncze amerykańskie laboratorium .
9 sierpnia 2026 roku Gartner opublikował raport „2026 Key AI Trends in China”, prognozując, że wskaźnik adopcji chińskich modeli AI wśród globalnych przedsiębiorstw wzrośnie z 5% w 2025 roku do 50% w 2027 roku . Czynnik napędzający: przedsiębiorstwa odchodzą od polegania na jednym modelu na rzecz strategii wielomodelowych, a chińskie modele oferują porównywalną wydajność przy ułamku kosztów . Gartner przewidział również, że do 2030 roku chińskie firmy będą wykorzystywać rodzime akceleratory AI do ponad 50% swojej infrastruktury AI .
Ta prognoza, opublikowana zaledwie kilka tygodni po premierze K3, sygnalizuje, że rynek postrzega K3 jako katalizator, a nie anomalię.
Wstrzymanie subskrypcji Kimi K3 obnażyło sprzeczność w sercu chińskich ambicji AI. Chińskie laboratoria mogą teraz produkować modele konkurujące z czołowymi amerykańskimi systemami, ale nie są w stanie obsługiwać ich na masową skalę, ponieważ amerykańskie kontrole eksportu od 2022 roku blokują chińskim firmom dostęp do chipów Nvidia H100 i nowszych akceleratorów generacji Blackwell .
Zaciskanie GPU w Moonshot było strukturalne, a nie przypadkowe. Firma opublikowała wyniki benchmarków pokazujące, że jej model dorównuje – a w niektórych obszarach przewyższa – amerykańskie systemy graniczne, ale brakowało jej rezerw sprzętowych, aby sprostać wynikającemu z tego popytowi. Te same ograniczenia chipowe dotyczą całego chińskiego ekosystemu AI, choć są one częściowo łagodzone przez wydajność algorytmiczną (rzadkość MoE) i dystrybucję otwartych wag, która omija sprzętowe bariery .
| Wymiar | Wpływ |
|---|---|
| Wydajność GPU | Popyt na K3 przeciążył klastry Moonshot w ciągu 48 godzin, obnażając chińskie wąskie gardło obliczeniowe pomimo światowej klasy wydajności modelu. |
| Strategia otwartych wag | Publikacja wag K3 (2,8 T) na licencji Modified MIT ustanawia nowy standard otwartości, wywierając presję na amerykańskie laboratoria, aby ponownie rozważyły podejście zamknięte. |
| Presja cenowa | Chińskie ceny API zmuszają amerykańskich dostawców do obniżania marż lub masowej utraty klientów korporacyjnych. |
| Migracja tokenów | Chińskie modele mają teraz ponad 60% wolumenu OpenRouter; odwrócenie z 70% udziału amerykańskiego na 70% chińskiego zajęło około 18 miesięcy. |
| Adopcja korporacyjna | Gartner prognozuje 50% globalnej adopcji chińskiej AI przez przedsiębiorstwa do 2027 roku, w porównaniu z 5% w 2025 roku. |
| Wymiar geopolityczny | Amerykańskie kontrole eksportu chipów, mające na celu ograniczenie chińskiej AI, są częściowo omijane dzięki wydajności algorytmicznej (rzadkość MoE) i dystrybucji otwartych wag, które omijają sprzętowe bariery. |