Francuski startup Kog zaprezentował 28 maja 2026 roku publiczną wersję demonstracyjną swojego silnika inferencyjnego KIE, który na pojedynczym węźle 8× AMD MI300X osiągnął ponad 3000 tokenów wyjściowych na sekundę – o... Przełom polega na zastosowaniu monojądra: jeden, nieprzerwany program na GPU wykonuje cały proce...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog, how does its approach to GPU inference acceleration differ from the hardware-centric strategy of companies like Cerebras, what. Article summary: Here is a comprehensive breakdown of Kog, covering all the areas you asked about.. Topic tags: general, general web, user generated, academic, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
Branża AI wydała miliardy na szybsze chipy. Paryski startup Kog obstawia, że rozwiązywano zły problem – a zapowiedź techniczna z maja 2026 roku sugeruje, że ten zakład może być trafiony.
Kog (Kog AI) to francuski startup infrastruktury AI założony w 2023 roku przez Gaëla Delalleau. Jego flagowym produktem jest Kog Inference Engine (KIE) – silnik inferencyjny działający wyłącznie w oprogramowaniu, który radykalnie przyspiesza inferencję LLM na standardowych GPU w centrach danych, bez potrzeby stosowania niestandardowych chipów . Firma wyszła z ukrycia w maju 2025 roku, a publiczną wersję demonstracyjną udostępniła 28 maja 2026
.
Cerebras buduje chipy waflowe na zamówienie. Groq i SambaNova podążają podobną, sprzętową ścieżką. Kog stawia na odwrotne podejście: ogromny potencjał wydajnościowy istniejących GPU jest marnowany przez nieefektywne oprogramowanie, a głęboka optymalizacja kodu może dorównać lub przewyższyć prędkości dedykowanego sprzętu bez produkcji nowych chipów .
Kluczową innowacją jest monojądro – jeden, trwały program rezydujący na GPU, który wykonuje cały proces dekodowania LLM (prefill, dekodowanie, próbkowanie LM-head) w jednym przebiegu, eliminując narzut na uruchamianie jąder dla każdego tokena, który obciąża standardowe stosy . Standardowe frameworki inferencyjne, takie jak vLLM, SGLang i TensorRT-LLM, uruchamiają jedno jądro GPU na token, każde z narzutem około 4,5 μs plus czas restartu HBM
. Silnik Kog omija standardowe biblioteki komunikacyjne i eliminuje synchronizacje gridu, które – jak zmierzono – pochłaniały 35% czasu generowania każdego tokena
.
Twierdzenie o „30-krotnym przyspieszeniu” opiera się na porównaniu z typową prędkością dekodowania 100–300 tok/s dla modeli 2B–8B na wysokiej klasy GPU, podczas gdy Kog osiąga 3000 tok/s .
Wyniki:
Ograniczenia:
Kog celuje w trzy główne obszary:
Na froncie biznesowym Kog odnotował ponad 200 konkretnych leadów biznesowych według stanu na sierpień 2026 roku, co podał CEO Delalleau . Demonstracja techniczna trafiła na pierwszą stronę Hacker News w maju 2026 roku
. Firma pozyskała rundę seed współprowadzoną przez Varsity VC, którego partner Kamel Zeroual był współzałożycielem Delalleau w jego pierwszym startupie, Stribe
.
CEO Gaël Delalleau wnosi do infrastruktury AI nietypowe doświadczenie: fizykę ciała stałego i ofensywne cyberbezpieczeństwo .
Przed Kog stoją trzy istotne wyzwania związane ze skalowaniem:
Następnym krytycznym kamieniem milowym dla Kog jest udowodnienie, że ich podejście działa na dużych modelach językowych (70B+ parametrów). CEO Delalleau oświadczył, że firma koncentruje się teraz na skalowaniu swoich technik do pełnowymiarowych LLM. Pewność siebie wynika z nowszych architektur GPU o znacznie wyższej przepustowości pamięci – zasobu, który według Kog pozostaje fundamentalnie niewykorzystany przez standardowe stosy oprogramowania . Firma nie ogłosiła konkretnej daty, ale demonstracja ta jest powszechnie postrzegana jako decydujący test dla całej tezy.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Francuski startup Kog zaprezentował 28 maja 2026 roku publiczną wersję demonstracyjną swojego silnika inferencyjnego KIE, który na pojedynczym węźle 8× AMD MI300X osiągnął ponad 3000 tokenów wyjściowych na sekundę – o...
Francuski startup Kog zaprezentował 28 maja 2026 roku publiczną wersję demonstracyjną swojego silnika inferencyjnego KIE, który na pojedynczym węźle 8× AMD MI300X osiągnął ponad 3000 tokenów wyjściowych na sekundę – o... Przełom polega na zastosowaniu monojądra: jeden, nieprzerwany program na GPU wykonuje cały proces dekodowania LLM (prefill, dekodowanie, próbkowanie), eliminując narzut związany z uruchamianiem osobnych jąder dla każd...
Demonstracja objęła tylko model 2,3B (Laneformer 2B), obsługiwała zaledwie dwa typy GPU (AMD MI300X i NVIDIA H200) i działała w trybie jednoużytkowniczym – bez obsługi wsadowej i przy dużym obciążeniu.