Den centrala innovationen är en monokernel – ett enda, ihållande GPU-resident program som kör hela LLM-avkodningspasset (prefill, decode, LM-head sampling) i ett svep, vilket eliminerar den per-token kernel-uppstartsomkostnad som plågar standardstackar . Standardinferensramverk som vLLM, SGLang och TensorRT-LLM startar en GPU-kernel per token, var och en med cirka 4,5 μs uppstartsomkostnad plus HBM-omstartsfördröjning
. Kogs motor kringgår standardkommunikationsbibliotek och eliminerar gridsynkroniseringar som man mätt upp tar 35 % av per-token genereringstiden
.
Påståendet om "30 gånger snabbare" är kalibrerat mot typiska avkodningshastigheter på 100–300 tokens/s för 2B–8B-modeller på högklassiga GPU:er, jämfört med Kogs 3 000 tokens/s .
Resultat:
Begränsningar:
Kog riktar in sig på tre huvudsakliga scenarier:
På affärssidan rapporterade Kog 200+ konkreta affärskontakter i augusti 2026, enligt VD Delalleau . Tech-previewn hamnade på förstasidan av Hacker News i maj 2026
. Företaget har tagit in en såddrunda som medleddes av Varsity VC, vars partner Kamel Zeroual var Delalleaus medgrundare i hans första startup, Stribe
.
VD Gaël Delalleau har en ovanlig bakgrund för AI-infrastruktur: fasta-tillståndsfysik och offensiv cybersäkerhet .
Kog står inför tre betydande skalningshinder:
Kogs nästa kritiska milstolpe är att bevisa att dess metod fungerar på stora språkmodeller (70B+ parametrar). VD Delalleau har sagt att företaget nu fokuserar på att skala sina tekniker till fullskaliga LLM:er. Förtroendet kommer från nyare GPU-arkitekturer med väsentligt högre minnesbandbredd – en resurs som Kog anser förblir fundamentalt underutnyttjad av standardmjukvarustackar . Företaget har inte annonserat ett specifikt datum, men denna demonstration ses allmänt som den avgörande bevispunkten för hela tesen.