Kog AI har demonstrert 3000+ tokens per sekund per forespørsel på en enkelt 8× AMD MI300X node — omtrent 30 ganger raskere enn typiske 100–300 tok/s — ved å kjefte hele LLM dekodingen inn i en enkelt vedvarende GPU kj... Tech forhåndsvisningen i mai 2026 kjørte kun på en 2,3 milliarder parametere stor modell (Lanefo...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog, how does its approach to GPU inference acceleration differ from the hardware-centric strategy of companies like Cerebras, what. Article summary: Here is a comprehensive breakdown of Kog, covering all the areas you asked about.. Topic tags: general, general web, user generated, academic, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
AI-industrien har brukt milliarder på å utvikle raskere brikker. Den Paris-baserte oppstarten Kog AI satser på at de har løst feil problem — og tech-forhåndsvisningen i mai 2026 tyder på at veddemålet kan holde vann.
Kog (Kog AI) er en fransk AI-infrastrukturoppstart grunnlagt i 2023 av Gaël Delalleau. Kjerne produktet er Kog Inference Engine (KIE), en programvarebasert inferansemotor som dramatisk akselererer LLM-inferanse på standard datagrafikkort uten å kreve spesialtilpasset silisium . Selskapet kom ut av «stealth»-modus i mai 2025 og lanserte en offentlig tech-forhåndsvisning 28. mai 2026
.
Cerebras bygger spesialbygde wafer-skala brikker. Groq og SambaNova følger lignende maskinvareførste veier. Kog tar det motsatte veddemålet: massiv ytelsesmargin i eksisterende GPUer blir liggende uutnyttet på grunn av ineffektive programvarestabler, og dyptgående programvareoptimalisering kan matche eller overgå dedikert maskinvarehastigheter uten noen nye brikker .
Kjerneinnovasjonen er en monokjerne — et enkelt, vedvarende GPU-resident program som kjører hele LLM-dekodingspasset (prefill, decode, LM-head sampling) i ett eneste trekk, og eliminerer overheaden ved oppstart av kjerner per token som plager standard stabeler . Standard inferanserammer som vLLM, SGLang og TensorRT-LLM starter én GPU-kjerne per token, hver med omtrent 4,5 μs oppstartsoverhead pluss HBM-omstart-latens
. Kogs motor omgår standard kommunikasjonsbiblioteker og eliminerer rutenettsynkroniseringer som de målte til å utgjøre 35 % av tiden per token-generering
.
Påstanden om «30 ganger raskere» er kalibrert mot typiske dekodingshastigheter på 100–300 tokens/s for 2B–8B modeller på avanserte GPUer, sammenlignet med Kogs 3000 tokens/s .
Resultater:
Begrensninger:
Kog retter seg mot tre hovedscenarioer:
På forretningssiden rapporterte Kog 200+ konkrete forretningshenvendelser per august 2026, ifølge administrerende direktør Delalleau . Tech-forhåndsvisningen nådde forsiden av Hacker News i mai 2026
. Selskapet har hentet en såkornsinvestering med Varsity VC som medleder, hvis partner Kamel Zeroual var Delalleaus medgründer i hans første oppstart, Stribe
.
Administrerende direktør Gaël Delalleau har en uvanlig bakgrunn for AI-infrastruktur: faststoff-fysikk og offensiv cybersikkerhet .
Kog står overfor tre betydelige skaleringshindringer:
Kogs neste kritiske milepæl er å bevise at tilnærmingen fungerer på store språkmodeller (70B+ parametere). Administrerende direktør Delalleau har uttalt at selskapet nå fokuserer på å skalere teknikkene sine til fullskala LLM-er. Tilliten kommer fra nyere GPU-arkitekturer med betydelig høyere minnebåndbredde — en ressurs Kog mener fortsatt er fundamentalt underutnyttet av standard programvarestabeler . Selskapet har ikke annonsert en spesifikk dato, men denne demonstrasjonen blir bredt sett på som det avgjørende beviset for hele tesen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kog AI har demonstrert 3000+ tokens per sekund per forespørsel på en enkelt 8× AMD MI300X node — omtrent 30 ganger raskere enn typiske 100–300 tok/s — ved å kjefte hele LLM dekodingen inn i en enkelt vedvarende GPU kj...
Kog AI har demonstrert 3000+ tokens per sekund per forespørsel på en enkelt 8× AMD MI300X node — omtrent 30 ganger raskere enn typiske 100–300 tok/s — ved å kjefte hele LLM dekodingen inn i en enkelt vedvarende GPU kj... Tech forhåndsvisningen i mai 2026 kjørte kun på en 2,3 milliarder parametere stor modell (Laneformer 2B), støttet bare to GPU arkitekturer (AMD MI300X og NVIDIA H200), og viste kun ytelse for én bruker og én forespørs...
Med over 200 forretningshenvendelser og såkornsinvesteringer fra Varsity VC, retter Kog seg mot agentiske AI arbeidsflyter, sanntids inferanse og selvhostet bedriftsinferanse, og posisjonerer seg som et programvarefør...