Kog oppnår 3000 tokens per sekund per forespørsel på en 8× AMD MI300X node med en ren programvaredrevet inferensmotor – uten spesialmaskinvare, kvantisering eller spekulativ dekoding. Kjerneinnovasjonen – forsinket tensor parallellisme (DTP) – utsetter kommunikasjon mellom GPUer med 2 lag, slik at overlapp med bereg...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog er en fransk startup som hevder å kunne oppnå opptil 30x raskere LLM-inferens på eksisterende datacenter-GPUer, ved hjelp av en dyp, programvarefokusert optimaliseringsstabel – der en spesialdesignet modellarkitektur (Laneformer), en enkeltkjerne-inferensmotor (KIE) og et egendefinert kommunikasjonslag (KCCL) samdesignes for å eliminere alle kilder til hastighetstap i dekodingsløkken.
I stedet for å bygge egne ASIC-er eller anskaffe eksotisk maskinvare, behandler Kog tre lag som ett samdesignet system:
Kog åpnet kildekoden til Laneformer 2B (2,3 milliarder parametere), en instruksjonstilpasset kodingsmodell designet for dekodingshastighet fremfor rå benchmark-score. Disse hastighetene er omtrent 10x raskere enn typisk vLLM-gjennomstrømning for en modell av denne størrelsen.
Kogs offentlige teknologipreview kjører på en 2B-modell. Selskapet jobber nå med å skalere teknikkene:
ZML – Også en fransk KI-startup (anbefalt av Yann LeCun), ZML tar en annen tilnærming: de lanserte LLMD, en gratis inferensmotor som lar mange åpne kildemodeller kjøre på en lang rekke brikker (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) ved hjelp av en enhetlig kompilatorbasert tilnærming. ZML prioriterer maskinvareportabilitet og støtte for flere brikker fremfor ekstrem én-forespørsels-latens. Kog er derimot skreddersydd for maksimal latensreduksjon på spesifikke avanserte datacenter-GPUer (MI300X, H200) gjennom dyp, maskinvarespesifikk optimalisering.
Cerebras – Bruker en fundamentalt maskinvareførste strategi: Wafer-Scale Engine (WSE-3), en massiv enkeltbrikke som eliminerer behovet for kommunikasjon mellom flere GPUer. Cerebras oppnår ~2100 tokens/s på Llama 3.1 70B (batch 1) på WSE-3-maskinvaren – merk at denne hastigheten er for en 70B-modell, ikke en 2B-modell.
Viktig forbehold: Kogs 3000 tok/s-resultat gjelder en 2,3B-modell – en størrelsesorden mindre enn 70B-modellene Cerebras betjener med sammenlignbare hastigheter. Kog har ennå ikke demonstrert 30x-påstanden i stor skala. Selskapets neste milepæl (10x på en stor industrimodell) vil være det kritiske beviset.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kog oppnår 3000 tokens per sekund per forespørsel på en 8× AMD MI300X node med en ren programvaredrevet inferensmotor – uten spesialmaskinvare, kvantisering eller spekulativ dekoding.
Kog oppnår 3000 tokens per sekund per forespørsel på en 8× AMD MI300X node med en ren programvaredrevet inferensmotor – uten spesialmaskinvare, kvantisering eller spekulativ dekoding. Kjerneinnovasjonen – forsinket tensor parallellisme (DTP) – utsetter kommunikasjon mellom GPUer med 2 lag, slik at overlapp med beregning eliminerer flaskehalser.
Kog har ennå ikke vist 30x ytelse i stor skala – beste demo er på en 2B modell; neste milepæl er 10x forbedring på en stor modell.