Kog AI ha raggiunto oltre 3.000 token al secondo per richiesta su un nodo 8× AMD MI300X — circa 30 volte più veloce dei 100–300 token/s tipici — eliminando il sovraccarico dei kernel con un 'monokernel' che esegue l'i... La tech preview del maggio 2026 ha funzionato solo su un modello da 2,3 miliardi di parametri (L...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog, how does its approach to GPU inference acceleration differ from the hardware-centric strategy of companies like Cerebras, what. Article summary: Here is a comprehensive breakdown of Kog, covering all the areas you asked about.. Topic tags: general, general web, user generated, academic, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
L'industria AI ha speso miliardi per rincorrere chip più veloci. La startup parigina Kog AI scommette che il vero problema fosse un altro — e la sua tech preview del maggio 2026 suggerisce che la scommessa potrebbe reggere.
Kog (Kog AI) è una startup francese di infrastruttura AI fondata nel 2023 da Gaël Delalleau. Il suo prodotto principale è il Kog Inference Engine (KIE), un motore di inferenza puramente software che accelera drasticamente l'inferenza dei LLM su GPU standard per datacenter, senza bisogno di chip custom . L'azienda è uscita dalla modalità stealth nel maggio 2025 e ha lanciato una tech preview pubblica il 28 maggio 2026
.
Cerebras produce chip wafer-scale su misura. Groq e SambaNova seguono percorsi simili, incentrati sull'hardware. Kog punta sulla scommessa opposta: una quantità enorme di prestazioni inespresse nelle GPU esistenti viene sprecata da stack software inefficienti, e un'ottimizzazione software profonda può eguagliare o superare le velocità dell'hardware dedicato senza nuovi chip .
L'innovazione chiave è un monokernel — un singolo programma persistente residente sulla GPU che esegue l'intero passaggio di decoding del LLM (prefill, decode, sampling dalla testa LM) in un colpo solo, eliminando il sovraccarico del lancio di un kernel per ogni token che affligge gli stack standard . I framework standard come vLLM, SGLang e TensorRT-LLM lanciano un kernel GPU per token, ciascuno con un overhead di lancio di circa 4,5 μs più la latenza di riavvio dell'HBM
. Il motore di Kog bypassa le librerie di comunicazione standard ed elimina le sincronizzazioni di griglia, misurate come causa del 35% del tempo di generazione per token
.
L'affermazione "30 volte più veloce" è calibrata rispetto alle velocità tipiche di decoding di 100–300 token/s per modelli da 2 a 8 miliardi di parametri su GPU di fascia alta, confrontate con i 3.000 token/s di Kog .
Risultati:
Limiti:
Kog punta a tre scenari principali:
Sul fronte commerciale, Kog ha dichiarato di aver raccolto oltre 200 lead commerciali concreti ad agosto 2026, secondo il CEO Delalleau . La tech preview ha raggiunto la prima pagina di Hacker News nel maggio 2026
. L'azienda ha chiuso un seed round co-guidato da Varsity VC, il cui partner Kamel Zeroual era stato co-fondatore di Delalleau nella sua prima startup, Stribe
.
Il CEO Gaël Delalleau porta un background insolito nell'infrastruttura AI: fisica dello stato solido e sicurezza informatica offensiva .
Kog deve affrontare tre ostacoli significativi di scalabilità:
Il prossimo traguardo critico per Kog è dimostrare che il suo approccio funziona su modelli linguistici di grandi dimensioni (70 miliardi+ parametri). Il CEO Delalleau ha dichiarato che l'azienda è ora concentrata sul portare le sue tecniche ai LLM su scala reale. La fiducia deriva dalle architetture GPU più recenti con larghezza di banda della memoria sostanzialmente maggiore — una risorsa che Kog ritiene rimanga fondamentalmente sottoutilizzata dagli stack software standard . L'azienda non ha annunciato una data specifica, ma questa dimostrazione è ampiamente considerata come il punto di prova decisivo per l'intera tesi.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kog AI ha raggiunto oltre 3.000 token al secondo per richiesta su un nodo 8× AMD MI300X — circa 30 volte più veloce dei 100–300 token/s tipici — eliminando il sovraccarico dei kernel con un 'monokernel' che esegue l'i...
Kog AI ha raggiunto oltre 3.000 token al secondo per richiesta su un nodo 8× AMD MI300X — circa 30 volte più veloce dei 100–300 token/s tipici — eliminando il sovraccarico dei kernel con un 'monokernel' che esegue l'i... La tech preview del maggio 2026 ha funzionato solo su un modello da 2,3 miliardi di parametri (Laneformer 2B), supporta due architetture GPU (AMD MI300X e NVIDIA H200) e ha mostrato prestazioni per singolo utente, non...
Con oltre 200 lead commerciali e un seed round guidato da Varsity VC, Kog punta a flussi di lavoro agente AI, inferenza in tempo reale e inferenza enterprise self hosted, posizionandosi come alternativa software first...