Kog consigue 3000 tokens/s por petición en un nodo de 8× AMD MI300X usando solo software — sin hardware a medida, sin cuantización y sin decodificación especulativa — gracias al codiseño de una arquitectura de modelo... Su innovación principal, el Paralelismo de Tensores Retardado (DTP), retrasa la comunicación entr...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog es una startup francesa que afirma conseguir hasta 30 veces más rapidez en la inferencia de grandes modelos de lenguaje (LLM) en GPUs de datacenter convencionales. Lo logra mediante una pila de optimización puramente software que codiseña una arquitectura de modelo propia (Laneformer), un motor de inferencia de un solo kernel (KIE) y una capa de comunicación personalizada (KCCL) para eliminar cualquier fuente de bloqueo en el bucle de decodificación.
En lugar de construir ASICs personalizados o adquirir hardware exótico, Kog trata tres capas como un solo sistema codiseñado:
Kog publicó en código abierto Laneformer 2B (2.300 millones de parámetros), un modelo de codificación ajustado por instrucciones diseñado para velocidad de decodificación antes que para puntuaciones brutas en benchmarks. Estas velocidades son aproximadamente 10 veces más rápidas que el rendimiento típico de vLLM para un modelo de este tamaño.
La vista previa técnica pública de Kog funciona con un modelo de 2B. La compañía ahora compite por escalar sus técnicas:
ZML — También una startup francesa de IA (avalada por Yann LeCun), ZML toma un enfoque diferente: lanzó LLMD, un motor de inferencia gratuito que permite ejecutar muchos modelos de código abierto en una gran variedad de chips (NVIDIA, AMD, TPU de Google, Apple Metal, Intel Arc) utilizando un enfoque unificado basado en compiladores. ZML prioriza la portabilidad del hardware y el soporte multi-chip frente a la latencia extrema de una sola petición. Kog, por el contrario, está diseñado específicamente para la máxima reducción de latencia en GPUs de datacenter de gama alta concretas (MI300X, H200) mediante una optimización profunda y específica del hardware.
Cerebras — Utiliza una estrategia fundamentalmente centrada en el hardware: el Wafer-Scale Engine (WSE-3), un chip masivo único que elimina la necesidad de comunicación entre múltiples GPUs. Cerebras consigue ~2.100 tokens/s en Llama 3.1 70B (batch 1) en su hardware WSE-3 — notablemente, esa velocidad es para un modelo de 70B, no de 2B.
Advertencia clave: El resultado de 3.000 tok/s de Kog es en un modelo de 2.300 millones de parámetros, un orden de magnitud más pequeño que los modelos de 70B que Cerebras sirve a velocidades comparables. Kog aún tiene que demostrar su afirmación de 30x a escala. El próximo hito de la compañía (10x en un modelo industrial grande) será el punto de prueba crítico.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Kog consigue 3000 tokens/s por petición en un nodo de 8× AMD MI300X usando solo software — sin hardware a medida, sin cuantización y sin decodificación especulativa — gracias al codiseño de una arquitectura de modelo...
Kog consigue 3000 tokens/s por petición en un nodo de 8× AMD MI300X usando solo software — sin hardware a medida, sin cuantización y sin decodificación especulativa — gracias al codiseño de una arquitectura de modelo... Su innovación principal, el Paralelismo de Tensores Retardado (DTP), retrasa la comunicación entre GPUs en 2 capas para solaparla con el cómputo, eliminando los cuellos de botella que afectan al paralelismo de tensore...
Kog aún no ha demostrado su afirmación de 30x a escala completa (su mejor demo es en un modelo de 2B parámetros); el próximo hito crítico será una mejora de 10x en un modelo de tamaño industrial en los próximos meses.