Kog досягає 3000 вихідних токенів/с на один запит на вузлі 8× AMD MI300X, використовуючи виключно програмний рушій — без спеціалізованого обладнання, квантування та спекулятивної декодинги, завдяки спільному проєктува... Ключова інновація — Delayed Tensor Parallelism (DTP) — затримує між GPU all reduce на 2 шари, пе...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog — це французький стартап, який стверджує, що може досягти до 30-кратного прискорення LLM-інференсу на звичайних датацентрових GPU завдяки глибокому, програмно-орієнтованому стеку оптимізації. Підхід компанії полягає у спільному проєктуванні власної архітектури моделі (Laneformer), одноядерного рушія інференсу (KIE) та власного комунікаційного шару (KCCL) для усунення всіх джерел простою в циклі декодингу.
Замість створення спеціалізованих ASIC або придбання екзотичного обладнання, Kog розглядає три рівні як єдину спроєктовану систему:
Kog відкрив вихідний код Laneformer 2B (2.3 млрд параметрів) — інструкційно налаштованої моделі для кодування, призначеної для швидкості декодингу, а не для найвищих показників бенчмарків. Ці швидкості приблизно в 10 разів перевищують типову пропускну здатність vLLM для моделі такого розміру.
Публічний технічний попередній перегляд Kog працює на моделі 2B. Компанія зараз зосереджена на масштабуванні своїх технік:
ZML — Також французький AI-стартап (схвалений Янном ЛеКуном), ZML обирає інший підхід: він випустив LLMD, безкоштовний рушій інференсу, який дозволяє багатьом моделям з відкритим кодом працювати на різноманітних чипах (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) за допомогою уніфікованого підходу на основі компілятора. ZML пріоритезує переносимість обладнання та підтримку різних чипів, а не екстремальну затримку одного запиту. Kog, навпаки, створений для максимального зменшення затримки на конкретних високопродуктивних датацентрових GPU (MI300X, H200) через глибоку, специфічну для обладнання оптимізацію.
Cerebras — Використовує принципово іншу стратегію, орієнтовану на обладнання: Wafer-Scale Engine (WSE-3), масивний одночип, який усуває необхідність багато-GPU комунікації. Cerebras досягає ~2100 токенів/с на Llama 3.1 70B (batch 1) на своєму обладнанні WSE-3 — примітно, що ця швидкість досягається для 70B моделі, а не 2B.
Ключове застереження: Результат Kog у 3000 токенів/с досягнуто на моделі 2.3B, що на порядок менше, ніж 70B моделі, які Cerebras обслуговує на порівнянних швидкостях. Kog ще має продемонструвати свою заяву про 30-кратне прискорення в масштабі. Наступний етап компанії (10x на великій промисловій моделі) стане критичним доказом.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kog досягає 3000 вихідних токенів/с на один запит на вузлі 8× AMD MI300X, використовуючи виключно програмний рушій — без спеціалізованого обладнання, квантування та спекулятивної декодинги, завдяки спільному проєктува...
Kog досягає 3000 вихідних токенів/с на один запит на вузлі 8× AMD MI300X, використовуючи виключно програмний рушій — без спеціалізованого обладнання, квантування та спекулятивної декодинги, завдяки спільному проєктува... Ключова інновація — Delayed Tensor Parallelism (DTP) — затримує між GPU all reduce на 2 шари, перекриваючи комунікацію з обчисленнями та усуваючи простої, характерні для стандартного тензорного паралелізму.
Kog ще не продемонстрував повну заяву про 30 кратне прискорення на масштабних моделях (найкраща демонстрація — на 2B моделі); наступним критичним доказом стане 10 кратне прискорення на великій промисловій моделі.