Kog добился 3 000 выходных токенов/с (8× AMD MI300X) на кастомной 2,3B модели Laneformer без квантования и спекулятивного декодирования — за счёт программной оптимизации «снизу вверх». Ключевые инновации: единый моноядро (monokernel), отложенный тензорный параллелизм (DTP) и собственная библиотека связи KCCL — они у...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Французский стартап Kog утверждает, что может добиться ускорения инференса больших языковых моделей (LLM) до 30 раз на существующих датацентровых GPU — и всё это исключительно за счёт глубокой оптимизации программного стека. Вместо создания собственных ASIC или покупки экзотического «железа» компания спроектировала кастомную архитектуру модели (Laneformer), однокристальный инференс-движок (KIE) и собственный коммуникационный слой (KCCL), чтобы устранить каждую точку простоя в цикле декодирования.
В основе подхода — проектирование трёх уровней как единой системы:
Kog опубликовал в открытом доступе модель Laneformer 2B (2,3 млрд параметров) — настроенную для задач кодирования, оптимизированную для скорости декодирования, а не для абсолютных бенчмарков. Эти скорости примерно в 10 раз выше, чем типичная пропускная способность vLLM для модели такого размера.
Публичный техпревью Kog пока работает на 2B-модели. Компания спешит масштабировать свои методы:
ZML — ещё один французский AI-стартап (поддержанный Яном ЛеКуном). ZML выбрал иной путь: он выпустил LLMD — бесплатный движок для инференса, позволяющий запускать множество открытых моделей на самых разных чипах (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) с помощью единого компиляторного подхода. ZML делает ставку на аппаратную портативность и поддержку множества чипов, а не на экстремальную задержку одиночного запроса. Kog, напротив, создан для максимального снижения задержки на конкретных высокопроизводительных датацентровых GPU (MI300X, H200) через глубокую, аппаратно-зависимую оптимизацию.
Cerebras — использует принципиально иную, «железную» стратегию: Wafer-Scale Engine (WSE-3), огромный одиночный кристалл, устраняющий необходимость в меж-GPU-взаимодействии. Cerebras достигает ~2 100 токенов/с на Llama 3.1 70B (batch 1) на своём WSE-3 — примечательно, что эта скорость достигается для модели на 70B, а не на 2B.
Ключевое предостережение: результат Kog в 3 000 ток/с получен на модели с 2,3B параметров — на порядок меньше, чем 70B-модели, которые Cerebras обслуживает на сопоставимых скоростях. Kog ещё предстоит продемонстрировать своё 30-кратное ускорение в масштабе. Следующая веха компании (10x на крупной отраслевой модели) станет решающим доказательством.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Kog добился 3 000 выходных токенов/с (8× AMD MI300X) на кастомной 2,3B модели Laneformer без квантования и спекулятивного декодирования — за счёт программной оптимизации «снизу вверх».
Kog добился 3 000 выходных токенов/с (8× AMD MI300X) на кастомной 2,3B модели Laneformer без квантования и спекулятивного декодирования — за счёт программной оптимизации «снизу вверх». Ключевые инновации: единый моноядро (monokernel), отложенный тензорный параллелизм (DTP) и собственная библиотека связи KCCL — они устраняют простои GPU при обмене данными между чипами.
Главный вызов — масштабирование: пока рекордные цифры достигнуты на 2B модели; компания обещает в ближайшие месяцы показать 10 кратное ускорение на «тяжёлых» моделях (70B+).