Ключевая инновация — монокерн (monokernel): единая постоянная программа, работающая на GPU, которая выполняет весь цикл декодинга LLM (prefill, decode, LM-head sampling) за один заход, устраняя накладные расходы на запуск ядер для каждого токена, которые преследуют стандартные стеки . Стандартные фреймворки инференса, такие как vLLM, SGLang и TensorRT-LLM, запускают одно ядро GPU на каждый токен, каждое с накладными расходами около 4,5 мкс плюс задержка перезапуска HBM
. Движок Kog обходит стандартные библиотеки коммуникации и устраняет синхронизации сетки, которые, по его замерам, потребляли 35% времени генерации каждого токена
.
Заявление о «30-кратном ускорении» калибруется относительно типичной скорости декодинга в 100–300 токенов/с для моделей 2B–8B на высокопроизводительных GPU, в сравнении с 3000 токенов/с у Kog .
Результаты:
Ограничения:
Kog нацеливается на три основных сценария:
В бизнес-плане Kog сообщил о 200+ реальных бизнес-лидах по состоянию на август 2026 года, по словам CEO Деллало . Технопревью попало на главную страницу Hacker News в мае 2026 года
. Компания привлекла начальный раунд финансирования, со-лидом которого выступил Varsity VC, партнёр которого Камель Зеруаль был сооснователем Деллало в его первом стартапе Stribe
.
CEO Гаэль Деллало привносит в AI-инфраструктуру необычный бэкграунд: физика твёрдого тела и наступательная кибербезопасность .
Kog сталкивается с тремя серьёзными препятствиями в масштабировании:
Следующий критический рубеж для Kog — доказать, что его подход работает на больших языковых моделях (70B+ параметров). CEO Деллало заявил, что компания сейчас сосредоточена на масштабировании своих техник до полномасштабных LLM. Уверенность основана на том, что более новые архитектуры GPU имеют существенно более высокую пропускную способность памяти — ресурс, который, по мнению Kog, остаётся фундаментально недоиспользованным стандартными программными стеками . Компания не объявила конкретную дату, но эта демонстрация широко рассматривается как решающее «или пан, или пропал» доказательство всей концепции.