Kog'un temel yeniliği monokernel (tek çekirdek) olarak adlandırılıyor. Bu, tüm LLM kod çözme aşamasını (ön doldurma, kod çözme, LM-başlığı örnekleme) tek seferde çalıştıran, kalıcı ve tek bir GPU programıdır. Bu sayede, standart yığınları etkileyen her bir token için yapılan kernel başlatma yükü ortadan kalkar . Standart çıkarım çerçeveleri (vLLM, SGLang, TensorRT-LLM gibi) her token için bir GPU kernel'i başlatır ve her biri yaklaşık 4,5 μs'lik bir başlatma yükü ve HBM yeniden başlatma gecikmesi öder
. Kog'un motoru, standart iletişim kütüphanelerini devre dışı bırakır ve toplam token üretim süresinin %35'ini oluşturduğu ölçülen grid senkronizasyonlarını ortadan kaldırır
.
"30 kat daha hızlı" iddiası, üst düzey GPU'larda 2B-8B modelleri için tipik olan saniyede 100-300 tokenlik çözme hızına karşılık, Kog'un saniyede 3.000 tokenlik hızına dayanmaktadır .
Sonuçlar:
Sınırlamalar:
Kog üç ana senaryoyu hedefliyor:
İş tarafında, Kog, CEO Delalleau'ya göre Ağustos 2026 itibarıyla 200'ün üzerinde somut iş bağlantısı bildirdi . Teknik önizleme, Mayıs 2026'da Hacker News'in ön sayfasına çıktı
. Şirket, tohum yatırım turunu Varsity VC liderliğinde tamamladı; Varsity VC'nin ortağı Kamel Zeroual, Delalleau'nun ilk girişimi Stribe'deki kurucu ortağıydı
.
CEO Gaël Delalleau, yapay zeka altyapısına sıra dışı bir geçmişle geliyor: katı hal fiziği ve saldırı amaçlı siber güvenlik (offensive cybersecurity) .
Kog'un karşılaştığı üç temel ölçeklendirme engeli:
Kog için bir sonraki kritik dönüm noktası, yaklaşımının büyük dil modellerinde (70B+ parametre) işe yaradığını kanıtlamak. CEO Delalleau, şirketin artık tekniklerini tam ölçekli LLM'lere ölçeklemeye odaklandığını belirtti. Güven, standart yazılım yığınları tarafından temelde yetersiz kullanıldığına inandıkları, önemli ölçüde daha yüksek bellek bant genişliğine sahip yeni GPU mimarilerinden geliyor . Şirket henüz belirli bir tarih açıklamadı, ancak bu gösterim, tüm tez için ya hep ya hiç anlamına gelen bir kanıt noktası olarak görülüyor.