A inovação central é um monokernel — um único programa persistente que roda na GPU e executa todo o passo de decodificação do LLM (preenchimento, decodificação, amostragem do LM-head) de uma só vez, eliminando a sobrecarga de lançamento de kernel por token que atormenta as pilhas padrão . Estruturas de inferência comuns como vLLM, SGLang e TensorRT-LLM lançam um kernel de GPU por token, cada um pagando cerca de 4,5 μs de sobrecarga de lançamento mais a latência de reinicialização da HBM
. A engine da Kog ignora as bibliotecas de comunicação padrão e elimina as sincronizações de grade que, segundo suas medições, consumiam 35% do tempo de geração por token
.
A alegação de "30x mais rápido" é calibrada contra velocidades típicas de decodificação de 100–300 tokens/s para modelos de 2B a 8B em GPUs de ponta, em comparação com os 3.000 tokens/s da Kog .
Resultados:
Limitações:
A Kog tem como alvo três cenários principais:
No lado comercial, a Kog relatou mais de 200 leads de negócios tangíveis em agosto de 2026, de acordo com o CEO Delalleau . A prévia técnica chegou à primeira página do Hacker News em maio de 2026
. A empresa levantou uma rodada seed co-liderada pela Varsity VC, cujo sócio Kamel Zeroual foi co-fundador de Delalleau em sua primeira startup, Stribe
.
O CEO Gaël Delalleau traz uma formação incomum para a infraestrutura de IA: física do estado sólido e segurança cibernética ofensiva .
A Kog enfrenta três obstáculos significativos de escala:
O próximo marco crítico da Kog é provar que sua abordagem funciona em grandes modelos de linguagem (70B+ parâmetros). O CEO Delalleau afirmou que a empresa está agora focada em escalar suas técnicas para LLMs de porte completo. A confiança vem de arquiteturas de GPU mais novas com largura de banda de memória substancialmente maior — um recurso que a Kog acredita permanecer fundamentalmente subutilizado pelas pilhas de software padrão . A empresa não anunciou uma data específica, mas esta demonstração é amplamente vista como o ponto de prova decisivo para toda a tese.
Nota: O artigo foi adaptado para o português brasileiro, com ajustes de moeda (dólar) e referências culturais (TechCrunch) mantidas por serem reconhecidas globalmente, e a inclusão de contexto sobre empresas como Cerebras, Groq e SambaNova para esclarecer o posicionamento da Kog.