A Kog disponibilizou como código aberto o Laneformer 2B (2,3 bilhões de parâmetros), um modelo de codificação ajustado por instruções, projetado para velocidade de decodificação em vez de pontuação bruta em benchmarks. Essas velocidades são aproximadamente 10x mais rápidas que a taxa de transferência típica do vLLM para um modelo deste tamanho.
A prévia técnica pública da Kog funciona em um modelo de 2B. A empresa agora corre para escalar suas técnicas:
ZML — Também uma startup francesa de IA (endossada por Yann LeCun), a ZML adota uma abordagem diferente: lançou o LLMD, um motor de inferência gratuito que permite que muitos modelos de código aberto sejam executados em uma grande variedade de chips (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) usando uma abordagem unificada baseada em compilador. A ZML prioriza a portabilidade de hardware e suporte a múltiplos chips em vez de latência extrema de requisição única. A Kog, por outro lado, é propositalmente construída para a máxima redução de latência em GPUs de datacenter de ponta específicas (MI300X, H200) por meio de otimização profunda e específica de hardware.
Cerebras — Usa uma estratégia fundamentalmente focada em hardware: o Wafer-Scale Engine (WSE-3), um chip único massivo que elimina a necessidade de comunicação multi-GPU. A Cerebras alcança ~2.100 tokens/s no Llama 3.1 70B (batch 1) em seu hardware WSE-3 — notavelmente, essa velocidade é para um modelo de 70B, não um modelo de 2B.
Ressalva importante: O resultado de 3.000 tok/s da Kog é em um modelo de 2,3B de parâmetros — uma ordem de magnitude menor do que os modelos de 70B que a Cerebras atende em velocidades comparáveis. A Kog ainda precisa demonstrar sua alegação de 30x em escala. O próximo marco da empresa (10x em um modelo industrial grande) será o ponto de prova crítico.