Kog ha rilasciato come open source Laneformer 2B (2,3 miliardi di parametri), un modello di codifica istruito progettato per la velocità di decoding piuttosto che per un punteggio grezzo nei benchmark. Queste velocità sono circa 10 volte superiori alla produttività tipica di vLLM per un modello di queste dimensioni.
L'anteprima tecnica pubblica di Kog funziona su un modello da 2 miliardi di parametri. L'azienda ora sta correndo per scalare le sue tecniche:
ZML — Anche questa una startup francese (sostenuta da Yann LeCun), ZML adotta un approccio diverso: ha rilasciato LLMD, un motore di inferenza gratuito che permette di eseguire molti modelli open-source su una varietà di chip (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) usando un approccio unificato basato su compilatore. ZML dà priorità alla portabilità hardware e al supporto multi-chip piuttosto che alla latenza estrema per singola richiesta. Kog, al contrario, è costruito appositamente per la massima riduzione della latenza su specifiche GPU da datacenter di fascia alta (MI300X, H200) attraverso un'ottimizzazione hardware-specifica profonda.
Cerebras — Utilizza una strategia fondamentalmente hardware-first: il Wafer-Scale Engine (WSE-3), un chip singolo massiccio che elimina la necessità di comunicazione multi-GPU. Cerebras raggiunge ~2.100 token/s su Llama 3.1 70B (batch 1) sul suo hardware WSE-3 — notevolmente, quella velocità è per un modello da 70B, non da 2B.
Avvertenza chiave: Il risultato di 3.000 tok/s di Kog è su un modello da 2,3 miliardi di parametri — un ordine di grandezza più piccolo dei modelli da 70B che Cerebras serve a velocità comparabili. Kog deve ancora dimostrare la sua affermazione 30x su larga scala. Il prossimo traguardo dell'azienda (10x su un modello industriale di grandi dimensioni) sarà il punto di prova critico.