Kog a open-sourcé Laneformer 2B (2,3 milliards de paramètres), un modèle de codage ajusté par instructions conçu pour la vitesse de décodage plutôt que pour un score brut de benchmark. Ces vitesses sont environ 10 fois plus rapides que le débit typique de vLLM pour un modèle de cette taille.
L'aperçu technique public de Kog fonctionne sur un modèle de 2B. L'entreprise cherche maintenant à étendre ses techniques :
ZML — Également une startup française d'IA (soutenue par Yann LeCun), ZML adopte une approche différente : elle a publié LLMD, un moteur d'inférence gratuit qui permet à de nombreux modèles open-source de fonctionner sur une grande variété de puces (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) en utilisant une approche unifiée basée sur un compilateur. ZML privilégie la portabilité du matériel et le support multi-puces plutôt que la latence extrême d'une seule requête. Kog, à l'inverse, est conçu pour une réduction maximale de la latence sur des GPU de datacenter haut de gamme spécifiques (MI300X, H200) via une optimisation matérielle profonde et spécifique.
Cerebras — Utilise une stratégie fondamentalement axée sur le matériel : le Wafer-Scale Engine (WSE-3), une puce unique massive qui élimine le besoin de communication multi-GPU. Cerebras atteint environ 2 100 tokens/s sur Llama 3.1 70B (batch 1) sur son matériel WSE-3 — notablement, cette vitesse est pour un modèle 70B, pas un modèle 2B.
Avertissement clé : Le résultat de 3 000 tok/s de Kog concerne un modèle de 2,3B de paramètres — un ordre de grandeur plus petit que les modèles 70B que Cerebras sert à des vitesses comparables. Kog n'a pas encore démontré son affirmation de 30x à grande échelle. La prochaine étape de l'entreprise (10x sur un grand modèle industriel) sera le point de preuve critique.