Kog udostępnił na licencji open source model Laneformer 2B (2,3 mld parametrów), model do kodowania z instrukcjami, zaprojektowany z myślą o szybkości dekodowania, a nie surowej wydajności w testach porównawczych. Podane prędkości są mniej więcej 10 razy szybsze niż typowa przepustowość vLLM dla modelu tej wielkości.
Publiczna wersja zapoznawcza Kog działa na modelu 2B. Firma ściga się teraz, aby przeskalować swoje techniki:
ZML — Również francuski startup AI (wspierany przez Yanna LeCuna). ZML ma inne podejście: wypuścił LLMD, darmowy silnik wnioskowania, który umożliwia uruchamianie wielu modeli open-source na różnych układach (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) przy użyciu ujednoliconego podejścia opartego na kompilatorze. ZML stawia na przenośność między różnymi układami i obsługę wielu układów, a nie na ekstremalnie małe opóźnienie pojedynczego żądania. Kog z kolei jest zbudowany z myślą o maksymalnej redukcji opóźnień na konkretnych, wysokiej klasy kartach GPU do centrów danych (MI300X, H200) poprzez głęboką, specyficzną sprzętowo optymalizację.
Cerebras — Stosuje fundamentalnie inną strategię, stawiając na sprzęt: Wafer-Scale Engine (WSE-3), czyli masywny, pojedynczy układ scalony, który eliminuje potrzebę komunikacji między wieloma GPU. Cerebras osiąga około 2100 tokenów/s na modelu Llama 3.1 70B (partia 1) na swoim sprzęcie WSE-3 — co należy podkreślić, jest to prędkość dla modelu 70B, a nie 2B.
Kluczowe zastrzeżenie: Wynik Kog na poziomie 3000 tok/s dotyczy modelu 2,3B – o rząd wielkości mniejszego niż modele 70B, które Cerebras obsługuje z porównywalną prędkością. Kog nie udowodnił jeszcze swojego twierdzenia o 30-krotnym przyspieszeniu w skali. Kolejny kamień milowy firmy (10x na dużym modelu przemysłowym) będzie krytycznym dowodem.