Kog ने Laneformer 2B (2.3 बिलियन पैरामीटर) को ओपन-सोर्स किया है। यह एक इंस्ट्रक्शन-ट्यून्ड कोडिंग मॉडल है जिसे रॉ बेंचमार्क स्कोर के बजाय डिकोडिंग स्पीड के लिए डिज़ाइन किया गया है। ये गति इस आकार के मॉडल के लिए सामान्य vLLM थ्रूपुट से लगभग 10 गुना अधिक है।
Kog का सार्वजनिक टेक प्रीव्यू फ़िलहाल 2B मॉडल पर चलता है। कंपनी अब अपनी तकनीक को बड़े पैमाने पर ले जाने की दौड़ में है:
ZML — एक और फ़्रांसीसी AI स्टार्टअप (Yann LeCun द्वारा समर्थित), ZML ने LLMD नाम से एक मुफ़्त इन्फ़रेंस इंजन जारी किया है जो कई ओपन-सोर्स मॉडलों को विभिन्न चिप्स (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) पर चलाने की अनुमति देता है। ZML हार्डवेयर पोर्टेबिलिटी और मल्टी-चिप सपोर्ट को प्राथमिकता देता है, जबकि Kog विशिष्ट हाई-एंड GPU पर अधिकतम गति कम करने पर केंद्रित है।
Cerebras — यह मौलिक रूप से हार्डवेयर-फर्स्ट रणनीति अपनाता है: Wafer-Scale Engine (WSE-3), एक विशाल एकल चिप जो मल्टी- GPU कम्युनिकेशन की आवश्यकता को समाप्त करती है। Cerebras WSE-3 पर Llama 3.1 70B मॉडल के लिए ~2,100 टोकन/सेकंड (batch 1) हासिल करता है — ध्यान दें, यह गति 70B मॉडल के लिए है, न कि 2B मॉडल के लिए।
मुख्य सावधानी: Kog का 3,000 टोकन/सेकंड का परिणाम 2.3B पैरामीटर वाले मॉडल पर है — जो उन 70B मॉडलों की तुलना में दस गुना छोटा है जिन्हें Cerebras समान गति से सर्व करता है। Kog को अभी तक अपने 30x के दावे को बड़े पैमाने पर प्रदर्शित करना बाकी है। कंपनी का अगला माइलस्टोन (एक बड़े उद्योग मॉडल पर 10x) महत्वपूर्ण प्रूफ पॉइंट होगा।