تحقق Kog سرعة 3000 رمز في الثانية لكل طلب على عقدة 8× AMD MI300X باستخدام محرك استدلال برمجي بحت، دون الحاجة إلى عتاد مخصص أو تقنيات كمية أو تخمينية. ابتكارها الأساسي هو 'التوازي الموتر المؤجل' (DTP) الذي يؤخر الاتصال بين معالجات GPU إلى طبقتين، مما يلغي فترات التوقف ويخفي تكاليف الاتصال تمامًا.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
تزعم Kog، وهي شركة ناشئة فرنسية، أنها قادرة على تحقيق سرعة استدلال (Inference) لنماذج اللغات الكبيرة (LLM) تصل إلى 30 ضعفًا على معالجات GPU الحالية، وذلك من خلال حزمة تحسين برمجية عميقة تعيد تصميم ثلاثة مستويات كنظام واحد متماسك: الهندسة المعمارية المخصصة للنموذج (Laneformer)، ومحرك الاستدلال أحادي النواة (KIE)، وطبقة اتصال مخصصة (KCCL) . الفكرة الأساسية هي التخلص من كل مصدر من مصادر التوقف في حلقة فك التشفير دون الحاجة إلى عتاد جديد.
كيف تعمل الاستراتيجية البرمجية؟
نتائج Laneformer 2B المثبتة
أصدرت Kog نموذج Laneformer 2B (2.3 مليار معلم) مفتوح المصدر، وهو نموذج برمجة معدّل تعليميًا، مصمم لسرعة فك التشفير على حساب نتائج المعايير الخام . هذه السرعات أسرع بحوالي 10 مرات من سرعة vLLM التقليدية لنموذج بهذا الحجم
.
المعالم القادمة للتوسع
مقارنة مع المنافسين
ZML: شركة فرنسية ناشئة أخرى في مجال الذكاء الاصطناعي (يدعمها Yann LeCun) تتبنى نهجًا مختلفًا مع LLMD، وهو محرك استدلال مجاني ومتعدد الشرائح (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) . بينما تركز ZML على قابلية النقل والدعم عبر أجهزة متعددة، تم تصميم Kog خصيصًا لتقليل زمن الانتقال إلى أقصى حد على معالجات GPU المحددة عالية الأداء (MI300X, H200) من خلال تحسينات عميقة خاصة بالعتاد.
Cerebras: تعتمد استراتيجية تعتمد على العتاد أولاً مع معالج Wafer-Scale Engine (WSE-3) الضخم الذي يلغي الحاجة للاتصال بين معالجات GPU المتعددة. توفر Cerebras حوالي 2,100 رمز/ثانية على نموذج Llama 3.1 70B (حجم الدفعة 1) — وهي سرعة لنموذج 70B وليس 2B.
تحذير مهم: نتيجة 3,000 رمز/ثانية لـ Kog مبنية على نموذج 2.3B — وهو أصغر بعشر مرات من نماذج 70B التي تقدمها Cerebras بسرعات مماثلة. لم تثبت Kog بعد ادعاءها بـ 30 ضعفًا على نطاق واسع؛ المعلم الحاسم التالي سيكون إثبات سرعة 10 أضعاف على نموذج صناعي كبير .
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
تحقق Kog سرعة 3000 رمز في الثانية لكل طلب على عقدة 8× AMD MI300X باستخدام محرك استدلال برمجي بحت، دون الحاجة إلى عتاد مخصص أو تقنيات كمية أو تخمينية.
تحقق Kog سرعة 3000 رمز في الثانية لكل طلب على عقدة 8× AMD MI300X باستخدام محرك استدلال برمجي بحت، دون الحاجة إلى عتاد مخصص أو تقنيات كمية أو تخمينية. ابتكارها الأساسي هو 'التوازي الموتر المؤجل' (DTP) الذي يؤخر الاتصال بين معالجات GPU إلى طبقتين، مما يلغي فترات التوقف ويخفي تكاليف الاتصال تمامًا.
لم تثبت Kog بعد ادعاءها الكامل بـ 30 ضعفًا على النماذج الكبيرة (أفضل عرض لها على نموذج 2B)، وتحتاج إلى إثبات سرعة 10 أضعاف على نموذج صناعي كبير في الأشهر المقبلة.