Kog, סטארט אפ צרפתי, טוען שהשיג מהירות הסקה של 3,000 אסימונים בשנייה (tokens/s) על 8 כרטיסי AMD MI300X ו 2,100 אסימונים בשנייה על 8 כרטיסי NVIDIA H200, עבור מודל מותאם אישית בעל 2.3 מיליארד פרמטרים (Laneformer 2B), תו... הטכנולוגיה מבוססת על תכנון משותף של שלוש שכבות: ארכיטקטורת מודל ייחודית (Laneformer), מנוע הסקה...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog הוא סטארט-אפ צרפתי הטוען שהוא יכול להגיע למהירות הסקת LLM (Large Language Model) מהירה עד פי 30 על גבי GPUs סטנדרטיים במרכזי נתונים. זאת, באמצעות מחסנית אופטימיזציה תוכנתית מעמיקה הכוללת תכנון משותף של ארכיטקטורת מודל מותאמת אישית (Laneformer), מנוע הסקה מבוסס קרנל יחיד (KIE), ושכבת תקשורת מותאמת אישית (KCCL), במטרה לבטל כל גורם עיכוב בלולאת הפענוח (decode loop).
במקום לבנות ASICs מותאמים אישית או לרכוש חומרה אקזוטית, Kog מתייחסת לשלוש שכבות כאל מערכת אחת שתוכננה במשותף:
Kog פרסמה כקוד פתוח את Laneformer 2B (2.3 מיליארד פרמטרים), מודל קידוד מכוון-הוראות (instruction-tuned), אשר תוכנן למהירות פענוח על פני ציון Benchmark גולמי. מהירויות אלו מהירות בערך פי 10 מתפוקת vLLM האופיינית למודל בגודל זה.
ה-tech preview הציבורי של Kog פועל על מודל 2B. החברה נמצאת כעת במירוץ לסקל את הטכניקות שלה:
ZML — גם היא סטארט-אפ צרפתי בתחום ה-AI (בחסות Yann LeCun), ZML נוקטת גישה שונה: היא פרסמה את LLMD, מנוע הסקה חינמי המאפשר למודלי קוד פתוח רבים לרוץ על מגוון רחב של שבבים (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) באמצעות גישה מבוססת קומפיילר אחידה. ZML נותנת עדיפות לניידות חומרה ותמיכה בריבוי שבבים במקום להשהיית בקשה בודדת קיצונית. Kog, לעומת זאת, בנויה במיוחד להפחתת השהיה מקסימלית על GPUs ספציפיים ברמה גבוהה (MI300X, H200) באמצעות אופטימיזציה תוכנתית עמוקה ומותאמת חומרה.
Cerebras — משתמשת באסטרטגיה שהיא מהותית מבוססת-חומרה: ה-Wafer-Scale Engine (WSE-3), שבב ענק יחיד המבטל את הצורך בתקשורת מרובת GPUs. Cerebras משיגה ~2,100 אסימונים/שנייה על Llama 3.1 70B (batch 1) על חומרת WSE-3 שלה — חשוב לציין, מהירות זו היא עבור מודל 70B, לא מודל 2B.
| ממד | Kog | Cerebras |
|---|---|---|
| גישה | תוכנה בלבד על GPUs סטנדרטיים | חומרה מותאמת אישית (wafer-scale) |
| הדגמה הטובה ביותר | 3,000 אסימונים/שנייה על מודל 2B | ~2,100 אסימונים/שנייה על מודל 70B |
| טענת השהיה | מכוונת לפי 30 על מודלים מתקדמים | ~פי 4 לעומת H100 על מודלי 70B |
| עלות חומרה | משתמש בתשתית GPU קיימת | דורש מערכות CS-3 קנייניות |
| בשלות | שלב מוקדם (tech preview, 2B בלבד) | ברמת ייצור עבור מספר דגמי קוד פתוח |
הערה חשובה: תוצאת 3,000 האסימונים/שנייה של Kog היא על מודל 2.3B — בסדר גודל קטן יותר ממודלי 70B ש-Cerebras משרתת במהירויות דומות. Kog עדיין לא הציגה את הטענה שלה ל-30x בקנה מידה. אבן הדרך הבאה של החברה (פי 10 על מודל תעשייתי גדול) תהווה נקודת הוכחה קריטית.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kog, סטארט אפ צרפתי, טוען שהשיג מהירות הסקה של 3,000 אסימונים בשנייה (tokens/s) על 8 כרטיסי AMD MI300X ו 2,100 אסימונים בשנייה על 8 כרטיסי NVIDIA H200, עבור מודל מותאם אישית בעל 2.3 מיליארד פרמטרים (Laneformer 2B), תו...
Kog, סטארט אפ צרפתי, טוען שהשיג מהירות הסקה של 3,000 אסימונים בשנייה (tokens/s) על 8 כרטיסי AMD MI300X ו 2,100 אסימונים בשנייה על 8 כרטיסי NVIDIA H200, עבור מודל מותאם אישית בעל 2.3 מיליארד פרמטרים (Laneformer 2B), תו... הטכנולוגיה מבוססת על תכנון משותף של שלוש שכבות: ארכיטקטורת מודל ייחודית (Laneformer), מנוע הסקה מבוסס קרנל יחיד (KIE), ושכבת תקשורת מותאמת אישית (KCCL), במטרה לבטל כל עיכוב אפשרי בלולאת הפענוח (decode loop).
החברה עדיין לא הוכיחה את טענתה העיקרית להאצה של פי 30 על מודלים גדולים (70B+), והאתגר המרכזי הבא שלה יהיה להדגים שיפור של פי 10 על מודל תעשייתי סטנדרטי.