Kog, özel bir donanım üretmeden, mevcut AMD MI300X ve NVIDIA H200 GPU'larında saniyede 3.000 token çıktısı üretebilen bir yazılım motoru geliştirdi. Şirketin temel yeniliği, Gecikmeli Tensör Paralelliği (DTP) ile GPU'lar arası iletişim gecikmesini hesaplamayla çakıştırarak sıfıra indirmek.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog, Fransız bir girişim olarak, mevcut veri merkezi GPU'larında büyük dil modellerinin (LLM) çıkarımını 30 kata kadar hızlandırabileceğini iddia ediyor. Bu başarıyı, özel bir model mimarisi (Laneformer), tek çekirdekli bir çıkarım motoru (KIE) ve özel bir iletişim katmanı (KCCL) tasarlayarak, kod çözme döngüsündeki her tıkanıklığı ortadan kaldıran, derinlemesine bir yazılım optimizasyonu yığını ile elde ediyor.
Kog, özel ASIC'ler üretmek veya egzotik donanımlar edinmek yerine, üç katmanı tek bir ortak tasarım sistemi olarak ele alıyor:
Kog, ham kıyaslama puanından ziyade kod çözme hızı için tasarlanmış, talimatla ince ayar yapılmış bir kodlama modeli olan Laneformer 2B'yi (2,3 milyar parametre) açık kaynak olarak yayınladı. Bu hızlar, bu boyuttaki bir model için tipik vLLM çıktı hızından yaklaşık 10 kat daha hızlıdır.
Kog'un halka açık teknoloji önizlemesi şu anda 2B model üzerinde çalışıyor. Şirket, tekniklerini ölçeklendirmek için yarışıyor:
ZML — Yine bir Fransız yapay zeka girişimi olan (Yann LeCun tarafından desteklenen) ZML, farklı bir yaklaşım benimsiyor: birleşik bir derleyici tabanlı yaklaşım kullanarak birçok açık kaynak modelin çok çeşitli çiplerde (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) çalışmasını sağlayan ücretsiz bir çıkarım motoru olan LLMD'yi piyasaya sürdü. ZML, aşırı düşük tek istek gecikmesi yerine donanım taşınabilirliğine ve çoklu çip desteğine öncelik veriyor. Kog ise, derin, donanıma özgü optimizasyon yoluyla belirli üst düzey veri merkezi GPU'larında (MI300X, H200) maksimum gecikme azaltma için özel olarak tasarlandı.
Cerebras — Temelde donanım odaklı bir strateji kullanıyor: Çoklu GPU iletişimi ihtiyacını ortadan kaldıran dev bir tek çip olan Wafer-Scale Engine (WSE-3). Cerebras, WSE-3 donanımında Llama 3.1 70B'de (batch 1) saniyede ~2.100 token hızına ulaşıyor — bu hızın 2B değil, 70B bir model için olduğunu belirtmek önemli.
Önemli uyarı: Kog'un saniyede 3.000 token sonucu, 2,3 milyar parametreli bir modelde elde edildi — bu, Cerebras'ın benzer hızlarda hizmet verdiği 70B modellerden çok daha küçük. Kog, 30x iddiasını henüz büyük ölçekte kanıtlayamadı. Şirketin bir sonraki kilometre taşı (büyük bir endüstri modelinde 10x) kritik kanıt noktası olacak.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kog, özel bir donanım üretmeden, mevcut AMD MI300X ve NVIDIA H200 GPU'larında saniyede 3.000 token çıktısı üretebilen bir yazılım motoru geliştirdi.
Kog, özel bir donanım üretmeden, mevcut AMD MI300X ve NVIDIA H200 GPU'larında saniyede 3.000 token çıktısı üretebilen bir yazılım motoru geliştirdi. Şirketin temel yeniliği, Gecikmeli Tensör Paralelliği (DTP) ile GPU'lar arası iletişim gecikmesini hesaplamayla çakıştırarak sıfıra indirmek.
Kog, iddiasını şimdilik sadece 2.3 milyar parametreli küçük bir modelle (Laneformer 2B) kanıtlayabildi.