Enjin inferens berasaskan perisian Kog AI mencapai 3,000+ token output sesaat setiap permintaan pada nod 8x AMD MI300X — kira kira 30x lebih pantas daripada 100–300 tok/s biasa — dengan menggabungkan keseluruhan litar... Pratonton teknik Mei 2026 hanya dijalankan pada model 2.3B parameter (Laneformer 2B), menyokong...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog, how does its approach to GPU inference acceleration differ from the hardware-centric strategy of companies like Cerebras, what. Article summary: Here is a comprehensive breakdown of Kog, covering all the areas you asked about.. Topic tags: general, general web, user generated, academic, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
Industri AI telah membelanjakan berbilion dolar memburu cip yang lebih pantas. Namun, startup yang berpangkalan di Paris, Kog AI, bertaruh bahawa mereka menyelesaikan masalah yang salah — dan pratonton teknik Mei 2026 mereka menunjukkan bahawa taruhan ini mungkin tepat.
Kog AI ialah startup infrastruktur AI Perancis yang diasaskan pada 2023 oleh Gaël Delalleau. Produk utamanya ialah Enjin Inferens Kog (KIE), enjin inferens berasaskan perisian semata-mata yang mempercepatkan inferens LLM secara drastik pada GPU pusat data standard — tanpa memerlukan silikon tersuai . Syarikat itu muncul dari persembunyian pada Mei 2025 dan melancarkan pratonton teknik awam pada 28 Mei 2026
.
Cerebras membina cip berskala wafer tujuan khas. Groq dan SambaNova mengikut laluan utamakan perkakasan yang serupa. Kog mengambil taruhan yang bertentangan: ruang kepala prestasi yang besar dalam GPU sedia ada ditinggalkan oleh timbunan perisian yang tidak cekap, dan pengoptimuman perisian peringkat dalam boleh menyamai atau mengatasi kelajuan perkakasan khusus tanpa cip baharu .
Inovasi terasnya ialah monokernel — satu program tunggal yang menetap di GPU yang menjalankan keseluruhan laluan nyahkod LLM (prefill, decode, persampelan LM-head) dalam satu pukulan, menghapuskan overhed pelancaran kernel setiap token yang membebani timbunan standard . Rangka kerja inferens standard seperti vLLM, SGLang, dan TensorRT-LLM melancarkan satu kernel GPU setiap token, setiap satunya membayar kira-kira 4.5 μs overhed pelancaran ditambah kependaman mulakan semula HBM
. Enjin Kog memintas perpustakaan komunikasi standard dan menghapuskan penyegerakan grid yang diukurnya menggunakan 35% daripada masa penjanaan setiap token
.
Tuntutan "30x lebih pantas" ditentukur terhadap kelajuan nyahkod biasa 100–300 token/s untuk model 2B–8B pada GPU mewah, berbanding 3,000 token/s Kog .
Keputusan:
Had:
Kog menyasarkan tiga senario utama:
Di bahagian perniagaan, Kog melaporkan 200+ petunjuk perniagaan ketara setakat Ogos 2026, menurut CEO Delalleau . Pratonton teknik itu menjadi halaman depan Hacker News pada Mei 2026
. Syarikat itu telah mengumpul pusingan benih yang diketuai bersama oleh Varsity VC, yang rakan kongsinya Kamel Zeroual adalah rakan pengasas Delalleau di syarikat pertamanya, Stribe
.
CEO Gaël Delalleau membawa latar belakang yang luar biasa kepada infrastruktur AI: fizik keadaan pepejal dan keselamatan siber ofensif .
Kog menghadapi tiga halangan penskalaan yang ketara:
Pencapaian kritikal Kog yang seterusnya ialah membuktikan pendekatannya berfungsi pada model bahasa besar (70B+ parameter). CEO Delalleau telah menyatakan bahawa syarikat itu kini memberi tumpuan kepada meningkatkan tekniknya kepada LLM skala penuh. Keyakinan datang daripada seni bina GPU yang lebih baharu dengan lebar jalur memori yang jauh lebih tinggi — sumber yang dipercayai Kog masih kurang digunakan oleh timbunan perisian standard . Syarikat itu belum mengumumkan tarikh tertentu, tetapi demonstrasi ini dilihat secara meluas sebagai titik bukti penentu untuk keseluruhan tesis.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Enjin inferens berasaskan perisian Kog AI mencapai 3,000+ token output sesaat setiap permintaan pada nod 8x AMD MI300X — kira kira 30x lebih pantas daripada 100–300 tok/s biasa — dengan menggabungkan keseluruhan litar...
Enjin inferens berasaskan perisian Kog AI mencapai 3,000+ token output sesaat setiap permintaan pada nod 8x AMD MI300X — kira kira 30x lebih pantas daripada 100–300 tok/s biasa — dengan menggabungkan keseluruhan litar... Pratonton teknik Mei 2026 hanya dijalankan pada model 2.3B parameter (Laneformer 2B), menyokong hanya dua seni bina GPU (AMD MI300X dan NVIDIA H200), dan menunjukkan prestasi pengguna tunggal, permintaan tunggal — buk...
Dengan 200+ petunjuk perniagaan dan pembiayaan benih daripada Varsity VC, Kog menyasarkan aliran kerja AI ejen, inferens masa nyata, dan inferens perusahaan yang dihoskan sendiri, meletakkan dirinya sebagai alternatif...