Kog, sebuah startup Perancis, mendakwa dapat mencapai 3,000 token output/s setiap permintaan pada nod 8× AMD MI300X menggunakan enjin inferens berasaskan perisian semata mata – tiada perkakasan khas, tiada kuantisasi,... Inovasi utamanya, Delayed Tensor Parallelism (DTP), melengahkan all reduce antara GPU sebanyak 2...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog ialah sebuah startup Perancis yang mendakwa mampu mencapai inferens LLM sehingga 30x lebih pantas pada GPU pusat data sedia ada melalui timbunan pengoptimuman perisian yang mendalam – mereka bentuk bersama seni bina model tersuai (Laneformer), enjin inferens kernel tunggal (KIE), dan lapisan komunikasi tersuai (KCCL) untuk menghapuskan setiap punca kelewatan dalam gelung decode.
Daripada membina ASIC tersuai atau mendapatkan perkakasan eksotik, Kog menganggap tiga lapisan sebagai satu sistem yang direka bersama:
Kog membuka sumber Laneformer 2B (2.3 bilion parameter), model pengekodan yang ditala arahan yang direka untuk kelajuan decode berbanding skor penanda aras mentah. Kelajuan ini kira-kira 10x lebih pantas daripada daya pemprosesan vLLM biasa untuk model saiz ini.
Pratonton teknikal awam Kog berjalan pada model 2B. Syarikat kini berlumba untuk menskalakan tekniknya:
ZML — Juga startup AI Perancis (disokong oleh Yann LeCun), ZML mengambil pendekatan berbeza: ia mengeluarkan LLMD, enjin inferens percuma yang membolehkan banyak model sumber terbuka berjalan pada pelbagai cip (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) menggunakan pendekatan berasaskan pengkompil bersatu. ZML mengutamakan kebolehpindahan perkakasan dan sokongan pelbagai cip berbanding kependaman permintaan tunggal yang melampau. Kog, sebaliknya, dibina khas untuk pengurangan kependaman maksimum pada GPU pusat data mewah tertentu (MI300X, H200) melalui pengoptimuman khusus perkakasan yang mendalam.
Cerebras — Menggunakan strategi perkakasan dahulu secara asas: Wafer-Scale Engine (WSE-3), cip tunggal besar yang menghapuskan keperluan untuk komunikasi berbilang GPU. Cerebras mencapai ~2,100 token/s pada Llama 3.1 70B (kelompok 1) pada perkakasan WSE-3 — yang ketara, kelajuan itu adalah untuk model 70B, bukan model 2B.
Kaveat utama: Keputusan 3,000 tok/s Kog adalah pada model 2.3B — susunan magnitud lebih kecil daripada model 70B yang dilayan Cerebras pada kelajuan setanding. Kog masih belum menunjukkan dakwaan 30x pada skala. Pencapaian seterusnya syarikat (10x pada model industri besar) akan menjadi titik bukti kritikal.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kog, sebuah startup Perancis, mendakwa dapat mencapai 3,000 token output/s setiap permintaan pada nod 8× AMD MI300X menggunakan enjin inferens berasaskan perisian semata mata – tiada perkakasan khas, tiada kuantisasi,...
Kog, sebuah startup Perancis, mendakwa dapat mencapai 3,000 token output/s setiap permintaan pada nod 8× AMD MI300X menggunakan enjin inferens berasaskan perisian semata mata – tiada perkakasan khas, tiada kuantisasi,... Inovasi utamanya, Delayed Tensor Parallelism (DTP), melengahkan all reduce antara GPU sebanyak 2 lapisan untuk menindih komunikasi dengan pengiraan, menghapuskan kelewatan yang melanda tensor parallelism standard.
Kog belum lagi menunjukkan dakwaan 30x sepenuhnya pada skala besar (demo terbaik adalah pada model 2B, bukan model 70B+); titik bukti kritikal seterusnya ialah peningkatan kelajuan 10x pada model berskala industri dal...