Kog ใช้ซอฟต์แวร์ล้วนๆ โดยไม่ต้องมีฮาร์ดแวร์พิเศษ ทำความเร็ว 3,000 โทเคนต่อวินาทีต่อคำขอบน 8x AMD MI300X ด้วยโมเดลขนาด 2.3B พารามิเตอร์ นวัตกรรมหลักคือ Delayed Tensor Parallelism (DTP) เลื่อนการ all reduce ระหว่าง GPU ออกไป 2 เลเยอร์ เพื่อซ้อนทับการสื่อสารเข้ากับการคำนวณ ลดการรอคอย ความท้าทายของ Kog คือยังต้องพิสูจน์...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog สตาร์ทอัพฝรั่งเศสประกาศความสำเร็จในการทำ LLM inference ที่เร็วขึ้นถึง 30 เท่าบน GPU ดาต้าเซ็นเตอร์มาตรฐาน ด้วยแนวทางที่เน้นซอฟต์แวร์เป็นหลัก โดยออกแบบร่วมกันระหว่างสถาปัตยกรรมโมเดลแบบกำหนดเอง (Laneformer), inference engine แบบ single-kernel (KIE), และเลเยอร์การสื่อสารแบบกำหนดเอง (KCCL) เพื่อกำจัดทุกสาเหตุของการหยุดชะงักใน decode loop
แทนที่จะสร้าง ASIC หรือฮาร์ดแวร์เฉพาะ Kog มองสามเลเยอร์เป็นระบบที่ออกแบบร่วมกัน:
Kog เปิดซอร์ส Laneformer 2B (2.3 พันล้านพารามิเตอร์) ซึ่งเป็นโมเดล coding ที่ถูกปรับแต่งคำสั่ง ออกแบบมาเพื่อความเร็วในการ decode มากกว่าคะแนน benchmark ดิบ ความเร็วเหล่านี้เร็วกว่า throughput ทั่วไปของ vLLM สำหรับโมเดลขนาดนี้ประมาณ 10 เท่า
Kog เปิดตัว tech preview ในโมเดลขนาด 2B ตอนนี้บริษัทกำลังแข่งกับเวลาเพื่อขยายเทคนิค:
ZML — สตาร์ทอัพ AI ฝรั่งเศสอีกแห่ง (ได้รับการรับรองโดย Yann LeCun) ZML ใช้แนวทางที่แตกต่าง: เปิดตัว LLMD, inference engine ฟรีที่ช่วยให้โมเดลโอเพนซอร์สจำนวนมากทำงานบนชิปหลากหลายประเภท (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) โดยใช้แนวทางที่ใช้คอมไพเลอร์แบบรวมศูนย์ ZML ให้ความสำคัญกับ การพกพาข้ามฮาร์ดแวร์และการรองรับหลายชิป มากกว่า latency ต่อคำขอที่ต่ำมาก ในทางตรงกันข้าม Kog ถูกสร้างขึ้นมาเพื่อลด latency สูงสุดบน GPU ดาต้าเซ็นเตอร์ระดับสูงเฉพาะ (MI300X, H200) ผ่านการปรับแต่งฮาร์ดแวร์แบบเจาะลึก
Cerebras — ใช้กลยุทธ์ฮาร์ดแวร์เป็นหลัก: Wafer-Scale Engine (WSE-3) ชิปเดี่ยวขนาดใหญ่ที่ขจัดความจำเป็นในการสื่อสารข้าม GPU Cerebras ทำความเร็ว ~2,100 tokens/s บน Llama 3.1 70B (batch 1) บนฮาร์ดแวร์ WSE-3 — ที่น่าสังเกตคือ ความเร็วนั้นสำหรับ โมเดล 70B ไม่ใช่โมเดล 2B
ข้อสังเกตสำคัญ: ผลลัพธ์ 3,000 tok/s ของ Kog อยู่บนโมเดล 2.3B ซึ่งมีขนาดเล็กกว่าโมเดล 70B ที่ Cerebras ให้บริการด้วยความเร็วใกล้เคียงกันถึงหนึ่งลำดับความสำคัญ Kog ยังไม่ได้แสดงเคลม 30x ในระดับขนาดใหญ่ เป้าหมายถัดไปของบริษัท (10x ในโมเดลอุตสาหกรรมขนาดใหญ่) จะเป็นจุดพิสูจน์ที่สำคัญ
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Kog ใช้ซอฟต์แวร์ล้วนๆ โดยไม่ต้องมีฮาร์ดแวร์พิเศษ ทำความเร็ว 3,000 โทเคนต่อวินาทีต่อคำขอบน 8x AMD MI300X ด้วยโมเดลขนาด 2.3B พารามิเตอร์
Kog ใช้ซอฟต์แวร์ล้วนๆ โดยไม่ต้องมีฮาร์ดแวร์พิเศษ ทำความเร็ว 3,000 โทเคนต่อวินาทีต่อคำขอบน 8x AMD MI300X ด้วยโมเดลขนาด 2.3B พารามิเตอร์ นวัตกรรมหลักคือ Delayed Tensor Parallelism (DTP) เลื่อนการ all reduce ระหว่าง GPU ออกไป 2 เลเยอร์ เพื่อซ้อนทับการสื่อสารเข้ากับการคำนวณ ลดการรอคอย
ความท้าทายของ Kog คือยังต้องพิสูจน์เคลม 30x ในโมเดลขนาดใหญ่ 70B+ ก่อน โดยเป้าหมายถัดไปคือเร่งความเร็ว 10 เท่าในโมเดลระดับอุตสาหกรรม