นวัตกรรมหลักของ Kog คือ monokernel — โปรแกรมเดียวที่ทำงานถาวรบน GPU รันขั้นตอนการ decode ของ LLM ทั้งหมดในคราวเดียว (prefill, decode, LM-head sampling) ขจัดภาระการเปิดใช้เคอร์เนลซ้ำในทุกโทเคน ซึ่งเป็นปัญหาใหญ่ของระบบพื้นฐานทั่วไป ในระบบมาตรฐานอย่าง vLLM, SGLang และ TensorRT-LLM แต่ละโทเคนต้องเปิด GPU kernel ใหม่ แต่ละครั้งเสียเวลา overhead ประมาณ 4.5 ไมโครวินาที บวกกับเวลาในการเริ่ม HBM ใหม่
ในทางกลับกัน เอ็นจิ้นของ Kog ข้ามไลบรารีการสื่อสารมาตรฐาน และกำจัดการซิงโครไนซ์กริดซึ่งใช้เวลามากถึง 35% ของเวลาในการสร้างโทเคน
การอ้างว่า 'เร็วกว่า 30 เท่า' เทียบกับความเร็ว decoding ทั่วไปที่ 100–300 โทเคน/วินาทีสำหรับโมเดล 2B–8B บน GPU ระดับไฮเอนด์ ขณะที่ Kog ทำได้ 3,000 โทเคน/วินาที
ผลลัพธ์:
ข้อจำกัด:
Kog มุ่งเน้นสามสถานการณ์หลัก:
ในด้านธุรกิจ Kog รายงานว่า มีลูกค้าธุรกิจจริง 200+ ราย ณ เดือนสิงหาคม 2026 ตามที่ CEO Delalleau กล่าว Tech Preview ขึ้นหน้าแรกของ Hacker News ในเดือนพฤษภาคม 2026
และบริษัทได้รับเงินทุนรอบ Seed โดยมี Varsity VC เป็นผู้ร่วมนำ โดย Kamel Zeroual พาร์ทเนอร์ของ Varsity เป็นผู้ร่วมก่อตั้งสตาร์ตอัปแรกของ Delalleau คือ Stribe
CEO Gaël Delalleau นำประสบการณ์ที่ผิดแผกมาสู่โครงสร้างพื้นฐาน AI: ฟิสิกส์สสารควบแน่น และ ความมั่นคงปลอดภัยทางไซเบอร์เชิงรุก
Kog เผชิญอุปสรรคสำคัญสามประการ:
ขั้นตอนสำคัญถัดไปของ Kog คือ การพิสูจน์ว่าแนวทางของมันใช้ได้กับ Large Language Models (70B+ พารามิเตอร์) CEO Delalleau ระบุว่าขณะนี้บริษัทมุ่งเน้นไปที่การขยายเทคนิคไปยัง LLM ขนาดเต็ม ความมั่นใจมาจากสถาปัตยกรรม GPU ที่ใหม่กว่าซึ่งมีแบนด์วิธหน่วยความจำสูงกว่าอย่างมาก — ทรัพยากรที่ Kog เชื่อว่ายังคงถูกนำไปใช้ได้ไม่เต็มประสิทธิภาพโดยซอฟต์แวร์มาตรฐาน บริษัทยังไม่ได้ประกาศวันที่แน่นอน แต่การสาธิตนี้ถูกมองว่าเป็นจุดพิสูจน์แห่งความสำเร็จหรือความล้มเหลวของแนวคิดทั้งหมด