Startup Pháp Kog AI đạt 3.000+ token đầu ra mỗi giây mỗi yêu cầu trên cụm 8 GPU AMD MI300X, nhanh gấp 30 lần so với tốc độ 100–300 token/giây thông thường nhờ mô hình monokernel... Bản xem trước tháng 5/2026 chỉ chạy trên mô hình 2,3 tỷ tham số (Laneformer 2B), hỗ trợ hai kiến trúc GPU và chỉ cho thấy hiệu suất đơn...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Kog, how does its approach to GPU inference acceleration differ from the hardware-centric strategy of companies like Cerebras, what. Article summary: Here is a comprehensive breakdown of Kog, covering all the areas you asked about.. Topic tags: general, general web, user generated, academic, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
Ngành AI đã chi hàng tỷ đô la để chạy đua tạo ra những con chip nhanh hơn. Startup Kog AI có trụ sở tại Paris lại đặt cược rằng họ đang giải quyết sai vấn đề — và bản xem trước công nghệ vào tháng 5/2026 cho thấy canh bạc này có thể đúng.
Kog (Kog AI) là một startup cơ sở hạ tầng AI của Pháp, được thành lập vào năm 2023 bởi Gaël Delalleau. Sản phẩm cốt lõi của họ là Kog Inference Engine (KIE), một engine suy luận chạy hoàn toàn bằng phần mềm, giúp tăng tốc đáng kể quá trình suy luận LLM trên GPU trung tâm dữ liệu tiêu chuẩn — mà không cần đến chip chuyên dụng tùy chỉnh . Công ty chính thức ra mắt vào tháng 5/2025 và công bố bản xem trước công khai vào ngày 28 tháng 5 năm 2026
.
Cerebras chế tạo những con chip wafer-scale (kích thước tấm bán dẫn) chuyên dụng. Groq và SambaNova cũng đi theo con đường ưu tiên phần cứng tương tự. Kog lại đặt cược ngược lại: họ cho rằng các GPU hiện tại có một khoảng trống hiệu năng khổng lồ bị bỏ qua do các lớp phần mềm kém hiệu quả, và việc tối ưu hóa phần mềm ở mức độ sâu có thể đạt hoặc vượt tốc độ của phần cứng chuyên dụng mà không cần chip mới .
Cải tiến cốt lõi là một monokernel — một chương trình GPU duy nhất, thường trực, chạy toàn bộ quá trình giải mã LLM (prefill, decode, lấy mẫu LM-head) trong một lần, loại bỏ chi phí khởi động kernel cho mỗi token vốn là gánh nặng của các stack tiêu chuẩn . Các framework suy luận tiêu chuẩn như vLLM, SGLang và TensorRT-LLM khởi chạy một GPU kernel cho mỗi token, mỗi lần chịu chi phí khởi động khoảng 4,5 μs cộng thêm độ trễ khởi động lại HBM
. Engine của Kog bỏ qua các thư viện giao tiếp tiêu chuẩn và loại bỏ các thao tác đồng bộ hóa lưới (grid synchronizations) mà họ đo được chiếm tới 35% thời gian tạo mỗi token
.
Tuyên bố "nhanh hơn 30 lần" được đưa ra khi so sánh với tốc độ giải mã thông thường từ 100–300 token/giây cho các mô hình 2B–8B trên GPU cao cấp, trong khi Kog đạt 3.000 token/giây .
Kết quả:
Hạn chế:
Kog nhắm đến ba kịch bản chính:
Về mặt kinh doanh, theo CEO Delalleau, Kog đã có hơn 200 khách hàng tiềm năng thực tế tính đến tháng 8/2026 . Bản xem trước công nghệ đã lên trang nhất của Hacker News vào tháng 5/2026
. Công ty đã huy động được vòng hạt giống do Varsity VC đồng dẫn đầu, với partner Kamel Zeroual từng là đồng sáng lập của Delalleau tại startup đầu tiên của anh, Stribe
.
CEO Gaël Delalleau mang đến một nền tảng khác thường cho cơ sở hạ tầng AI: vật lý chất rắn và an ninh mạng tấn công .
Kog phải đối mặt với ba rào cản mở rộng quy mô đáng kể:
Cột mốc quan trọng tiếp theo của Kog là chứng minh cách tiếp cận của họ hoạt động trên các mô hình ngôn ngữ lớn (70B+ tham số). CEO Delalleau đã tuyên bố công ty hiện đang tập trung vào việc mở rộng quy mô các kỹ thuật của mình lên các LLM quy mô đầy đủ. Sự tự tin đến từ các kiến trúc GPU mới hơn với băng thông bộ nhớ cao hơn đáng kể — một nguồn tài nguyên mà Kog tin rằng vẫn chưa được khai thác triệt để bởi các stack phần mềm tiêu chuẩn . Công ty chưa công bố ngày cụ thể, nhưng màn trình diễn này được nhiều người coi là minh chứng sống còn cho toàn bộ luận điểm.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Startup Pháp Kog AI đạt 3.000+ token đầu ra mỗi giây mỗi yêu cầu trên cụm 8 GPU AMD MI300X, nhanh gấp 30 lần so với tốc độ 100–300 token/giây thông thường nhờ mô hình monokernel...
Startup Pháp Kog AI đạt 3.000+ token đầu ra mỗi giây mỗi yêu cầu trên cụm 8 GPU AMD MI300X, nhanh gấp 30 lần so với tốc độ 100–300 token/giây thông thường nhờ mô hình monokernel... Bản xem trước tháng 5/2026 chỉ chạy trên mô hình 2,3 tỷ tham số (Laneformer 2B), hỗ trợ hai kiến trúc GPU và chỉ cho thấy hiệu suất đơn người dùng, chưa phải dạng batch...
Với hơn 200 khách hàng tiềm năng và vốn hạt giống từ Varsity VC, Kog nhắm đến các luồng AI tác nhân, suy luận thời gian thực và suy luận tại chỗ cho doanh nghiệp.