Kog, startup AI của Pháp, tuyên bố đạt 3.000 token đầu ra mỗi giây cho mỗi yêu cầu trên cụm 8 GPU AMD MI300X, hoàn toàn dựa vào tối ưu phần mềm, không dùng phần cứng tùy chỉnh, lượng tử hóa hay giải mã suy diễn. Cốt lõi là 'Delayed Tensor Parallelism' (DTP) và 'Monokernel': trì hoãn việc đồng bộ dữ liệu giữa các GPU...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog, một startup công nghệ Pháp, tuyên bố có thể tăng tốc suy luận mô hình ngôn ngữ lớn (LLM) lên tới 30 lần trên các GPU trung tâm dữ liệu hiện có thông qua một ngăn xếp tối ưu hóa phần mềm chuyên sâu. Trọng tâm là đồng thiết kế kiến trúc mô hình tùy chỉnh (Laneformer), một engine suy luận đơn nhân (KIE) và một lớp giao tiếp tùy chỉnh (KCCL) để loại bỏ mọi điểm nghẽn trong vòng lặp giải mã.
Thay vì xây dựng chip ASIC tùy chỉnh hay mua sắm phần cứng đắt đỏ, Kog xử lý ba lớp như một hệ thống được đồng thiết kế thống nhất:
Kog đã mã nguồn mở hóa Laneformer 2B (2,3 tỷ tham số), một mô hình mã hóa được tinh chỉnh theo hướng dẫn, được thiết kế cho tốc độ giải mã hơn là điểm benchmark thô. Tốc độ này nhanh gấp khoảng 10 lần so với thông lượng vLLM điển hình cho một mô hình cùng kích cỡ.
Bản xem trước công nghệ của Kog hiện chỉ chạy trên mô hình 2B. Công ty đang chạy đua để nhân rộng các kỹ thuật của mình:
ZML — Cũng là một startup AI của Pháp, ZML có cách tiếp cận khác: họ phát hành LLMD, một engine suy luận miễn phí cho phép nhiều mô hình mã nguồn mở chạy trên nhiều loại chip khác nhau (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) bằng cách tiếp cận dựa trên trình biên dịch hợp nhất. ZML ưu tiên tính khả chuyển của phần cứng và hỗ trợ đa chip hơn là độ trễ yêu cầu đơn cực thấp. Ngược lại, Kog được chế tạo có mục đích để giảm độ trễ tối đa trên các GPU trung tâm dữ liệu cao cấp cụ thể (MI300X, H200) thông qua tối ưu hóa chuyên sâu dành riêng cho phần cứng.
Cerebras — Sử dụng chiến lược ưu tiên phần cứng triệt để: Wafer-Scale Engine (WSE-3), một chip đơn khổng lồ loại bỏ nhu cầu giao tiếp đa GPU. Cerebras đạt ~2.100 token/giây trên Llama 3.1 70B (batch 1) trên chip WSE-3 của họ — đáng chú ý là tốc độ đó dành cho mô hình 70B, không phải mô hình 2B.
Lưu ý quan trọng: Kết quả 3.000 tok/s của Kog là trên mô hình 2,3B tham số — nhỏ hơn một bậc so với các mô hình 70B mà Cerebras phục vụ ở tốc độ tương đương. Kog vẫn chưa chứng minh được tuyên bố 30 lần của mình trên quy mô lớn. Cột mốc tiếp theo của công ty (tăng 10 lần trên một mô hình công nghiệp lớn) sẽ là điểm kiểm chứng quan trọng.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Kog, startup AI của Pháp, tuyên bố đạt 3.000 token đầu ra mỗi giây cho mỗi yêu cầu trên cụm 8 GPU AMD MI300X, hoàn toàn dựa vào tối ưu phần mềm, không dùng phần cứng tùy chỉnh, lượng tử hóa hay giải mã suy diễn.
Kog, startup AI của Pháp, tuyên bố đạt 3.000 token đầu ra mỗi giây cho mỗi yêu cầu trên cụm 8 GPU AMD MI300X, hoàn toàn dựa vào tối ưu phần mềm, không dùng phần cứng tùy chỉnh, lượng tử hóa hay giải mã suy diễn. Cốt lõi là 'Delayed Tensor Parallelism' (DTP) và 'Monokernel': trì hoãn việc đồng bộ dữ liệu giữa các GPU, gộp toàn bộ vòng lặp giải mã thành một kernel duy nhất để loại bỏ hoàn toàn độ trễ khởi tạo và chờ đợi.
Hiện tại Kog mới chỉ chứng minh được trên mô hình nhỏ 2B tham số; thử thách lớn nhất là nhân rộng lên các mô hình 70B+ hay MoE để chứng minh tuyên bố tăng tốc 30 lần là khả thi.