法國巴黎 AI 基礎設施新創 Kog AI 的純軟體推理引擎在單一 8× AMD MI300X 節點上,對 2B 參數模型達到每秒每請求 3,000+ 個輸出 token 的速度,比傳統 100–300 tok/s 的解碼速度提升約 30 倍。 2026 年 5 月的技術預覽僅在 2.3B 參數的 Laneformer 2B 模型上運行,僅支援 AMD MI300X 和 NVIDIA H200 兩種 GPU 架構,且為單用戶、單請求的測試情境,尚未展示多用戶批次生產環境的吞吐量。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Kog, how does its approach to GPU inference acceleration differ from the hardware-centric strategy of companies like Cerebras, what. Article summary: Here is a comprehensive breakdown of Kog, covering all the areas you asked about.. Topic tags: general, general web, user generated, academic, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
AI 產業過去幾年投入數十億美元競逐更快的晶片。總部位於巴黎的新創公司 Kog AI 賭上了一個截然不同的方向:他們認為業界從一開始就解決錯了問題。而 2026 年 5 月推出的技術預覽,似乎為這個賭注提供了有力佐證。
Kog (Kog AI) 是一家成立於 2023 年的法國 AI 基礎設施新創公司,創辦人為 Gaël Delalleau。其核心產品是 Kog 推理引擎 (Kog Inference Engine, KIE),這是一款純軟體的推理引擎,能在標準的資料中心 GPU 上大幅加速大型語言模型 (LLM) 的推理過程,完全不需要客製化晶片 。該公司於 2025 年 5 月首次公開亮相,並在 2026 年 5 月 28 日推出了公開技術預覽
。
Cerebras 打造專用的晶圓級晶片,Groq 和 SambaNova 也遵循類似的硬體優先路徑。Kog 則採取完全相反的策略:現有 GPU 中存在大量未被充分利用的效能空間,原因是軟體堆疊效率不彰。透過深層的軟體最佳化,在不使用任何新晶片的情況下,就能達到甚至超越專用硬體的速度 。
其核心創新在於一個單核心 (monokernel)——這是一個單一、持久駐留在 GPU 上的程式,一氣呵成地執行整個 LLM 解碼流程 (包括 prefill、decode、LM-head sampling),從而消除了困擾標準軟體堆疊的「每 token 核心啟動開銷」。標準的推理框架 (如 vLLM、SGLang、TensorRT-LLM) 每生成一個 token 就需要啟動一個 GPU 核心,每次啟動約耗費 4.5 微秒的開銷,並伴隨 HBM 重新啟動的延遲
。Kog 的引擎則繞過了標準的通訊庫,並消除了其測量中占據每 token 生成時間 35% 的網格同步 (grid synchronizations)
。
所謂的「30 倍加速」,是相較於高端 GPU 上 2B 到 8B 模型典型的 100 到 300 tokens/s 解碼速度,與 Kog 達到的 3,000 tokens/s 相比所得出的結果 。
成果:
限制:
Kog 鎖定三大主要應用場景:
在商業方面,根據 CEO Delalleau 的說法,截至 2026 年 8 月,Kog 已累積超過 200 個具體的商業潛在客戶。其技術預覽在 2026 年 5 月曾登上 Hacker News 首頁
。該公司已獲得由 Varsity VC 共同領投的種子輪資金,Varsity VC 的合夥人 Kamel Zeroual 曾是 Delalleau 第一家新創公司 Stribe 的共同創辦人
。
CEO Gaël Delalleau 的背景相當獨特:固態物理學和攻擊性網路安全 。
Kog 面臨三項重大的規模化障礙:
Kog 的下一個關鍵里程碑是證明其方法在大型語言模型 (700 億參數以上) 上同樣有效。CEO Delalleau 已表示公司現正專注於將其技術擴展到全尺寸的 LLM。其信心來自於具有更高記憶體頻寬的新一代 GPU 架構——Kog 認為這項資源在標準軟體堆疊下仍被嚴重低估 。該公司尚未公布具體時程,但業界普遍認為,能否成功展示在大型模型上的效能,將是驗證其整個技術願景的成敗關鍵。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
法國巴黎 AI 基礎設施新創 Kog AI 的純軟體推理引擎在單一 8× AMD MI300X 節點上,對 2B 參數模型達到每秒每請求 3,000+ 個輸出 token 的速度,比傳統 100–300 tok/s 的解碼速度提升約 30 倍。
法國巴黎 AI 基礎設施新創 Kog AI 的純軟體推理引擎在單一 8× AMD MI300X 節點上,對 2B 參數模型達到每秒每請求 3,000+ 個輸出 token 的速度,比傳統 100–300 tok/s 的解碼速度提升約 30 倍。 2026 年 5 月的技術預覽僅在 2.3B 參數的 Laneformer 2B 模型上運行,僅支援 AMD MI300X 和 NVIDIA H200 兩種 GPU 架構,且為單用戶、單請求的測試情境,尚未展示多用戶批次生產環境的吞吐量。
Kog 已累積 200 多個商業潛在客戶,並獲得 Varsity VC 領投的種子輪資金,目標鎖定 AI 代理工作流程、即時推理與企業自建推理部署,試圖以軟體優先路徑挑戰客製推理晶片陣營。