Kog AI 嘅純軟件推理引擎喺單一 8× AMD MI300X 節點上達到每秒每請求 3,000+ 輸出 tokens,比典型 100–300 tok/s 嘅解碼速度快約 30 倍;關鍵係將整個 LLM 解碼循環收縮成一個持續嘅 GPU 核心程式(monokernel),消滅咗每 token 嘅核心啟動開銷。 2026 年 5 月嘅技術預覽只喺一個 2.3B 參數模型(Laneformer 2B)上運行,只支援 AMD MI300X 同 NVIDIA H200 兩種 GPU 架構,而且係單一用戶、單一請求嘅表現,唔係多用戶並行嘅生產環境。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Kog, how does its approach to GPU inference acceleration differ from the hardware-centric strategy of companies like Cerebras, what. Article summary: Here is a comprehensive breakdown of Kog, covering all the areas you asked about.. Topic tags: general, general web, user generated, academic, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
AI 產業一直燒咗幾十億美元去追逐更快的晶片。總部位於巴黎嘅初創公司 Kog AI 就賭佢哋由頭到尾搞錯咗問題——而佢哋 2026 年 5 月嘅技術預覽似乎有啲料到。
Kog(Kog AI)係一間法國 AI 基建初創,2023 年由 Gaël Delalleau 創立。佢哋嘅核心產品係 Kog Inference Engine(KIE),一個純軟件嘅推理引擎,可以喺標準嘅數據中心 GPU 上大幅加速 LLM 推論——完全唔使特製晶片 。公司喺 2025 年 5 月結束隱身模式,並喺 2026 年 5 月 28 日推出公開技術預覽
。
Cerebras 自己整巨型晶片;Groq 同 SambaNova 都係行硬件優先嘅路。Kog 就反其道而行:佢哋認為現有 GPU 嘅巨大性能空間係因為低效率嘅軟件堆疊而被浪費咗,而深度軟件優化係可以喺唔用新晶片嘅情況下,達到甚至超越專用硬件嘅速度 。
核心創新係一個 monokernel——一個單一、持續留喺 GPU 入面嘅程式,一口氣運行晒成個 LLM 解碼過程(prefill、decode、LM-head sampling),消滅咗標準堆疊嗰種每 token 都要啟動一次 kernel 嘅開銷 。標準推理框架好似 vLLM、SGLang 同 TensorRT-LLM,每生成一個 token 就要啟動一次 GPU kernel,每次付出大約 4.5 微秒嘅啟動成本,加上 HBM 重啟延遲
。Kog 嘅引擎繞過標準通訊庫,並消除咗佢哋量度到佔每 token 生成時間 35% 嘅 grid 同步
。
個「30 倍快」嘅聲稱係對比典型解碼速度:2B–8B 模型喺高端 GPU 上通常得 100–300 tokens/s,而 Kog 係 3,000 tokens/s 。
結果:
限制:
Kog 主要瞄準三個場景:
商業方面,CEO Delalleau 話截至 2026 年 8 月,Kog 已經有 200+ 個實質商業線索 。技術預覽喺 2026 年 5 月衝上咗 Hacker News 首頁
。公司獲得由 Varsity VC 共同領投嘅種子輪融資,Varsity VC 的合夥人 Kamel Zeroual 正係 Delalleau 第一間初創 Stribe 嘅共同創辦人
。
CEO Gaël Delalleau 嘅背景好特別:固態物理學同攻擊性網絡安全 。
Kog 面對三個主要嘅擴展障礙:
Kog 嘅下一個關鍵里程碑係 證明佢哋嘅方法喺大型語言模型(70B+ 參數)上都 work。CEO Delalleau 話公司而家專注於將技術擴展到完整規模嘅 LLM。信心嚟自新一代 GPU 架構有顯著更高嘅記憶體頻寬——Kog 認為呢個資源仍然被標準軟件堆疊嚴重低估 。公司未有公布具體日期,但呢個演示普遍被視為整個理論嘅成敗關鍵。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Kog AI 嘅純軟件推理引擎喺單一 8× AMD MI300X 節點上達到每秒每請求 3,000+ 輸出 tokens,比典型 100–300 tok/s 嘅解碼速度快約 30 倍;關鍵係將整個 LLM 解碼循環收縮成一個持續嘅 GPU 核心程式(monokernel),消滅咗每 token 嘅核心啟動開銷。
Kog AI 嘅純軟件推理引擎喺單一 8× AMD MI300X 節點上達到每秒每請求 3,000+ 輸出 tokens,比典型 100–300 tok/s 嘅解碼速度快約 30 倍;關鍵係將整個 LLM 解碼循環收縮成一個持續嘅 GPU 核心程式(monokernel),消滅咗每 token 嘅核心啟動開銷。 2026 年 5 月嘅技術預覽只喺一個 2.3B 參數模型(Laneformer 2B)上運行,只支援 AMD MI300X 同 NVIDIA H200 兩種 GPU 架構,而且係單一用戶、單一請求嘅表現,唔係多用戶並行嘅生產環境。
Kog 已經有超過 200 個商業線索,並獲得 Varsity VC 領投嘅種子輪融資;目標係 agentic AI 工作流程、實時 LLM 推論同自托管企業推理,定位為 Cerebras、Groq 等硬件優先方案嘅軟件替代品。