法国AI基础设施初创公司Kog推出纯软件推理引擎KIE,在8× AMD MI300X节点上实现每秒3000+输出token,速度约为主流框架(vLLM等)的30倍,无需定制芯片。 其核心技术“monokernel”将整个LLM解码过程整合为单个驻留GPU程序,消除了逐token的核启动与栅格同步开销(后者占生成时间的35%)。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Kog, how does its approach to GPU inference acceleration differ from the hardware-centric strategy of companies like Cerebras, what. Article summary: Here is a comprehensive breakdown of Kog, covering all the areas you asked about.. Topic tags: general, general web, user generated, academic, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
AI行业已经砸了数十亿美元去造更快的芯片。但巴黎创企Kog AI认为,它们从一开始就找错了问题——而该公司2026年5月的技术预览,正在让这个判断变得越来越可信。
Kog AI是一家2023年成立于法国的AI基础设施公司,创始人为Gaël Delalleau。其核心产品是Kog推理引擎(KIE) ,一个纯软件推理引擎,无需定制芯片,仅靠软件优化就能在标准数据中心GPU上大幅加速LLM推理。公司于2025年5月结束隐身模式,并于2026年5月28日开放公开技术预览
。
Cerebras自研晶圆级芯片,Groq和SambaNova也走硬件定制路线。Kog走了一条完全相反的路:它认为现有GPU中还存在大量因软件栈低效而被浪费的性能空间,深层的软件优化完全可以匹敌甚至超越专用硬件的速度,而无需任何新芯片。
其核心创新是一个单核(monokernel)程序——一个持久驻留于GPU中的程序,将LLM解码的整个环节(预填充、逐token生成、语言头采样)一次性完成,从而彻底消除标准方案中逐token启动GPU核的开销。常规推理框架(如vLLM、SGLang、TensorRT-LLM)每生成一个token就要启动一次GPU核,每次启动耗时约4.5微秒,再加上HBM重开延迟
。Kog的引擎跳过了标准通信库,并消除了栅格同步——Kog团队测量发现,这种同步占用了每个token生成时间的35%
。
所谓“30倍提速”,是将Kog每秒3000 token的速度,与高端GPU上2B-8B参数模型常见的每秒100-300 token解码速度进行比较得出的。
成果:
局限:
Kog瞄准三大场景:
商业方面,截至2026年8月,CEO Delalleau表示已获得200多条高质量商业线索。该技术预览于2026年5月登顶Hacker News首页
。公司已完成种子轮融资,由Varsity VC联合领投,其合伙人Kamel Zeroual曾是Delalleau第一家公司Stribe的联合创始人
。
CEO Gaël Delalleau的背景在AI基础设施领域实属罕见:凝聚态物理学与攻击性网络安全。
Kog面临三个明显的规模化难题:
Kog的下一个关键里程碑是证明其方法在70B+参数大型语言模型上有效。CEO表示公司当前正集中精力将技术扩展到全尺寸LLM。其信心来源于新一代GPU架构显著提升的内存带宽——Kog认为这部分资源仍被标准软件栈严重浪费。公司尚未公布具体时间表,但业界普遍认为,这将是验证Kog技术路线能否成真的决定性时刻。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
法国AI基础设施初创公司Kog推出纯软件推理引擎KIE,在8× AMD MI300X节点上实现每秒3000+输出token,速度约为主流框架(vLLM等)的30倍,无需定制芯片。
法国AI基础设施初创公司Kog推出纯软件推理引擎KIE,在8× AMD MI300X节点上实现每秒3000+输出token,速度约为主流框架(vLLM等)的30倍,无需定制芯片。 其核心技术“monokernel”将整个LLM解码过程整合为单个驻留GPU程序,消除了逐token的核启动与栅格同步开销(后者占生成时间的35%)。
2026年5月的技术预览仅支持2.3B参数模型、单用户单请求,暂未展示多用户并发吞吐和70B+大模型能力——后者是验证其技术路线的关键里程碑。