法国创企Kog称,通过纯软件优化栈可在现有数据中心GPU上实现最高30倍LLM推理加速,其核心是协同设计自定义模型架构Laneformer、单内核推理引擎KIE和自定义通信层KCCL,以消除解码循环中的每一个停顿点。 Kog在8× AMD MI300X节点上实现了每请求每秒3000个输出token的解码速度(FP16,batch size 1),不使用量化、推测解码或剪枝;在8× NVIDIA H200上为每秒2100个token。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
法国AI基础设施公司Kog宣称,通过一套深度、软件优先的优化栈——协同设计自定义模型架构(Laneformer)、单内核推理引擎(KIE)和自定义通信层(KCCL)——可在现有数据中心GPU上实现最高30倍的LLM推理加速,目标是消除解码循环中的每一个停顿点。
Kog不制造定制ASIC或采购特殊硬件,而是将以下三层视为一个协同设计的系统:
Kog开源了Laneformer 2B(23亿参数),这是一个针对解码速度而非原始基准分数设计的指令微调代码模型。 这些速度大约是同尺寸模型在典型vLLM吞吐量下的10倍。
| 指标 | 结果 |
|---|---|
| 在8× AMD MI300X上的解码速度 | 每请求每秒3000个输出token(FP16,batch size 1) |
| 在8× NVIDIA H200上的解码速度 | 每请求每秒2100个输出token(FP16,batch size 1) |
| HumanEval+(贪婪解码) | 45.1% |
| MBPP+(贪婪解码) | 51.6% |
| 方法 | 无量化、无推测解码、无剪枝 |
Kog的公开技术预览目前运行在一个2B模型上。该公司正争分夺秒地将其技术扩展到更大模型:
ZML——同样是一家法国AI初创公司(由Yann LeCun背书),ZML采取了不同方法:它发布了LLMD,一个免费的推理引擎,允许许多开源模型在各种芯片(NVIDIA、AMD、Google TPU、Apple Metal、Intel Arc)上运行,采用统一的编译器方法。 ZML优先考虑硬件可移植性和多芯片支持,而非极端的单请求延迟。相比之下,Kog专注于在特定高端数据中心GPU(MI300X、H200)上通过深度、硬件特异性优化实现最大延迟降低。
Cerebras——采用根本性的硬件优先策略:晶圆级引擎(WSE-3),一个消除了多GPU通信需求的巨型单芯片。Cerebras在其WSE-3硬件上对Llama 3.1 70B(batch 1)实现了约每秒2100个token的速度——值得注意的是,该速度是针对70B模型,而非2B模型。
| 维度 | Kog | Cerebras |
|---|---|---|
| 方法 | 标准GPU上的纯软件方法 | 定制晶圆级硬件 |
| 最佳演示 | 2B模型上每秒3000个token | 70B模型上约每秒2100个token |
| 延迟声明 | 目标在前沿模型上实现30倍加速 | 相对于H100在70B模型上约4倍加速 |
| 硬件成本 | 使用现有GPU基础设施 | 需要专有CS-3系统 |
| 成熟度 | 早期阶段(技术预览,仅2B模型) | 针对多个开源模型的生产就绪级 |
关键提示: Kog每秒3000个token的结果是在一个23亿参数的模型上实现的——比Cerebras以类似速度服务的70B模型小一个数量级。Kog尚未在规模化场景下验证其30倍加速声明。该公司的下一个里程碑(在大型工业模型上实现10倍加速)将是关键的验证点。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
法国创企Kog称,通过纯软件优化栈可在现有数据中心GPU上实现最高30倍LLM推理加速,其核心是协同设计自定义模型架构Laneformer、单内核推理引擎KIE和自定义通信层KCCL,以消除解码循环中的每一个停顿点。
法国创企Kog称,通过纯软件优化栈可在现有数据中心GPU上实现最高30倍LLM推理加速,其核心是协同设计自定义模型架构Laneformer、单内核推理引擎KIE和自定义通信层KCCL,以消除解码循环中的每一个停顿点。 Kog在8× AMD MI300X节点上实现了每请求每秒3000个输出token的解码速度(FP16,batch size 1),不使用量化、推测解码或剪枝;在8× NVIDIA H200上为每秒2100个token。
Kog尚未在70B+参数级大模型上验证其30倍加速声明;其下一个关键里程碑是在主流工业级模型上实现10倍加速,预计在未来数月内完成。