フランスのスタートアップKogは、カスタムASICや量子化、投機的デコードを用いず、ソフトウェアの深層最適化のみで、既存のデータセンターGPU上でLLM推論を最大30倍高速化する技術を発表。 核となる革新は、GPU間のall reduce通信を2層遅延させる「遅延テンソル並列化(DTP)」と、デコード処理全体を1つの永続カーネルとして実行する「モノカーネル」、そしてこれらに最適化された8レーン構造の独自アーキテクチャ「Laneformer」の共同設計。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
フランス・パリ発のAIスタートアップKogは、カスタムASICや特殊なハードウェアに頼らず、既存のデータセンター向けGPU(NVIDIA H200、AMD MI300X)上で動作するソフトウェアの深層最適化のみによって、LLM(大規模言語モデル)の推論処理を最大30倍高速化できると主張している。
同社の技術は、通常は別々のチームが担当するモデルアーキテクチャ、並列化スキーム、GPUランタイムの3層を単一のシステムとして共同設計する点に特徴がある。
Kogは2026年5月、2.3Bパラメータの命令チューニング済みコーディングモデル「Laneformer 2B」をオープンソースで公開。このモデルは、ベンチマークスコアよりもデコード速度を最優先に設計されている。
| 指標 | 結果 |
|---|---|
| 8× AMD MI300Xでのデコード速度 | リクエストあたり3,000出力トークン/秒(FP16、バッチサイズ1) |
| 8× NVIDIA H200でのデコード速度 | リクエストあたり2,100出力トークン/秒(FP16、バッチサイズ1) |
| HumanEval+(greedy) | 45.1% |
| MBPP+(greedy) | 51.6% |
| 手法 | 量子化なし、投機的デコードなし、プルーニングなし |
これらの速度は、同規模のモデルにおける標準的なvLLMスループットと比較して約10倍高速である。Kogはこの速度を基に、より大規模なモデルでは30倍の高速化を目標としている。
Kogのテックプレビューは現在2Bモデルのみで動作する。同社はこの技術をより大規模なモデルに拡張すべく、以下の目標に取り組んでいる。
ZML:同じくフランス発のAIスタートアップ(ヤン・ルカン氏も支援)。ZMLのアプローチは、コンパイラベースの統一手法を用いて、NVIDIA、AMD、Google TPU、Apple Metal、Intel Arcなど多様なチップ上で多くのオープンソースモデルを実行できる自由な推論エンジン「LLMD」を提供すること。 ZMLはハードウェアのポータビリティとマルチチップ対応を重視しており、Kogのように特定のハイエンドGPUでの極端なレイテンシ低減に特化しているわけではない。
Cerebras:根本的にハードウェア・ファーストの戦略。巨大な単一チップ「Wafer-Scale Engine(WSE-3)」により、マルチGPU通信の必要性そのものを排除。CerebrasはWSE-3上で、Llama 3.1 70Bに対して約2,100トークン/秒(バッチサイズ1)を達成している。 注目すべきは、この速度が2Bモデルではなく70Bモデルで達成されている点だ。
重要な留意点: Kogの3,000トークン/秒という結果は、Cerebrasが同等の速度で提供する70Bモデルと比較して、一桁小さい2.3Bパラメータモデルでのものだ。Kogが主張する30倍高速化がスケールするかどうかはまだ実証されていない。同社の次のマイルストーン(大規模モデルでの10倍高速化)が、その真価を問う重要な試金石となる。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
フランスのスタートアップKogは、カスタムASICや量子化、投機的デコードを用いず、ソフトウェアの深層最適化のみで、既存のデータセンターGPU上でLLM推論を最大30倍高速化する技術を発表。
フランスのスタートアップKogは、カスタムASICや量子化、投機的デコードを用いず、ソフトウェアの深層最適化のみで、既存のデータセンターGPU上でLLM推論を最大30倍高速化する技術を発表。 核となる革新は、GPU間のall reduce通信を2層遅延させる「遅延テンソル並列化(DTP)」と、デコード処理全体を1つの永続カーネルとして実行する「モノカーネル」、そしてこれらに最適化された8レーン構造の独自アーキテクチャ「Laneformer」の共同設計。
2.3BパラメータのLaneformer 2Bで、8× AMD MI300X上で毎秒3,000トークン、8× NVIDIA H200上で毎秒2,100トークンを達成(FP16、バッチサイズ1)。ただし、これは小規模モデルでの結果であり、70B以上のフロンティアモデルで同様の性能を実証できるかが次の焦点。