| 指標 | 結果 |
|---|---|
| 8× AMD MI300X 上的解碼速度 | 每秒 3,000 個輸出 token (FP16, 批次大小 1) |
| 8× NVIDIA H200 上的解碼速度 | 每秒 2,100 個輸出 token (FP16, 批次大小 1) |
| HumanEval+ (貪婪解碼) | 45.1% |
| MBPP+ (貪婪解碼) | 51.6% |
| 實現方式 | 無需量化、無需推測解碼、無需模型剪枝 |
Kog 的公開技術預覽目前僅針對 20 億參數的模型。該公司正加緊腳步,將其技術擴展到更大的模型:
ZML —— 同樣是法國 AI 新創公司(獲 Yann LeCun 認可),ZML 採取不同路線:其推出的免費推論引擎 LLMD 能讓多種開源模型在廣泛的晶片上運行(NVIDIA、AMD、Google TPU、Apple Metal、Intel Arc)。 ZML 優先考慮 硬體可攜性與多晶片支援,而非極致的單一請求延遲。相比之下,Kog 則是為了在特定高階資料中心 GPU(MI300X、H200)上實現最大延遲降低而設計的深度硬體特定優化解決方案。
Cerebras —— 採取根本性的硬體優先策略:其晶圓級引擎 (WSE-3) 是一顆巨大的單一晶片,完全消除了多 GPU 之間的通訊需求。Cerebras 在其 WSE-3 硬體上,能以每秒約 2,100 個 token 的速度運行 Llama 3.1 70B 模型(批次大小 1) —— 值得注意的是,這個速度是針對 一個 700 億參數的模型,而非 20 億的模型。