Kog는 커스텀 하드웨어, 양자화, 추측 디코딩 없이 순수 소프트웨어 기반 추론 엔진으로 8× AMD MI300X 노드에서 요청당 초당 3,000 출력 토큰을 달성했습니다. 핵심 혁신은 '지연된 텐서 병렬화(DTP)'로, GPU 간 all reduce 통신을 2레이어 지연시켜 연산과 통신을 겹치게 함으로써 표준 텐서 병렬화의 정체를 제거합니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Kog's approach to achieving up to 30x faster LLM inference on existing GPUs, how does its software-first strategy work, what results. Article summary: ## Kog's Approach and Results. Topic tags: general, documentation, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Kog는 프랑스 AI 스타트업으로, 기존 데이터센터 GPU에서 LLM 추론 속도를 최대 30배까지 높일 수 있다고 주장합니다. 이를 위해 자체 모델 아키텍처(Laneformer), 단일 커널 추론 엔진(KIE), 맞춤형 통신 라이브러리(KCCL)를 하나의 시스템으로 공동 설계하여 디코딩 루프의 모든 지연 원인을 제거하는 소프트웨어 우선 최적화 스택을 구축했습니다.
Kog는 커스텀 ASIC을 만들거나 특수 하드웨어를 도입하는 대신, 다음 세 가지 계층을 하나의 공동 설계 시스템으로 취급합니다:
Kog는 디코딩 속도에 최적화된 명령어 튜닝 코딩 모델인 Laneformer 2B(2.3B 파라미터)를 오픈소스로 공개했습니다. 이 속도는 동일한 크기의 모델에 대한 일반적인 vLLM 처리량보다 약 10배 빠른 수준입니다.
| 지표 | 결과 |
|---|---|
| 8× AMD MI300X 디코드 속도 | 요청당 초당 3,000 출력 토큰 (FP16, 배치 크기 1) |
| 8× NVIDIA H200 디코드 속도 | 요청당 초당 2,100 출력 토큰 (FP16, 배치 크기 1) |
| HumanEval+ (greedy) | 45.1% |
| MBPP+ (greedy) | 51.6% |
| 방법 | 양자화 없음, 추측 디코딩 없음, 프루닝 없음 |
Kog의 공개 기술 미리보기는 2B 모델에서 실행됩니다. 회사는 이제 기술을 대규모 모델로 확장하기 위해 경쟁하고 있습니다:
ZML — 얀 르쿤(Yann LeCun)의 지지를 받는 또 다른 프랑스 AI 스타트업으로, ZML은 다른 접근 방식을 취합니다. 통합 컴파일러 기반 접근 방식을 통해 다양한 칩(NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc)에서 많은 오픈소스 모델을 실행할 수 있는 무료 추론 엔진 LLMD를 출시했습니다. ZML은 극도의 단일 요청 지연 시간보다 하드웨어 이식성과 멀티 칩 지원을 우선시합니다. 반면 Kog는 특정 고급 데이터센터 GPU(MI300X, H200)에서의 최대 지연 시간 감소를 위해 심층적인 하드웨어 특화 최적화를 통해 구축되었습니다.
Cerebras — 근본적으로 하드웨어 우선 전략을 사용합니다. 웨이퍼 스케일 엔진(WSE-3)은 멀티 GPU 통신의 필요성을 없애는 거대한 단일 칩입니다. Cerebras는 WSE-3 하드웨어에서 Llama 3.1 70B(배치 1)에 대해 약 2,100토큰/초를 달성합니다 — 주목할 점은 이 속도가 2B 모델이 아닌 70B 모델에 대한 것이라는 점입니다.
핵심 주의사항: Kog의 3,000토큰/초 결과는 2.3B 모델에 대한 것입니다. 이는 Cerebras가 비슷한 속도로 서비스하는 70B 모델보다 한 자릿수 작은 규모입니다. Kog는 아직 대규모에서 30배 주장을 입증하지 못했습니다. 회사의 다음 이정표(대규모 산업 모델에서 10배)가 중요한 증명 지점이 될 것입니다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Kog는 커스텀 하드웨어, 양자화, 추측 디코딩 없이 순수 소프트웨어 기반 추론 엔진으로 8× AMD MI300X 노드에서 요청당 초당 3,000 출력 토큰을 달성했습니다.
Kog는 커스텀 하드웨어, 양자화, 추측 디코딩 없이 순수 소프트웨어 기반 추론 엔진으로 8× AMD MI300X 노드에서 요청당 초당 3,000 출력 토큰을 달성했습니다. 핵심 혁신은 '지연된 텐서 병렬화(DTP)'로, GPU 간 all reduce 통신을 2레이어 지연시켜 연산과 통신을 겹치게 함으로써 표준 텐서 병렬화의 정체를 제거합니다.
Kog는 아직 30배 가속 주장을 대규모(70B+ 모델)에서 입증하지 못했습니다. 2B 모델에서 최고 속도를 보였으며, 다음 핵심 이정표는 산업용 대규모 모델에서 10배 속도 향상을 증명하는 것입니다.