이 글에서는 Kimi K3의 실제 성능, 가격, 그리고 미중 AI 경쟁에서의 의미를 살펴봅니다.
Kimi K3는 독립 기관인 Artificial Analysis Intelligence Index v4.1에서 57.1점을 기록하며, Claude Fable 5(60점)와 GPT-5.6 Sol(59점)에 이어 세계 3위를 차지했습니다 . 약 3점 차이는 역사적으로 볼 때 매우 좁은 격차이지만, 가장 광범위한 지능 테스트에서는 여전히 상위 미국 모델들이 앞서 있음을 의미합니다
. Moonshot 역시 "K3는 Anthropic과 OpenAI의 가장 강력한 독점 모델에 전반적인 성능에서 여전히 뒤처진다"고 공식적으로 인정했습니다
.
하지만 특정 실제 에이전트 벤치마크에서는 K3가 확실히 앞섰습니다:
| 벤치마크 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| DeepSWE | 73.0 | 70.0 | 67.5 | 59.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 75.6 | — | — | — |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 |
이 5개의 에이전트 벤치마크와 Program Bench(77.8)를 포함해 K3는 6개 중 5개에서 1위를 차지하며 Fable 5와 GPT-5.6 Sol을 모두 능가했습니다 . 또한, Claude Opus 4.8을 모든 공개 벤치마크에서 크게 앞질렀습니다. 이는 Opus 4.8이 입력 100만 토큰당 5달러, 출력 25달러에 책정된 직접적인 가격 경쟁자라는 점에서 중요한 의미를 가집니다
.
UC Berkeley 연구진이 구축한 Arena 블라인드 인간 선호도 플랫폼에서 K3는 출시 직후 코딩 리더보드 정상에 올랐습니다 . Arena의 군중 비교 평가에서 K3는 프론트엔드 웹 개발 부문에서 1,679점을 기록, Fable 5(1,631점)와 GPT-5.6 Sol(1,618점)을 제쳤습니다
.
GPU 커널 최적화 측면에서 Moonshot은 K3가 Opus 4.8, GPT-5.6 Sol, GPT-5.5를 "크게 능가"했다고 보고했습니다 . 이는 동일한 하드웨어에서 지연 시간 단축과 처리량 향상을 의미하므로 상업적으로 중요합니다.
K3는 896개의 전문가 중 토큰당 16개만 활성화되는 희소 MoE 아키텍처를 사용하여, 총 2.8조 파라미터임에도 GPT-5.6 Sol과 비슷한 추론 비용을 유지합니다 . 또한, 장문 추론 능력을 개선하기 위해 설계된 Kimi Delta Attention (KDA) 및 Attention Residuals (AttnRes) 라는 새로운 아키텍처 구성 요소를 도입했습니다
.
Kimi K3의 API 가격은 시장을 뒤흔들 정도로 파격적입니다:
| 모델 | 입력 (100만 토큰당) | 출력 (100만 토큰당) |
|---|---|---|
| Kimi K3 | $3.00 | $15.00 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
Kimi K3는 GPT-5.6 Sol보다 약 40% 저렴하고, Claude Fable 5보다 약 70% 저렴합니다 . 세 모델은 3.3배 단계를 형성합니다. Fable 5는 입력과 출력 모두에서 Kimi K3의 3.3배이며, GPT-5.6 Sol은 그 중간에 위치합니다
.
또한, K3는 이전에 처리된 컨텍스트 쿼리에 대해 캐시 적중 입력 요금이 100만 토큰당 $0.30으로, 캐시 미스 요금보다 10배 저렴합니다 . 작업당 비용으로는 미국 플래그십 모델보다 50-65% 저렴한 것으로 추정됩니다
.
이는 Kimi K3가 가격을 '예산형'이 아닌 '프론티어 모델' 수준으로 책정한 중요한 변화입니다 . 이전 모델인 K2.5, K2.6은 입력 $0.60, 출력 $2.50-4.00 수준이었지만, K3는 이전 모델보다 약 3-4배 비싸졌습니다
. 그럼에도 특정 에이전트 작업에서는 동등하거나 더 나은 성능을 제공하면서 최상위 미국 모델보다는 저렴합니다.
2026년 7월 19일, 출시 약 48시간 만에 Moonshot AI는 Kimi K3의 신규 구독을 일시 중단한다고 발표했습니다. 회사는 X(구 트위터)에 "Kimi K3가 예상보다 훨씬 더 큰 사랑을 받았고, GPU가 그 영향을 느끼고 있습니다. 지난 48시간 동안 수요가 현재 용량의 한계에 근접했습니다"라고 게시했습니다 .
회사는 기존 구독자에게 컴퓨팅 자원을 우선 배정하고 가능한 한 빨리 용량을 늘려 배치 단위로 신규 구독을 재개할 계획이라고 밝혔습니다 . 기존 사용자는 완전한 접근 권한을 유지했으며, 기업/API 서비스도 계속 제공되었습니다
.
다수의 언론은 이번 사태가 미국의 칩 수출 제한으로 인한 중국의 지속적인 컴퓨팅 자원 제약을 여실히 보여준다고 지적했습니다 . 사우스차이나모닝포스트(SCMP)는 "이 상황은 중국 AI 연구소가 제품을 글로벌 사용자에게 서비스하는 데 직면한 어려움을 강조한다"고 보도했습니다
. 모델의 전체 가중치는 7월 27일까지 공개되지 않아, 출시 기간 동안 Moonshot만이 유일한 추론 용량 제공자였습니다
.
Moonshot은 이 중단 기간을 이용해 멤버십을 Kimi Membership(웹, 앱, Work용)과 Kimi Code Membership(코딩 워크플로용)의 두 가지로 분리하여 컴퓨팅 자원을 더 효율적으로 배분했습니다 .
Kimi K3의 출시는 AI 벤치마크를 넘어 파장을 일으켰습니다. Straits Times는 K3가 "기술주 급락을 촉발했다"고 직접 보도했으며, 여러 매체는 이 출시를 미국 반도체 및 AI 주식 매도와 연결 지었습니다 .
한편, 로이터는 2026년 7월 20일, "구독 중단은 회사가 신규 자금을 조달하려는 시점에 발생했으며, 소식통에 따르면 홍콩에서의 기업공개(IPO)를 추진 중"이라고 보도했습니다 . 다만, 300억 달러의 기업 가치를 목표로 하는 구체적인 주주 결의안은 제공된 소스 내에서 확인되지 않았습니다.
Kimi K3의 전체 모델 가중치는 2026년 7월 27일에 공개될 예정입니다 . 이는 개발자와 조직이 API를 통해 빌리는 것이 아닌, 모델을 다운로드, 실행, 검사, 미세 조정 및 소유할 수 있음을 의미합니다
. 이 2단계 출시(API 우선, 11일 후 오픈웨이트)는 전체 발표의 핵심입니다
.
오픈웨이트 출시 전까지 개발자는 kimi.com, Kimi API 또는 OpenRouter를 통해 K3에 접근할 수 있습니다 . 이 모델은 OpenAI SDK와 호환되며, 도구 호출, 구조화된 출력, 자동 컨텍스트 캐싱을 지원하고, 100만 토큰 컨텍스트 윈도우를 장문 컨텍스트 추가 요금 없이 제공합니다
.
다만, 2.8조 파라미터 모델을 로컬에서 실행하는 것은 간단한 작업이 아닙니다. 파일 크기는 약 1.5TB로 추정되며, 권장 하드웨어는 64개 이상의 엔터프라이즈 NVIDIA H100 GPU가 필요합니다 . 대부분의 팀에게 API가 실질적인 접근 수단이 될 것입니다.
Kimi K3는 전반적인 지능에서 GPT-5.6 Sol이나 Claude Fable 5를 무너뜨리는 모델이 아닙니다. Moonshot 스스로도 그렇게 말합니다. 하지만 이 모델은 오픈웨이트 시스템이 특정 상업적으로 가치 있는 작업에서 프론티어 독점 모델과 경쟁할 수 있고, 가격은 훨씬 저렴하다는 것을 증명했습니다. 이는 역대 가장 큰 오픈웨이트 모델이며, 단 이틀 만에 회사의 GPU 인프라를 마비시킬 만큼의 실시간 수요를 입증했습니다.
에이전트 벤치마크에서의 프론티어급 성능, 공격적인 가격, 오픈웨이트, 그리고 압도적인 수요 신호의 조합은 K3가 단순한 리더보드 순위를 넘어 AI 환경에서 중요한 이정표가 되게 합니다.