Kimi K3의 핵심 논지는 배포 전 모델 용량 확대와 배포 후 추론 컴퓨팅 확대를 함께 추진해야 한다는 것이다. 2.8조 개 전체 파라미터 가운데 토큰마다 약 1,040억 개만 활성화하는 MoE가 그 출발점이다. 긴 문맥을 실용화하기 위해 KDA의 고정 크기 순환 상태와 Gated MLA의 전역 검색을 결합하고, AttnRes·Stable LatentMoE·MoonEP로 깊이 방향 정보 흐름, 전문가 라우팅, 장치 간 통신을 함께 다뤘다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
문샷 AI의 Kimi K3 기술 보고서가 내세우는 주장은 단순히 “더 큰 모델”이 아니다. 핵심은 두 축 스케일링이다. 배포 전에는 훨씬 큰 모델 용량을 만들고, 배포 후에는 그 모델이 긴 문맥을 읽고 도구를 호출하며 웹을 탐색·코딩하고 오류를 되짚는 데 충분한 추론 컴퓨팅을 쓰게 하자는 접근이다.
관건은 경제성이다. 모델을 무작정 더 깊고 조밀하게 만들면, 긴 문맥 서비스 비용이 너무 커져 실제 활용이 어려워질 수 있다. K3의 설계는 전체 용량은 크게 늘리되, 토큰 하나를 생성할 때 필요한 연산과 메모리는 통제하려는 시도다. 1
Kimi K3는 네이티브 멀티모달 Mixture-of-Experts(MoE) 모델로 소개된다. 전체 파라미터는 2.8조 개, 토큰당 활성화되는 파라미터는 약 1,040억 개, 최대 문맥 창은 100만 토큰이다. 1
17
두 수치는 서로 다른 것을 뜻한다.
MoE의 실질적 매력은 여기에 있다. K3는 토큰당 연산량이 비슷한 밀집형(dense) 모델보다 전체적으로 훨씬 큰 용량을 가질 수 있다. 물론 1,040억 활성 파라미터도 가벼운 규모는 아니다. 다만 매 토큰마다 2.8조 파라미터짜리 밀집형 네트워크 전체를 돌리는 비용은 피한다. 1
따라서 문샷 AI의 주장은 “파라미터가 많을수록 좋다”에 그치지 않는다. 조건부 연산을 통해 새로운 규모의 모델 용량을 긴 시간에 걸친 작업에 쓸 수 있게 하겠다는 것이다.
100만 토큰 문맥은 학습만 어려운 문제가 아니다. 일반적인 어텐션은 시퀀스가 길어질수록 메모리와 연산 부담이 누적될 수 있다. K3는 **Kimi Delta Attention(KDA)**과 **Gated Multi-head Latent Attention(Gated MLA)**을 결합한 하이브리드 구조를 사용한다. 보고된 백본 구성은 KDA 69개 층과 Gated MLA 24개 층이며, 주로 KDA 3개 층 뒤에 MLA 1개 층을 두는 3:1 패턴이다. 1
12
KDA는 선형 어텐션 계열 구성 요소다. 이런 층은 전체 이력을 따라 계속 커지는 전통적 키-값(KV) 캐시를 유지하는 대신, 고정 크기의 순환 상태를 사용한다. 의도된 장점은 과거 문맥이 길어져도 메모리 상태와 디코딩 작업량이 완전 어텐션과 같은 방식으로 커지지 않게 하는 데 있다. 1
보고서는 KDA의 감쇠율에 하한을 둔다고 설명한다. 이는 단순한 모델링 선택이 아니다. 매우 작은 감쇠값에서 발생할 수 있는 수치 계산 문제를 막고, 텐서 코어에 적합한 블록 단위 구현을 가능하게 하기 위한 설계다. 1
선형 순환만으로는 전체 문맥을 대상으로 필요한 정보를 골라 찾는 능력이 충분하지 않을 수 있다. 그래서 K3는 네트워크 전반에 Gated MLA 층을 남겨뒀다. 보고된 하이브리드 설계에서 KDA는 저비용의 지속적 시퀀스 처리를 담당하고, MLA는 주기적으로 전역 검색 기능을 제공한다. 1
이 구조가 눈에 띄는 이유는 긴 문맥을 단순한 아키텍처 문제가 아니라 시스템 문제로 본다는 점이다. 큰 문맥 창을 내세우더라도, 관련 정보를 찾아내고 사용할 만한 비용으로 응답할 수 없다면 그 가치는 제한적이다.
K3의 또 다른 구성 요소는 **Attention Residuals(AttnRes)**다. 모델은 93개 층으로 구성되며, 보고서는 AttnRes가 뒤쪽 층에서 앞선 깊이 블록의 압축 표현을 다시 가져올 수 있게 한다고 설명한다. 즉, 모든 정보가 반드시 한 층씩만 순차적으로 전달될 필요가 없도록 만든다. 1
개념적으로 KDA가 시퀀스 길이 방향의 정보 흐름을 다룬다면, AttnRes는 모델 깊이 방향의 정보 흐름을 다룬다. 상당수 층이 선형 어텐션을 쓰는 깊은 모델에서는 비용이 큰 전역 어텐션을 줄이는 것만으로 충분하지 않다. 활성값이 네트워크를 통과하는 과정에서 유용한 정보가 사라지거나 고립되지 않도록 할 경로도 필요하다. 1
K3의 MoE 층은 라우팅 전문가 896개 중 토큰마다 16개 전문가를 선택하는 방식으로 보고됐다. 1
6 전체 파라미터와 활성 파라미터 사이에 큰 차이가 생기는 직접적인 이유다.
보고서의 Stable LatentMoE는 이러한 라우팅을 안정적이고 균형 있게 유지하는 데 초점을 둔다. 배치 단위의 전문가 할당을 최적화 문제로 다루고, 분위수 기반 균형화 방식을 도입한다. 보고서는 명시한 가정 아래 정확한 최적해를 유도한다. 다만 실제 배포 시에는 추론 배치마다 균형화 문제를 새로 풀기보다, 고정된 전문가 바이어스와 일반적인 top-k 선택을 사용한다. 1
이 차이는 중요하다. 보고서의 ‘최적 균형’은 특정 라우팅 수식과 가정에서 나온 결과이지, 실제 모든 서비스 워크로드에서 토큰이 전문가들에게 완벽하게 균등 분배된다는 보장은 아니다.
대형 MoE는 네트워킹 문제도 만든다. 선택된 토큰은 할당된 전문가가 있는 다른 장치로 이동해야 하는 경우가 많다. 일부 전문가로 수요가 쏠리면 가장 느린 통신 경로가 전체 지연 시간을 좌우할 수 있다.
문샷 AI는 MoonEP를 전문가 병렬 통신을 위한 보완 시스템 계층으로 제시한다. 희소 라우팅이 만드는 올투올(all-to-all) 통신의 불균형을 줄여, 큰 전문가 풀을 학습하고 서비스할 수 있도록 돕는 역할이다. 1
이는 K3의 더 큰 주장에서 핵심이다. 아키텍처, 라우팅, 통신을 각각 따로 떼어 성능의 원인으로 보기 어렵다. 이론상 희소한 대규모 용량을 실제 처리량으로 바꾸려면 세 요소가 모두 필요하다.
K3의 다른 축은 사전학습 이후에 있다. 문샷 AI는 긴 작업 범위, 도구 사용, 코딩, 웹 탐색, 반복적 문제 해결을 포함하는 강화학습(RL) 궤적을 위한 인프라를 설명한다. 여러 영역·추론 교사 모델의 능력을 하나의 시스템으로 증류하는 방식도 보고서에 포함됐다. 1
이를 뒷받침하는 환경은 대규모로 생성·스냅샷·재개할 수 있도록 설계된 경량 가상머신 샌드박스 시스템이다. 보고된 수치는 샌드박스 인스턴스 5,120만 개, 스냅샷 133ms, 복원 49ms다. 1
전략적 의도는 분명하다. 모델이 테스트 시점에 더 많은 연산을 써서 계획을 세우고, 도구를 부르고, 결과를 확인하거나, 긴 작업을 계속 수행하게 하려면 학습 과정도 이런 궤적에 노출돼야 한다. 환경을 저렴하게 멈추고 분기하고 복원할 수 있다면, 이런 학습 롤아웃을 더 많이 수행할 여지가 생긴다.
그렇다고 단일 응답이 자동으로 무제한의 추론 컴퓨팅을 사용한다는 뜻은 아니다. K3 보고서의 논지는 더 큰 사전학습 모델 하나에만 의존하지 않고, 추가 단계와 추가 문맥을 실제 작업 성능 향상으로 바꿀 수 있는 시스템을 만들겠다는 데 있다.
Kimi K3는 장기 정보 탐색을 겨냥한 벤치마크인 BrowseComp에서 **91.2%**를 기록했다고 보고됐다. 제3자 리더보드도 K3를 91.2%로 기재하고 있지만, 순위와 측정 설정은 시간이 지나며 바뀔 수 있다. 18
이 결과는 제품 목표와 잘 맞는다. 긴 문맥, 에이전트형 사후학습, 테스트 시점 추론을 중심으로 설계된 모델이라면 복잡한 정보 탐색 과제에서 평가받는 것이 자연스럽다. 다만 이 점수만으로 개별 기술의 효과를 분리해 확인할 수는 없다.
단일 벤치마크 점수는 KDA, AttnRes, 전문가 라우팅, 통신 인프라, RL 환경, 증류, 프롬프팅, 추론 시 설정이 각각 얼마나 기여했는지 알려주지 않는다. 가장 신중한 해석은 이 시스템이 통합 스택으로서 좋은 성과를 냈다는 것이다. 특정 아키텍처 혁신 하나가 점수를 만들었다는 증거는 아니다. 1
18
K3는 DeepSeek 계열을 포함한 다른 대형 오픈 모델에 대한 도전으로 자주 거론된다. 그러나 보고서에서 무리 없이 끌어낼 수 있는 결론은 오픈 모델의 진척도를 단정하는 순위표가 아니라, 서로 다른 설계 강조점이다. 문샷 AI는 매우 큰 희소 용량, 효율적인 장문맥 처리, 에이전트를 위한 사후학습 인프라를 결합한 스택을 주장한다. 1
17
논문은 K3의 사양과 설계 선택을 뒷받침한다. 하지만 다른 오픈 모델이 “정체됐다”거나 특정 경쟁 모델 대비 결정적인 아키텍처 우위가 있다는 사실까지 논문 하나만으로 입증하지는 않는다. 그런 시장 차원의 주장은 일관된 조건에서의 독립 재현 비교가 필요하다.
토큰당 가격이나 작업당 비용 비교는 특히 과대해석하기 쉽다. 프롬프트, 추론 강도, 문맥 길이, 캐싱, 도구 사용, 처리량 가정, 가격 기준일, 평가 하니스에 따라 달라질 수 있기 때문이다.
제공된 자료에서 인용된 한 비교는 완료 작업당 비용을 K3 약 0.94달러, GPT-5.6 Sol 약 1.04달러로 추정한다. 이는 그 특정 설정에서 K3가 소폭 유리할 수 있음을 시사하지만, K3가 Sol의 ‘절반 비용’이라는 일반적 주장을 뒷받침하지는 않는다. 20
더 지속력 있는 결론은 이렇다. K3는 장문맥·에이전트 기능을 훨씬 큰 전체 모델 규모에서도 경제적으로 성립시키려는 시도다. 실제로 그 이점이 유지되는지는 재현 가능한 평가와 배포 환경별 비용 산정에 달려 있다.
Kimi K3의 기술 보고서는 전면적인 스케일링 논리를 제시한다. 배포 전 규모는 2.8조 파라미터 MoE와 토큰당 약 1,040억 활성 파라미터에서 나온다. 배포 후 규모는 모델이 긴 문맥, 도구, 추론 단계, 에이전트 롤아웃을 활용하도록 학습·서비스하는 방식에서 나온다. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP, RL 샌드박스 인프라는 모두 하나의 명제에 연결된다. 최전선급 에이전트 행동에는 더 큰 모델만이 아니라, 더 많은 문맥과 더 많은 추론 시점 작업을 실제로 쓸 수 있게 만드는 설계가 필요하다는 것이다. 벤치마크 결과는 이 통합 접근법에 유망한 근거를 제공하지만, 각 구성 요소의 기여를 최종적으로 증명한 결과로 읽어서는 안 된다. 1
18
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Kimi K3의 핵심 논지는 배포 전 모델 용량 확대와 배포 후 추론 컴퓨팅 확대를 함께 추진해야 한다는 것이다. 2.8조 개 전체 파라미터 가운데 토큰마다 약 1,040억 개만 활성화하는 MoE가 그 출발점이다.
Kimi K3의 핵심 논지는 배포 전 모델 용량 확대와 배포 후 추론 컴퓨팅 확대를 함께 추진해야 한다는 것이다. 2.8조 개 전체 파라미터 가운데 토큰마다 약 1,040억 개만 활성화하는 MoE가 그 출발점이다. 긴 문맥을 실용화하기 위해 KDA의 고정 크기 순환 상태와 Gated MLA의 전역 검색을 결합하고, AttnRes·Stable LatentMoE·MoonEP로 깊이 방향 정보 흐름, 전문가 라우팅, 장치 간 통신을 함께 다뤘다.
BrowseComp 91.2%는 통합 시스템의 성과로 읽어야 한다. 완료 작업당 비용이 K3 약 0.94달러, GPT 5.6 Sol 약 1.04달러라는 비교도 특정 조건의 추정치일 뿐, 보편적인 ‘반값’ 주장을 뒷받침하지는 않는다.