Kimi K3의 핵심 주장은 AI 성능을 끌어올리려면 배포 전 모델 용량과 배포 후 장기 추론·도구 사용에 쓰는 연산을 함께 확장해야 한다는 것이다. 총 2.78조 개 매개변수 중 토큰당 1,042억 개만 활성화하는 MoE 구조는 거대한 용량을 확보하면서도 2.78조 개 전체를 매 토큰 계산하는 비용은 피하려는 설계다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Kimi K3 기술 보고서의 핵심 메시지는 단순히 “더 큰 모델을 학습하자”가 아니다. 문샷 AI는 최전선 AI의 발전에는 배포 전 확보하는 모델 용량과 배포 후 실제 문제를 풀 때 투입하는 추론 연산량이라는 두 자원을 함께 키워야 한다고 본다. 긴 추론, 웹 탐색, 코딩, 도구 호출, 계획 수정 같은 에이전트 작업은 모델이 출시된 뒤에도 더 많은 계산을 요구하기 때문이다.
이를 위해 K3는 대규모 용량을 담되, 매 토큰마다 그 전체를 계산하지 않도록 설계됐다. 보고서상 K3는 네이티브 멀티모달 MoE(전문가 혼합) 모델로, 총 매개변수는 2.78조 개, 토큰당 활성화되는 매개변수는 1,042억 개이며, 최대 100만 토큰 컨텍스트를 지원한다. 즉 2.78조 개 규모의 지식을 담을 수 있는 모델 용량을 추구하면서도, 추론 비용을 조밀한(dense) 2.78조 매개변수 모델 수준으로 만들지 않겠다는 접근이다. 1
여기서 중요한 정정도 있다. 보고서가 주장하는 네이티브 컨텍스트 외삽 범위는 10만 토큰이 아니라 100만 토큰이다. 학습은 처음 8K 토큰, 이후 64K 토큰 길이에서 진행됐으며, 명시적 위치 임베딩을 쓰지 않는다. 문샷 AI는 KDA의 순환 게이트와 감쇠가 위치 정보를 충분히 인코딩하므로, RoPE를 수정하지 않아도 더 긴 길이로 외삽할 수 있다고 설명한다. 1
Kimi Delta Attention(KDA)은 일반적인 전체 어텐션의 큰 KV 캐시 대신 고정 크기의 순환 상태를 주로 사용한다. 따라서 긴 문맥이 누적될수록 과거 토큰을 모두 참조하는 방식에서 발생하는 부담을 낮추려는 목적이다. K3는 KDA 3개 층 뒤에 Gated MLA 1개 층을 두는 3:1 혼합 구조를 반복한다. KDA가 저렴하고 지속적인 시퀀스 처리를 담당하고, Gated MLA가 필요한 전역 정보 검색 능력을 보완하는 역할이다. 1
보고서가 언급한 KDA 감쇠율의 하한은 단순한 모델링 선택만은 아니다. 지나치게 작은 감쇠값에서 발생할 수 있는 수치적 문제를 막고, 텐서 코어에 적합한 블록 연산을 가능하게 하기 위한 구현상 장치라는 설명이다. 1
93개 층으로 깊어진 네트워크에서 Attention Residuals(AttnRes)는 이전 깊이 블록의 압축 표현을 뒤쪽 층이 다시 가져올 수 있게 한다. 유용한 정보가 오직 바로 앞 층을 거쳐서만 전달되는 병목을 완화하려는 것이다. 문샷 AI의 주장은, 이 교차 깊이 검색 경로가 값비싼 전역 어텐션의 상당 부분을 KDA로 대체하면서도 품질을 유지하는 데 도움이 된다는 것이다. 1
모델의 ‘너비’는 Stable LatentMoE가 담당한다. 보고서상 이 구조는 896개 전문가 가운데 토큰마다 상위 16개를 선택하는 라우팅을 사용한다. 양자위 균형화 방식은 라우팅을 균형 잡힌 할당 문제로 다루며, 배치 수준의 가정 아래 정확한 최적해를 도출한다고 설명한다. 다만 실제 배포에서는 이 균형화 해법을 매번 실행하는 대신, 고정된 전문가 편향과 일반적인 top-k 선택을 사용한다. 1
따라서 여기서 말하는 ‘완벽한 균형’은 명시된 라우팅 최적화 문제에서의 결과이지, 모든 실제 서비스 배치에서 전문가 부하가 언제나 완벽히 균등하다는 보장은 아니다.
대규모 MoE에서는 토큰이 선택된 전문가가 있는 장비로 이동하는 all-to-all 통신도 핵심 비용이다. MoonEP는 전문가 수요가 고르지 않을 때 통신 지연이나 특정 장비의 병목이 전체 지연 시간을 좌우하지 않도록 이를 균형화하려는 시스템 구성이다. 다시 말해 KDA·AttnRes·MoE 라우팅은 모델 구조의 선택이고, MoonEP는 그 선택을 대규모 학습과 서비스에서 실제로 운용하기 위한 기반이다. 두 종류의 주장을 별개의 벤치마크 향상 원인으로 분리해 볼 수는 없다. 1
K3의 두 번째 축은 사후학습과 테스트 타임 추론이다. 보고서는 경량 VM 샌드박스 클러스터를 통해 검증 가능한 장기 강화학습(RL) 궤적을 대량으로 만들고, 스냅샷을 이용해 분기하거나 재개하는 비용을 낮췄다고 설명한다. 이는 더 큰 사전학습 모델 하나에만 의존하기보다, 실제 문제 풀이에서 여러 단계의 계획 수립·브라우징·코딩·도구 호출·자기 수정에 계산을 쓸 수 있는 모델을 훈련하기 위한 기반이다. 또한 여러 도메인 및 추론 교사의 행동을 하나의 시스템으로 증류해, 특화 모델 9개를 각각 서빙하지 않고도 해당 역량을 전달하려는 접근을 기술한다. 1
이 관점에서 K3의 전략은 ‘매개변수 경쟁’만이 아니라 저렴하게 큰 용량을 보유하고, 필요할 때 긴 에이전트 롤아웃에 더 많은 계산을 쓰는 구조를 만들겠다는 주장으로 읽힌다.
제3자 리더보드에서 K3는 BrowseComp **91.2%**를 기록했다. BrowseComp는 단순한 내재 지식보다 실제 웹 리서치 행동을 평가하도록 설계된 벤치마크이므로, 이 수치는 장기 정보 탐색 에이전트에 강점이 있다는 주장을 뒷받침할 수 있다. 4
다만 이 점수만으로 KDA, AttnRes, MoE 라우팅, RL 환경, 증류, 테스트 타임 연산 가운데 어느 요소가 어느 정도 성과를 만들었는지는 분리해 알 수 없다. 이는 여러 구성 요소가 결합된 종단간 결과다.
가격 비교도 신중할 필요가 있다. 기술 보고서나 권위 있는 독립 출처로는 K3가 “GPT-5.6 Sol의 절반 비용”이라는 정확한 주장, 또는 Kimi Code Bench에서 “Claude Fable 5보다 정확히 4점 낮지만 비용은 38%”라는 주장을 확인하기 어렵다. 한 비교 자료는 완료 과제당 추정 비용을 K3 약 0.94달러, GPT-5.6 Sol 약 1.04달러로 제시하는데, 이는 50% 차이와는 거리가 있다. 8 비용 수치는 프롬프트, 설정, 가격 기준일, 평가 하네스와 전체 비용 산정 방식에 따라 달라질 수 있다.
결국 K3 보고서가 내놓는 전략적 함의는 단순한 가격 경쟁보다 아키텍처에 가깝다. 문샷 AI는 조 단위 매개변수 장벽을 넘고, 장문맥·에이전트 추론을 실사용 가능한 능력으로 바꾸려면 모델 구조와 시스템 설계, 사후학습 인프라를 한꺼번에 바꿔야 한다고 주장한다. 다만 다른 오픈 모델이 1조 매개변수 부근에서 정체됐다는 식의 비교 주장은, 여기 제시된 K3 논문 자체의 근거만으로는 확립됐다고 보기 어렵다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Kimi K3의 핵심 주장은 AI 성능을 끌어올리려면 배포 전 모델 용량과 배포 후 장기 추론·도구 사용에 쓰는 연산을 함께 확장해야 한다는 것이다.
Kimi K3의 핵심 주장은 AI 성능을 끌어올리려면 배포 전 모델 용량과 배포 후 장기 추론·도구 사용에 쓰는 연산을 함께 확장해야 한다는 것이다. 총 2.78조 개 매개변수 중 토큰당 1,042억 개만 활성화하는 MoE 구조는 거대한 용량을 확보하면서도 2.78조 개 전체를 매 토큰 계산하는 비용은 피하려는 설계다.
보고서는 최대 100만 토큰 컨텍스트를 주장하며, KDA·Gated MLA·Attention Residuals·Stable LatentMoE로 장문맥 처리와 대규모 전문가 라우팅의 비용 및 안정성 문제를 다룬다.