Kimi K3’ün tezi iki kaldıraç üzerine kurulu: dağıtımdan önce model kapasitesini büyütmek, dağıtımdan sonra ise akıl yürütme, araç kullanımı ve ajan görevleri için daha fazla hesaplama harcamak. 2,8 trilyon toplam parametreye karşılık token başına yaklaşık 104 milyar parametrenin etkinleşmesi, MoE mimarisinin devasa...
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI, Kimi K3’ü iki eksenli ölçekleme yaklaşımının örneği olarak sunuyor: Önce çok daha büyük bir model kurmak, ardından bu modele dağıtım aşamasında akıl yürütme, araç kullanımı, web’de gezinme, kod yazma ve hatalardan toparlanma için yeterli hesaplama gücü vermek. Asıl mesele ise ekonomi: Modeli daha yoğun ve daha derin yapmak tek başına yetmez; uzun bağlamlı kullanımın maliyeti bu yetenekleri pratik olmaktan çıkarabilir. K3’ün tasarımı, toplam kapasiteyi büyütürken üretilen her token için gereken hesaplama ve bellek yükünü sınırlamayı hedefliyor. 1
Kimi K3, yerleşik çok modlu bir uzman karışımı (Mixture-of-Experts, MoE) modeli olarak tanımlanıyor. Modelin 2,8 trilyon toplam parametresi, token başına yaklaşık 104 milyar etkin parametresi ve 1 milyon token’a kadar bağlam penceresi bulunuyor. 1
17
Bu iki parametre sayısı farklı şeyleri ifade ediyor:
MoE’nin pratik cazibesi burada yatıyor: K3, token başına benzer hesaplama ayak izine sahip yoğun bir modele kıyasla toplamda çok daha büyük olabilir. Elbette 104 milyar etkin parametre hâlâ ciddi bir yük; ancak model, her token’da yoğun 2,8 trilyon parametreli bir ağın çıkarım maliyetini ödemiyor. 1
Dolayısıyla Moonshot’ın savı yalnızca “daha çok parametre daha iyidir” değil. Sav, koşullu hesaplamanın yeni bir model kapasitesi ölçeğini uzun süren görevlerde kullanılabilir hâle getirebileceği yönünde.
Bir milyon token’lık bağlam, yalnızca eğitim açısından zor değil. Klasik dikkat mekanizmalarında dizi uzadıkça bellek ve hesaplama maliyeti de büyüyebiliyor. K3, Kimi Delta Attention (KDA) ile Gated Multi-head Latent Attention (Gated MLA) bileşenlerini birleştiren hibrit bir tasarım kullanıyor. Bildirilen omurga yapısı, ağırlıklı olarak üç KDA katmanına bir MLA katmanı gelecek biçimde düzenlenmiş 69 KDA ve 24 Gated MLA katmanından oluşuyor. 1
12
KDA, modelin doğrusal dikkat bileşeni. Bu yapı, her katmanda tüm geçmiş boyunca büyüyen klasik anahtar-değer önbelleğini korumak yerine sabit boyutlu, tekrarlayan bir durum kullanıyor. Amaç, bellek durumunun ve token üretim maliyetinin, önceki bağlam uzadıkça tam dikkat mekanizmasındaki gibi büyümemesini sağlamak. 1
Raporda KDA’nın bozunma oranına bir alt sınır konulduğu da belirtiliyor. Bu yalnızca modelleme tercihi değil: Sayısal hesaplama açısından sorunlu olabilecek aşırı küçük bozunma değerlerini engelliyor ve tensör çekirdekleri için uygun bloklu bir uygulamaya imkân tanıyor. 1
Tek başına doğrusal tekrarlama, tüm bağlam içinde seçici küresel arama yapma bakımından tam dikkat kadar güçlü olmayabilir. Bu nedenle K3, ağ boyunca Gated MLA katmanlarını da koruyor. Bildirilen hibrit düzende KDA düşük maliyetli kalıcı dizi işleme sağlarken MLA, belirli aralıklarla küresel erişim sunuyor. 1
Bu yaklaşım, uzun bağlamı yalnızca bir mimari özelliği değil, aynı zamanda bir sistem sorunu olarak ele alıyor. Büyük bir bağlam penceresinin anlamı, modelin gerekli bilgiyi hâlâ bulabilmesi ve bunu kullanılabilir maliyetle üretebilmesinde yatıyor.
K3’ün ikinci mimari bileşeni Attention Residuals (AttnRes). Modelin 93 katmanı var ve rapor, sonraki katmanların daha önceki derinlik bloklarından sıkıştırılmış temsillere erişebilmesi için AttnRes kullanıldığını belirtiyor. Böylece bilginin mutlaka katman katman taşınması gerekmiyor. 1
Kavramsal olarak KDA, bilginin dizi uzunluğu boyunca akışını; AttnRes ise bilginin derinlik boyunca akışını hedefliyor. Küresel dikkatin büyük bölümünü doğrusal dikkat ile değiştiren derin bir ağda bu eşleşme kritik: Pahalı küresel dikkat azaltılırken yararlı bilginin aktivasyonlar arasında kaybolmaması gerekiyor. 1
K3’ün MoE katmanında 896 yönlendirilmiş uzman bulunuyor ve her token için 16 uzman seçiliyor. 1
6 Toplam parametre sayısı ile etkin parametre sayısı arasındaki büyük farkın temelinde bu mekanizma var.
Rapordaki Stable LatentMoE yaklaşımı, uzman yönlendirmesini dengeli ve kararlı tutmaya odaklanıyor. Toplu uzman atamasını bir optimizasyon problemi olarak ele alıyor ve kuantil tabanlı dengeleme getiriyor. Rapor, kendi varsayımları altında kesin bir optimum türetiyor; ancak dağıtımda her çıkarım topluluğu için dengeleme problemini yeniden çözmek yerine, sabit uzman yanlılıkları ve olağan top-k seçimi kullanılıyor. 1
Bu ayrım önemli: “Mükemmel denge” sonucu, rapordaki yönlendirme formülasyonu için geçerli. Gerçek üretim iş yüklerinde her token’ın uzmanlara kusursuz biçimde dağılacağı garantisi anlamına gelmiyor.
Büyük MoE modellerinde bir ağ iletişimi sorunu ortaya çıkıyor: Seçilen token’ların, atandıkları uzmanlara ulaşmak için çoğu zaman cihazlar arasında taşınması gerekiyor. Bazı uzmanlar orantısız talep görürse gecikmeyi en yavaş iletişim hattı belirleyebilir.
Moonshot, MoonEP’yi uzman paralelliğinde iletişim için tamamlayıcı sistem katmanı olarak konumlandırıyor. Hedefi, seyrek yönlendirmenin oluşturduğu tümden-tüme iletişimdeki dengesizliği azaltmak; böylece büyük uzman havuzunu eğitilebilir ve sunulabilir tutmak. 1
Bu, K3’ün daha geniş iddiasının önemli parçası. Mimari, yönlendirme ve iletişim sistemleri birbirinden bağımsız performans açıklamaları olarak görülemez; teorik seyrek kapasitenin gerçek çıktıya dönüşmesi için üçünün birlikte çalışması gerekiyor.
K3 tezinin diğer ekseni, ön eğitim sonrasında olanlar. Moonshot; uzun ufuklu görevler, araç kullanımı, kodlama, web’de gezinme ve yinelemeli problem çözme içeren pekiştirmeli öğrenme yörüngeleri için altyapı tanımlıyor. Raporda ayrıca birden fazla alan ve akıl yürütme öğretmeninin tek bir sisteme damıtılmasından söz ediliyor. 1
Bu yaklaşımı destekleyen ortam, görev ortamlarını büyük ölçekte oluşturmak, anlık görüntüsünü almak ve kaldığı yerden sürdürmek üzere tasarlanmış hafif bir sanal makine sandbox sistemi. Bildirilen rakamlar 51,2 milyon sandbox örneği, 133 ms anlık görüntü alma ve 49 ms geri yükleme süresi. 1
Stratejik mantık açık: Bir modelin test anında daha fazla planlama yapması, araç çağırması, işini kontrol etmesi veya uzun bir görevi sürdürmesi bekleniyorsa eğitim ortamı da bu tür yörüngeleri modelle buluşturmalı. Ortamları düşük maliyetle duraklatmak, dallandırmak ve geri yüklemek daha fazla eğitim denemesini mümkün kılabilir.
Bu, tek bir model yanıtının otomatik olarak sınırsız çıkarım hesabı kullanacağı anlamına gelmiyor. Raporun savı daha çok şu: Sistem, yalnızca daha büyük bir ön eğitimli modele bel bağlamak yerine ek adımları ve ek bağlamı görev performansına dönüştürebilmeli.
Kimi K3 için, uzun ufuklu bilgi aramayı ölçmeyi amaçlayan BrowseComp testinde %91,2 sonucu bildiriliyor. Üçüncü taraf bir sıralama da K3’ü %91,2 ile listeliyor; ancak sıralamalar ve raporlama yapılandırmaları zaman içinde değişebilir. 18
Bu sonuç, ürün hedefiyle uyumlu: Uzun bağlam, ajan odaklı son eğitim ve test zamanı akıl yürütmesi etrafında tasarlanan bir modelin karmaşık bilgi arama görevlerinde değerlendirilmesi beklenir. Fakat bu, ayrı bileşenlerin etkisini temiz biçimde ölçen bir çalışma değil.
Tek bir benchmark skoru, sonucun ne kadarının KDA’dan, AttnRes’ten, uzman yönlendirmesinden, iletişim altyapısından, RL ortamlarından, damıtmadan, istemlerden veya çıkarım ayarlarından geldiğini gösteremez. En sağlam yorum, bildirilen sistemin entegre bir yığın olarak iyi performans verdiği; tek bir mimari yeniliğin skoru tek başına açıkladığının kanıtlanmadığıdır. 1
18
K3, DeepSeek sistemleri dahil başka büyük açık modeller için bir meydan okuma olarak anılıyor. Ancak rapordan çıkarılabilecek savunulabilir sonuç, açık model ilerlemesinin kesin bir lig tablosu değil; farklı bir tasarım vurgusu. Moonshot, çok büyük seyrek kapasiteyi, verimli uzun bağlam işlemeyi ve ajanlar için eğitim sonrası altyapıyı birleştiren bir yığını savunuyor. 1
17
Makalenin kendisi K3’ün teknik özelliklerini ve tasarım tercihlerini destekliyor. Buna karşılık, diğer açık modellerin “durakladığını” ya da belirli bir rakibe karşı kesin mimari üstünlük sağlandığını tek başına kanıtlamıyor. Bu tür piyasa iddiaları, tutarlı ve bağımsız biçimde yeniden üretilmiş karşılaştırmalar gerektirir.
Token başına fiyat ve görev başına maliyet kıyaslamaları özellikle kolay yanlış yorumlanır. Sonuç; isteme, akıl yürütme çabasına, bağlam uzunluğuna, önbelleğe alma biçimine, araç kullanımına, verim varsayımlarına, fiyat tarihine ve görev değerlendirme altyapısına göre değişebilir.
Mevcut materyalde atıf yapılan bir karşılaştırma, tamamlanan görev başına yaklaşık K3 için 0,94 dolar, GPT-5.6 Sol için 1,04 dolar tahmini veriyor. Bu, o kurulumda sınırlı bir avantaj olabileceğine işaret edebilir; ancak “Sol’un yarı maliyeti” şeklinde genel geçer bir iddiayı doğrulamaz. 20
Daha kalıcı çıkarım şu: K3, uzun bağlamlı ve ajan odaklı yetenekleri, çok daha büyük toplam model ölçeğinde ekonomik olarak inandırıcı hâle getirme girişimi. Bu avantajın pratikte gerçekleşip gerçekleşmediği, yeniden üretilebilir değerlendirmelere ve dağıtıma özgü maliyet hesaplarına bağlı.
Kimi K3 teknik raporu, uçtan uca bir ölçekleme savı ortaya koyuyor. Dağıtımdan önceki ölçek, 2,8 trilyon parametreli ve token başına yaklaşık 104 milyar parametre etkinleştiren MoE yapısından geliyor. Dağıtım sonrasındaki ölçek ise uzun bağlam, araçlar, akıl yürütme adımları ve ajan yörüngelerinden yararlanabilen bir modelin eğitilmesi ve çalıştırılmasına dayanıyor. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP ve RL sandbox altyapısı aynı önerinin parçaları: Sınır düzeyinde ajan davranışı yalnızca daha büyük model değil, daha fazla bağlamı ve test zamanı çalışmasını kullanılabilir kılan bir tasarım istiyor. Benchmark sonuçları bu bütünleşik yaklaşım için umut verici kanıtlar sunuyor; ancak her bileşenin katkısının kesin ispatı olarak değil, sistem düzeyinde bildirilmiş sonuçlar olarak okunmalı. 1
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3’ün tezi iki kaldıraç üzerine kurulu: dağıtımdan önce model kapasitesini büyütmek, dağıtımdan sonra ise akıl yürütme, araç kullanımı ve ajan görevleri için daha fazla hesaplama harcamak.
Kimi K3’ün tezi iki kaldıraç üzerine kurulu: dağıtımdan önce model kapasitesini büyütmek, dağıtımdan sonra ise akıl yürütme, araç kullanımı ve ajan görevleri için daha fazla hesaplama harcamak. 2,8 trilyon toplam parametreye karşılık token başına yaklaşık 104 milyar parametrenin etkinleşmesi, MoE mimarisinin devasa kapasiteyi yoğun 2,8T bir modelin her token’daki maliyeti olmadan sunma hedefini gösteriyor.
Maliyet karşılaştırmaları temkinli okunmalı: yayımlanmış bir kıyaslama, tamamlanan görev başına K3 için yaklaşık 0,94 dolar, GPT 5.6 Sol için ise 1,04 dolar tahmini veriyor; bu, K3’ün genel olarak Sol’un yarı maliyeti...