Kimi K3, ileri düzey yapay zekâ ilerlemesinin iki kaynağı birlikte büyütmeye bağlı olduğunu savunuyor: dağıtımdan önce model kapasitesi, dağıtımdan sonra ise uzun akıl yürütme ve araç kullanımına ayrılan hesaplama. Model 2,78 trilyon toplam parametre taşısa da her token için 104,2 milyar parametreyi etkinleştiriyor;...
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI’nin Kimi K3 teknik raporundaki ana sav şu: Yapay zekâdaki sınır performans yalnızca modelin eğitimden önce ne kadar büyük olduğuyla değil, model kullanıma alındıktan sonra akıl yürütme, araç çağrıları, tarama ve çok adımlı görevler için ne kadar hesaplama harcandığıyla da belirlenir. K3’ün mimarisi, bu iki ölçeği birlikte ekonomik hâle getirmek üzere tasarlanmış görünüyor. 1
K3, yerel çok modlu bir Mixture-of-Experts (MoE) modeli olarak 2,78 trilyon toplam parametreye sahip; fakat her token için etkinleşen parametre sayısı 104,2 milyar. Ayrıca 1 milyon tokena kadar bağlam penceresi sunuyor. 1
Bu ayrım kritik: Toplam parametre sayısı modelin depolayabildiği potansiyel kapasiteyi ifade ederken, etkin parametre sayısı bir token üretilirken gerçekten kullanılan hesaplama yüküne daha yakındır. Moonshot AI’nin yaklaşımı, 2,8 trilyon parametreli yoğun bir modelin token başına maliyetini üstlenmeden çok daha büyük bir kapasite havuzundan yararlanmak.
Rapordaki önemli düzeltmelerden biri bağlam uzunluğu: K3 için ileri sürülen değer 100 bin değil, 1 milyon token. Model ilk aşamada 8 bin token, daha sonra 64 bin token ile eğitiliyor. Rapora göre açık bir konumsal gömme kullanılmıyor; Kimi Delta Attention’ın (KDA) yinelemeli kapıları ve sönümleme mekanizması, konum bilgisinin daha uzun dizilere genellenmesine yardımcı oluyor. 1
KDA, tam dikkat mekanizmasının kuadratik maliyetini büyük ölçüde sabit boyutlu yinelemeli durumla değiştirmeyi amaçlıyor. Bu nedenle token başına durum ve üretim maliyeti, klasik tam anahtar-değer önbelleğinde olduğu gibi önceki bağlamın uzunluğuyla doğrudan büyümüyor. Buna karşılık K3, her üç KDA katmanından sonra bir Gated MLA katmanı yerleştiriyor. Böylece KDA düşük maliyetli sürekli dizi işleme sağlarken, MLA seçici küresel bilgi erişimini geri kazandırıyor. 1
Raporda belirtilen KDA sönümleme oranı alt sınırı da yalnızca modelleme tercihi değil: Sayısal açıdan sorunlu derecede küçük sönümlemeleri önlemeyi ve tensor çekirdeklerine uygun bloklu hesaplamayı mümkün kılan bir uygulama ayrıntısı olarak sunuluyor. 1
Attention Residuals (AttnRes), büyük ölçüde doğrusal dikkat kullanan çok derin bir ağda katmanların bilgi bakımından birbirinden kopmasını önlemeyi hedefliyor. K3’ün 93 katmanlı yapısında sonraki katmanlar, önceki derinlik bloklarından sıkıştırılmış temsillere yeniden erişebiliyor.
Başka bir deyişle, yararlı bilginin her aşamada yalnızca bir sonraki katmana aktarılması gerekmiyor; katmanlar arası daha uzun menzilli bir erişim yolu oluşturuluyor. Moonshot AI’nin iddiası, pahalı küresel dikkatin önemli bölümünü KDA ile değiştirirken kaliteyi koruyabilmek. 1
K3’teki Stable LatentMoE tasarımı, koşullu kapasiteyi genişletmek için 896 uzman kullanıyor ve her token için en üstteki 16 uzmanı seçiyor. Rapordaki kuantil dengeleme yöntemi, uzman yönlendirmesini dengeli atama problemi olarak ele alıyor; belirtilen toplu iş varsayımları altında kesin bir optimum türetiyor. Dağıtım aşamasında ise dengeleme çözücüsü çalıştırılmıyor; sabit uzman yanlılıkları ve olağan top-k seçimi kullanılıyor. 1
Bu, geleneksel yardımcı-kayıp tabanlı dengeleme yöntemlerinden daha güçlü bir çerçeve olarak sunuluyor. Ancak rapordaki “mükemmel denge” sonucu, tanımlanan yönlendirme optimizasyonu ve varsayımları için geçerli; gerçek kullanımdaki her isteğin veya her toplu işin kusursuz dengeleneceği anlamına gelmiyor.
Büyük bir MoE’nin ekonomik olması, seçilen uzmanlara yönlendirilen tokenların ağ gecikmesi yüzünden darboğaza takılmamasına da bağlı. Bu nedenle MoonEP iletişim altyapısının rolü, uzman talebindeki eşitsizliğin doğurduğu tümden-tüme iletişimi dengelemek. Mimari ve sistem tasarımı burada birbirinden bağımsız değil, aynı hedefin tamamlayıcı parçaları. 1
Raporun daha geniş tezi, model büyüklüğünün tek başına yeterli olmadığı yönünde. Hafif sanal makine tabanlı sandbox filosu; doğrulanabilir, uzun ufuklu pekiştirmeli öğrenme (RL) rotalarının çok sayıda üretilmesini, anlık görüntüler üzerinden dallandırılmasını ve sürdürülmesini kolaylaştırmayı amaçlıyor. 1
Bu altyapı, modelin test zamanında daha fazla adım kullanabilmesi için bir eğitim zemini sağlıyor: planlama, internette araştırma, kod yazma, araç çağrıları ve kendi hatasını düzeltme gibi süreçler. Raporda ayrıca farklı alan ve akıl yürütme öğretmenlerinin tek bir sisteme damıtılması anlatılıyor. Hedef, dokuz ayrı uzman modeli çalıştırmadan bu özel davranışları tek modelde toplamak. 1
Bu yüzden K3’ün mesajı yalnızca “daha büyük model” değil; büyük kapasiteyi, uzun bağlamı ve daha fazla çıkarım hesabını pratik maliyetle bir araya getirebilen model-sistem yığını kurmak.
K3’ün BrowseComp’ta aldığı bildirilen %91,2 puan, uzun ufuklu bilgi arama ve web araştırması odaklı görevlerde sistemin güçlü olduğuna işaret eder. 2 Eylül 2026 tarihli üçüncü taraf liderlik tablosunda K3, %91,2 ile ikinci sırada listeleniyor. 4
Yine de bu sonuç uçtan uca bir performans ölçümü. KDA’nın, AttnRes’in, MoE yönlendirmesinin, RL ortamlarının, damıtmanın veya test zamanı hesaplamasının katkısını tek başına ayrıştırmıyor.
Maliyet karşılaştırmalarında da temkinli olmak gerekiyor. Teknik raporda veya yüksek otoriteli bağımsız bir kaynakta K3’ün “GPT-5.6 Sol’un yarı fiyatına” olduğu ya da belirli bir kod değerlendirmesinde “Claude Fable 5’in dört puan gerisinde, maliyetinin %38’iyle” çalıştığı iddialarını doğrulayan ayrıntılı bir değerlendirme düzeni bulunmuyor. Bir karşılaştırma, tamamlanan görev başına tahmini maliyeti K3 için yaklaşık 0,94 ABD doları, GPT-5.6 Sol için 1,04 ABD doları olarak veriyor; bu, %50’lik bir fark anlamına gelmiyor. 8
Dolayısıyla fiyat iddiaları; kullanılan yapılandırmaya, istem uzunluğuna, araç kullanımına, fiyat tarihine ve maliyet hesabı yöntemine bağlı kabul edilmeli. Moonshot AI’nin daha sağlam biçimde desteklenen stratejik iddiası, salt fiyat rekabetinden ziyade şu: Trilyon parametre eşiğini aşmak ve uzun bağlamlı, ajan benzeri çıkarımı kullanılabilir hâle getirmek için model mimarisiyle sistem altyapısının birlikte yeniden tasarlanması gerekiyor. Açık modellerin yaklaşık 1 trilyon parametrede takıldığı veya belirli rakiplerle farkın bu nedenle oluştuğu yönündeki daha geniş karşılaştırmalar ise mevcut kanıta göre K3 raporunun tek başına kanıtladığı sonuçlar değil.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3, ileri düzey yapay zekâ ilerlemesinin iki kaynağı birlikte büyütmeye bağlı olduğunu savunuyor: dağıtımdan önce model kapasitesi, dağıtımdan sonra ise uzun akıl yürütme ve araç kullanımına ayrılan hesaplama.
Kimi K3, ileri düzey yapay zekâ ilerlemesinin iki kaynağı birlikte büyütmeye bağlı olduğunu savunuyor: dağıtımdan önce model kapasitesi, dağıtımdan sonra ise uzun akıl yürütme ve araç kullanımına ayrılan hesaplama. Model 2,78 trilyon toplam parametre taşısa da her token için 104,2 milyar parametreyi etkinleştiriyor; amaç, yoğun 2,8 trilyon parametreli bir modelin token başına maliyetini ödemeden kapasiteyi artırmak.
Rapora göre K3, 1 milyon token bağlam penceresine doğal biçimde genelleşebiliyor; hibrit dikkat, uzman yönlendirme ve iletişim altyapısı bu kapasiteyi kullanılabilir maliyette tutmayı hedefliyor.