Bu yaklaşım, modelin ağırlıklarında büyük bir kapasite tutulurken çıkarım sırasında daha sınırlı hesaplama yapılmasını sağlıyor. Inkling-Small, toplam parametre sayısı bakımından yaklaşık dörtte biri büyüklüğünde olduğu Inkling’e kıyasla bazı önemli testlerde aynı seviyeye çıkıyor veya onu geçiyor. Inkling’in toplam parametre sayısı 975 milyar, token başına aktif parametre sayısı ise 41 milyar .
Model; metin, görüntü ve ses girdilerini destekliyor, 1 milyon tokenlık bağlam penceresi sunuyor ve geliştiricilerin yanıt kalitesiyle gecikme arasında seçim yapmasına olanak tanıyan değişken bir düşünme eforu ayarı içeriyor .
Inkling-Small, özellikle akıl yürütme, yazılım geliştirme ve bilimsel bilgi alanlarında Inkling’in önüne geçiyor. Buna karşılık, doğrudan olgusal hatırlama ve yarışma matematiğinde büyük model hâlâ avantajlı .
| Benchmark | Inkling-Small | Inkling | Fark |
|---|---|---|---|
| HLE (yalnızca metin) | %31,6 | %29,7 | +1,9 puan |
| SWE-Bench Verified | %80,2 | %77,6 | +2,6 puan |
| GPQA Diamond | %89,5 | %87,2 | +2,3 puan |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | -1 puan |
| AIME 2026 | %95,5 | %97,1 | -1,6 puan |
| SimpleQA Verified | %20,6 | %43,9 | -23,3 puan |
Kaynaklar:
Öne çıkan sonuçlar şöyle:
Kısacası, “daha küçük” burada her alanda daha iyi anlamına gelmiyor. Inkling-Small, kodlama ve muhakeme iş akışlarında daha pratik bir seçenek sunarken, güvenilir olgusal hatırlama gereken görevlerde Inkling’in gerisinde kalabiliyor.
Inkling-Small, 42 katmanlı seyrek bir MoE Transformer yapısı kullanıyor. Her token için 256 uzmanın 6’sı etkinleştiriliyor; buna ek olarak 2 ortak uzman bulunuyor . Mimari, tam dikkat mekanizması ile kayan pencere dikkatini birleştiren hibrit bir attention düzenine sahip .
Bu tasarımın temel fikri şu: Modelin toplam kapasitesi 276 milyar parametre seviyesinde tutuluyor, ancak her token için bütün uzmanlar çalıştırılmıyor. Böylece çıkarım sırasında kullanılan etkin parametre miktarı 12 milyar civarında kalıyor. Bu, modeli klasik anlamda 12 milyar parametreli yoğun bir modelle aynı şey yapmasa da, işlem maliyeti açısından daha yönetilebilir bir profile yaklaştırıyor .
Inkling-Small, Inkling ile aynı MoE ailesinden geliyor; ancak daha az toplam uzmana sahip ve katman başına daha az uzman etkinleştiriyor. Sonuç, daha düşük gecikme ve daha düşük donanım maliyeti karşılığında büyük modelin ağırlıklarında bulunan kapasitenin bir bölümünü koruyan bir yapı.
Thinking Machines Lab, Inkling-Small’ın geliştirilmesinde iki aşamalı bir son-eğitim reçetesi kullandı .
İlk aşamada daha önceki bir Inkling-Small kontrol noktası, Inkling’in öğretmen olarak kullanıldığı on-policy distillation yöntemiyle eğitildi. Bu yöntemde öğrenci model kendi yanıt ve düşünme yörüngelerini üretirken öğretmen model, öğrencinin gerçekten ürettiği token’lar için yoğun ve ayrıntılı geri bildirim sağlıyor .
Klasik distillation yaklaşımında öğrenci çoğu zaman öğretmenin önceden ürettiği yanıtları taklit eder. On-policy yaklaşımda ise öğrenci kendi hatalarını ve kendi dağılımını ortaya koyuyor; öğretmen de bu gerçek çalışma akışı üzerinde rehberlik ediyor. Böylece distillation’ın yoğun denetimi ile on-policy eğitimin dağılımsal gerçekçiliği bir araya getiriliyor .
İkinci aşamada ekip, yaklaşık iki hafta boyunca ajan tabanlı kodlama için pekiştirmeli öğrenmeyi ölçeklendirmeye devam etti. Bu ek çalışma, Inkling-Small’ın akıl yürütme ve ajanlı kodlama benchmark’larında öğretmen model Inkling’i geçmesine katkı sağladı .
Öğrencinin öğretmenini bazı görevlerde geride bırakması, yalnızca model boyutunun performansı belirlemediğini gösteriyor. Eğitim verisi, son-eğitim yöntemi ve hedeflenen iş akışları; özellikle doğrulanabilir kodlama görevlerinde parametre sayısı kadar önemli olabilir.
Inkling-Small’ın en pratik avantajı, açık ağırlıkları kendi altyapısında çalıştırmak veya ince ayar yapmak isteyen ekipler için daha düşük donanım eşiği sunması. Thinking Machines Lab’in model kartındaki resmi yapılandırmalar şöyle :
| Format | Toplam VRAM | Örnek yapılandırma |
|---|---|---|
| BF16 | yaklaşık 600 GB | 4 × NVIDIA B300 veya 8 × NVIDIA H200 |
| NVFP4 (W4A16) | yaklaşık 180 GB | 2 × NVIDIA H200 |
| NVFP4 (W4A4) | yaklaşık 180 GB | 1 × NVIDIA B300; SM100+ gerekiyor |
Karşılaştırma için Inkling’in BF16 kontrol noktası yaklaşık 1,9 TB toplam VRAM gerektiriyordu . Inkling’in resmi NVFP4 sürümü için gereken değer de yaklaşık 600 GB’tı .
Inkling-Small’ın yaklaşık üç katlık bu VRAM avantajı, modeli büyük çok düğümlü kümelere erişimi olmayan orta ölçekli ekipler için daha uygulanabilir hâle getiriyor. Model BF16, MXFP8 ve NVFP4 sayısal formatlarını destekliyor .
Bununla birlikte “12 milyar aktif parametre” ifadesi, modelin yalnızca 12 milyar parametre depoladığı anlamına gelmiyor. Donanım planlamasında modelin toplam 276 milyar parametreli ağırlık dosyası dikkate alınmalı .
Inkling-Small’ın tam ağırlıkları Hugging Face üzerinde Apache 2.0 lisansıyla sunuluyor. Model ayrıca Thinking Machines Lab’in araçları üzerinden de kullanılabiliyor .
Apache 2.0 lisansı, model ağırlıklarının geliştiriciler ve şirketler tarafından daha esnek biçimde kullanılmasına ve değiştirilmesine olanak tanıyor. Ancak gerçek işletim maliyeti; GPU kiralama fiyatları, bağlam uzunluğu, eşzamanlı kullanıcı sayısı ve kullanılan sayısal format gibi etkenlere göre değişecektir.
Thinking Machines Lab, OpenAI’ın eski teknoloji direktörü Mira Murati tarafından kuruldu. OpenAI’ın kurucu ortaklarından ve RLHF ekibinin eski üyelerinden John Schulman da şirketin kurucu ortakları arasında yer alıyor .
Başlangıçta kurucu ekipte bulunan Lilian Weng ise daha sonra Thinking Machines Lab’den ayrılarak OpenAI’a döndü. Bu gelişmenin ardından girişimin kalan kurucu ortakları Mira Murati ve John Schulman olarak öne çıkıyor .
Bu liderlik geçmişi, Inkling-Small’ın piyasaya çıkışını yalnızca yeni bir model duyurusu olmaktan çıkarıyor. Model, bir yandan açık ağırlık ve özelleştirme odaklı bir şirket stratejisini temsil ederken, diğer yandan OpenAI kökenli araştırmacıların model eğitimi ve pekiştirmeli öğrenme konusundaki deneyimini yansıtıyor.
Inkling-Small’ın asıl iddiası, daha büyük bir modelin her alanda taklit edilmesi değil; doğru son-eğitim yöntemiyle daha küçük bir modelin belirli görevlerde öğretmenini geçebilmesi.
Model, HLE’de %31,6, SWE-Bench Verified’da %80,2 ve GPQA Diamond’da %89,5 skor alarak Inkling’in akıl yürütme, kodlama ve bilimsel sorulardaki sonuçlarını aştı . Artificial Analysis Intelligence Index’te de 40 puanla büyük modelin 41 puanlık sonucuna oldukça yaklaştı .
Buna karşılık SimpleQA Verified’daki %20,6’lık skor, olgusal hatırlama konusunda belirgin bir zayıflığa işaret ediyor. AIME 2026’da da Inkling’in %97,1’lik sonucu, Inkling-Small’ın %95,5’lik skorunun üzerinde kaldı .
Donanım tarafında ise fark daha çarpıcı: Inkling için yaklaşık 1,9 TB BF16 VRAM gerekirken Inkling-Small yaklaşık 600 GB BF16 veya 180 GB NVFP4 ile çalışabiliyor . Bu nedenle Temmuz 2026 itibarıyla Inkling-Small; özellikle kodlama ajanları, akıl yürütme ve özelleştirilebilir açık ağırlık modelleri arayan ekipler için Inkling’den daha pratik bir seçenek olarak öne çıkıyor. Ancak güvenilir olgusal yanıtların öncelikli olduğu kullanım alanlarında büyük Inkling hâlâ daha güçlü alternatif.