Sebagai perbandingan, model pendahulunya, Inkling, memiliki 975 miliar parameter total dan 41 miliar parameter aktif. Meski berukuran kira-kira seperempat dari Inkling, Inkling-Small mampu menyamai atau melampaui model yang lebih besar itu dalam sejumlah pengujian penting—dengan kebutuhan perangkat keras yang jauh lebih rendah .
Inkling-Small mendukung input multimodal berupa teks, gambar, dan audio, memiliki jendela konteks hingga 1 juta token, serta menyediakan pengaturan thinking effort yang dapat disesuaikan untuk menukar kedalaman penalaran dengan latensi .
Inkling-Small unggul dalam beberapa tugas penalaran, coding berbasis agen, dan pengetahuan sains. Namun, Inkling tetap lebih kuat dalam pengambilan fakta langsung dan matematika kompetisi .
| Benchmark | Inkling-Small | Inkling | Selisih |
|---|---|---|---|
| HLE, teks saja | 31,6% | 29,7% | +1,9 poin persentase |
| SWE-Bench Verified | 80,2% | 77,6% | +2,6 poin persentase |
| GPQA Diamond | 89,5% | 87,2% | +2,3 poin persentase |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 poin |
| AIME 2026 | 95,5% | 97,1% | −1,6 poin persentase |
| SimpleQA Verified | 20,6% | 43,9% | −23,3 poin persentase |
Sumber:
Beberapa temuan penting dari hasil tersebut:
Dengan kata lain, “lebih kecil” dalam nama Inkling-Small tidak otomatis berarti lebih lemah. Model ini lebih menjanjikan untuk pekerjaan yang membutuhkan penalaran dan pemecahan masalah, tetapi Inkling masih lebih cocok untuk tugas yang bergantung pada pengingatan fakta secara presisi.
Inkling-Small menggunakan transformer MoE jarang (sparse) dengan 42 lapisan. Untuk setiap token, 6 dari 256 expert diaktifkan, ditambah 2 shared expert . Mekanisme ini membuat sebagian besar bobot model tetap tidak aktif pada satu waktu.
Model ini juga menggunakan perhatian hibrida, yaitu kombinasi full attention dan sliding-window attention. Pengembang dapat mengatur tingkat usaha berpikir agar memperoleh respons yang lebih cepat atau penalaran yang lebih mendalam .
Secara arsitektural, Inkling-Small masih berada dalam keluarga MoE yang sama dengan Inkling. Perbedaannya, Inkling-Small memiliki lebih sedikit expert—256 dibandingkan sekitar 576 pada Inkling—serta jumlah expert aktif yang lebih kecil di setiap lapisan. Hasilnya, beban komputasi saat inferensi lebih menyerupai model padat 12B, sementara bobotnya tetap menyimpan kapasitas model 276B .
Thinking Machines Lab menggunakan resep pascapelatihan dua tahap .
Pada tahap pertama, checkpoint awal Inkling-Small belajar dari Inkling sebagai guru. Berbeda dari distilasi biasa yang hanya meniru jawaban yang sudah dibuat guru, pendekatan on-policy distillation memungkinkan model siswa menghasilkan trajektorinya sendiri. Guru kemudian memberikan supervisi padat pada tingkat token, termasuk pada rangkaian langkah penalaran .
Pendekatan ini menggabungkan dua keunggulan: data yang lebih realistis karena berasal dari perilaku model siswa sendiri, serta umpan balik yang lebih kaya karena diberikan oleh model guru.
Setelah distilasi, Thinking Machines melanjutkan pelatihan selama dua minggu dengan reinforcement learning yang berfokus pada agen, terutama tugas coding. Tahap tambahan ini disebut membantu Inkling-Small melewati Inkling pada benchmark penalaran dan coding .
Hasilnya menarik karena model yang jauh lebih kecil dapat melampaui model gurunya dalam sejumlah tugas setelah menjalani pelatihan lanjutan yang relatif singkat. Temuan ini sejalan dengan riset tentang weak-to-strong generalization menggunakan distilasi on-policy .
Keuntungan praktis terbesar Inkling-Small adalah kebutuhan VRAM yang lebih rendah. Berikut konfigurasi resmi dari kartu modelnya :
| Format | Total VRAM | Contoh konfigurasi |
|---|---|---|
| BF16 | sekitar 600 GB | 4× NVIDIA B300 atau 8× H200 |
| NVFP4 (W4A16) | sekitar 180 GB | 2× NVIDIA H200 |
| NVFP4 (W4A4) | sekitar 180 GB | 1× NVIDIA B300, membutuhkan arsitektur SM100 atau lebih baru |
Sebagai pembanding, checkpoint BF16 Inkling membutuhkan sekitar 1,9 TB VRAM gabungan, sedangkan varian Inkling yang dikuantisasi dalam NVFP4 membutuhkan sekitar 600 GB .
Pengurangan dari sekitar 1,9 TB menjadi 600 GB pada BF16 membuat Inkling-Small lebih realistis untuk dijalankan dan disesuaikan oleh tim berukuran menengah. Model ini mendukung format numerik BF16, MXFP8, dan NVFP4 .
Meski demikian, angka 180 GB atau 600 GB tetap berada jauh di atas kemampuan kartu grafis konsumen biasa. Jadi, Inkling-Small lebih mudah diakses dibandingkan Inkling, tetapi masih merupakan model untuk infrastruktur pusat data atau penyedia komputasi khusus.
Inkling-Small tersedia melalui beberapa jalur :
Lisensi Apache 2.0 juga memberi keleluasaan bagi pengembang untuk mempelajari, memodifikasi, dan mengintegrasikan bobot model ke dalam berbagai aplikasi, dengan tetap mematuhi ketentuan lisensinya.
Thinking Machines Lab didirikan oleh Mira Murati, mantan CTO OpenAI, setelah ia meninggalkan perusahaan tersebut. John Schulman, salah satu mantan pendiri OpenAI dan anggota tim yang mengembangkan RLHF, juga menjadi salah satu pendiri Thinking Machines Lab .
Lilian Weng, yang pada awalnya menjadi bagian dari tim pendiri, kemudian meninggalkan Thinking Machines Lab dan kembali ke OpenAI. Dengan demikian, Murati dan Schulman disebut sebagai dua pendiri yang tersisa di startup tersebut .
Inkling-Small menunjukkan bahwa jumlah parameter bukan satu-satunya penentu kemampuan model AI. Dengan arsitektur MoE yang hanya mengaktifkan 12B parameter per token dan resep pascapelatihan yang menggabungkan distilasi on-policy dengan reinforcement learning untuk agen, model 276B ini mampu melampaui Inkling 975B dalam penalaran, coding, dan beberapa tugas sains.
Keunggulan itu datang dengan kompromi: kemampuan mengambil fakta secara langsung turun cukup tajam pada SimpleQA Verified, dan Inkling masih lebih baik dalam AIME 2026. Namun, untuk pengembang yang memprioritaskan coding, penalaran, dan kustomisasi model, Inkling-Small lebih praktis daripada Inkling.
Kebutuhan sekitar 600 GB VRAM dalam BF16 atau 180 GB dalam NVFP4 juga membuatnya lebih dekat ke jangkauan tim menengah—meski belum menjadi model yang bisa dijalankan secara nyaman di komputer pribadi. Pada Juli 2026, Inkling-Small menjadi salah satu contoh paling jelas bahwa model open-weight yang lebih kecil dapat menawarkan rasio kemampuan terhadap biaya komputasi yang lebih menarik.