Sebagai perbandingan, model terdahulunya, Inkling, mempunyai 975 bilion parameter keseluruhan dan 41 bilion parameter aktif. Walaupun saiz Inkling-Small kira-kira satu perempat daripada Inkling, ia menyamai atau mengatasi model lebih besar itu dalam beberapa ujian penaakulan, sains dan pengekodan.
Inkling-Small turut menyokong input teks, imej dan audio, konteks sehingga 1 juta token, serta tetapan thinking effort yang boleh diubah suai untuk menyeimbangkan kelajuan dengan kedalaman penaakulan.
Inkling-Small tidak menang dalam setiap kategori. Kelebihannya paling ketara dalam tugasan yang memerlukan penaakulan berbilang langkah dan tindakan seperti ejen pengekodan, manakala Inkling masih jauh lebih baik dalam ingatan fakta terus.
| Penanda aras | Inkling-Small | Inkling | Perbezaan |
|---|---|---|---|
| HLE, teks sahaja | 31.6% | 29.7% | +1.9 mata peratusan |
| SWE-Bench Verified | 80.2% | 77.6% | +2.6 mata peratusan |
| GPQA Diamond | 89.5% | 87.2% | +2.3 mata peratusan |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 mata |
| AIME 2026 | 95.5% | 97.1% | −1.6 mata peratusan |
| SimpleQA Verified | 20.6% | 43.9% | −23.3 mata peratusan |
Sumber:
Antara dapatan utama:
Ringkasnya, Inkling-Small lebih menarik untuk kerja pengekodan, penaakulan dan penggunaan alat, tetapi Inkling kekal pilihan yang lebih kukuh apabila ketepatan fakta asas menjadi keutamaan.
Inkling-Small ialah model MoE jarang dengan 42 lapisan. Bagi setiap token, sistem mengaktifkan 6 daripada 256 pakar, di samping 2 pakar dikongsi.
Dalam seni bina MoE, semua parameter model masih disimpan dalam pemberat, tetapi hanya sebahagian pakar digunakan untuk memproses token tertentu. Oleh itu, Inkling-Small mempunyai kapasiti model 276B, sedangkan beban pengiraan ketika inferens lebih hampir kepada model padat 12B berbanding model padat 276B.
Model ini menggunakan perhatian hibrid — gabungan perhatian penuh dan perhatian tetingkap gelongsor — serta thinking effort yang boleh dikawal. Pembangun boleh memilih sama ada mahu respons lebih pantas dengan penaakulan yang lebih ringan atau memberi model lebih banyak ruang untuk menyelesaikan tugasan kompleks.
Berbanding Inkling, keluarga seni binanya sama tetapi Inkling-Small menggunakan jumlah pakar yang lebih sedikit: 256 berbanding kira-kira 576, selain mengaktifkan lebih sedikit pakar pada setiap lapisan.
Thinking Machines Lab menggunakan proses pascalatihan dua peringkat yang menggabungkan peniruan daripada model guru dengan pembelajaran pengukuhan berfokuskan ejen.
Keputusan ini penting kerana model pelajar berjaya mengatasi model gurunya dalam beberapa tugasan selepas hanya dua minggu tambahan pembelajaran pengukuhan. Hasil tersebut selari dengan penyelidikan terkini tentang generalisasi lemah-ke-kuat melalui penyulingan atas dasar polisi sendiri.
Inkling-Small masih bukan model yang boleh dijalankan pada komputer riba biasa. Namun, keperluan perkakasannya jauh lebih rendah berbanding Inkling. Konfigurasi rasmi daripada kad model adalah seperti berikut:
| Format | Jumlah VRAM | Contoh konfigurasi |
|---|---|---|
| BF16 | kira-kira 600GB | 4× NVIDIA B300 atau 8× H200 |
| NVFP4 (W4A16) | kira-kira 180GB | 2× NVIDIA H200 |
| NVFP4 (W4A4) | kira-kira 180GB | 1× NVIDIA B300, dengan keperluan SM100+ |
Sebagai perbandingan, titik semak Inkling dalam BF16 memerlukan kira-kira 1.9TB VRAM terkumpul. Varian Inkling NVFP4 pula memerlukan kira-kira 600GB.
Pengurangan ini menjadikan Inkling-Small lebih munasabah untuk dijalankan dan ditala oleh pasukan pertengahan, walaupun jumlah perkakasan yang diperlukan masih besar dan lazimnya melibatkan GPU pusat data. Model ini menyokong numerik BF16, MXFP8 dan NVFP4.
Inkling-Small boleh digunakan melalui beberapa saluran:
Thinking Machines Lab diasaskan oleh bekas ketua pegawai teknologi OpenAI, Mira Murati, selepas beliau meninggalkan OpenAI pada 2024. John Schulman, yang pernah menjadi pengasas bersama OpenAI dan anggota penting pasukan RLHF, turut menjadi pengasas bersama syarikat itu.
Lilian Weng, yang pada awalnya merupakan sebahagian daripada pasukan pengasas, kemudiannya meninggalkan Thinking Machines Lab dan kembali ke OpenAI. Dengan perkembangan itu, Mira Murati dan John Schulman kekal sebagai pengasas bersama yang masih berada dalam syarikat tersebut.
Inkling-Small menunjukkan bahawa model yang lebih kecil dari segi jumlah parameter tidak semestinya lebih lemah dalam semua tugasan. Dengan 276B parameter keseluruhan tetapi hanya 12B aktif bagi setiap token, ia mengatasi Inkling 975B dalam HLE, SWE-Bench Verified dan GPQA Diamond.
Namun, kelebihan itu datang bersama pertukaran. Inkling-Small ketinggalan besar dalam SimpleQA Verified, jadi ia bukan pengganti menyeluruh untuk Inkling apabila ketepatan fakta menjadi faktor utama.
Bagi pasukan yang tidak mampu menyediakan kira-kira 1.9TB VRAM untuk Inkling, Inkling-Small menawarkan pilihan yang lebih praktikal pada sekitar 600GB dalam BF16 atau 180GB dalam NVFP4. Ia masih memerlukan perkakasan pusat data, tetapi penurunan kos ini membuka ruang yang lebih luas untuk pengekodan ejen, penaakulan dan penyesuaian model melalui LoRA.