Dla porównania, jego większy poprzednik — Inkling — ma 975 mld parametrów, z czego aktywnych jest około 41 mld. Mimo niemal czterokrotnie mniejszej liczby parametrów całkowitych Inkling-Small dorównuje mu lub go wyprzedza w kilku ważnych testach, a do uruchomienia i dostrajania wymaga znacznie mniej sprzętu .
Model obsługuje dane tekstowe, obrazy i dźwięk, oferuje kontekst do miliona tokenów oraz pozwala kontrolować „wysiłek myślenia” — można więc wybrać kompromis między głębszym rozumowaniem a niższymi opóźnieniami .
Inkling-Small nie wygrywa we wszystkim. Jego profil jest jednak interesujący: lepiej radzi sobie z rozumowaniem, zadaniami programistycznymi i pytaniami naukowymi, natomiast większy Inkling zachowuje przewagę w zapamiętywaniu faktów i matematyce konkursowej .
| Benchmark | Inkling-Small | Inkling | Różnica |
|---|---|---|---|
| HLE — tylko tekst | 31,6% | 29,7% | +1,9 pkt proc. |
| SWE-Bench Verified | 80,2% | 77,6% | +2,6 pkt proc. |
| GPQA Diamond | 89,5% | 87,2% | +2,3 pkt proc. |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 punkt |
| AIME 2026 | 95,5% | 97,1% | −1,6 pkt proc. |
| SimpleQA Verified | 20,6% | 43,9% | −23,3 pkt proc. |
Źródła:
Najważniejsze wnioski:
Inkling-Small to 42-warstwowy, rzadki model MoE. W każdej operacji wybiera sześciu z 256 ekspertów, a dodatkowo korzysta z dwóch ekspertów współdzielonych . W praktyce oznacza to, że nie wszystkie parametry są używane przy każdym tokenie. Model może więc przechowywać dużą różnorodność „umiejętności”, ale podczas pojedynczej odpowiedzi wykonuje obliczenia bliższe znacznie mniejszemu modelowi gęstemu.
Architektura należy do tej samej rodziny MoE co Inkling, lecz wykorzystuje mniej ekspertów — 256 zamiast około 576 — oraz mniej ekspertów aktywowanych w poszczególnych warstwach. Zastosowano także hybrydowy mechanizm uwagi, łączący pełną uwagę z uwagą w oknie przesuwnym, oraz regulowany poziom wysiłku rozumowania .
Warto jednak pamiętać, że „12 mld aktywnych parametrów” nie oznacza, iż do uruchomienia wystarczy sprzęt dla klasycznego modelu 12B. Cały checkpoint ma 276 mld parametrów i musi zostać odpowiednio załadowany do pamięci — oszczędność dotyczy przede wszystkim obliczeń wykonywanych dla poszczególnych tokenów .
Thinking Machines Lab zastosowało dwuetapowy proces post-treningu, który łączy destylację wiedzy z dalszym uczeniem przez wzmacnianie .
Istotne jest to, że uczeń przewyższył nauczyciela w kilku zadaniach po zaledwie dwóch tygodniach dodatkowego uczenia przez wzmacnianie. Wynik ten wpisuje się w nowsze badania nad przenoszeniem zdolności z modeli słabszych do silniejszych za pomocą destylacji on-policy .
Największą praktyczną zaletą Inkling-Small jest niższy próg sprzętowy. Oficjalna karta modelu podaje następujące konfiguracje :
| Format | Łączna pamięć VRAM | Przykładowa konfiguracja |
|---|---|---|
| BF16 | około 600 GB | 4 × NVIDIA B300 lub 8 × H200 |
| NVFP4 (W4A16) | około 180 GB | 2 × NVIDIA H200 |
| NVFP4 (W4A4) | około 180 GB | 1 × NVIDIA B300, wymagane SM100+ |
Dla porównania checkpoint Inklinga w BF16 wymagał około 1,9 TB łącznej pamięci VRAM . Oficjalny skwantyzowany wariant NVFP4 większego modelu potrzebował około 600 GB .
W przypadku Inkling-Small redukcja do około 600 GB w BF16 i 180 GB w NVFP4 oznacza, że model staje się bardziej realistyczną opcją dla średniej wielkości zespołów prowadzących dostrajanie LoRA, a w odpowiedniej konfiguracji także pełne dostrajanie parametrów . Model obsługuje formaty BF16, MXFP8 i NVFP4 .
Inkling-Small jest dostępny w kilku formach :
Licencja Apache 2.0 pozwala na szerokie wykorzystanie i modyfikowanie wag, choć rzeczywiste koszty samodzielnego uruchomienia nadal pozostają wysokie ze względu na wymagania dotyczące pamięci GPU.
Thinking Machines Lab założyła była dyrektor techniczna OpenAI Mira Murati, po jej odejściu z OpenAI w 2024 roku. Wśród współzałożycieli znalazł się także John Schulman, wcześniej współtwórca zespołu OpenAI zajmującego się RLHF, czyli uczeniem ze wzmocnieniem na podstawie informacji zwrotnej od ludzi.
Lilian Weng, początkowo należąca do zespołu założycielskiego, odeszła później z Thinking Machines Lab i wróciła do OpenAI. W przedstawianym kontekście pozostającymi współzałożycielami startupu są Mira Murati i John Schulman .
Inkling-Small pokazuje, że liczba parametrów nie przekłada się automatycznie na wynik w każdym zadaniu. Model mający około jednej czwartej parametrów Inklinga przewyższa większego „nauczyciela” w publicznych testach rozumowania, programowania agentowego i wiedzy naukowej, a jego przygotowanie do pracy wymaga znacznie mniej pamięci GPU.
Nie jest to jednak uniwersalny zwycięzca. Inkling pozostaje wyraźnie lepszy w SimpleQA Verified, czyli w zadaniach wymagających trafnego odtwarzania faktów, oraz w AIME 2026. Dla zespołów budujących asystentów programistycznych i agentów AI Inkling-Small może być mimo to praktyczniejszym otwartym modelem — szczególnie gdy budżet sprzętowy nie pozwala na uruchomienie checkpointu wymagającego około 1,9 TB VRAM. W przypadku nowego modelu próg spada do około 600 GB w BF16 lub 180 GB w NVFP4.