MoE-arkkitehtuurissa kaikki mallin painot eivät osallistu jokaiseen laskutoimitukseen. Näin Inkling-Small voi säilyttää erittäin suuren mallin kapasiteettia, mutta käyttää päättelyssä vain osaa siitä. Lopputulos on noin neljänneksen Inklingin koosta: alkuperäisessä Inklingissä on 975 miljardia kokonaisparametria ja 41 miljardia aktiivista parametria .
Inkling-Small tukee teksti-, kuva- ja äänisyötteitä, jopa miljoonan tokenin konteksti-ikkunaa sekä säädettävää ajattelupanosta. Kehittäjä voi siis vaihtaa nopeamman vastauksen syvempään päättelyyn käyttämällä enemmän laskentaa .
Inkling-Small ei ole kaikissa tehtävissä suurempaa sisarmalliaan parempi. Se kuitenkin päihittää Inklingin useissa päättelyyn, ohjelmointiin ja tieteelliseen ongelmanratkaisuun liittyvissä testeissä .
| Testi | Inkling-Small | Inkling | Ero |
|---|---|---|---|
| HLE, vain teksti | 31,6 % | 29,7 % | +1,9 prosenttiyksikköä |
| SWE-Bench Verified | 80,2 % | 77,6 % | +2,6 prosenttiyksikköä |
| GPQA Diamond | 89,5 % | 87,2 % | +2,3 prosenttiyksikköä |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 piste |
| AIME 2026 | 95,5 % | 97,1 % | −1,6 prosenttiyksikköä |
| SimpleQA Verified | 20,6 % | 43,9 % | −23,3 prosenttiyksikköä |
Lähteet:
Humanity’s Last Exam -testissä, joka tunnetaan lyhenteellä HLE, Inkling-Small saavutti tekstimuodossa 31,6 prosentin tuloksen, kun Inkling ylsi 29,7 prosenttiin. Thinking Machines Labin mukaan pienemmän mallin etu säilyi eri ajattelupanoksilla .
GPQA Diamond -testissä, joka mittaa muun muassa jatko-opintotason luonnontieteellistä osaamista, Inkling-Small sai 89,5 prosenttia ja Inkling 87,2 prosenttia .
SWE-Bench Verified -testissä mitataan, pystyykö malli ratkaisemaan todellisista GitHub-projekteista poimittuja ohjelmistovirheitä. Inkling-Small saavutti testissä 80,2 prosentin tuloksen, kun Inklingin tulos oli 77,6 prosenttia. Ilmoitettu tulos perustuu bash-pohjaiseen testikehykseen ja 256 000 tokenin työskentely-uraan .
Pienemmän mallin merkittävin kompromissi näkyy faktatiedon palauttamisessa. SimpleQA Verified -testissä Inkling-Small sai vain 20,6 prosenttia, kun Inkling ylsi 43,9 prosenttiin .
Tulos muistuttaa siitä, ettei päättelykyky automaattisesti tarkoita parempaa faktuaalista muistia. Malli on viritetty vahvemmin päättelyyn ja agenttitehtäviin, mikä voi tapahtua ulkoa opittujen yksityiskohtien kustannuksella. Myös kilpailumatematiikan AIME 2026 -testissä suurempi Inkling säilytti etunsa: 97,1 prosenttia verrattuna Inkling-Smallin 95,5 prosenttiin .
Inkling-Small on 42-kerroksinen harva MoE-muuntajamalli. Kussakin tokenissa käytetään kuutta 256 asiantuntijasta sekä kahta jaettua asiantuntijaa . Mallissa on hybridihuomio, jossa yhdistyvät täysi huomio ja liukuva ikkuna, sekä säädettävä ajattelupanoksen taso .
Vaikka painoissa on 276 miljardia parametria, laskennallisesti aktiivinen osa vastaa lähempänä 12 miljardin parametrin tiheää mallia. Muistin ja laitteiston tarvetta ei silti voi arvioida pelkän aktiivisen parametrimäärän perusteella: koko mallin painot on ladattava käyttöä varten .
Inkling-Small kuuluu samaan MoE-malliperheeseen kuin Inkling, mutta siinä on vähemmän asiantuntijoita — 256, kun suuremmassa mallissa niitä on noin 576 — ja kerrallaan aktivoituu pienempi osuus .
Thinking Machines Lab käytti mallin jälkikoulutuksessa kaksiosaista menetelmää .
Tulos on kiinnostava ennen kaikkea siksi, että pienempi opiskelijamalli ohitti opettajansa joissakin tehtävissä suhteellisen lyhyen, kahden viikon lisäkoulutuksen jälkeen. Se sopii yhteen tuoreemman heikosta vahvaan -yleistämisestä tehdyn tutkimuksen kanssa, jossa on-policy-distillationia käytetään vahvistusoppimisesta saadun osaamisen siirtämiseen .
Inkling-Smallin suurin käytännön etu voi olla suorituskyvyn sijaan sen laitteistovaatimus. Thinking Machines Labin mallikortin mukaan virallinen minimivaatimus on seuraava :
| Muoto | Yhteenlaskettu VRAM | Esimerkkikokoonpano |
|---|---|---|
| BF16 | noin 600 Gt | 4 × NVIDIA B300 tai 8 × H200 |
| NVFP4 (W4A16) | noin 180 Gt | 2 × NVIDIA H200 |
| NVFP4 (W4A4) | noin 180 Gt | 1 × NVIDIA B300, SM100+ vaaditaan |
Vertailun vuoksi Inklingin BF16-tarkistuspiste vaati noin 1,9 teratavua yhteenlaskettua VRAM-muistia . Alkuperäisen mallin virallinen NVFP4-versio tarvitsi noin 600 gigatavua .
Kyse ei siis ole tavalliselle kuluttajatietokoneelle sopivasta mallista. VRAM-vaatimuksen putoaminen noin 600 gigatavuun BF16-muodossa ja 180 gigatavuun NVFP4-muodossa tekee mallista kuitenkin aiempaa realistisemman keskisuurille yrityksille, tutkimusryhmille ja hyvin rahoitetuille startup-yrityksille.
Malli tukee BF16-, MXFP8- ja NVFP4-lukumuotoja .
Inkling-Smallin täydet painot ovat saatavilla Hugging Facessa Apache 2.0 -lisenssillä. Mallia voi käyttää myös Thinking Machines Labin palveluissa :
Thinking Machines Labin perusti OpenAI:n entinen teknologiajohtaja Mira Murati hänen lähdettyään OpenAI:sta vuonna 2024. Yhtiön toinen perustaja on John Schulman, joka oli aiemmin OpenAI:n perustajajäsen ja vahvistusoppimiseen perustuvan RLHF-työn keskeisiä henkilöitä .
Lilian Weng, joka kuului alun perin perustajatiimiin, on sittemmin lähtenyt Thinking Machines Labista ja palannut OpenAI:hin. Tämän myötä Murati ja Schulman ovat startupin jäljellä olevat perustajat .
Inkling-Small on Thinking Machines Labilta vahva osoitus siitä, miten arkkitehtuuri ja jälkikoulutus voivat muuttaa mallien kokovertailua. Neljä kertaa pienempi kokonaismalli päihittää suuremman Inklingin päättelyssä, agenttimaisessa koodauksessa ja GPQA Diamond -testissä, vaikka häviääkin selvästi faktatiedon palauttamisessa ja hieman kilpailumatematiikassa.
Käytännössä tärkein ero on laitteistossa: Inklingin noin 1,9 teratavun BF16-vaatimukseen verrattuna Inkling-Smallin noin 600 gigatavun vaatimus on huomattavasti helpompi saavuttaa — ja NVFP4-muodossa laskennallinen minimivaatimus putoaa noin 180 gigatavuun. Siksi Inkling-Small on heinäkuussa 2026 Thinking Machines Labin malleista käytännöllisempi avoimien painojen vaihtoehto erityisesti koodaus-, päättely- ja ohjeidenseurantatehtäviin.