Inkling-Small er omtrent en fjerdedel så stor som den tidligere Inkling, der har 975 milliarder parametre i alt og 41 milliarder aktive pr. token. Alligevel matcher eller overgår den den større model på flere centrale benchmarks – samtidig med at den kræver væsentligt mindre hardware til drift og finjustering .
Modellen understøtter tekst-, billed- og lydinput, har et kontekstvindue på op til én million tokens og giver udviklere mulighed for at justere, hvor meget den skal “tænke”, så svartid og ræsonneringsdybde kan afvejes mod hinanden .
Inkling-Small klarer sig bedre end Inkling på ræsonnering, agentbaseret kodning og videnskabelige spørgsmål. Til gengæld ligger den bagefter på faktuel genkaldelse og konkurrencepræget matematik .
| Benchmark | Inkling-Small | Inkling | Forskel |
|---|---|---|---|
| HLE, kun tekst | 31,6 % | 29,7 % | +1,9 procentpoint |
| SWE-Bench Verified | 80,2 % | 77,6 % | +2,6 procentpoint |
| GPQA Diamond | 89,5 % | 87,2 % | +2,3 procentpoint |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | –1 point |
| AIME 2026 | 95,5 % | 97,1 % | –1,6 procentpoint |
| SimpleQA Verified | 20,6 % | 43,9 % | –23,3 procentpoint |
Kildegrundlag:
På Humanity's Last Exam scorer Inkling-Small 31,6 procent mod Inklings 29,7 procent. Fordelen gælder ifølge Thinking Machines ved samtlige niveauer for “thinking effort” .
På SWE-Bench Verified, hvor modellerne skal løse problemer i virkelige softwareprojekter, opnår Inkling-Small 80,2 procent i den oplyste bash-only-test med en 256.000-token-trajektorie. Det er 2,6 procentpoint mere end Inkling .
Modellen klarer sig også bedre på GPQA Diamond, et benchmark med spørgsmål på højt fagligt niveau inden for blandt andet naturvidenskab: 89,5 procent mod 87,2 procent .
Den store svaghed er SimpleQA Verified, som måler faktuel præcision og genkaldelse. Her scorer Inkling-Small kun 20,6 procent, mens Inkling når 43,9 procent. Resultatet illustrerer en klassisk afvejning: En model, der trænes hårdt til ræsonnering og problemløsning, kan miste noget af sin styrke i ren faktuel hukommelse .
På det eksterne Artificial Analysis Intelligence Index v4.1 ligger Inkling-Small med en score på 40 blot ét point efter Inkling, der scorer 41 .
Inkling-Small er bygget som en 42-lags sparse MoE-transformer. For hvert token aktiveres seks ud af 256 eksperter samt to delte eksperter . Det betyder, at modellen ikke bruger alle sine parametre på hver eneste del af en forespørgsel.
Arkitekturen kombinerer fuld opmærksomhed med sliding-window attention og understøtter justerbar tænkeindsats. Udviklere kan dermed vælge, om modellen primært skal prioritere lav latenstid eller mere omfattende ræsonnering .
Modellen tilhører samme MoE-familie som Inkling, men har færre eksperter – 256 mod cirka 576 i Inkling – og færre aktive eksperter pr. lag. I praksis opfører den sig derfor omtrent som en langt mindre tæt model under inferens, mens de samlede vægte stadig rummer kapaciteten fra 276 milliarder parametre .
Thinking Machines beskriver en post-training-proces i to dele :
On-policy-destillation fra Inkling: Den mindre model genererede selv sine egne trajektorier, mens Inkling fungerede som lærer og leverede tæt supervision på token-niveau. Metoden kombinerer den realistiske datafordeling fra on-policy-træning med den detaljerede feedback fra destillation .
To ekstra ugers reinforcement learning med fokus på agenter: Teamet fortsatte arbejdet med reinforcement learning til agentbaseret kodning. Ifølge Thinking Machines var det med til at løfte Inkling-Small forbi Inkling på flere benchmarks for ræsonnering og kodning .
Det interessante er, at en mindre studentmodel efter denne proces overgår sin større lærer på udvalgte opgaver. Resultatet ligger i forlængelse af nyere arbejde med såkaldt weak-to-strong generalisering og on-policy-destillation .
Inkling-Small sænker hardwarekravene markant sammenlignet med Inkling. De officielle minimumskonfigurationer fra modelkortet er :
| Format | Samlet VRAM | Eksempel på konfiguration |
|---|---|---|
| BF16 | Cirka 600 GB | 4 × NVIDIA B300 eller 8 × H200 |
| NVFP4 (W4A16) | Cirka 180 GB | 2 × NVIDIA H200 |
| NVFP4 (W4A4) | Cirka 180 GB | 1 × NVIDIA B300, kræver SM100 eller nyere |
Til sammenligning krævede Inklings BF16-checkpoint cirka 1,9 TB samlet VRAM . Den mindre model reducerer dermed den officielle VRAM-tærskel til omkring en tredjedel. Inkling-Small understøtter BF16, MXFP8 og NVFP4 .
Det betyder ikke, at modellen bliver almindeligt “lokal” software på en standard-pc. Selv 180 GB VRAM kræver avancerede datacenter-GPU'er. Men for mellemstore AI-teams, startups og universitetslaboratorier er den langt mere realistisk at køre og tilpasse end Inkling.
Thinking Machines Lab har gjort de fulde vægte tilgængelige på Hugging Face under Apache 2.0-licensen . Modellen kan også bruges på virksomhedens egne tjenester:
Open weights betyder, at udviklere kan hente modellen og arbejde direkte med vægtene inden for licensens rammer, i stedet for udelukkende at tilgå den gennem en lukket API.
Thinking Machines Lab blev grundlagt af den tidligere OpenAI-teknologidirektør Mira Murati, efter at hun forlod OpenAI i 2024. John Schulman, der var med til at grundlægge OpenAI og arbejdede med RLHF-teamet, er også medstifter .
Lilian Weng, som oprindeligt var en del af det stiftende hold, har siden forladt Thinking Machines Lab og er vendt tilbage til OpenAI. Det efterlader ifølge den tilgængelige dækning Murati og Schulman som startupvirksomhedens tilbageværende medstiftere .
Inkling-Small er et stærkt eksempel på, at en mindre model ikke nødvendigvis behøver at være mindre kompetent. Med en kombination af sparse MoE-arkitektur, on-policy-destillation og målrettet reinforcement learning overgår den Inkling på flere krævende opgaver inden for ræsonnering, kodning og videnskab.
Den vigtigste gevinst er dog måske hardwarekravene. Hvor Inkling i BF16 kræver omkring 1,9 TB VRAM, kan Inkling-Small køre med cirka 600 GB i BF16 eller 180 GB i NVFP4 . Det gør den mere interessant for teams, der vil finjustere en stor open-weight-model uden at investere i en massiv GPU-klynge.
Prisen er en markant svagere præstation på faktuel genkaldelse: 20,6 procent mod Inklings 43,9 procent i SimpleQA Verified. For udviklere, der primært arbejder med kodning, agentopgaver og kompleks problemløsning, kan Inkling-Small derfor være det mere praktiske valg. Til opgaver, hvor præcis faktuel viden er afgørende, er den større Inkling fortsat det sikrere valg ud fra de offentliggjorte resultater.