Inkling-Small använder öppna vikter under Apache 2.0-licensen och kan därmed laddas ned, köras och anpassas av externa utvecklare och organisationer . Den har stöd för text, bilder och ljud, ett kontextfönster på upp till en miljon token samt möjlighet att styra hur mycket beräkningsarbete modellen ska lägga på sitt resonemang .
På flera av de mest krävande testerna presterar den mindre modellen bättre än sin större föregångare. Skillnaden är tydligast inom resonemang, programmering och vetenskapliga frågor.
| Benchmark | Inkling-Small | Inkling | Skillnad |
|---|---|---|---|
| HLE, endast text | 31,6 % | 29,7 % | +1,9 procentenheter |
| SWE-Bench Verified | 80,2 % | 77,6 % | +2,6 procentenheter |
| GPQA Diamond | 89,5 % | 87,2 % | +2,3 procentenheter |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 poäng |
| AIME 2026 | 95,5 % | 97,1 % | −1,6 procentenheter |
| SimpleQA Verified | 20,6 % | 43,9 % | −23,3 procentenheter |
Källor:
På Humanity’s Last Exam, ett test med avancerade kunskaps- och resonemangsfrågor, får Inkling-Small 31,6 procent mot Ink lings 29,7 procent. Fördelen kvarstår vid olika nivåer av så kallad thinking effort, alltså hur mycket tid och beräkning modellen får lägga på att tänka .
Inom kodning når modellen 80,2 procent på SWE-Bench Verified, där AI-agenter ska lösa verkliga problem i kodbaser. Testet kördes med ett bash-baserat upplägg och en bana på 256 000 token . På GPQA Diamond, som innehåller avancerade frågor inom bland annat naturvetenskap, får modellen 89,5 procent mot Ink lings 87,2 procent .
Men mindre är inte bättre på allt. Inkling-Small tappar stort i SimpleQA Verified, ett test av faktabaserad återgivning: 20,6 procent jämfört med Ink lings 43,9 procent. Den ligger också efter i AIME 2026, ett tävlingsinriktat matematiktest. Resultaten pekar på en tydlig kompromiss: modellen har optimerats för resonemang och agentiska uppgifter snarare än ren faktamemorering .
På Artificial Analysis Intelligence Index v4.1 hamnar Inkling-Small på 40 poäng, bara en poäng bakom Inkling på 41 .
Inkling-Small är en gles Mixture-of-Experts-modell, eller MoE. I stället för att använda alla modellens parametrar för varje fråga väljer systemet ut ett begränsat antal specialiserade experter för varje token.
Modellen har 42 lager. Sex av 256 experter aktiveras per token i varje lager, tillsammans med två delade experter . Det innebär att modellen har kapaciteten hos ett mycket stort parameterutrymme, men ungefär den beräkningsbelastning som förknippas med en betydligt mindre tät modell vid körning.
Arkitekturen tillhör samma MoE-familj som Inkling, men Inkling-Small har färre totala experter och färre aktiva experter per lager. Den använder också en hybrid av full uppmärksamhet och uppmärksamhet över ett glidande fönster. Utvecklare kan dessutom justera modellens thinking effort för att väga svarstid mot djupare resonemang .
Thinking Machines Lab använde en tvådelad metod för modellens efterträning:
Det intressanta är att eleven i det här fallet överträffar läraren på vissa uppgifter. Resultatet ligger i linje med aktuell forskning om hur on-policy-destillering kan överföra förbättringar från förstärkningsinlärning till en annan modell .
Den största praktiska skillnaden mot Inkling är minnesbehovet. Enligt modellkortet kräver Inkling-Small följande konfigurationer :
| Format | Samlad VRAM | Exempel på konfiguration |
|---|---|---|
| BF16 | cirka 600 GB | 4 × NVIDIA B300 eller 8 × H200 |
| NVFP4 (W4A16) | cirka 180 GB | 2 × NVIDIA H200 |
| NVFP4 (W4A4) | cirka 180 GB | 1 × NVIDIA B300, med krav på SM100 eller senare |
Ink lings BF16-version kräver omkring 1,9 TB samlad VRAM . Inkling-Small minskar därmed minneskravet till ungefär en tredjedel i BF16 och ännu mer med kvantiserad NVFP4-körning.
Det gör modellen mer realistisk för LoRA-anpassning och i vissa fall full parameterfinjustering hos medelstora team, även om kraven fortfarande är långt över vad en vanlig arbetsstation eller konsumentdator klarar .
Modellen stöder BF16, MXFP8 och NVFP4 . Det är dock viktigt att skilja på aktiva parametrar och den totala modellstorleken: även om bara 12 miljarder parametrar används för varje token måste systemet fortfarande hantera hela viktuppsättningen vid distribution .
Thinking Machines Lab erbjuder Inkling-Small på flera sätt :
Thinking Machines Lab grundades av Mira Murati, tidigare teknikchef på OpenAI, efter hennes avhopp från bolaget 2024. John Schulman, medgrundare av OpenAI och tidigare en del av företagets RLHF-team, är också medgrundare .
Lilian Weng, som ursprungligen ingick i Thinking Machines Labs grundarteam, har senare lämnat startupen och återvänt till OpenAI. Därmed återstår Murati och Schulman som bolagets kvarvarande medgrundare.
Inkling-Small är ett tydligt argument för att modellstorlek inte ensamt avgör praktisk kapacitet. Med en fjärdedel av Ink lings totala parameterstorlek slår den större modellen i flera tester av resonemang, programmering och vetenskapliga frågor.
Samtidigt är den inte en universell ersättare. Det stora tappet i SimpleQA visar att Inkling fortfarande är ett bättre val när faktabaserad återgivning väger tyngst. För organisationer som prioriterar kodning, agentiska arbetsflöden och kontrollerat resonemang är Inkling-Small däremot betydligt enklare att köra och anpassa – med cirka 600 GB VRAM i BF16 eller 180 GB i NVFP4, jämfört med omkring 1,9 TB för Inkling.