Det er hovedideen bak MoE-arkitekturen: Modellen kan ha en svært stor samlet kapasitet, samtidig som bare et utvalg av «ekspertene» aktiveres for hver oppgave. Inkling-Small er dermed omtrent en fjerdedel så stor som forgjengeren Inkling, som har 975 milliarder parametere totalt og 41 milliarder aktive parametere.
Til tross for den mindre aktive delen matcher eller overgår Inkling-Small storebroren på flere sentrale tester. Den støtter tekst, bilder og lyd, har et kontekstvindu på opptil én million tokens og lar utviklere styre hvor mye «tenking» modellen skal bruke .
Inkling-Small gjør det bedre enn Inkling på resonnering, agentbasert koding og vitenskapelige spørsmål. Samtidig har den tydelige svakheter når oppgaven krever presis faktagjenkalling eller konkurransematematikk .
| Test | Inkling-Small | Inkling | Forskjell |
|---|---|---|---|
| HLE, kun tekst | 31,6 % | 29,7 % | +1,9 prosentpoeng |
| SWE-Bench Verified | 80,2 % | 77,6 % | +2,6 prosentpoeng |
| GPQA Diamond | 89,5 % | 87,2 % | +2,3 prosentpoeng |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 poeng |
| AIME 2026 | 95,5 % | 97,1 % | −1,6 prosentpoeng |
| SimpleQA Verified | 20,6 % | 43,9 % | −23,3 prosentpoeng |
Kilder:
På Humanity’s Last Exam, en krevende test av kunnskap og problemløsing, oppnår Inkling-Small 31,6 prosent mot Inkling på 29,7 prosent. Thinking Machines Lab oppgir at fordelen gjelder på tvers av ulike nivåer for tenkeinnsats .
I SWE-Bench Verified, som måler om en modell kan løse reelle programvareoppgaver i kodebaser, får Inkling-Small 80,2 prosent. Testen ble kjørt med et bash-basert oppsett og en bane på 256 000 tokens, og resultatet er 2,6 prosentpoeng bedre enn Inkling .
På GPQA Diamond, som består av spørsmål på høyt nivå innen blant annet naturvitenskap, får den mindre modellen 89,5 prosent mot Inkling på 87,2 prosent .
Inkling-Small taper derimot kraftig på SimpleQA Verified, en test som i større grad måler faktabasert gjenkalling. Her får modellen 20,6 prosent, mens Inkling oppnår 43,9 prosent .
Det illustrerer en viktig avveining: En modell kan trenes til å bli bedre på trinnvis problemløsing og agentoppgaver uten nødvendigvis å bli bedre på å huske eller gjengi konkrete fakta. Inkling-Small er derfor ikke automatisk det beste valget for alle bruksområder.
Inkling-Small er en 42-lags sparsom MoE-transformer. For hvert token aktiveres seks av 256 eksperter, i tillegg til to delte eksperter . Modellen bruker en kombinasjon av full oppmerksomhet og oppmerksomhet innenfor glidende vinduer. Det skal bidra til å håndtere lange tekster uten at alle deler av modellen må arbeide med hvert eneste token.
Den tilhører samme MoE-familie som Inkling, men har færre eksperter totalt – 256 mot omtrent 576 i Inkling – og færre aktive eksperter per lag. I praksis oppfører den aktive delen seg mer som en langt mindre tett modell under kjøring, samtidig som de samlede vektene gir den større kapasitet .
Funksjonen for justerbar tenkeinnsats lar utviklere velge mellom lavere forsinkelse og mer omfattende resonnering. Det kan være nyttig i produkter der enkle spørsmål bør besvares raskt, mens mer krevende oppgaver får bruke mer beregning .
Thinking Machines Lab brukte en totrinnsoppskrift for å videreutvikle modellen :
Det oppsiktsvekkende er at studentmodellen overgår lærermodellen på flere områder etter denne ekstra treningen. Resultatet passer med nyere forskning på såkalt weak-to-strong-generalisering, der en mindre modell eller et svakere treningssignal likevel kan bidra til å forbedre en sterkere modell gjennom on-policy-destillering .
Den største praktiske forskjellen mellom modellene ligger i minnekravet. Thinking Machines Labs modellkort oppgir følgende konfigurasjoner for Inkling-Small :
| Format | Samlet VRAM | Eksempel på konfigurasjon |
|---|---|---|
| BF16 | rundt 600 GB | 4 × NVIDIA B300 eller 8 × H200 |
| NVFP4 (W4A16) | rundt 180 GB | 2 × NVIDIA H200 |
| NVFP4 (W4A4) | rundt 180 GB | 1 × NVIDIA B300, med krav om SM100 eller nyere |
Til sammenligning krevde Inkling omtrent 1,9 TB samlet VRAM i BF16-format . Den offisielle kvantiserte NVFP4-versjonen av Inkling krevde rundt 600 GB .
Det betyr ikke at Inkling-Small kan kjøres på en vanlig PC. Også 180 GB er langt over kapasiteten til typiske forbrukergrafikkort. Men for godt finansierte oppstartsbedrifter, universitetsmiljøer og mellomstore utviklingsteam er terskelen betydelig lavere enn for den opprinnelige Inkling-modellen.
Inkling-Small støtter BF16, MXFP8 og NVFP4 . For mange utviklere vil kvantisering og LoRA være mer relevant enn full finjustering, fordi det gjør det mulig å tilpasse modellen til egne agent-, kode- eller dokumentarbeidsflyter uten et stort fler-node-klyngesystem.
Thinking Machines Lab tilbyr Inkling-Small på flere måter :
Thinking Machines Lab ble grunnlagt av tidligere OpenAI-teknologidirektør Mira Murati etter at hun forlot OpenAI i 2024. John Schulman, en tidligere OpenAI-medgründer og sentral person i arbeidet med RLHF, er også medgründer.
Lilian Weng, som opprinnelig var del av grunnleggerteamet, har senere forlatt Thinking Machines Lab og gått tilbake til OpenAI. Det etterlater ifølge den oppgitte dekningen Murati og Schulman som selskapets gjenværende medgründere .
Inkling-Small er et tydelig eksempel på at modellstørrelse alene ikke avgjør hvor nyttig en AI-modell er. Med omtrent en fjerdedel av Inkling-modellens totale parametermengde slår den storebroren på flere tester av resonnering, vitenskap og agentbasert programmering.
Samtidig har den en betydelig svakhet på faktabasert gjenkalling. For oppgaver som krever dokumentert presisjon, bør Inkling derfor fortsatt vurderes. For kodeassistenter, resonnerende agenter og tilpassede arbeidsflyter kan Inkling-Small derimot være det mer praktiske åpne alternativet.
Den viktigste endringen er maskinvarekravet: fra rundt 1,9 TB VRAM for Inkling i BF16 til cirka 600 GB for Inkling-Small, eller 180 GB i NVFP4. Det er fortsatt datasenterklasse, men avstanden til mellomstore utviklingsteam er blitt betydelig mindre.