Inkling-Small: 276 miljard parameters, maar slechts 12 miljard actief
Thinking Machines Lab bracht Inkling Small op 30 juli 2026 uit onder de Apache 2.0 licentie: een multimodaal MoE model met 276 miljard parameters, waarvan 12 miljard per token actief zijn. Het model presteert beter dan het vier keer grotere Inkling op Humanity's Last Exam, SWE Bench Verified en GPQA Diamond, maar sc...
Gepubliceerd doorBewerkt met DeepSeek-V4-FlashAfbeeldingen gegenereerd met GPT Image 1.5
Thinking Machines Lab bracht Inkling Small op 30 juli 2026 uit onder de Apache 2.0 licentie: een multimodaal MoE model met 276 miljard parameters, waarvan 12 miljard per token actief zijn.
Het model presteert beter dan het vier keer grotere Inkling op Humanity's Last Exam, SWE Bench Verified en GPQA Diamond, maar scoort veel lager op feitelijke recall in SimpleQA Verified.
Dankzij een combinatie van on policy distillation en twee weken extra reinforcement learning voor agents is de benodigde hoeveelheid videogeheugen teruggebracht van ongeveer 1,9 terabyte naar 600 gigabyte in BF16 of 1...
What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active paInkling-Small (276B total, 12B active) beats Inkling (975B total, 41B active) on reasoning, coding, and science benchmarks while requiring a fraction of the VRAM.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active pa. Article summary: Now I have all the key data. Let me compile the answer.. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
openai.com
Wat is Inkling-Small?
Inkling-Small is een sparse Mixture-of-Experts- (MoE-)transformermodel van Thinking Machines Lab. Het werd op 30 juli 2026 uitgebracht met volledige open weights onder de permissieve Apache 2.0-licentie. Het model bevat in totaal 276 miljard parameters, maar activeert per token slechts ongeveer 12 miljard daarvan. Daardoor kan het een groot deel van de capaciteit van een veel groter model bieden zonder bij iedere berekening alle parameters te gebruiken .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Inkling-Small: 276 miljard parameters, maar slechts 12 miljard actief"?
Thinking Machines Lab bracht Inkling Small op 30 juli 2026 uit onder de Apache 2.0 licentie: een multimodaal MoE model met 276 miljard parameters, waarvan 12 miljard per token actief zijn.
What are the key points to validate first?
Thinking Machines Lab bracht Inkling Small op 30 juli 2026 uit onder de Apache 2.0 licentie: een multimodaal MoE model met 276 miljard parameters, waarvan 12 miljard per token actief zijn. Het model presteert beter dan het vier keer grotere Inkling op Humanity's Last Exam, SWE Bench Verified en GPQA Diamond, maar scoort veel lager op feitelijke recall in SimpleQA Verified.
What should I do next in practice?
Dankzij een combinatie van on policy distillation en twee weken extra reinforcement learning voor agents is de benodigde hoeveelheid videogeheugen teruggebracht van ongeveer 1,9 terabyte naar 600 gigabyte in BF16 of 1...
Inkling-Small is ongeveer een kwart zo groot als de eerdere Inkling, die 975 miljard parameters heeft en er 41 miljard per token activeert. Toch evenaart of overtreft de kleinere variant zijn voorganger op verschillende belangrijke tests. Het model ondersteunt tekst-, beeld- en audio-input, heeft een contextvenster van maximaal 1 miljoen tokens en laat ontwikkelaars de gewenste denkintensiteit instellen .
Prestaties: sterker in redeneren, zwakker in feitenkennis
Inkling-Small wint van Inkling op drie veeleisende publieke benchmarks, maar levert in op feitelijke recall en wedstrijdwiskunde .
Benchmark
Inkling-Small
Inkling
Verschil
HLE (alleen tekst)
31,6%
29,7%
+1,9 procentpunt
SWE-Bench Verified
80,2%
77,6%
+2,6 procentpunt
GPQA Diamond
89,5%
87,2%
+2,3 procentpunt
Artificial Analysis Intelligence Index v4.1
40
41
–1 punt
AIME 2026
95,5%
97,1%
–1,6 procentpunt
SimpleQA Verified
20,6%
43,9%
–23,3 procentpunt
Bronnen:
De belangrijkste conclusies:
Redeneren: op Humanity's Last Exam (alleen tekst) haalt Inkling-Small 31,6%, tegenover 29,7% voor Inkling. Volgens Thinking Machines Lab blijft die voorsprong overeind bij verschillende instellingen voor denkintensiteit .
Programmeeragents: op SWE-Bench Verified komt het model uit op 80,2%, tegenover 77,6% voor Inkling. Deze evaluatie gebruikte een bash-only harness en trajecten van maximaal 256K tokens .
Wetenschappelijke kennis: met 89,5% op GPQA Diamond ligt Inkling-Small boven de 87,2% van Inkling .
Feitelijke nauwkeurigheid: op SimpleQA Verified zakt de score naar 20,6%, terwijl Inkling 43,9% haalt. Dat wijst op een duidelijke inruil: meer nadruk op redeneren, minder op het reproduceren van opgeslagen feiten .
Onafhankelijke index: op de Artificial Analysis Intelligence Index v4.1 scoort Inkling-Small 40 punten, slechts één punt minder dan Inkling .
De modelkeuze hangt dus sterk af van de toepassing. Voor code, complexe instructies en redeneertaken is de kleinere variant aantrekkelijker. Voor vragen waarbij betrouwbare feitelijke recall centraal staat, blijft Inkling duidelijk sterker.
Hoe werkt de MoE-architectuur?
Inkling-Small is een sparse MoE-transformer met 42 lagen. Per token worden zes van de 256 experts geactiveerd, naast twee gedeelde experts . In plaats van het volledige netwerk voor ieder token te berekenen, kiest de router alleen de experts die voor dat token het meest relevant zijn.
De architectuur behoort tot dezelfde MoE-familie als Inkling, maar gebruikt minder totale experts — 256 tegenover ongeveer 576 bij Inkling — en activeert er per laag minder. In de praktijk gedraagt het model zich tijdens inferentie daardoor ongeveer als een dense model met 12 miljard actieve parameters, terwijl de volledige gewichten de capaciteit van 276 miljard parameters bevatten .
Daarnaast gebruikt Inkling-Small hybride attention, met een combinatie van volledige en sliding-window attention. De instelbare denkintensiteit biedt ontwikkelaars een keuze tussen lagere latency en meer tijd voor complexe redeneringen .
Twee stappen in de post-training
Thinking Machines Lab gebruikte een tweedelige trainingsaanpak :
On-policy distillation vanuit Inkling. Een eerdere Inkling-Small-checkpoint genereerde eerst zijn eigen trajecten. Inkling fungeerde vervolgens als leermeester en gaf dichte supervisie op tokenniveau, inclusief feedback op de tussenstappen van het redeneerproces. Zo combineert de methode de realistische voorbeelden van on-policy training met de fijnmazige feedback van distillation .
Twee extra weken reinforcement learning voor agents. Daarna schaalde het team de reinforcement learning voor agentische programmeertaken verder op. Volgens Thinking Machines Lab hielp dat Inkling-Small om Inkling voorbij te streven op verschillende redeneer- en programmeerbenchmarks .
Het opvallende resultaat: de leerling presteert na deze extra post-training op meerdere taken beter dan zijn grotere leermeester. Dat sluit aan bij recent onderzoek naar weak-to-strong generalization, waarbij on-policy distillation wordt gebruikt om kennis en trainingssignalen van een kleiner of zwakker model over te dragen .
Hardware: ongeveer drie keer minder videogeheugen
De grootste praktische winst zit mogelijk niet in de benchmarkcijfers, maar in de hardware. Volgens de officiële modelkaart zijn dit de minimale configuraties :
Formaat
Gecombineerd VRAM-geheugen
Voorbeeldconfiguratie
BF16
circa 600 GB
4× NVIDIA B300 of 8× H200
NVFP4 (W4A16)
circa 180 GB
2× NVIDIA H200
NVFP4 (W4A4)
circa 180 GB
1× NVIDIA B300, met SM100+ vereist
Ter vergelijking: de BF16-checkpoint van Inkling vraagt ongeveer 1,9 terabyte aan gecombineerd VRAM-geheugen . De officiële NVFP4-variant van Inkling komt uit op ongeveer 600 GB .
Voor Inkling-Small betekent dat een daling met ongeveer een factor drie. Het model blijft met 600 GB uiteraard veel te groot voor een gewone consumenten-pc, maar wordt wel realistischer voor middelgrote AI-teams, startups en universitaire labs zonder enorme multi-nodeclusters. Inkling-Small ondersteunt BF16, MXFP8 en NVFP4 .
Wat betekent dit voor fine-tuning?
Volledige fine-tuning in BF16: hiervoor is een cluster nodig met vier B300-gpu's of acht H200-gpu's. Dat blijft een forse investering, maar valt binnen het bereik van goed gefinancierde startups en onderzoeksinstellingen .
LoRA-fine-tuning in NVFP4: met twee H200-gpu's kan een team een LoRA-adapter trainen. LoRA — Low-Rank Adaptation — past slechts kleine adapterlagen aan in plaats van alle modelgewichten opnieuw te trainen .
Inferentie in NVFP4: in W4A4-modus past het model op één B300-gpu, mits die SM100+-architectuur ondersteunt. Daarmee is dit het eerste Thinking Machines-model dat op één hoogwaardige datacenter-gpu kan draaien .
Beschikbaarheid en prijs
Inkling-Small is op meerdere manieren beschikbaar :
Volledige gewichten: te downloaden via Hugging Face onder Apache 2.0.
Tinker Playground: chatten met het model via tekst, beeld en audio.
Tinker API: fine-tuning met LoRA.
API-prijs: $1,20 per 1 miljoen gegenereerde tokens .
De open weights geven ontwikkelaars meer controle dan bij gesloten modellen: ze kunnen het model zelf hosten, aanpassen en voor specifieke toepassingen finetunen. De hardware-eisen blijven echter aanzienlijk; “open” betekent hier niet dat het model zonder gespecialiseerde datacenter-gpu's lokaal op een laptop draait.
De leiding achter Thinking Machines Lab
Thinking Machines Lab werd opgericht door voormalig OpenAI-CTO Mira Murati, nadat zij OpenAI in 2024 verliet. Ook John Schulman, medeoprichter van OpenAI en voormalig lid van het RLHF-team, is medeoprichter van de startup. Lilian Weng, die aanvankelijk deel uitmaakte van het oprichtersteam, is inmiddels vertrokken bij Thinking Machines Lab en teruggekeerd naar OpenAI. Daarmee zijn Mira Murati en John Schulman de resterende medeoprichters van het bedrijf .
De conclusie
Inkling-Small laat zien dat een groter model niet automatisch de beste keuze is. Met ongeveer een kwart van het totale parameterbudget van Inkling presteert het op meerdere redeneer-, wetenschaps- en programmeertests beter — waarschijnlijk mede dankzij de combinatie van on-policy distillation en gerichte reinforcement learning.
De keerzijde is duidelijk: op feitelijke recall verliest het model fors van Inkling. Maar voor ontwikkelaars die vooral code schrijven, agents bouwen of complexe instructies laten uitvoeren, is Inkling-Small de praktischere open-weightoptie. De benodigde hardware daalt van ongeveer 1,9 TB VRAM voor Inkling in BF16 naar circa 600 GB voor Inkling-Small, of 180 GB met NVFP4. Dat is nog steeds datacenterhardware, maar wel een veel haalbaardere stap voor middelgrote teams.