Inkling-Small: 276 miliard parametrů, ale jen 12 miliard aktivních
Thinking Machines Lab vydala 30. července 2026 model Inkling Small s 276 miliardami parametrů, z nichž se při zpracování každého tokenu aktivuje pouze 12 miliard.
PublikovalUpraveno pomocí DeepSeek-V4-FlashObrázky vytvořeny pomocí GPT Image 1.5
Thinking Machines Lab vydala 30. července 2026 model Inkling Small s 276 miliardami parametrů, z nichž se při zpracování každého tokenu aktivuje pouze 12 miliard.
Model využívá dvoufázové dodatečné trénování: on policy distilaci od Inklingu a následné dva týdny posilovaného učení zaměřeného na autonomní programovací agenty.
Požadavky na paměť klesly z přibližně 1,9 TB u Inklingu na zhruba 600 GB v režimu BF16 nebo 180 GB při použití NVFP4, což usnadňuje nasazení i dolaďování ve středně velkých týmech.
What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active paInkling-Small (276B total, 12B active) beats Inkling (975B total, 41B active) on reasoning, coding, and science benchmarks while requiring a fraction of the VRAM.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active pa. Article summary: Now I have all the key data. Let me compile the answer.. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
openai.com
Co je Inkling-Small?
Inkling-Small je řídký transformer typu Mixture of Experts (MoE), který Thinking Machines Lab vydala 30. července 2026 pod permisivní licencí Apache 2.0. Jeho váhy jsou tedy dostupné vývojářům, kteří si model mohou stáhnout, provozovat a upravovat podle vlastních potřeb.
Model obsahuje celkem 276 miliard parametrů, ale při zpracování jednoho tokenu aktivuje přibližně 12 miliard. Díky tomu si zachovává kapacitu velmi rozsáhlého modelu, aniž by při každém kroku využíval všechny své parametry .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Inkling-Small: 276 miliard parametrů, ale jen 12 miliard aktivních"?
Thinking Machines Lab vydala 30. července 2026 model Inkling Small s 276 miliardami parametrů, z nichž se při zpracování každého tokenu aktivuje pouze 12 miliard.
What are the key points to validate first?
Thinking Machines Lab vydala 30. července 2026 model Inkling Small s 276 miliardami parametrů, z nichž se při zpracování každého tokenu aktivuje pouze 12 miliard. Model využívá dvoufázové dodatečné trénování: on policy distilaci od Inklingu a následné dva týdny posilovaného učení zaměřeného na autonomní programovací agenty.
What should I do next in practice?
Požadavky na paměť klesly z přibližně 1,9 TB u Inklingu na zhruba 600 GB v režimu BF16 nebo 180 GB při použití NVFP4, což usnadňuje nasazení i dolaďování ve středně velkých týmech.
Ve srovnání s původním Inklingem — který má 975 miliard parametrů celkem a 41 miliard aktivních — je Inkling-Small přibližně čtyřikrát menší. Přesto svého většího sourozence překonává v několika důležitých testech zaměřených na uvažování, programování a vědecké znalosti .
Podporuje textové, obrazové i zvukové vstupy, kontextové okno až 1 milion tokenů a nastavitelnou intenzitu „přemýšlení“. Vývojář tak může podle potřeby měnit poměr mezi rychlostí, cenou a hloubkou uvažování .
Výsledky testů: menší model vítězí v uvažování i programování
Inkling-Small není lepší ve všem. Výrazně zaostává například v testu faktografického vybavování SimpleQA Verified a mírně také v soutěžní matematice AIME 2026. V několika náročných disciplínách však svého většího učitele předstihuje .
Test
Inkling-Small
Inkling
Rozdíl
HLE, pouze text
31,6 %
29,7 %
+1,9 p. b.
SWE-Bench Verified
80,2 %
77,6 %
+2,6 p. b.
GPQA Diamond
89,5 %
87,2 %
+2,3 p. b.
Artificial Analysis Intelligence Index v4.1
40
41
−1 bod
AIME 2026
95,5 %
97,1 %
−1,6 p. b.
SimpleQA Verified
20,6 %
43,9 %
−23,3 p. b.
Zdroj:
V čem je Inkling-Small silný
Uvažování: V textové verzi testu Humanity’s Last Exam dosáhl 31,6 %, zatímco Inkling získal 29,7 %. Výhoda se podle Thinking Machines drží napříč různými nastaveními rozpočtu na přemýšlení .
Programovací agenti: V testu SWE-Bench Verified, který ověřuje řešení skutečných problémů v repozitářích, dosáhl 80,2 %. Test probíhal v bash-only prostředí s trajektorií dlouhou 256 000 tokenů .
Věda: V testu GPQA Diamond, zaměřeném na odborné otázky na úrovni postgraduálního studia, získal 89,5 % oproti 87,2 % u Inklingu .
Celkové srovnání: V žebříčku Artificial Analysis Intelligence Index v4.1 zaostal Inkling-Small za Inklingem pouze o jediný bod — získal 40 oproti 41 .
Kde ztrácí
Největší slabinou je faktografická přesnost měřená testem SimpleQA Verified. Inkling-Small zde dosáhl jen 20,6 %, zatímco Inkling 43,9 %. Výsledek naznačuje kompromis mezi optimalizací pro hlubší uvažování a schopností spolehlivě vybavovat izolovaná fakta .
Menší model také zaostal v matematickém testu AIME 2026: 95,5 % oproti 97,1 % u Inklingu .
Jak funguje MoE architektura s 276 miliardami parametrů?
Inkling-Small je 42vrstvý řídký MoE transformer. V každé vrstvě vybírá z 256 expertů šest a zároveň využívá dva sdílené experty .
Prakticky to znamená, že model má v uložených vahách kapacitu odpovídající 276 miliardám parametrů, ale pro konkrétní token zapojuje jen omezenou část. Výpočetní náročnost se tak při inferenci blíží menšímu hustému modelu, zatímco celková kapacita zůstává výrazně vyšší.
Model používá hybridní attention, tedy kombinaci plné a posuvné pozornosti. Součástí architektury je i nastavitelná intenzita uvažování, která umožňuje vyměnit delší a důkladnější odpověď za nižší latenci .
Oproti původnímu Inklingu využívá méně expertů — 256 namísto přibližně 576 — a aktivuje menší počet expertů v jednotlivých vrstvách. Právě to pomáhá snižovat provozní náklady .
Dvoufázové dodatečné trénování
Thinking Machines připravila Inkling-Small ve dvou hlavních krocích .
On-policy distilace od Inklingu. Student nejprve generoval vlastní trajektorie, tedy celé průběhy řešení včetně mezikroků uvažování. Učitel Inkling následně poskytoval hustou zpětnou vazbu na úrovni jednotlivých tokenů. Tento postup spojuje realistické situace, do kterých se student sám dostává, s podrobným vedením silnějšího modelu .
Dva týdny posilovaného učení zaměřeného na agenty. Tým dále rozvíjel zejména autonomní programovací schopnosti a práci agentů s nástroji. Právě tato fáze podle dostupných údajů pomohla Inkling-Small překonat Inkling v testech uvažování a programování .
Výsledek je zajímavý hlavně z hlediska trénování modelů: menší student po krátké fázi dalšího RL překonal učitele v několika konkrétních úlohách. Neznamená to, že je celkově lepší ve všech oblastech — propad v SimpleQA je výrazný — ukazuje to však, jak moc může záležet na následném trénování, nejen na počtu parametrů.
Hardware: přibližně třikrát méně paměti GPU
Největší praktickou výhodou Inkling-Small jsou nižší hardwarové nároky. Oficiální model card uvádí následující konfigurace :
Formát
Celková požadovaná paměť GPU
Příklad konfigurace
BF16
přibližně 600 GB
4× NVIDIA B300 nebo 8× H200
NVFP4 (W4A16)
přibližně 180 GB
2× NVIDIA H200
NVFP4 (W4A4)
přibližně 180 GB
1× NVIDIA B300, vyžaduje SM100+
Pro srovnání: plná BF16 verze Inklingu vyžaduje přibližně 1,9 TB agregované paměti GPU. Jeho kvantizovaná varianta NVFP4 potřebuje zhruba 600 GB .
Inkling-Small proto snižuje paměťové nároky oproti původnímu modelu asi na třetinu. Stále nejde o model pro běžný domácí počítač ani typickou herní grafickou kartu, ale pro středně velké výzkumné týmy, startupy a univerzitní laboratoře je výrazně realističtější.
Co to znamená pro dolaďování
Plné dolaďování v BF16: Vyžaduje alespoň čtyři GPU NVIDIA B300 nebo osm H200. Jde o nákladnou konfiguraci, která je však dostupnější než infrastruktura potřebná pro Inkling .
LoRA v NVFP4: Dolaďování pomocí metody LoRA lze podle oficiálních konfigurací provádět na dvou GPU H200. LoRA upravuje jen malé adaptéry, nikoli všechny původní váhy, a proto je výrazně úspornější .
Infer ence v NVFP4: Režim W4A4 se vejde na jednu NVIDIA B300, pokud podporuje architekturu SM100+. Jde o první model Thinking Machines, který lze v oficiálně podporované konfiguraci provozovat na jediném špičkovém datacentrovém GPU .
Model podporuje numerické formáty BF16, MXFP8 a NVFP4 .
Dostupnost a cena
Thinking Machines zveřejnila plné váhy Inkling-Small na Hugging Face pod licencí Apache 2.0. Model je zároveň dostupný prostřednictvím vlastních služeb společnosti :
Hugging Face: stažení plných vah a vlastní provoz;
Tinker Playground: chatování s textovými, obrazovými a zvukovými vstupy;
Tinker API: nasazení modelu a dolaďování pomocí LoRA;
Cena výstupu v Tinker API: 1,20 USD za 1 milion tokenů .
Kdo za modelem stojí?
Thinking Machines Lab založila bývalá technická ředitelka OpenAI Mira Murati po svém odchodu z této společnosti. Spoluzakladatelem je také John Schulman, jeden z někdejších spoluzakladatelů OpenAI a člen týmu, který stál u rozvoje RLHF.
Lilian Weng, která byla původně součástí zakládajícího týmu, později z Thinking Machines Lab odešla a vrátila se do OpenAI. Mezi zbývajícími spoluzakladateli tak podle dodaného kontextu zůstávají Mira Murati a John Schulman .
Závěr: menší neznamená automaticky slabší
Inkling-Small je přesvědčivou ukázkou toho, že počet parametrů sám o sobě neurčuje praktickou užitečnost modelu. Přestože má jen zhruba čtvrtinovou celkovou velikost oproti Inklingu, překonává ho v textovém uvažování, programování a odborných vědeckých otázkách.
Jeho hlavní předností je kombinace výkonu a nižších hardwarových nároků: přibližně 600 GB v BF16 a 180 GB v NVFP4 představuje výrazný posun oproti 1,9 TB u původního modelu. Pro vývojáře, kteří chtějí model provozovat sami nebo si ho přizpůsobit pomocí LoRA, je proto Inkling-Small praktičtější volbou.
Kompromisem zůstává výrazně horší faktografické vybavování. Inkling-Small tedy není univerzálně lepší Inkling — je spíše efektivnější variantou optimalizovanou pro uvažování, programovací agenty a úlohy s dlouhým kontextem.