Inkling-Small è stato rilasciato il 30 luglio 2026 con licenza permissiva Apache 2.0, che consente di utilizzare, modificare e redistribuire il modello nel rispetto dei relativi termini .
Il modello più piccolo supera Inkling in tre aree particolarmente rilevanti: ragionamento, coding su repository reali e conoscenza scientifica. Il vantaggio, tuttavia, non è uniforme: Inkling conserva un margine netto nel richiamo di fatti e un vantaggio più contenuto nella matematica competitiva .
| Benchmark | Inkling-Small | Inkling | Differenza |
|---|---|---|---|
| HLE, solo testo | 31,6% | 29,7% | +1,9 punti percentuali |
| SWE-Bench Verified | 80,2% | 77,6% | +2,6 punti percentuali |
| GPQA Diamond | 89,5% | 87,2% | +2,3 punti percentuali |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 punto |
| AIME 2026 | 95,5% | 97,1% | −1,6 punti percentuali |
| SimpleQA Verified | 20,6% | 43,9% | −23,3 punti percentuali |
Fonti:
Su Humanity’s Last Exam, nella versione solo testo, Inkling-Small raggiunge il 31,6%, contro il 29,7% di Inkling. Secondo Thinking Machines Lab, il vantaggio rimane presente anche variando il budget di ragionamento, cioè la quantità di elaborazione che il modello può dedicare alla soluzione .
Nel test scientifico GPQA Diamond, composto da domande di livello avanzato, il modello raggiunge l’89,5%, superando l’87,2% di Inkling .
Nel benchmark SWE-Bench Verified, che misura la capacità di risolvere problemi reali in repository software, Inkling-Small ottiene l’80,2%, contro il 77,6% del modello più grande . La valutazione è stata eseguita con un harness bash-only e traiettorie fino a 256.000 token: il dato va quindi interpretato nel contesto della configurazione usata, non come una garanzia di prestazioni identiche in ogni ambiente di sviluppo .
Il limite più evidente emerge in SimpleQA Verified, dove Inkling-Small si ferma al 20,6%, mentre Inkling arriva al 43,9% . In altre parole, il modello più piccolo sembra essere stato ottimizzato maggiormente per ragionamento e comportamento agentico, pagando un prezzo nel richiamo fattuale diretto.
Anche in AIME 2026 Inkling conserva un vantaggio: 97,1% contro il 95,5% di Inkling-Small . Nell’Artificial Analysis Intelligence Index v4.1, invece, la distanza è minima: 40 punti per il nuovo modello contro 41 per Inkling .
Inkling-Small è un transformer MoE sparso composto da 42 livelli. Per ogni token vengono attivati 6 esperti su 256, oltre a 2 esperti condivisi .
In un modello denso, ogni token attraversa sostanzialmente lo stesso insieme di parametri. In un’architettura Mixture-of-Experts, invece, un router seleziona soltanto alcuni “esperti” specializzati per ciascun token. Il modello può così mantenere una grande capacità complessiva senza usare tutti i parametri a ogni passaggio.
Nel caso di Inkling-Small:
Il modello supporta inoltre input di testo, immagini e audio, con una finestra di contesto fino a un milione di token .
Il risultato non dipende soltanto dall’architettura. Thinking Machines Lab ha utilizzato una procedura di post-training in due passaggi .
In una normale distillazione, un modello più piccolo impara spesso imitando risposte già generate da un modello maestro. La distillazione on-policy aggiunge un elemento importante: è lo studente stesso a generare le proprie traiettorie, mentre il modello insegnante fornisce una supervisione densa a livello di token .
In questo caso, Inkling-Small ha appreso da Inkling, ricevendo indicazioni anche sui passaggi intermedi del ragionamento. L’approccio combina il feedback dettagliato della distillazione con la distribuzione più realistica delle situazioni generate direttamente dal modello studente.
Dopo la distillazione, Thinking Machines ha proseguito per altre due settimane con reinforcement learning focalizzato sui compiti agentici, in particolare sul coding e sull’uso di strumenti .
Secondo il laboratorio, questa seconda fase ha contribuito a portare Inkling-Small davanti al suo insegnante nei test di ragionamento e coding. Il risultato si inserisce in una linea di ricerca più ampia sulla generalizzazione “weak-to-strong”, in cui tecniche apprese da modelli più deboli o più economici vengono trasferite a sistemi più capaci .
Il punto di forza più concreto di Inkling-Small è la riduzione della memoria necessaria per eseguire e personalizzare il modello.
| Formato | VRAM aggregata | Configurazione d’esempio |
|---|---|---|
| BF16 | circa 600 GB | 4 GPU NVIDIA B300 oppure 8 H200 |
| NVFP4, W4A16 | circa 180 GB | 2 GPU NVIDIA H200 |
| NVFP4, W4A4 | circa 180 GB | 1 GPU NVIDIA B300, con architettura SM100 o superiore |
Il checkpoint BF16 di Inkling richiedeva circa 1,9 TB di VRAM aggregata, mentre la versione quantizzata NVFP4 del modello principale richiedeva circa 600 GB . Per Inkling-Small, il requisito scende quindi a circa un terzo in BF16 e a circa 180 GB con NVFP4 .
Il modello supporta i formati numerici BF16, MXFP8 e NVFP4 .
Questo non significa che Inkling-Small sia un modello “leggero” nel senso comune del termine: 180 GB o 600 GB di VRAM restano requisiti da infrastruttura professionale. La differenza è che il modello diventa più realistico per team di medie dimensioni, senza dover ricorrere necessariamente a grandi cluster multi-nodo.
Inkling-Small è disponibile attraverso più canali :
Thinking Machines Lab è stata fondata da Mira Murati, ex CTO di OpenAI, dopo la sua uscita dall’azienda. Tra i cofondatori figura anche John Schulman, già cofondatore di OpenAI e membro del team che ha lavorato sul reinforcement learning from human feedback, o RLHF .
Lilian Weng, inizialmente parte del gruppo fondatore, ha in seguito lasciato Thinking Machines Lab ed è tornata in OpenAI. La struttura dei cofondatori rimasti è quindi oggi incentrata su Murati e Schulman .
Inkling-Small non è semplicemente una versione ridotta di Inkling. È un esempio di come architettura MoE, distillazione on-policy e reinforcement learning mirato possano spostare il rapporto tra dimensioni del modello e prestazioni.
Con un quarto dei parametri totali di Inkling e soltanto 12 miliardi attivi per token, il modello supera il fratello maggiore in ragionamento, coding agentico e scienza. Il prezzo da pagare è soprattutto nella factuality: per domande che richiedono un richiamo preciso di informazioni, Inkling resta nettamente più affidabile nei benchmark disponibili.
Per chi sviluppa agenti, strumenti di coding o applicazioni multimodali e dispone di un’infrastruttura professionale, Inkling-Small è però la proposta più pratica della famiglia Thinking Machines. Il requisito scende da circa 1,9 TB a 600 GB in BF16, o a circa 180 GB in NVFP4: non abbastanza per un normale computer domestico, ma una differenza sostanziale per startup, laboratori e team tecnici di medie dimensioni.