À titre de comparaison, son prédécesseur Inkling totalise 975 milliards de paramètres et en active 41 milliards par jeton. Inkling-Small représente donc environ un quart de la taille totale de son aîné, tout en l’égalant ou en le dépassant sur plusieurs évaluations importantes .
Le modèle accepte les entrées texte, image et audio, dispose d’une fenêtre de contexte pouvant atteindre 1 million de jetons et permet de régler l’intensité de son raisonnement afin d’arbitrer entre vitesse et profondeur d’analyse .
Inkling-Small prend l’avantage sur Inkling dans trois domaines particulièrement exigeants : le raisonnement général, la programmation assistée par agent et les connaissances scientifiques. En revanche, le grand modèle reste supérieur pour le rappel factuel et les mathématiques de compétition .
| Benchmark | Inkling-Small | Inkling | Écart |
|---|---|---|---|
| HLE, texte uniquement | 31,6 % | 29,7 % | +1,9 point |
| SWE-Bench Verified | 80,2 % | 77,6 % | +2,6 points |
| GPQA Diamond | 89,5 % | 87,2 % | +2,3 points |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 point |
| AIME 2026 | 95,5 % | 97,1 % | −1,6 point |
| SimpleQA Verified | 20,6 % | 43,9 % | −23,3 points |
Sources :
Autrement dit, le modèle « Small » n’est pas systématiquement meilleur. Il paraît surtout calibré pour les tâches où il faut raisonner, suivre des instructions complexes ou agir dans un environnement logiciel — plutôt que pour répondre à des questions factuelles simples avec une grande fiabilité.
Inkling-Small repose sur un Transformer MoE sparse de 42 couches. Pour chaque jeton, le système sélectionne 6 experts parmi 256, auxquels s’ajoutent 2 experts partagés . Il utilise également une attention hybride, combinant attention complète et fenêtres glissantes, ainsi qu’un mécanisme permettant de contrôler l’effort de réflexion .
Le principe d’un modèle MoE est de ne pas mobiliser tous ses paramètres pour chaque étape de génération. Inkling-Small conserve ainsi la capacité potentielle de ses 276 milliards de paramètres, mais son coût d’activation se rapproche davantage de celui d’un modèle dense de 12 milliards de paramètres.
L’architecture appartient à la même famille que celle d’Inkling, avec toutefois moins d’experts au total — 256, contre environ 576 pour le modèle original — et moins d’experts actifs par couche . Pour les développeurs, cela signifie une inférence moins lourde sans renoncer à une capacité globale de modèle très importante.
La performance d’Inkling-Small ne repose pas uniquement sur sa taille. Thinking Machines Lab a utilisé une méthode de post-entraînement en deux temps .
Le résultat est notable : après seulement deux semaines supplémentaires de renforcement, l’élève dépasse son professeur sur plusieurs évaluations. Cette observation rejoint les travaux récents sur la généralisation « du faible vers le fort » grâce à la distillation on-policy .
Le principal intérêt pratique d’Inkling-Small est peut-être matériel. Selon la fiche officielle du modèle, les besoins minimaux sont les suivants :
| Format | Mémoire vidéo cumulée | Configuration indicative |
|---|---|---|
| BF16 | Environ 600 Go | 4 GPU NVIDIA B300 ou 8 GPU H200 |
| NVFP4 (W4A16) | Environ 180 Go | 2 GPU NVIDIA H200 |
| NVFP4 (W4A4) | Environ 180 Go | 1 GPU NVIDIA B300, avec architecture SM100 ou ultérieure |
Le checkpoint BF16 d’Inkling nécessitait environ 1,9 To de VRAM cumulée, tandis que sa version quantifiée NVFP4 demandait environ 600 Go . Inkling-Small réduit donc fortement la barrière matérielle, même si ses besoins restent ceux d’une infrastructure de centre de données et non d’un ordinateur personnel classique.
Le modèle prend en charge les formats numériques BF16, MXFP8 et NVFP4 .
C’est cette combinaison entre poids ouverts, quantification et architecture MoE qui rend Inkling-Small plus réaliste à expérimenter pour des équipes qui ne pouvaient pas envisager Inkling et ses quelque 1,9 To de VRAM en BF16.
Inkling-Small est proposé sous plusieurs formes :
La disponibilité des poids complets distingue cette version de la préversion présentée lors du lancement initial d’Inkling, qui attendait encore la fin de ses tests .
Thinking Machines Lab a été fondé par Mira Murati, ancienne directrice technique d’OpenAI, après son départ de l’entreprise en 2024. John Schulman, ancien cofondateur d’OpenAI et membre clé de l’équipe à l’origine des travaux sur le RLHF, figure également parmi les cofondateurs .
Lilian Weng, qui faisait initialement partie de l’équipe fondatrice, a depuis quitté Thinking Machines Lab et rejoint de nouveau OpenAI. Le noyau des cofondateurs restant est donc composé de Mira Murati et de John Schulman .
Inkling-Small défend une idée simple : un modèle peut être nettement plus petit sans être nettement moins performant, à condition de bien répartir sa capacité et de soigner son post-entraînement.
Sur le raisonnement, la programmation agentique et les connaissances scientifiques, il dépasse même Inkling sur les évaluations communiquées. En contrepartie, il perd beaucoup de terrain sur le rappel factuel et cède légèrement en mathématiques de compétition.
Pour les développeurs qui souhaitent créer des assistants de code, des agents capables d’utiliser des outils ou des applications multimodales, Inkling-Small apparaît donc comme l’option la plus pragmatique de la gamme Thinking Machines Lab en juillet 2026. Ses besoins restent élevés — environ 600 Go en BF16 ou 180 Go en NVFP4 — mais ils sont nettement plus accessibles que les quelque 1,9 To requis par Inkling.