Na prática, ele tem cerca de um quarto do tamanho total do Inkling, modelo anterior da empresa, que conta com 975 bilhões de parâmetros e ativa 41 bilhões por token. Mesmo assim, o Inkling-Small iguala ou supera o modelo maior em alguns dos principais testes de raciocínio, programação e conhecimento científico .
O modelo aceita entradas de texto, imagem e áudio, oferece uma janela de contexto de até 1 milhão de tokens e permite controlar o esforço de raciocínio — recurso que ajuda desenvolvedores a equilibrar qualidade, latência e custo .
Os resultados divulgados mostram uma troca clara: o Inkling-Small é mais forte em raciocínio e programação agentiva, mas perde terreno em recuperação factual e matemática competitiva .
| Benchmark | Inkling-Small | Inkling | Diferença |
|---|---|---|---|
| HLE — somente texto | 31,6% | 29,7% | +1,9 p.p. |
| SWE-Bench Verified | 80,2% | 77,6% | +2,6 p.p. |
| GPQA Diamond | 89,5% | 87,2% | +2,3 p.p. |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 ponto |
| AIME 2026 | 95,5% | 97,1% | −1,6 p.p. |
| SimpleQA Verified | 20,6% | 43,9% | −23,3 p.p. |
Fontes:
Os principais pontos são:
Portanto, “Small” não significa necessariamente menos capacidade em todas as tarefas. Para programação, uso de ferramentas e problemas de raciocínio, o modelo menor pode ser a opção mais eficiente. Para respostas factuais diretas e matemática competitiva, porém, o Inkling continua à frente.
O Inkling-Small é um transformer MoE esparso com 42 camadas. Em cada token, são ativados seis de 256 especialistas, além de dois especialistas compartilhados .
Em um modelo denso, praticamente todos os parâmetros participam do processamento de cada token. No MoE, diferentes “especialistas” são selecionados conforme a entrada. Assim, o Inkling-Small mantém 276 bilhões de parâmetros nos pesos, mas usa cerca de 12 bilhões durante cada etapa de inferência.
A arquitetura pertence à mesma família do Inkling, mas tem menos especialistas totais — 256, contra aproximadamente 576 no modelo maior — e ativa menos especialistas por camada. O sistema também usa atenção híbrida, combinando atenção completa e janelas deslizantes, além de oferecer esforço de raciocínio ajustável .
A Thinking Machines adotou uma receita de pós-treinamento em duas fases :
O resultado é relevante porque o modelo menor ultrapassou seu professor em várias tarefas após apenas duas semanas adicionais de aprendizado por reforço. A estratégia também se alinha a pesquisas recentes sobre generalização de modelos menores para modelos mais fortes por meio da destilação on-policy .
A principal vantagem prática do Inkling-Small está no custo de execução. As configurações oficiais divulgadas na documentação do modelo são :
| Formato | VRAM agregada | Configuração de exemplo |
|---|---|---|
| BF16 | Cerca de 600 GB | 4 GPUs NVIDIA B300 ou 8 H200 |
| NVFP4 (W4A16) | Cerca de 180 GB | 2 GPUs NVIDIA H200 |
| NVFP4 (W4A4) | Cerca de 180 GB | 1 GPU NVIDIA B300, com arquitetura SM100 ou superior |
Para comparação, o checkpoint BF16 do Inkling exige aproximadamente 1,9 TB de VRAM agregada . Sua variante oficial quantizada em NVFP4 requer cerca de 600 GB .
A redução para 600 GB em BF16 — ou 180 GB em NVFP4 — não transforma o modelo em uma solução para computadores pessoais, mas muda o público que pode considerá-lo viável. Equipes de médio porte, startups bem financiadas e laboratórios universitários podem avaliar inferência e personalização sem recorrer necessariamente a clusters enormes com muitos nós .
O modelo oferece suporte a BF16, MXFP8 e NVFP4 . Ainda assim, os requisitos continuam muito acima dos de modelos abertos menores: os 12 bilhões de parâmetros ativos não eliminam a necessidade de carregar e distribuir o checkpoint completo.
O Inkling-Small está disponível por diferentes caminhos :
A Thinking Machines Lab foi fundada pela ex-diretora de tecnologia da OpenAI Mira Murati, após sua saída da empresa em 2024. John Schulman, ex-cofundador da OpenAI e integrante da equipe responsável pelo RLHF, também está entre os fundadores.
Lilian Weng, que inicialmente fazia parte da equipe fundadora, deixou a Thinking Machines Lab e retornou à OpenAI. Com isso, Mira Murati e John Schulman são os cofundadores que permanecem à frente da startup .
O Inkling-Small apresenta uma tese forte: um modelo com cerca de um quarto do tamanho total do Inkling pode alcançar desempenho semelhante — e até superior — em tarefas de raciocínio e programação agentiva quando recebe o pós-treinamento adequado.
Para organizações que não conseguem justificar os cerca de 1,9 TB de VRAM necessários pelo Inkling em BF16, o novo modelo reduz o ponto de entrada para aproximadamente 600 GB em BF16 ou 180 GB em NVFP4. A contrapartida é uma queda expressiva em recuperação factual, além de um desempenho um pouco inferior em AIME 2026.
Em resumo, para código, raciocínio e fluxos que dependem de agentes, o Inkling-Small surge como a alternativa de pesos abertos mais prática da Thinking Machines em julho de 2026. Para consultas factuais diretas, o Inkling maior ainda é a escolha mais segura entre os dois.