El modelo equivale aproximadamente a una cuarta parte del tamaño de Inkling, el modelo anterior de la compañía, que tiene 975.000 millones de parámetros totales y 41.000 millones activos. Aun así, Inkling-Small iguala o supera a su hermano mayor en varias pruebas de razonamiento, programación y conocimiento científico, con unos requisitos de hardware mucho más bajos .
También admite entradas de texto, imágenes y audio, ofrece una ventana de contexto de hasta un millón de tokens y permite controlar el esfuerzo de razonamiento para intercambiar profundidad por latencia .
Los resultados dibujan un perfil bastante claro: Inkling-Small está especialmente bien posicionado para tareas de razonamiento y agentes de programación, pero sacrifica rendimiento en la recuperación factual directa y en las matemáticas de competición .
| Prueba | Inkling-Small | Inkling | Diferencia |
|---|---|---|---|
| HLE, solo texto | 31,6% | 29,7% | +1,9 puntos porcentuales |
| SWE-Bench Verified | 80,2% | 77,6% | +2,6 puntos porcentuales |
| GPQA Diamond | 89,5% | 87,2% | +2,3 puntos porcentuales |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 punto |
| AIME 2026 | 95,5% | 97,1% | −1,6 puntos porcentuales |
| SimpleQA Verified | 20,6% | 43,9% | −23,3 puntos porcentuales |
Fuentes:
En Humanity’s Last Exam (HLE), una evaluación diseñada para medir conocimientos y razonamiento avanzados, Inkling-Small obtiene un 31,6% en la versión de solo texto, frente al 29,7% de Inkling. Thinking Machines afirma que la ventaja se mantiene con distintos niveles de esfuerzo de razonamiento .
En SWE-Bench Verified, que evalúa si un agente puede resolver problemas reales de repositorios de software, el modelo alcanza el 80,2%, frente al 77,6% de Inkling. La comparación se realizó con un arnés de evaluación basado únicamente en Bash y trayectorias de hasta 256.000 tokens .
Inkling-Small también se impone en GPQA Diamond, una prueba de preguntas científicas de nivel avanzado: 89,5% frente a 87,2% .
La contrapartida aparece en SimpleQA Verified, una prueba de recuperación factual. Inkling-Small logra solo un 20,6%, mientras que Inkling llega al 43,9%. El resultado sugiere un intercambio entre optimizar el razonamiento y conservar una memoria factual más sólida, aunque las puntuaciones de los benchmarks no permiten por sí solas establecer una causa definitiva .
En AIME 2026, Inkling también conserva la ventaja: 97,1% frente a 95,5%. En el índice independiente Artificial Analysis Intelligence Index v4.1, la distancia es mínima: 40 puntos para Inkling-Small y 41 para Inkling .
Inkling-Small utiliza un Transformer MoE disperso de 42 capas. En cada token se activan 6 de 256 expertos, además de 2 expertos compartidos . Un modelo MoE puede almacenar muchos expertos especializados, pero seleccionar solo una parte de ellos para cada fragmento de texto o entrada multimodal.
Por eso conviene distinguir entre sus dos cifras de parámetros:
El diseño pertenece a la misma familia de MoE que Inkling, pero utiliza menos expertos totales —256 frente a los aproximadamente 576 de Inkling— y activa menos expertos por capa. El resultado busca ofrecer una latencia y un coste de inferencia más cercanos a los de un modelo denso de 12.000 millones de parámetros, manteniendo una capacidad total muy superior en sus pesos .
La arquitectura combina atención completa y atención de ventana deslizante. Además, el esfuerzo de razonamiento configurable permite que los desarrolladores decidan cuánto tiempo y cómputo dedicar a una respuesta .
Thinking Machines empleó una receta de dos pasos para convertir el modelo en un sistema más eficaz en tareas de razonamiento y uso de herramientas .
El resultado es relevante porque el modelo más pequeño terminó superando a su profesor en varias tareas después de un periodo relativamente corto de aprendizaje por refuerzo. El enfoque coincide con una línea de investigación reciente sobre cómo transferir capacidades de modelos más fuertes a otros más pequeños mediante entrenamiento on-policy .
La principal diferencia práctica frente a Inkling está en la memoria necesaria para ejecutar y adaptar el modelo. Estas son las configuraciones oficiales indicadas en la tarjeta del modelo :
| Formato | Memoria de vídeo agregada | Configuración de ejemplo |
|---|---|---|
| BF16 | Aproximadamente 600 GB | 4 GPU NVIDIA B300 u 8 H200 |
| NVFP4 (W4A16) | Aproximadamente 180 GB | 2 GPU NVIDIA H200 |
| NVFP4 (W4A4) | Aproximadamente 180 GB | 1 GPU NVIDIA B300; requiere arquitectura SM100 o posterior |
El checkpoint BF16 de Inkling necesitaba alrededor de 1,9 TB de VRAM agregada, mientras que su variante oficial cuantizada en NVFP4 requería unos 600 GB . En comparación, Inkling-Small reduce aproximadamente tres veces la memoria necesaria en BF16 y permite bajar hasta unos 180 GB con NVFP4.
La diferencia no convierte al modelo en una opción para un ordenador personal convencional: sigue necesitando GPU de centro de datos de alta gama. Pero sí reduce el umbral para equipos medianos, laboratorios universitarios y empresas que quieran ajustar un modelo abierto sin desplegar clústeres enormes .
Inkling-Small admite los formatos numéricos BF16, MXFP8 y NVFP4 .
El modelo está disponible a través de varias vías :
La licencia Apache 2.0 permite utilizar, modificar y redistribuir el modelo con pocas restricciones en comparación con licencias más limitadas. Aun así, el coste total de operarlo depende también de la infraestructura, la longitud del contexto y el nivel de esfuerzo de razonamiento elegido.
Thinking Machines Lab fue fundada por Mira Murati, exdirectora de tecnología de OpenAI, después de su salida de esa compañía. John Schulman, antiguo cofundador de OpenAI y miembro destacado del equipo que trabajó en RLHF, también figura como cofundador .
Lilian Weng, que inicialmente formó parte del equipo fundador, dejó posteriormente Thinking Machines Lab y regresó a OpenAI. Con ello, Mira Murati y John Schulman quedan como los cofundadores que permanecen en la startup, según el contexto de la cobertura disponible .
Inkling-Small plantea una idea sencilla pero importante: el tamaño total de un modelo no determina por sí solo cuánto cuesta utilizarlo ni qué rendimiento tendrá en cada tarea. Con una cuarta parte de los parámetros totales de Inkling y solo 12.000 millones activos por token, el modelo supera a su hermano mayor en razonamiento, programación con agentes y ciencia.
No es, sin embargo, un reemplazo universal. Su caída en SimpleQA Verified muestra que Inkling sigue siendo mucho mejor para recuperar datos concretos. La elección dependerá del uso: para agentes de código, razonamiento e instrucciones con restricciones de hardware, Inkling-Small parece la opción más práctica; para tareas que exigen una recuperación factual sólida, Inkling conserva una ventaja clara a fecha de julio de 2026.