Для сравнения, первая модель компании, Inkling, располагает 975 млрд параметров, из которых активны примерно 41 млрд на токен. Несмотря на разницу почти в четыре раза по общему числу параметров, Inkling-Small сравнялась со старшей моделью или превзошла её в нескольких важных тестах .
Обе модели рассчитаны на мультимодальную работу: принимают текст, изображения и аудио, поддерживают контекст до 1 млн токенов и позволяют управлять интенсивностью «размышлений» — то есть выбирать компромисс между глубиной рассуждения, задержкой и стоимостью .
Inkling-Small не стала безоговорочной заменой Inkling: она выиграла в рассуждениях, программировании и научных вопросах, но уступила в математическом соревновании и особенно в воспроизведении фактов .
| Бенчмарк | Inkling-Small | Inkling | Разница |
|---|---|---|---|
| HLE, только текст | 31,6% | 29,7% | +1,9 п.п. |
| SWE-Bench Verified | 80,2% | 77,6% | +2,6 п.п. |
| GPQA Diamond | 89,5% | 87,2% | +2,3 п.п. |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | −1 пункт |
| AIME 2026 | 95,5% | 97,1% | −1,6 п.п. |
| SimpleQA Verified | 20,6% | 43,9% | −23,3 п.п. |
Иными словами, модель выглядит особенно убедительно там, где нужно не просто выдать знакомый факт, а выполнить последовательность действий: разобрать задачу, написать код или решить сложный научный вопрос. Для справочных сценариев, где критична точность коротких утверждений, Inkling остаётся более сильным вариантом.
Inkling-Small построена как 42-слойный разреженный MoE-трансформер. На каждом токене выбираются 6 экспертов из 256, дополнительно используются два общих эксперта . В архитектуре также применяется гибридное внимание — сочетание полноразмерного и скользящего оконного внимания — и настраиваемая интенсивность рассуждений .
Все 276 млрд параметров сохраняются в весах, но в конкретном вычислительном шаге участвует только часть модели. Поэтому нагрузка при инференсе ближе к нагрузке плотной модели примерно на 12 млрд параметров, тогда как общий набор экспертов даёт системе существенно большую ёмкость .
По сравнению с Inkling у новой модели меньше экспертов — 256 против примерно 576 — и меньше активных экспертов на слой. Именно это помогает снизить задержку и требования к оборудованию, не отказываясь от крупной общей параметрической ёмкости.
Thinking Machines Lab использовала двухэтапную схему посттренировки :
Результат примечателен: после короткого дополнительного этапа RL студент оказался сильнее учителя в нескольких задачах. Это согласуется с современными исследованиями weak-to-strong generalization — переносом полезных поведенческих изменений от менее мощной модели к более мощной или иначе обученной системе с помощью on-policy-дистилляции .
Главное практическое преимущество Inkling-Small — не только результаты в таблицах, но и более низкий порог для запуска и адаптации. Официальная карточка модели указывает следующие конфигурации :
| Формат | Совокупная видеопамять | Пример конфигурации |
|---|---|---|
| BF16 | около 600 ГБ | 4 × NVIDIA B300 или 8 × H200 |
| NVFP4 (W4A16) | около 180 ГБ | 2 × NVIDIA H200 |
| NVFP4 (W4A4) | около 180 ГБ | 1 × NVIDIA B300, требуется архитектура SM100+ |
Для BF16-чекпойнта Inkling требовалось около 1,9 ТБ совокупной VRAM, а его официальный вариант в NVFP4 занимал примерно 600 ГБ . У Inkling-Small этот показатель снижается примерно втрое.
Это всё ещё дата-центровый масштаб, а не запуск на обычном игровом компьютере. Однако модель становится заметно реалистичнее для средних исследовательских групп, университетских лабораторий и хорошо финансируемых стартапов, которым нужны LoRA-адаптация или полноценное дообучение без огромного многосерверного кластера . Поддерживаются форматы BF16, MXFP8 и NVFP4 .
Полные веса модели опубликованы на Hugging Face под лицензией Apache 2.0. Кроме самостоятельного развёртывания, доступны облачные варианты :
Открытые веса дают разработчикам возможность не ограничиваться готовым API: модель можно адаптировать под собственные данные и сценарии, если команда располагает необходимой инфраструктурой.
Thinking Machines Lab основала бывший технический директор OpenAI Мира Муратти после ухода из компании в 2024 году. Сооснователем также является Джон Шульман, один из бывших руководителей команды OpenAI, занимавшейся RLHF — обучением с подкреплением на основе обратной связи от людей .
Лилиан Венг, первоначально входившая в команду основателей, позднее покинула Thinking Machines Lab и вернулась в OpenAI. В результате среди оставшихся сооснователей стартапа называются Мира Муратти и Джон Шульман .
Inkling-Small показывает, что размер модели сам по себе не определяет её результат в каждом сценарии. При примерно четверти общего числа параметров Inkling она обошла старшую модель в Humanity’s Last Exam, SWE-Bench Verified и GPQA Diamond, а в сводном индексе отстала всего на один балл.
Компромисс очевиден: более слабый результат в SimpleQA Verified означает, что для задач, требующих надёжного фактического воспроизведения, Inkling по-прежнему предпочтительнее. Но для программирования, сложных рассуждений и агентных рабочих процессов Inkling-Small выглядит более практичным открытым вариантом. Снижение требований с примерно 1,9 ТБ до 600 ГБ в BF16 или 180 ГБ в NVFP4 делает её существенно доступнее для команд, которые не могли позволить себе инфраструктуру для запуска Inkling.