Inkling-Small: менша модель Thinking Machines випереджає Inkling у міркуванні та програмуванні
Inkling Small, випущена 30 липня 2026 року, має 276 млрд загальних параметрів, але використовує лише 12 млрд на кожен токен. Модель навчають у два етапи: спочатку дистиляцією на власних траєкторіях під наглядом Inkling, а потім двома тижнями підсилювального навчання для агентних завдань.
ОпублікувавВідредаговано за допомогою DeepSeek-V4-FlashЗображення створено за допомогою GPT Image 1.5
Inkling Small, випущена 30 липня 2026 року, має 276 млрд загальних параметрів, але використовує лише 12 млрд на кожен токен.
Модель навчають у два етапи: спочатку дистиляцією на власних траєкторіях під наглядом Inkling, а потім двома тижнями підсилювального навчання для агентних завдань.
Для запуску Inkling Small потрібно близько 600 ГБ VRAM у BF16 або 180 ГБ у NVFP4 — проти приблизно 1,9 ТБ для BF16 версії Inkling.
What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active paInkling-Small (276B total, 12B active) beats Inkling (975B total, 41B active) on reasoning, coding, and science benchmarks while requiring a fraction of the VRAM.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active pa. Article summary: Now I have all the key data. Let me compile the answer.. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
openai.com
Що таке Inkling-Small
Inkling-Small — це розріджена трансформерна модель класу Mixture of Experts (MoE), яку Thinking Machines Lab випустила 30 липня 2026 року за ліберальною ліцензією Apache 2.0. У її вагових коефіцієнтах міститься 276 млрд параметрів, однак для обробки кожного токена активуються лише 12 млрд. Така архітектура дає моделі велику ємність, але зменшує обчислювальні витрати під час роботи .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Inkling-Small: менша модель Thinking Machines випереджає Inkling у міркуванні та програмуванні"?
Inkling Small, випущена 30 липня 2026 року, має 276 млрд загальних параметрів, але використовує лише 12 млрд на кожен токен.
What are the key points to validate first?
Inkling Small, випущена 30 липня 2026 року, має 276 млрд загальних параметрів, але використовує лише 12 млрд на кожен токен. Модель навчають у два етапи: спочатку дистиляцією на власних траєкторіях під наглядом Inkling, а потім двома тижнями підсилювального навчання для агентних завдань.
What should I do next in practice?
Для запуску Inkling Small потрібно близько 600 ГБ VRAM у BF16 або 180 ГБ у NVFP4 — проти приблизно 1,9 ТБ для BF16 версії Inkling.
Для порівняння, старша Inkling має 975 млрд загальних і 41 млрд активних параметрів. Попри приблизно чверть від її розміру, Inkling-Small не просто наближається до результатів старшої моделі, а й випереджає її в низці тестів на міркування, програмування та наукові знання .
Модель приймає текстові, зображувальні та аудіовхідні дані, підтримує контекстне вікно до 1 млн токенів і дає змогу регулювати «зусилля мислення» — тобто балансувати між глибиною міркувань, затримкою та витратами обчислень .
Результати тестів: де менша модель сильніша
Inkling-Small випередила Inkling у трьох важливих публічних тестах, але поступилася їй у точному відтворенні фактів і змагальній математиці .
Тест
Inkling-Small
Inkling
Різниця
HLE, лише текст
31,6%
29,7%
+1,9 в. п.
SWE-Bench Verified
80,2%
77,6%
+2,6 в. п.
GPQA Diamond
89,5%
87,2%
+2,3 в. п.
Artificial Analysis Intelligence Index v4.1
40
41
−1 бал
AIME 2026
95,5%
97,1%
−1,6 в. п.
SimpleQA Verified
20,6%
43,9%
−23,3 в. п.
Що означають ці цифри
Міркування. У Humanity’s Last Exam (текстова версія) Inkling-Small набрала 31,6% проти 29,7% в Inkling. Перевага зберігалася за різних рівнів обчислювального бюджету на міркування .
Програмування та AI-агенти. У SWE-Bench Verified модель показала 80,2%. Тест проводили в середовищі лише з Bash і з траєкторією завдовжки 256 тисяч токенів; результат на 2,6 відсоткового пункта вищий за Inkling .
Наукові завдання. У GPQA Diamond — тесті з питань рівня аспірантури з природничих наук — Inkling-Small отримала 89,5% проти 87,2% у старшої моделі .
Фактична точність. У SimpleQA Verified перевага Inkling є значною: 43,9% проти 20,6%. Це показує компроміс: нову модель оптимізували передусім для міркування й агентних сценаріїв, а не для механічного запам’ятовування та відтворення фактів .
Зведений індекс. У сторонньому Artificial Analysis Intelligence Index v4.1 Inkling-Small набрала 40 балів — лише на один бал менше за Inkling .
Отже, слово «Small» у назві не означає, що модель можна запускати на звичайному ноутбуці. Йдеться про меншу модель у порівнянні з майже трильйонною Inkling, а не про компактну споживчу нейромережу.
Як працює MoE-архітектура на 276 млрд параметрів
Inkling-Small — це 42-шарова розріджена MoE-трансформерна модель. У кожному шарі на один токен обираються 6 із 256 експертів, а також використовуються 2 спільні експерти .
У MoE-моделі не всі параметри беруть участь у кожній операції. Маршрутизатор обирає лише частину спеціалізованих експертів для конкретного фрагмента вхідних даних. Тому Inkling-Small має ємність моделі на 276 млрд параметрів, але за обчислювальним навантаженням під час інференсу поводиться значно ближче до щільної моделі на 12 млрд активних параметрів.
Модель належить до тієї самої MoE-родини, що й Inkling, але використовує менше експертів — 256 проти приблизно 576 у старшої моделі — і менше активних експертів на шар. Вона також поєднує повну та віконну увагу й підтримує регульовану глибину міркувань .
Дистиляція на власних траєкторіях від Inkling. Раніший чекпойнт Inkling-Small генерував власні послідовності дій, а Inkling виступала моделлю-вчителем і надавала щільний зворотний зв’язок на рівні токенів. Такий підхід називають дистиляцією на власній політиці, або on-policy distillation (OPD) . Учень навчається на ситуаціях, які виникли з його власних відповідей, але отримує підказки від сильнішої моделі на кожному кроці.
Ще два тижні підсилювального навчання для агентів. Команда продовжила масштабувати RL-тренування для агентних сценаріїв програмування. Саме цей етап, за даними Thinking Machines, допоміг Inkling-Small обійти Inkling у тестах на міркування та кодинг .
Результат особливо показовий: менша модель перевершила модель-вчителя в кількох завданнях після короткого додаткового циклу підсилювального навчання. Він узгоджується з новими дослідженнями слабшої-на-сильнішу генералізації через on-policy distillation .
Вимоги до обладнання: приблизно утричі менше VRAM
Головна практична перевага Inkling-Small — помітно нижчий поріг для запуску та донавчання. Офіційна картка моделі наводить такі конфігурації :
Формат
Сумарна VRAM
Приклад конфігурації
BF16
близько 600 ГБ
4 × NVIDIA B300 або 8 × H200
NVFP4 (W4A16)
близько 180 ГБ
2 × NVIDIA H200
NVFP4 (W4A4)
близько 180 ГБ
1 × NVIDIA B300, потрібна архітектура SM100+
Для BF16-чекпойнта Inkling потрібно було приблизно 1,9 ТБ сумарної VRAM. Офіційна квантизована версія Inkling у NVFP4 потребувала близько 600 ГБ .
Таким чином, Inkling-Small стає першою моделлю Thinking Machines, яку середні за розміром команди можуть розглядати для LoRA та повного донавчання без величезного багатовузлового кластера. Вона підтримує числові формати BF16, MXFP8 і NVFP4 .
Що це означає для донавчання
Повне донавчання у BF16: потрібен кластер із 4 GPU B300 або 8 GPU H200. Це все ще дорога конфігурація, але вона доступніша для добре профінансованих стартапів і університетських лабораторій .
LoRA-донавчання у NVFP4: можливе на 2 GPU H200. LoRA — це метод, за якого базові ваги заморожуються, а навчаються лише невеликі адаптери, тому потреба в пам’яті значно зменшується .
Інференс у NVFP4: у режимі W4A4 модель може працювати на одному GPU NVIDIA B300. Це перша модель Thinking Machines, яку офіційно можна запускати на одному потужному серверному GPU .
Де доступна модель і скільки коштує API
Inkling-Small доступна в кількох форматах :
Повні ваги: опубліковані на Hugging Face за ліцензією Apache 2.0.
Tinker Playground: чат із моделлю через текст, зображення та аудіо.
Tinker API: донавчання моделі за допомогою LoRA.
Використання API: вартість вихідних даних становить 1,20 долара за 1 млн токенів .
Ліцензія Apache 2.0 дозволяє розробникам завантажувати ваги, модифікувати їх і вбудовувати модель у власні продукти з дотриманням умов ліцензії. Водночас вимоги до GPU означають, що «відкриті ваги» не дорівнюють запуску на домашньому комп’ютері.
Контекст керівництва Thinking Machines Lab
Thinking Machines Lab заснувала колишня технічна директорка OpenAI Міра Мураті після її відходу з OpenAI у 2024 році. Співзасновником також є Джон Шульман, колишній співзасновник OpenAI та учасник команди, яка працювала над RLHF.
Ліліан Венг, яка спочатку входила до команди засновників, згодом залишила Thinking Machines Lab і повернулася до OpenAI. Після цього серед співзасновників стартапу залишилися Міра Мураті та Джон Шульман .
Висновок
Inkling-Small демонструє, що розмір моделі не завжди прямо визначає її результат у конкретному завданні. Завдяки MoE-архітектурі, дистиляції на власній політиці та двом тижням агентного підсилювального навчання модель на 276 млрд параметрів перевершила Inkling на тестах міркування, програмування й наукових знань.
Ціна цього результату — слабша фактична пам’ять: у SimpleQA Verified Inkling зберігає переконливу перевагу. Але для команд, яким потрібна модель із відкритими вагами для кодування, міркування та виконання інструкцій, Inkling-Small виглядає практичніше за Inkling. Її вимоги знижуються з приблизно 1,9 ТБ VRAM до 600 ГБ у BF16 або 180 ГБ у NVFP4 — усе ще рівень серверної інфраструктури, але вже значно реалістичніший для середніх команд станом на липень 2026 року.