Inkling-Small: छोटा मॉडल, बड़ी चुनौती—रीजनिंग और कोडिंग में Inkling से आगे
Thinking Machines Lab ने 30 जुलाई 2026 को Inkling Small जारी किया। यह 276B कुल पैरामीटर वाला MoE मॉडल है, जिसमें हर टोकन पर केवल 12B पैरामीटर सक्रिय होते हैं। मॉडल ने Humanity's Last Exam में 31.6% और SWE Bench Verified में 80.2% स्कोर किया—दोनों मामलों में बड़े Inkling के 29.7% और 77.6% से बेहतर प्रदर्शन किया। दो च...
प्रकाशितकर्ताDeepSeek-V4-Flash से संपादितGPT Image 1.5 से चित्र बनाए गए
Thinking Machines Lab ने 30 जुलाई 2026 को Inkling Small जारी किया। यह 276B कुल पैरामीटर वाला MoE मॉडल है, जिसमें हर टोकन पर केवल 12B पैरामीटर सक्रिय होते हैं।
मॉडल ने Humanity's Last Exam में 31.6% और SWE Bench Verified में 80.2% स्कोर किया—दोनों मामलों में बड़े Inkling के 29.7% और 77.6% से बेहतर प्रदर्शन किया।
दो चरणों वाली पोस्ट ट्रेनिंग—Inkling से on policy distillation और उसके बाद दो सप्ताह की agent focused reinforcement learning—इस प्रदर्शन सुधार की अहम वजह है।
Inkling Small को BF16 में लगभग 600 GB और NVFP4 में लगभग 180 GB aggregated VRAM चाहिए, जिससे mid sized टीमों के लिए LoRA और full parameter fine tuning अधिक व्यावहारिक बनती है।
What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active paInkling-Small (276B total, 12B active) beats Inkling (975B total, 41B active) on reasoning, coding, and science benchmarks while requiring a fraction of the VRAM.
AI संकेत
Create a landscape editorial hero image for this Studio Global article: What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active pa. Article summary: Now I have all the key data. Let me compile the answer.. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
openai.com
Inkling-Small क्या है?
Inkling-Small Thinking Machines Lab का sparse Mixture-of-Experts (MoE) transformer मॉडल है, जिसे 30 जुलाई 2026 को permissive Apache 2.0 लाइसेंस के तहत जारी किया गया। इसमें कुल 276 अरब पैरामीटर हैं, लेकिन किसी एक टोकन को प्रोसेस करते समय लगभग 12 अरब पैरामीटर ही सक्रिय होते हैं। यही डिजाइन बड़े मॉडल जैसी क्षमता को कम compute लागत में उपलब्ध कराने का लक्ष्य रखती है ।
Studio Global AI
अपना शोध जारी रखें
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
"Inkling-Small: छोटा मॉडल, बड़ी चुनौती—रीजनिंग और कोडिंग में Inkling से आगे" का संक्षिप्त उत्तर क्या है?
Thinking Machines Lab ने 30 जुलाई 2026 को Inkling Small जारी किया। यह 276B कुल पैरामीटर वाला MoE मॉडल है, जिसमें हर टोकन पर केवल 12B पैरामीटर सक्रिय होते हैं।
सबसे पहले सत्यापित करने योग्य मुख्य बिंदु क्या हैं?
Thinking Machines Lab ने 30 जुलाई 2026 को Inkling Small जारी किया। यह 276B कुल पैरामीटर वाला MoE मॉडल है, जिसमें हर टोकन पर केवल 12B पैरामीटर सक्रिय होते हैं। मॉडल ने Humanity's Last Exam में 31.6% और SWE Bench Verified में 80.2% स्कोर किया—दोनों मामलों में बड़े Inkling के 29.7% और 77.6% से बेहतर प्रदर्शन किया।
मुझे अभ्यास में आगे क्या करना चाहिए?
दो चरणों वाली पोस्ट ट्रेनिंग—Inkling से on policy distillation और उसके बाद दो सप्ताह की agent focused reinforcement learning—इस प्रदर्शन सुधार की अहम वजह है।
तुलना के लिए, मूल Inkling में 975 अरब कुल और 41 अरब active पैरामीटर हैं। आकार में लगभग एक-चौथाई होने के बावजूद Inkling-Small कई महत्वपूर्ण बेंचमार्क में अपने बड़े मॉडल से बराबर या बेहतर प्रदर्शन करता है। इसे चलाने और fine-tune करने के लिए भी काफी कम हार्डवेयर चाहिए ।
मॉडल टेक्स्ट, इमेज और ऑडियो इनपुट ले सकता है, इसमें 10 लाख टोकन का context window है और डेवलपर इसकी ‘thinking effort’ यानी सोचने की गहराई को नियंत्रित कर सकते हैं ।
बेंचमार्क में कहां आगे, कहां पीछे?
Inkling-Small ने reasoning, coding और graduate-level science जैसे कार्यों में Inkling को पीछे छोड़ा है। हालांकि factual recall और competition mathematics में बड़ा Inkling अभी मजबूत है ।
बेंचमार्क
Inkling-Small
Inkling
अंतर
HLE (केवल टेक्स्ट)
31.6%
29.7%
+1.9 प्रतिशत अंक
SWE-Bench Verified
80.2%
77.6%
+2.6 प्रतिशत अंक
GPQA Diamond
89.5%
87.2%
+2.3 प्रतिशत अंक
AA Index v4.1
40
41
–1 अंक
AIME 2026
95.5%
97.1%
–1.6 प्रतिशत अंक
SimpleQA Verified
20.6%
43.9%
–23.3 प्रतिशत अंक
स्रोत:
मुख्य नतीजे
रीजनिंग: Humanity's Last Exam के text-only संस्करण में Inkling-Small ने 31.6% स्कोर किया, जबकि Inkling का स्कोर 29.7% था। Thinking Machines के अनुसार यह बढ़त अलग-अलग thinking budgets पर भी बनी रहती है ।
कोडिंग एजेंट: SWE-Bench Verified में मॉडल ने 80.2% हासिल किया। यह bash-only harness और 256K trajectory कॉन्फिगरेशन पर दर्ज नतीजा है ।
विज्ञान: GPQA Diamond में 89.5% स्कोर के साथ Inkling-Small, Inkling के 87.2% से आगे रहा ।
फैक्चुअलिटी की कमी: SimpleQA Verified में छोटा मॉडल 20.6% पर रहा, जबकि Inkling ने 43.9% हासिल किया। यह reasoning के लिए distillation और training के दौरान memorization से जुड़े संभावित trade-off को दिखाता है ।
थर्ड-party इंडेक्स: Artificial Analysis Intelligence Index v4.1 में Inkling-Small का स्कोर 40 है—Inkling के 41 से सिर्फ एक अंक कम ।
276B पैरामीटर वाला MoE मॉडल काम कैसे करता है?
Inkling-Small एक 42-layer sparse MoE transformer है। हर टोकन पर 256 experts में से 6 experts सक्रिय किए जाते हैं, साथ ही 2 shared experts भी काम करते हैं । इसमें full और sliding-window attention का मिश्रण इस्तेमाल किया गया है। इसका controllable thinking effort डेवलपर को latency और reasoning depth के बीच संतुलन बनाने देता है ।
सरल शब्दों में, मॉडल के weights में 276B पैरामीटर की क्षमता मौजूद रहती है, लेकिन inference के दौरान हर बार पूरी नेटवर्क क्षमता नहीं चलती। प्रति टोकन करीब 12B पैरामीटर सक्रिय होने से यह compute के लिहाज से 12B dense मॉडल जैसा व्यवहार कर सकता है, जबकि कुल weights में बड़े मॉडल जैसी विशेषज्ञ क्षमता बनी रहती है ।
यह Inkling वाले ही MoE परिवार का हिस्सा है, लेकिन इसमें experts की संख्या कम है—लगभग 576 की जगह 256—और हर layer पर सक्रिय experts भी कम हैं।
दो चरणों वाली पोस्ट-ट्रेनिंग ने क्या बदला?
Thinking Machines Lab ने Inkling-Small के लिए दो-चरणीय post-training recipe अपनाई :
Inkling से on-policy distillation: Inkling-Small के एक शुरुआती checkpoint को Inkling के teacher मॉडल से प्रशिक्षित किया गया। इसमें student मॉडल अपनी trajectories खुद बनाता है, जबकि teacher उन generated tokens पर dense, token-level supervision देता है। इस तरीके में on-policy training की वास्तविक distribution और distillation की sample efficiency दोनों को मिलाने की कोशिश की जाती है ।
दो सप्ताह की agent-focused reinforcement learning: इसके बाद टीम ने agentic coding reinforcement learning को आगे बढ़ाया। इसी चरण ने reasoning और coding benchmarks में मॉडल को Inkling से आगे जाने में मदद की ।
यह परिणाम इसलिए उल्लेखनीय है क्योंकि अतिरिक्त RL के केवल दो सप्ताह बाद student मॉडल कई tasks में अपने teacher से बेहतर निकला। यह on-policy distillation और weak-to-strong generalization पर चल रहे शोध से भी मेल खाता है ।
हार्डवेयर जरूरत: लगभग तीन गुना कम VRAM
Inkling-Small का सबसे व्यावहारिक फायदा इसकी कम memory requirement है। Thinking Machines के model card में दिए गए आधिकारिक configurations इस प्रकार हैं :
फॉर्मेट
Aggregated VRAM
उदाहरण configuration
BF16
लगभग 600 GB
4× NVIDIA B300 या 8× H200
NVFP4 (W4A16)
लगभग 180 GB
2× NVIDIA H200
NVFP4 (W4A4)
लगभग 180 GB
1× NVIDIA B300; SM100+ जरूरी
मूल Inkling के BF16 checkpoint के लिए लगभग 1.9 TB aggregated VRAM चाहिए थी । उसका आधिकारिक NVFP4 संस्करण भी करीब 600 GB memory मांगता था ।
इस तुलना में Inkling-Small की VRAM जरूरत लगभग तीन गुना कम है। इसका मतलब है कि mid-sized कंपनियों, अच्छी तरह वित्तपोषित startups और विश्वविद्यालयी labs के लिए LoRA तथा full-parameter fine-tuning पहले की तुलना में अधिक व्यावहारिक हो सकती है—हालांकि यह अभी भी सामान्य उपभोक्ता PC के लिए छोटा मॉडल नहीं है । मॉडल BF16, MXFP8 और NVFP4 numerical formats को सपोर्ट करता है ।
Fine-tuning के लिए इसका अर्थ
BF16 में full-parameter fine-tuning: 4× B300 या 8× H200 GPUs वाला cluster चाहिए। यह महंगा setup है, लेकिन बड़े multi-node data-center cluster की तुलना में अधिक सीमित दायरे में आता है ।
NVFP4 में LoRA fine-tuning: 2× H200 GPUs पर किया जा सकता है, जिससे किसी खास domain या application के लिए customization की लागत घटती है ।
NVFP4 inference: W4A4 mode में एक NVIDIA B300 GPU पर चल सकता है। इसके लिए SM100+ architecture आवश्यक है ।
उपलब्धता और API लागत
Inkling-Small कई तरीकों से उपलब्ध है :
Full weights: Hugging Face पर Apache 2.0 लाइसेंस के तहत उपलब्ध।
Tinker Playground: टेक्स्ट, इमेज और ऑडियो के साथ मॉडल से बातचीत की जा सकती है।
Tinker API: LoRA के जरिए fine-tuning की सुविधा। Output pricing $1.20 प्रति 10 लाख tokens है ।
Tinker fine-tuning: Tinker platform पर LoRA fine-tuning उपलब्ध है ।
Thinking Machines Lab का नेतृत्व संदर्भ
Thinking Machines Lab की स्थापना OpenAI की पूर्व CTO Mira Murati ने OpenAI छोड़ने के बाद की थी। John Schulman, जो OpenAI के co-founder और RLHF टीम से जुड़े रहे हैं, भी कंपनी के co-founder हैं ।
प्रारंभिक founding team का हिस्सा रहीं Lilian Weng अब Thinking Machines Lab से अलग होकर OpenAI लौट चुकी हैं। इसके बाद startup के शेष co-founders के रूप में Mira Murati और John Schulman रह गए हैं ।
निष्कर्ष: क्या Inkling-Small ज्यादा व्यावहारिक विकल्प है?
Inkling-Small Thinking Machines Lab की एक स्पष्ट रणनीतिक बात सामने रखता है: सही post-training recipe के साथ, आकार में लगभग एक-चौथाई student मॉडल reasoning और agentic coding जैसे कामों में बड़े teacher से आगे निकल सकता है।
इसका मतलब यह नहीं है कि Inkling-Small हर काम में बेहतर है। SimpleQA Verified में factual recall का अंतर काफी बड़ा है और AIME 2026 में भी मूल Inkling आगे है। लेकिन coding agents, reasoning और instruction-following जैसे workloads के लिए कम VRAM वाला यह open-weight मॉडल अधिक व्यावहारिक साबित हो सकता है।
जहां Inkling को BF16 में लगभग 1.9 TB VRAM चाहिए, वहीं Inkling-Small लगभग 600 GB BF16 या 180 GB NVFP4 में काम कर सकता है। जुलाई 2026 तक, यही अंतर इसे उन टीमों के लिए आकर्षक बनाता है जो बड़े open-weight मॉडल को customize करना चाहती हैं, लेकिन विशाल multi-node infrastructure पर निर्भर नहीं होना चाहतीं।