وعلى الرغم من أن حجمه الإجمالي يعادل نحو ربع حجم سابقه Inkling، الذي يضم 975 مليار مَعلمة ويُفعّل 41 مليارًا منها، فإن Inkling-Small يضاهي النموذج الأكبر أو يتفوق عليه في عدد من الاختبارات المهمة، مع حاجة أقل بكثير إلى العتاد لتشغيله أو ضبطه .
يدعم النموذج مدخلات متعددة الوسائط تشمل النص والصور والصوت، وسياقًا يصل إلى مليون رمز، كما يتيح التحكم في مقدار «الجهد التفكيري» للموازنة بين عمق الاستدلال وزمن الاستجابة .
تكشف النتائج أن Inkling-Small ليس بديلاً متفوقًا في كل شيء، لكنه يقدّم مقايضة لافتة: أداء أقوى في بعض مهام الاستدلال والبرمجة، مقابل تراجع واضح في استرجاع المعلومات الواقعية والرياضيات التنافسية .
| الاختبار | Inkling-Small | Inkling | الفارق |
|---|---|---|---|
| HLE، نص فقط | 31.6% | 29.7% | +1.9 نقطة مئوية |
| SWE-Bench Verified | 80.2% | 77.6% | +2.6 نقطة مئوية |
| GPQA Diamond | 89.5% | 87.2% | +2.3 نقطة مئوية |
| Artificial Analysis Intelligence Index v4.1 | 40 | 41 | -1 نقطة |
| AIME 2026 | 95.5% | 97.1% | -1.6 نقطة مئوية |
| SimpleQA Verified | 20.6% | 43.9% | -23.3 نقطة مئوية |
المصادر:
يتكون Inkling-Small من Transformer متناثر من 42 طبقة، مع تفعيل 6 خبراء من أصل 256 لكل رمز، إلى جانب خبيرين مشتركين . ويستخدم النموذج آلية انتباه هجينة تجمع بين الانتباه الكامل والانتباه ضمن نافذة منزلقة، إضافة إلى إعداد قابل للتحكم في مقدار التفكير، بما يسمح للمطورين بالموازنة بين زمن التأخير وعمق المعالجة .
تنتمي البنية إلى عائلة MoE نفسها التي ينتمي إليها Inkling، لكنها تستخدم عددًا أقل من الخبراء الإجماليين: 256 خبيرًا تقريبًا، مقارنةً بنحو 576 في Inkling، مع عدد أقل من الخبراء النشطين في كل طبقة. والنتيجة نموذج يحتفظ بسعة أوزان تبلغ 276 مليار مَعلمة، بينما تكون الكلفة الحسابية الفعلية لكل رمز أقرب إلى نموذج كثيف بحجم 12 مليار مَعلمة .
اعتمدت Thinking Machines Lab وصفة من خطوتين للتدريب اللاحق، وهي وصفة تحظى باهتمام متزايد في أبحاث نماذج اللغة والوكلاء :
وتكمن أهمية هذه الوصفة في أن النموذج الطالب تجاوز معلّمه في عدة مهام بعد أسبوعين فقط من التعلم المعزز الإضافي، بما ينسجم مع أبحاث حديثة حول إمكان انتقال القدرات من نموذج أضعف إلى نموذج أقوى باستخدام التقطير وفق السياسة .
يخفض Inkling-Small حاجز العتاد مقارنةً بالنموذج الأصلي. وتوضح بطاقة النموذج الرسمية الإعدادات التالية :
| الصيغة | إجمالي ذاكرة GPU المطلوبة | مثال على الإعداد |
|---|---|---|
| BF16 | نحو 600 GB | 4 بطاقات NVIDIA B300 أو 8 بطاقات H200 |
| NVFP4 (W4A16) | نحو 180 GB | بطاقتان NVIDIA H200 |
| NVFP4 (W4A4) | نحو 180 GB | بطاقة NVIDIA B300 واحدة، مع اشتراط SM100+ |
وللمقارنة، احتاجت نسخة Inkling بصيغة BF16 إلى نحو 1.9 TB من ذاكرة GPU المجمّعة ، بينما احتاجت نسخته الرسمية المكمّمة بصيغة NVFP4 إلى نحو 600 GB .
لا يعني ذلك أن النموذج أصبح مناسبًا للحواسيب الشخصية؛ فمتطلبات 180 إلى 600 GB لا تزال تستهدف عتاد مراكز البيانات. لكنها تجعل Inkling-Small أقرب إلى متناول فرق متوسطة الحجم ترغب في إجراء الضبط الدقيق باستخدام LoRA أو حتى الضبط الكامل للمعلمات، من دون الاعتماد على عناقيد ضخمة متعددة العقد . ويدعم النموذج صيغ BF16 وMXFP8 وNVFP4 .
يتوفر Inkling-Small عبر عدة قنوات :
أسست ميرا موراتي، المديرة التقنية السابقة في OpenAI، شركة Thinking Machines Lab بعد مغادرتها OpenAI في 2024. ويُعد جون شولمان، أحد مؤسسي OpenAI سابقًا وعضو فريق التعلم المعزز من الملاحظات البشرية (RLHF)، شريكًا مؤسسًا أيضًا. أما ليليان وينغ، التي كانت ضمن الفريق المؤسس في البداية، فقد غادرت Thinking Machines Lab وعادت إلى OpenAI، لتبقى ميرا موراتي وجون شولمان المؤسسين المشاركين المتبقيين في الشركة الناشئة .
يرسل Inkling-Small رسالة واضحة من Thinking Machines Lab: قد لا يكون النموذج الأكبر هو الخيار الأفضل دائمًا. فمع وصفة مناسبة للتدريب اللاحق، استطاع نموذج يعادل نحو ربع حجم Inkling أن يتفوق عليه في بعض مهام الاستدلال والبرمجة الوكيلة.
وبالنسبة إلى المطورين والفرق التي كان تشغيل Inkling بذاكرة تصل إلى 1.9 TB أمرًا بعيد المنال، يفتح Inkling-Small بابًا أقل كلفة نسبيًا عند نحو 600 GB بصيغة BF16 أو 180 GB بصيغة NVFP4. لكن المقابل مهم: تراجع كبير في استرجاع الحقائق. لذلك يبدو النموذج خيارًا عمليًا أكثر لأعباء البرمجة والاستدلال واتباع التعليمات، بينما يظل Inkling الأقوى في مهام التذكر الواقعي وبعض الرياضيات التنافسية، وفق النتائج المتاحة حتى يوليو 2026.