Inkling-Small: 276 מיליארד פרמטרים, ביצועים שעוקפים מודל של 975 מיליארד
Thinking Machines Lab שחררה ב 30 ביולי 2026 את Inkling Small — מודל MoE עם 276 מיליארד פרמטרים בסך הכול ורק 12 מיליארד פרמטרים פעילים בכל טוקן. Inkling Small עוקף את Inkling הגדול ממנו במבחני reasoning, קידוד וסבירות מדעית, אך נופל ממנו משמעותית בשליפת עובדות ובמתמטיקה תחרותית.
פורסם על ידינערך באמצעות DeepSeek-V4-Flashהתמונות נוצרו באמצעות GPT Image 1.5
Thinking Machines Lab שחררה ב 30 ביולי 2026 את Inkling Small — מודל MoE עם 276 מיליארד פרמטרים בסך הכול ורק 12 מיליארד פרמטרים פעילים בכל טוקן.
Inkling Small עוקף את Inkling הגדול ממנו במבחני reasoning, קידוד וסבירות מדעית, אך נופל ממנו משמעותית בשליפת עובדות ובמתמטיקה תחרותית.
המודל משתמש בזיקוק on policy מ Inkling ולאחריו בשבועיים נוספים של למידת חיזוק ממוקדת בסוכני קידוד.
דרישות הזיכרון יורדות מכ 1.9 טרה בייט עבור Inkling ב BF16 לכ 600 ג׳יגה בייט ב Inkling Small, או לכ 180 ג׳יגה בייט ב NVFP4.
What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active paInkling-Small (276B total, 12B active) beats Inkling (975B total, 41B active) on reasoning, coding, and science benchmarks while requiring a fraction of the VRAM.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Thinking Machines Lab's newly released Inkling-Small model — how does its Mixture-of-Experts architecture (276B total, 12B active pa. Article summary: Now I have all the key data. Let me compile the answer.. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
openai.com
מהו Inkling-Small?
Inkling-Small הוא מודל Transformer דליל מסוג Mixture-of-Experts (MoE), ששוחרר על ידי Thinking Machines Lab ב-30 ביולי 2026 תחת רישיון Apache 2.0 המתיר שימוש, שינוי והפצה. למודל יש 276 מיליארד פרמטרים בסך הכול, אך רק 12 מיליארד פרמטרים מופעלים עבור כל טוקן — שילוב שמנסה לספק יכולות של מודל גדול בהרבה בעלות חישובית נמוכה משמעותית .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Inkling-Small: 276 מיליארד פרמטרים, ביצועים שעוקפים מודל של 975 מיליארד"?
Thinking Machines Lab שחררה ב 30 ביולי 2026 את Inkling Small — מודל MoE עם 276 מיליארד פרמטרים בסך הכול ורק 12 מיליארד פרמטרים פעילים בכל טוקן.
What are the key points to validate first?
Thinking Machines Lab שחררה ב 30 ביולי 2026 את Inkling Small — מודל MoE עם 276 מיליארד פרמטרים בסך הכול ורק 12 מיליארד פרמטרים פעילים בכל טוקן. Inkling Small עוקף את Inkling הגדול ממנו במבחני reasoning, קידוד וסבירות מדעית, אך נופל ממנו משמעותית בשליפת עובדות ובמתמטיקה תחרותית.
What should I do next in practice?
המודל משתמש בזיקוק on policy מ Inkling ולאחריו בשבועיים נוספים של למידת חיזוק ממוקדת בסוכני קידוד.
לשם השוואה, Inkling המקורי כולל 975 מיליארד פרמטרים בסך הכול ו-41 מיליארד פרמטרים פעילים. למרות ש-Inkling-Small הוא כרבע מגודלו, הוא משתווה אליו ואף עוקף אותו בכמה מבחנים מרכזיים, תוך הפחתה ניכרת בדרישות החומרה להרצה ולכוונון .
המודל תומך בקלט טקסט, תמונה ושמע, בחלון הקשר של עד מיליון טוקנים, וכן במנגנון המאפשר לשלוט במאמץ החשיבה — כלומר לבחור בין תגובה מהירה וזולה יותר לבין השקעת משאבים גדולה יותר בתהליך ההסקה .
מבחני ביצועים: איפה המודל הקטן מנצח?
Inkling-Small עוקף את Inkling בשלושה מבחנים תובעניים במיוחד, אך מפגר מאחור בשליפת עובדות ובמתמטיקה תחרותית .
מבחן
Inkling-Small
Inkling
פער
HLE — טקסט בלבד
31.6%
29.7%
+1.9 נק׳ אחוזיות
SWE-Bench Verified
80.2%
77.6%
+2.6 נק׳ אחוזיות
GPQA Diamond
89.5%
87.2%
+2.3 נק׳ אחוזיות
Artificial Analysis Intelligence Index v4.1
40
41
–1 נקודה
AIME 2026
95.5%
97.1%
–1.6 נק׳ אחוזיות
SimpleQA Verified
20.6%
43.9%
–23.3 נק׳ אחוזיות
מקורות:
המשמעות המעשית של הנתונים:
הסקה ופתרון בעיות: Inkling-Small קיבל 31.6% ב-Humanity’s Last Exam בגרסת הטקסט בלבד, לעומת 29.7% ל-Inkling. לפי Thinking Machines, היתרון נשמר בכל רמות מאמץ החשיבה שנבדקו .
סוכני קידוד: במבחן SWE-Bench Verified, הבודק יכולת לפתור בעיות אמיתיות במאגרי קוד, הגיע המודל ל-80.2% לעומת 77.6% ל-Inkling. הבדיקה בוצעה במעטפת bash ובמסלול של עד 256 אלף טוקנים .
מדע וידע מקצועי: ב-GPQA Diamond, מבחן לשאלות מדעיות ברמת בוגר, השיג Inkling-Small 89.5%, לעומת 87.2% למודל הגדול .
שליפת עובדות: כאן נרשם החיסרון הבולט ביותר. ב-SimpleQA Verified קיבל המודל 20.6% בלבד, לעומת 43.9% ל-Inkling — פשרה אפשרית של אימון שמעדיף reasoning על פני שינון ושליפה עובדתית .
מדד חיצוני: ב-Artificial Analysis Intelligence Index v4.1 קיבל Inkling-Small ציון 40, נקודה אחת בלבד מתחת ל-Inkling שקיבל 41 .
איך עובד מודל של 276 מיליארד פרמטרים עם 12 מיליארד פעילים?
Inkling-Small הוא מודל MoE דליל בעל 42 שכבות. בכל טוקן מופעלים שישה מתוך 256 מומחים, לצד שני מומחים משותפים . במודל MoE, לא כל הפרמטרים עוברים חישוב עבור כל מילה: מנגנון הניתוב בוחר את המומחים הרלוונטיים למשימה, בעוד שאר הפרמטרים נשארים לא פעילים באותו רגע.
המודל משתמש ב-attention היברידי — שילוב של attention מלא עם attention בחלון נע — ותומך בשליטה במאמץ החשיבה. כך מפתחים יכולים להחליף בין זמן תגובה ועלות נמוכים יותר לבין reasoning עמוק וממושך יותר .
הארכיטקטורה שייכת לאותה משפחת MoE כמו Inkling, אך כוללת פחות מומחים כוללים: 256 לעומת כ-576 ב-Inkling, וגם פחות מומחים פעילים בכל שכבה. בפועל, החישוב בכל רגע דומה יותר למודל צפוף של 12 מיליארד פרמטרים, אך משקלי המודל עדיין משמרים קיבולת של 276 מיליארד פרמטרים .
מתכון האימון בשני שלבים
Thinking Machines השתמשה בתהליך post-training בן שני שלבים, שמחבר בין זיקוק ממודל מורה לבין למידת חיזוק ממוקדת בסוכנים :
זיקוק on-policy מ-Inkling: גרסה מוקדמת של Inkling-Small הפיקה מסלולים משלה, כלומר רצפי חשיבה ופעולה שנוצרו על ידי המודל עצמו. Inkling שימש כמורה והעניק פיקוח צפוף ברמת הטוקן על המסלולים האלה. השיטה משלבת את היעילות של זיקוק עם התפלגות נתונים שמגיעה מהתנהגות התלמיד עצמו .
שבועיים נוספים של למידת חיזוק לסוכנים: הצוות המשיך להרחיב את אימון למידת החיזוק למשימות agentic coding. לפי החברה, שלב זה סייע לדחוף את Inkling-Small מעבר ל-Inkling במבחני reasoning וקידוד .
הנקודה המעניינת היא שהתלמיד הצליח לעבור את המורה בכמה משימות לאחר שבועיים בלבד של למידת חיזוק נוספת — תוצאה שמתיישבת עם מחקרים עדכניים על הכללה מ"חלש לחזק" באמצעות on-policy distillation .
דרישות חומרה: בערך פי שלושה פחות VRAM
היתרון המרכזי של Inkling-Small אינו רק במספר הפרמטרים הפעילים, אלא גם בכמות זיכרון ה-GPU הדרושה בפועל. אלה התצורות הרשמיות שמופיעות בכרטיס המודל :
פורמט
VRAM מצטבר
תצורות לדוגמה
BF16
כ-600 ג׳יגה-בייט
4 כרטיסי NVIDIA B300 או 8 כרטיסי H200
NVFP4 (W4A16)
כ-180 ג׳יגה-בייט
2 כרטיסי NVIDIA H200
NVFP4 (W4A4)
כ-180 ג׳יגה-בייט
כרטיס NVIDIA B300 אחד — נדרשת ארכיטקטורת SM100 ומעלה
לשם השוואה, נקודת ההפעלה הרשמית של Inkling ב-BF16 דורשת כ-1.9 טרה-בייט של VRAM מצטבר . הגרסה הכמותית הרשמית של Inkling ב-NVFP4 דורשת כ-600 ג׳יגה-בייט .
הפער הזה מוריד את רף הכניסה, גם אם הוא עדיין רחוק מחומרה צרכנית רגילה. החברה מציגה את Inkling-Small כמודל הראשון שלה שניתן להתאים באמצעות LoRA או בכוונון מלא עבור צוותים בינוניים, בלי להסתמך בהכרח על אשכולות ענקיים הפרוסים על פני צמתים רבים . המודל תומך ב-BF16, ב-MXFP8 וב-NVFP4 .
מה זה אומר עבור fine-tuning?
כוונון מלא ב-BF16: דורש אשכול של 4 כרטיסי B300 או 8 כרטיסי H200 — השקעה משמעותית, אך תצורה שנמצאת בטווח האפשרי של סטארטאפים ממומנים היטב ומעבדות מחקר באוניברסיטאות .
כוונון LoRA ב-NVFP4: ניתן לבצע על שני כרטיסי H200, וכך לצמצם משמעותית את עלות ההתאמה לתחום או לארגון מסוים .
הרצה ב-NVFP4: במצב W4A4 ניתן להריץ את המודל על כרטיס B300 יחיד — המודל הראשון של Thinking Machines שמגיע לתצורה כזו על GPU יחיד ברמת מרכז נתונים .
זמינות ועלות
Inkling-Small זמין בכמה מסלולים :
משקלים מלאים: להורדה מ-Hugging Face תחת רישיון Apache 2.0.
Tinker Playground: התנסות במודל בשיחה עם טקסט, תמונות ושמע.
Tinker API: התאמה באמצעות LoRA, עם מחיר פלט של 1.20 דולר למיליון טוקנים .
כוונון דרך Tinker: פלטפורמת Tinker מספקת מסלול ייעודי ל-LoRA ולתהליכי התאמה נוספים .
ההקשר הניהולי סביב Thinking Machines Lab
Thinking Machines Lab נוסדה על ידי מירה מוראטי, לשעבר סמנכ״לית הטכנולוגיה של OpenAI, לאחר שעזבה את החברה ב-2024. ג׳ון שולמן, ממייסדי OpenAI ומי שהיה מעורב בצוות RLHF, הוא גם ממייסדי הסטארטאפ.
ליליאן וֶנג, שהייתה בתחילה חלק מצוות ההקמה, עזבה מאז את Thinking Machines Lab וחזרה ל-OpenAI. בעקבות זאת, מירה מוראטי וג׳ון שולמן הם שני המייסדים-השותפים שנותרו בחברה .
השורה התחתונה
Inkling-Small הוא ניסוי משמעותי בטענה שגודל המודל לבדו אינו קובע את התוצאה. בעזרת ארכיטקטורת MoE דלילה ומתכון post-training שמשלב זיקוק on-policy עם למידת חיזוק ממוקדת, מודל שגודלו כרבע מ-Inkling הצליח לעקוף אותו ב-reasoning, בקידוד סוכני ובשאלות מדעיות.
המחיר הוא ירידה חדה בשליפת עובדות, ולכן Inkling-Small אינו תחליף עדיף בכל משימה. אבל עבור קידוד, פתרון בעיות, הפעלת סוכנים והתאמה לארגון, הוא מציע נקודת איזון מעשית יותר: כ-600 ג׳יגה-בייט ב-BF16 או כ-180 ג׳יגה-בייט ב-NVFP4, לעומת כ-1.9 טרה-בייט עבור Inkling ב-BF16. נכון ליולי 2026, זהו המודל הפתוח הנגיש יותר מבין השניים עבור צוותים שמחפשים יכולות גבוהות בלי התשתית הדרושה להפעלת Inkling המלא.