Ling 3.0 flash כולל 124 מיליארד פרמטרים, אך מפעיל כ־5.1 מיליארד לכל טוקן — דוגמה לאופן שבו MoE דליל עשוי לצמצם את עלויות ההסקה. חלון הקשר טבעי של 256K טוקנים, עם אפשרות הרחבה ל־1M, והמיקוד בקוד, שימוש בכלים וסוכנים הופכים אותו למועמד לבחינה בעומסי עבודה עתירי נפח.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
השאלה החשובה בפריסת AI עבור כתיבת קוד חוזרת, קריאות לכלים ושלבי עבודה אוטומטיים אינה תמיד "למי יש הכי הרבה פרמטרים?". לעיתים השאלה המעשית יותר היא: איזה מודל מספק איכות מספקת במחיר ההסקה ובזמן התגובה הנמוכים ביותר?
Ling-3.0-flash של Ant Group מדגים היטב את השינוי הזה בסדרי העדיפויות. למודל יש 124 מיליארד פרמטרים בסך הכול, אבל הוא מפעיל בערך 5.1 מיליארד פרמטרים לכל טוקן. Ant מציגה אותו כמודל היברידי לחשיבה, בעל יחס עלות־תועלת גבוה למשימות תכופות, עם חלון הקשר טבעי של 256 אלף טוקנים שניתן להרחיב עד מיליון טוקנים.
Ling-3.0-flash מבוסס על Mixture of Experts (MoE), או "תערובת מומחים". במקום להפעיל את כל הפרמטרים בכל יצירת טוקן, המודל מנתב את העבודה לתת־קבוצה קטנה של "מומחים". בפועל, הוא שומר מאגר גדול בהרבה של יכולת נלמדת, בעוד שכל תשובה נשענת על חלק פעיל קטן יחסית.
לפי Ant, ל-Ling-3.0-flash יש כ־12.4% מהפרמטרים הכוללים וכ־8.1% מהפרמטרים הפעילים של מודל Ring-2.6-1T, המשתייך למחלקת מודלי טריליון הפרמטרים. חומרי ההשקה מתארים גם ארכיטקטורת קשב ליניארית־היברידית, המשלבת שכבות KDA ו־MLA, לצד ניתוב MoE דליל.
אין בכך כדי להפוך את מספר הפרמטרים הכולל לבלתי רלוונטי. הקיבולת הכוללת עדיין משפיעה על מה שהמודל מסוגל לייצג, ואיכות הניתוב קובעת אם ארכיטקטורת MoE תממש את הפוטנציאל שלה. אבל הפעלה דלילה משנה את הכלכלה: עלות ההגשה והמהירות קשורות יותר לפרמטרים ולחישובי הקשב שנדרשים עבור כל טוקן, ולא רק לגודלו המלא של המודל בזיכרון.
Ant טוענת ש-Ling-3.0-flash משתווה ל-Ring-2.6-1T או עולה עליו ברוב ההשוואות שפרסמה. גם חשבון Ling של Ant ב-X תיאר את התוצאה כהשתוות או עליונות מול ספינת הדגל שלה ברוב הבנצ'מרקים, תוך שימוש בכשמינית ממספר הפרמטרים הכולל ובככשנים־עשרית ממספר הפרמטרים הפעילים.
זו השוואה פנימית בעלת משמעות, בעיקר משום שהמודל מיועד במפורש לעומסי עבודה של סוכני AI בפרודקשן. עם זאת, אין זו הוכחה שהוא טוב מכל מודל כללי גדול יותר, בכל משימה ובכל תנאי הפעלה.
ההסתייגויות המרכזיות פשוטות:
לכן, צוותים שבוחנים את המודל צריכים לבדוק עומס עבודה מייצג: סכמות כלים אמיתיות, הקשר מתוך המאגר, דרישות שיהוי, התנהגות בניסיונות חוזרים ועלותן של טעויות.
כרטיס המודל מציין הערכות כגון SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas ו־SkillsBench. הוא גם מציין שימוש בסביבות מוכוונות סוכנים, בהן Claude Code, Kilo Code, Qwen Code, Hermes Agent ו־OpenClaw. 1
אלו יעדים רלוונטיים מפני שמערכות סוכנים יכולות לצרוך נפח עצום של טוקנים: הן קוראות קבצים, מפעילות כלים, מקבלות פלט, מעדכנות תוכנית עבודה ומנסות שוב במקרה הצורך. בתרחיש כזה, מודל זול יותר שמבצע באופן אמין את שלבי הביצוע השגרתיים עשוי להיות בעל ערך גבוה יותר ממודל כללי ויקר שמופעל בכל תור.
גישה מעשית היא ארכיטקטורה מדורגת:
Ant מתעדת חלון הקשר טבעי של 256 אלף טוקנים, הניתן להרחבה עד מיליון טוקנים. זה עשוי להועיל למאגרי קוד גדולים, עקבות כלים ארוכים או מצב עבודה מתמשך.
ב-OpenRouter מופיע חלון הקשר מוגש של 262,144 טוקנים. 6
עם זאת, הקשר ארוך לבדו אינו שקול ליכולת רב־סוכנית מוכחת. הוא יכול להקל על שמירת מידע משותף לאורך תהליך, אך מערכת רב־סוכנית אמינה תלויה גם בתזמור, תכנון זיכרון, הרשאות לכלים, העברת משימות בין סוכנים והערכה שיטתית. המקורות הזמינים תומכים במפרט ההקשר הארוך ובמיצוב הסוכני של המודל, אך לא בטענה כמותית שהוא עולה על מתחרים בפריסות רב־סוכניות.
Ling-3.0-flash הוצג ב־24 ביולי 2026, ולפי פוסט ההשקה של Ant הוצעה גישת API חינמית לזמן מוגבל ב-OpenRouter ובפלטפורמה של Ant עד 3 באוגוסט. המודל זמין גם ב-Hugging Face, שם הפרויקט מדגיש את הבנצ'מרקים ואת המיקוד במסגרות עבודה סוכניות. 1
ב-OpenRouter המחיר המוצג הוא 0.021 דולר למיליון טוקני קלט ו־0.063 דולר למיליון טוקני פלט, עם חלון הקשר של 262,144 טוקנים. 6 המחירים הללו מאפשרים לבחון את המודל בתהליכים עתירי נפח, אם כי העלות בפועל, זמן התגובה, הזמינות ואיכות הפלט עשויים להשתנות בין ספקים ותנאי פריסה.
דף גילוי המודלים של OpenRouter מציג ל-Ling-3.0-flash אחוזונים נפרדים: 49 באינטליגנציה, 56 בקוד ו־54 במשימות סוכניות. זה ממחיש מדוע דירוג כותרת יחיד אינו כלי מספק להערכת מודל שמיועד לביצוע. 12
ההשקה חפפה לפוסט הראשון של ג'נסן הואנג ב-X, שבו שיתף מכתב התומך במודלים פתוחים. הוא טען שמודלים כאלה מחזקים בטיחות וסייבר, מאיצים חדשנות והפצה, ותומכים בריבונות טכנולוגית לצד מודלי קצה סגורים.
העיתוי הפך את Ling-3.0-flash לדוגמה מתאימה לוויכוח על מודלים בעלי משקולות פתוחות: זמינות המשקולות מאפשרת למפתחים לבדוק, לארח, לכוונן ולשלב מודלים באופן ישיר יותר. אולם שני האירועים אינם מעידים על שותפות או על קשר טכנולוגי בין Nvidia ל-Ant Group.
Ling-3.0-flash בולט בעיקר כהוכחה לאסטרטגיה של מודל ביצוע שנמדד לפי עלות־תועלת. MoE דליל יכול לשלב קיבולת מאוחסנת רחבה עם הפעלה קטנה בהרבה לכל טוקן, ובכך להפוך לולאות סוכנים תכופות למהירות וזולות יותר — בלי לרדת בהכרח למגבלות של מודל קטן מאוד.
טענות הביצועים עדיין זקוקות לשכפול עצמאי, ואין להתייחס אליו כתחליף אוניברסלי למערכות הכלליות הגדולות ביותר. ובכל זאת, המפרט, יעדי ההערכה הסוכניים, ההקשר הארוך ותמחור ה-API הנמוך המוצג מספקים סיבה טובה לבדוק מודלים דלילים וממוקדים בכל מקום שבו עלות ההסקה והשהיה הן מגבלות מרכזיות. 1
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash כולל 124 מיליארד פרמטרים, אך מפעיל כ־5.1 מיליארד לכל טוקן — דוגמה לאופן שבו MoE דליל עשוי לצמצם את עלויות ההסקה.
Ling 3.0 flash כולל 124 מיליארד פרמטרים, אך מפעיל כ־5.1 מיליארד לכל טוקן — דוגמה לאופן שבו MoE דליל עשוי לצמצם את עלויות ההסקה. חלון הקשר טבעי של 256K טוקנים, עם אפשרות הרחבה ל־1M, והמיקוד בקוד, שימוש בכלים וסוכנים הופכים אותו למועמד לבחינה בעומסי עבודה עתירי נפח.
ההשוואות ל Ring 2.6 1T מגיעות מחומרי Ant עצמה; מדדים חיצוניים מציגים תמונה מורכבת יותר, ולכן נדרש מבחן על עומס עבודה אמיתי.