Ling 3.0 flash VL הוא מודל משקלים פתוחים ברישיון MIT של inclusionAI מקבוצת Ant Group; הוא מקבל טקסט, תמונות ווידאו ומחזיר טקסט. למודל 124 מיליארד פרמטרים בסך הכול, אך כ־5.5 מיליארד בלבד מופעלים לכל טוקן, וכן חלון הקשר של עד 256K טוקנים.
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL הוא מודל שפה־וחזון בעל משקלים פתוחים של inclusionAI, מעבדת ה־AI של Ant Group. הוא מבוסס על משפחת Ling-3.0-flash, אך מוסיף קלט של תמונות ווידאו לצד טקסט. הכותרת הטכנית שלו היא ארכיטקטורת Mixture of Experts (MoE) דלילה: למודל יש 124 מיליארד פרמטרים בסך הכול, אבל רק כ־5.5 מיליארד פרמטרים מופעלים עבור כל טוקן. המטרה היא לשלב קיבולת של מודל גדול עם עלות חישוב נמוכה יותר לכל טוקן לעומת מודל צפוף בגודל 124B. 3
12
העניין המרכזי אינו רק היכולת "לראות". Ant Group מציגה את המודל כבסיס לסוכן חזותי: מערכת שיכולה לבחון מסך, מסמך או תוצאת פעולה; לבצע פעולה באמצעות כלי חיצוני; לראות את המצב החדש; ואז לאמת את התוצאה או לנסות לתקן. החברה מכנה זאת לולאת משוב חזותית. 12
Ling-3.0-flash-VL מקבל טקסט, תמונות ווידאו ומחזיר טקסט. חלון ההקשר המוצהר שלו מגיע עד 256K טוקנים — תכונה שמיועדת, בין השאר, למסמכים ארוכים, לשיחות רב־אופניות ממושכות ולתהליכי סוכנים שצריכים לשמור היסטוריית משימה רחבה. 3
4
לפי התיאורים שפורסמו, הארכיטקטורה משלבת שכבות Kimi Delta Attention עם שכבות gated multi-head latent attention. לטיפול בווידאו היא משתמשת בקידוד מיקום VideoRoPE, שנועד לשמר מידע על רצף הזמן בין פריימים. 1
6
החשיבות של תכנון כזה, לפי מפתחי המודל, היא שהמידע החזותי אמור להשתלב בתהליך ההסקה עצמו — ולא להופיע רק כתוספת חיצונית למודל טקסט. זו הטענה העומדת מאחורי ההגדרה שלו כמודל רב־אופני "ילידי". 1
12
במודלי MoE קיימות קבוצות פרמטרים מתמחות, המכונות לעיתים "מומחים". מנגנון ניתוב בוחר רק חלק מהן עבור טוקן נתון. במקרה של Ling-3.0-flash-VL, הנתונים המדווחים הם 124B פרמטרים בסך הכול וכ־5.5B פרמטרים פעילים לכל טוקן. 3
12
בפועל, ההבחנה היא זו:
אין פירוש הדבר שהרצה מקומית פשוטה: אירוח משקלים פתוחים בהיקף כזה עדיין דורש זיכרון רב ותכנון תשתיתי קפדני. אבל זו הסיבה לכך שהמודל משווק ברמת "flash", למרות מספר הפרמטרים הכולל. 3
5
מודל חזון־שפה רגיל יכול לתאר תמונה, לחלץ טקסט מקבלה או לענות על שאלה לגבי גרף. Ling-3.0-flash-VL מכוון למחזור עבודה ארוך יותר:
לכן הוא רלוונטי במיוחד לאוטומציית GUI — כלומר ממשקים גרפיים. למשל, מודל יכול לבחון את מצב הממשק, לבחור פעולה, לראות את המסך שהתקבל ולהחליט אם היעד הושג.
עם זאת, המודל אינו מחליף את הדפדפן, את הכלים, את ההרשאות או את מנגנוני ההגנה שמסביבו. אותם רכיבים הם שקובעים מה הסוכן רשאי לבצע בפועל.
Ant Group ודיווחים הקשורים להשקה מציינים יצירת פרונט־אנד, אוטומציית GUI ופרשנות של דוחות רפואיים כמקרי שימוש. 12 שימוש בדוחות רפואיים צריך להיחשב כלי עזר לתהליך עבודה — ולא הוכחה לאמינות קלינית אוטונומית או לבטיחות רפואית.
המודל שוחרר עם משקלים פתוחים ברישיון MIT. דווח על גרסאות משקלים ב־BF16 וב־FP8, בעוד שגרסאות FP4 ו־INT4 תוארו כמתוכננות או צפויות בסיקור ההשקה המוקדם. 3
4
פורסמה גם הנחיית הרצה עבור SGLang ועבור מסלול vLLM מותאם ל־Ling. 3
4 בסביבת ייצור, זו נקודת פתיחה ולא הבטחת תאימות: יש לבדוק את גרסת המודל המדויקת, הקוונטיזציה, עיבוד הקלט הרב־אופני, אורך ההקשר, החומרה וגרסת המסגרת המתוכננים.
בסיקור הופיעו שני ציונים של Artificial Analysis Intelligence Index:
המספרים אינם בהכרח סותרים זה את זה, משום שגרסת המדד השתנתה. אבל אסור להשוות אותם כאילו נמדדו באותו סולם. המסקנה המצומצמת והסבירה היא שהמודל מציג יעילות מדווחת ביחס למספר הפרמטרים הפעילים שלו; אין בכך, כשלעצמו, הוכחה לאמינות בכל סביבת סוכנים, ייצור או שימוש רפואי. 3
4
החידוש אינו רק תוספת של קלט תמונה ווידאו למשפחת Ling. המודל מוצג כראשון בקו Ling הפתוח שמשלב חזון בתכנון איטרטיבי, בפעולה, בבדיקה חזותית ובתיקון. תכנון ה־MoE הדליל נועד להפוך את הגישה הזו לחסכונית יותר חישובית ממודל צפוף בגודל דומה. 3
12
עבור מפתחים, התרחיש המשכנע ביותר הוא תהליך מוגבל ומבוקר שבו הראיה חשובה וכל פעולת כלי ניתנת לבדיקה: השוואת דף מרונדר לעיצוב ייחוס, ניווט בממשק נשלט, או חילוץ והצלבת מידע בין מסמכים. הדגמות והערכות שדווחו בידי הספק הן אות חיובי, אך הטמעה מהימנה תלויה עדיין בהערכה מותאמת למשימה, בקרות הרשאה, טיפול בשגיאות ופיקוח אנושי.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash VL הוא מודל משקלים פתוחים ברישיון MIT של inclusionAI מקבוצת Ant Group; הוא מקבל טקסט, תמונות ווידאו ומחזיר טקסט.
Ling 3.0 flash VL הוא מודל משקלים פתוחים ברישיון MIT של inclusionAI מקבוצת Ant Group; הוא מקבל טקסט, תמונות ווידאו ומחזיר טקסט. למודל 124 מיליארד פרמטרים בסך הכול, אך כ־5.5 מיליארד בלבד מופעלים לכל טוקן, וכן חלון הקשר של עד 256K טוקנים.
הייחוד המוצהר שלו הוא מחזור «התבונן → פעל → אמת → תקן» עבור אוטומציית ממשקים, יצירת פרונט־אנד ועיבוד מסמכים — לא רק תיאור תמונה חד־פעמי.