Ling 3.0 flash VL نموذج بأوزان مفتوحة وترخيص MIT من inclusionAI التابعة لـAnt Group، يستقبل النصوص والصور والفيديو. يضم 124 مليار معامل إجمالاً، لكنه يفعّل قرابة 5.5 مليارات معامل لكل رمز، ويعلن دعماً لسياق يصل إلى 256K رمز وأوزان BF16 وFP8.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
يقدّم Ling-3.0-flash-VL من inclusionAI وAnt Group نفسه كنموذج لغة ورؤية مفتوح الأوزان، مبني على عائلة الاستدلال Ling-3.0-flash. وتتلخص فكرته التقنية في بنية مزيج الخبراء المتفرق (MoE): لديه 124 مليار معامل إجمالاً، لكن الذي يُفعّل عند معالجة كل رمز يبلغ نحو 5.5 مليارات فقط. والهدف هو الجمع بين سعة نموذج كبير وتكلفة حسابية لكل رمز أقل من نموذج كثيف بالحجم الإجمالي نفسه. 3
12
لكن نقطة الاختلاف الأهم ليست عدد المعاملات، بل تموضعه بوصفه وكيلاً بصرياً. فبدلاً من التعامل مع الصورة كطلب منفرد لوصفها أو للإجابة عن سؤال حولها، صُمم النموذج لاستخدام المدخلات البصرية خلال المهمة كاملة: يفحص شاشة أو مستنداً، ينفذ إجراءً عبر أداة خارجية، يفحص الحالة الجديدة، ثم يتحقق من النتيجة أو يصححها. وتصف Ant Group ذلك بأنه حلقة تغذية راجعة بصرية مغلقة. 12
يستقبل Ling-3.0-flash-VL النصوص والصور والفيديو، ويولّد مخرجات نصية. ويصل طول السياق المعلن إلى 256 ألف رمز، وهو ما يجعله موجهاً للتعامل مع المستندات الطويلة، والمحادثات متعددة الوسائط الممتدة، وتدفقات عمل الوكلاء التي تحتاج إلى الاحتفاظ بسجل كبير للمهمة. 3
4
وتصف التقارير بنيته الهجينة بأنها تجمع بين Kimi Delta Attention وطبقات الانتباه الكامن متعدد الرؤوس ذات البوابات، مع استخدام ترميز موضعي VideoRoPE للفيديو بهدف الحفاظ على المعلومات الزمنية عبر الإطارات. 1
6
تكمن أهمية ذلك، وفقاً لطرح مطوريه، في أن المحتوى البصري يدخل ضمن مسار الاستدلال نفسه، لا كإضافة جانبية لنموذج نصي في نهاية المعالجة؛ وهو أساس وصفه بأنه نموذج «متعدد الوسائط أصيل». 1
12
تضم نماذج MoE مجموعات متخصصة من المعاملات، تُسمى غالباً «خبراء»، وتختار آلية توجيه جزءاً منها فقط لكل رمز. وفي حالة Ling-3.0-flash-VL، تشير التقارير إلى 124 مليار معامل إجمالاً ونحو 5.5 مليارات معامل نشط لكل رمز. 3
12
والفرق عملياً مهم:
هذا لا يعني أن تشغيل الأوزان المفتوحة سهل أو قليل المتطلبات؛ فاستضافة نموذج ضخم ما زالت تحتاج إلى ذاكرة كبيرة وهندسة تشغيل دقيقة. لكنه يفسر تسويقه ضمن فئة «flash» رغم الحجم الإجمالي الكبير. 3
5
قد ينجح نظام لغة ورؤية تقليدي في مهام لمرة واحدة، مثل وصف صورة، أو استخراج نص من إيصال، أو الإجابة عن سؤال بشأن مخطط. أما Ling-3.0-flash-VL فيستهدف دورة أطول:
لذلك يبدو مناسباً، من حيث التصميم، لأتمتة واجهات المستخدم الرسومية (GUI) والمهام البرمجية البصرية. فبإمكان النظام مثلاً فحص حالة واجهة ما، واختيار إجراء، ثم معاينة الشاشة بعد التغيير لتحديد ما إذا وصل إلى النتيجة المطلوبة.
لكن النموذج لا يحل محل المتصفح أو صلاحيات الأدوات أو ضوابط سير العمل المحيطة به؛ فتلك الطبقات هي التي تحدد ما يستطيع فعله فعلياً وما يجب منعه.
وتذكر Ant Group وتقارير مرتبطة بها توليد واجهات الويب الأمامية، وأتمتة GUI، وتفسير التقارير الطبية ضمن حالات الاستخدام المستهدفة. 12 وينبغي التعامل مع تفسير التقارير الطبية كاستخدام مساعد ضمن سير عمل خاضع للمراجعة، لا كدليل على موثوقية أو سلامة سريرية مستقلة.
أُطلق النموذج بأوزان مفتوحة تحت ترخيص MIT، مع توفر نسختَي أوزان BF16 وFP8 بحسب التقارير. كما وُصفت نسخ FP4 وINT4 بأنها مخطط لها أو مرتقبة في التغطية المبكرة للإصدار. 3
4
وتناولت تقارير إرشادات تشغيل عبر SGLang ومسار vLLM مكيّف لـLing. 3
4 إلا أن هذه الإرشادات تمثل نقطة بداية لا ضماناً للتوافق في بيئة إنتاجية؛ إذ ينبغي اختبار إصدار النموذج المحدد، والتكميم، والمعالجة المسبقة للمدخلات متعددة الوسائط، وطول السياق، والعتاد، وإصدار إطار التشغيل المراد استخدامه.
وردت في التغطية درجتان مختلفتان من مؤشر Artificial Analysis Intelligence Index:
لا يوجد تعارض لازم بين الرقمين إذا كان إصدار المؤشر نفسه قد تغيّر، لكن لا يصح مقارنتهما كما لو أنهما من مقياس الاختبار ذاته. والخلاصة الأكثر تحفظاً هي أن النموذج أظهر كفاءة تنافسية نسبةً إلى عدد معاملاته النشطة، لا أنه ثبتت موثوقيته في كل مهمة وكل وكيل أو بيئة إنتاجية أو استخدام طبي. 3
4
لا تقتصر أهميته على أن عائلة Ling اكتسبت مدخلات للصور والفيديو. يُقدَّم Ling-3.0-flash-VL على أنه أول نموذج مفتوح في خط Ling يدمج الرؤية ضمن التخطيط التكراري والتنفيذ والفحص البصري والتصحيح. ويسعى تصميم MoE المتفرق إلى جعل هذا النمط من الوكلاء متعددي الوسائط أقل كلفة حسابية من نموذج كثيف بسعة إجمالية مشابهة. 3
12
بالنسبة للمطورين، تبدو حالات الاستخدام الأكثر واقعية هي تدفقات العمل المقيدة التي تكون فيها الأدلة البصرية مهمة ويمكن اختبار كل إجراء فيها: مثل مطابقة صفحة ويب مع تصميم مرجعي بعد عرضها، أو التنقل في واجهة مضبوطة، أو استخراج المعلومات ومراجعتها عبر مستندات متعددة. أما العروض التوضيحية والتقييمات التي يذكرها المورّد فهي إشارات مشجعة، لكن النشر الموثوق يبقى مرهوناً بتقييم خاص بالمهمة، وضوابط الصلاحيات، ومعالجة الأخطاء، والإشراف البشري.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
Ling 3.0 flash VL نموذج بأوزان مفتوحة وترخيص MIT من inclusionAI التابعة لـAnt Group، يستقبل النصوص والصور والفيديو.
Ling 3.0 flash VL نموذج بأوزان مفتوحة وترخيص MIT من inclusionAI التابعة لـAnt Group، يستقبل النصوص والصور والفيديو. يضم 124 مليار معامل إجمالاً، لكنه يفعّل قرابة 5.5 مليارات معامل لكل رمز، ويعلن دعماً لسياق يصل إلى 256K رمز وأوزان BF16 وFP8.
جوهر تميّزه هو دورة «راقب، نفّذ، تحقّق، صحّح» البصرية، لا مجرد وصف صورة أو الإجابة عن سؤال بصري لمرة واحدة.