Qwen3.8 Omni Flash هو نموذج Qwen متعدد الوسائط أصليًا من علي بابا، يستقبل النصوص والصور والصوت والفيديو ضمن نافذة سياق تصل إلى مليون رمز. ميزته العملية الأبرز هي «الإدراك الوكيلي» للفيديو الطويل، إذ صُمم للبحث عن اللحظات المهمة بدل التعامل مع كامل التسجيل بالوتيرة نفسها.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Omni-Flash, launched by the Qwen team on September 18, 2026, and how does its native joint processing of text, ima. Article summary: Qwen3.8-Omni-Flash is Alibaba Qwen’s hosted, text-output native omni-modal model for agentic productivity work. It jointly accepts text, images, audio, and video in up to a 1-million-token context, rather than treating a. Topic tags: general, general web, documentation, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
يقدّم Qwen3.8-Omni-Flash من فريق Qwen التابع لعلي بابا نموذجًا «متعدد الوسائط أصليًا»: فهو يستقبل النصوص والصور والصوت والفيديو ضمن نافذة سياق واحدة تصل إلى مليون رمز. ويستهدف مهام الإنتاجية التي يحتاج فيها الوكيل الذكي إلى فهم مواد مختلطة، والتخطيط للخطوات، واستخدام الأدوات؛ فيما تكون مخرجاته نصية. 17
المقصود ليس مجرد إتاحة رفع فيديو أو تحليل صورة كلٌّ على حدة. تصف Qwen النموذج بأنه قادر، بصورة أصلية، على استقبال النصوص والصور والصوت والفيديو معًا، للتعامل مع مسارات عمل تتوزع فيها المعلومة بين هذه الأنواع المختلفة من المحتوى. 17
خذ تسجيل اجتماع مثالًا: قد يضم حديث المشاركين، وشرائح عرض مشتركة، وشرحًا ظاهرًا على الشاشة، ورسائل نصية، وطوابع زمنية. هنا يمكن توجيه النموذج لربط هذه الطبقات ببعضها؛ كأن يحدد القرار الذي اتُّخذ عند ظهور شريحة معيّنة، ثم يحوله إلى ملخص أو قائمة متابعة منظمة.
وتضع Qwen ضمن الاستخدامات المستهدفة البرمجة، والعمل المعرفي، والتفاعل مع واجهات المستخدم الرسومية، وتحرير الفيديو، وإنتاج الفيديوهات الموسيقية، والإنتاج السينمائي والمرئي، والسرد، والتلخيص متعدد الوسائط، والحوار الصوتي-المرئي. لكن هذه مجالات استخدام مستهدفة وليست ضمانًا لجودة ثابتة في كل مهمة. 17
تقول علي بابا إن Qwen3.8-Omni-Flash حقق متوسط نتائج أعلى بأكثر من 26% من Qwen3.5-Omni-Plus عبر حزمة تضم نحو 30 معيارًا عامًا وداخليًا. وتتركز المكاسب المُعلنة في مهام وكلاء الصوت والفيديو والمهام طويلة الأفق؛ منها زيادة قدرها 36.5 نقطة في WildClawBench-MM و22.3 نقطة في AgenticVBench. 40
هذه الأرقام مفيدة لفهم اتجاه الإصدار الجديد، لكنها تظل نتائج معيارية أعلنتها الشركة نفسها. ولا تثبت المصادر المتاحة وجود تقييم مستقل ومتطابق الظروف عبر أعباء العمل الفعلية في بيئات الإنتاج.
تحليل التسجيلات الطويلة قد يصبح مكلفًا إذا اضطر النموذج إلى استهلاك كل إطار أو مقطع بوتيرة ثابتة. وحل Qwen هو ما تسميه الإدراك الوكيلي: أن يستكشف النموذج الفيديو بنشاط بحثًا عن اللحظات ذات الصلة بالمهمة، بدل الاعتماد على أخذ عينات ثابتة فقط. 40
وتقول Qwen إن هذا الأسلوب حقق دقة أعلى مع استخدام رموز أقل بنسبة 51.8% مقارنة بالفهم الساكن في اختبار OmniVideoBench. 40 وإذا انتقل هذا السلوك بكفاءة إلى التطبيقات العملية، فقد يسهل البحث في تسجيلات الاجتماعات والدورات التدريبية وعروض المنتجات وأرشيفات الوسائط وتحليلها.
لكن ينبغي التعامل مع هذا الادعاء بحذر: فالتوفير في الرموز والدقة يتغيران بحسب طبيعة المادة، والسؤال المطروح، وإعداد الوكيل أو الأدوات. ولا يصح تعميم نتيجة معيار واحد على كل أعباء الفيديو.
يطرح الإصدار النموذج بوصفه خطوة من فهم المحتوى متعدد الوسائط إلى وكلاء يستطيعون تخطيط المهمة، واستدعاء الأدوات، وإنجاز العمل. 17 ويصف مشروع Qwen-MM-Plugins المصاحب نفسه بأنه وسيلة لجعل أطر الوكلاء داعمة للوسائط المتعددة بصورة أصلية، كما تشير وثائقه إلى اعتماد Qwen3.8-Omni-Flash نموذج Omni افتراضيًا.
5
وبالنسبة إلى المطورين، لا تكفي قدرة النموذج وحدها. فسير العمل المفيد يحتاج أيضًا إلى إطار وكيل يمرر ملفات الوسائط بصورة سليمة، ويحافظ على السياق، ويستدعي الأدوات المناسبة، ثم يعيد النتيجة بصيغة قابلة للاستخدام.
يلائم Qwen3.8-Omni-Flash المخرجات النصية المستندة إلى أدلة متعددة الوسائط: مثل الملخصات، والملاحظات القابلة للبحث، واستخراج القرارات، وتحليل المحتوى، وتنفيذ المهام المعتمدة على الأدوات. وبما أن مخرجاته الموثقة نصية، فلا ينبغي اعتباره تلقائيًا بديلًا مباشرًا لمساعد فوري يولد ردودًا صوتية. 17
كذلك، لا توفر المصادر المعطاة تفاصيل موثوقة وكافية لوصف عرض مستقل وفوري باسم Qwen3.8-Omni-Flash Realtime، أو خصائص وترخيص Qwen-Live Harness المذكور بصورة منفصلة. لذا ينبغي الرجوع إلى أحدث وثائق المنتج الرسمية قبل اتخاذ قرار تقني أو تشغيلي.
ليست القيمة الرئيسية لـ Qwen3.8-Omni-Flash مجرد نافذة سياق من مليون رمز، بل محاولته جمع فهم المحتوى المختلط طويل السياق وتنفيذ المهام الوكيلية ضمن نموذج واحد. وتشير مقارنة علي بابا مع Qwen3.5-Omni-Plus إلى تحسن ملحوظ، خصوصًا في وكلاء الصوت والفيديو والمهام طويلة الفيديو، إلا أن أرقام الأداء تظل مُعلنة من الشركة. 17
40
بالنسبة إلى الفرق التي تعمل على التسجيلات ومدخلات الوسائط المختلطة، يبقى الاختبار العملي هو الفيصل: هل يستطيع النموذج العثور على الدليل الصحيح، والحفاظ على السياق بين الوسائط، واستخدام الأدوات اللازمة، وإنتاج مخرجات نصية موثوقة لمسار العمل المحدد؟
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
Qwen3.8 Omni Flash هو نموذج Qwen متعدد الوسائط أصليًا من علي بابا، يستقبل النصوص والصور والصوت والفيديو ضمن نافذة سياق تصل إلى مليون رمز.
Qwen3.8 Omni Flash هو نموذج Qwen متعدد الوسائط أصليًا من علي بابا، يستقبل النصوص والصور والصوت والفيديو ضمن نافذة سياق تصل إلى مليون رمز. ميزته العملية الأبرز هي «الإدراك الوكيلي» للفيديو الطويل، إذ صُمم للبحث عن اللحظات المهمة بدل التعامل مع كامل التسجيل بالوتيرة نفسها.
مخرجات النموذج نصية؛ لذلك يلائم التحليل والبحث والتلخيص وسير العمل المدعوم بالأدوات أكثر من كونه مساعدًا صوتيًا مستقلاً يرد بالكلام.