يتلقى النموذج النصوص والصور والصوت والفيديو ضمن سير عمل واحد، مع نافذة سياق تصل إلى مليون رمز؛ ويُقدَّم عبر منصة Qwen AI. تقول علي بابا إن متوسط أدائه تحسّن بأكثر من 25% مقارنةً بـQwen3.5 Omni Plus عبر 29 تقييماً.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
إذا كان المطلوب استخراج قرار من اجتماع مصوّر أو العثور على لحظة بعينها في تسجيل طويل، فلا تكفي القدرة على تفريغ الكلام وحدها. هنا تتمحور فكرة Qwen3.8-Omni-Flash، الذي أطلقته علي بابا في سبتمبر 2026 وأتاحته عبر منصة Qwen AI: نموذج يستقبل النصوص والصور والصوت والفيديو بصورة أصلية ضمن سير عمل واحد، ثم يستدل على المحتوى ويستعين بالأدوات لإنجاز المهمة. وتصل نافذة سياقه إلى مليون رمز؛ والرموز وحدات معالجة النص والوسائط، وليست مرادفاً مباشراً لعدد الكلمات. أما النموذج الأساسي فيُخرج النص، في حين يضيف إصدار Realtime مخرجات صوتية للتفاعل المباشر. 1
2
5
بدلاً من فحص كل لحظة في الفيديو الطويل بالوتيرة نفسها، يستطيع الوكيل تحديد الأجزاء المرتبطة بالسؤال والعودة إليها لجمع الأدلة. وتفيد علي بابا بأن هذه المعالجة الانتقائية استهلكت رموزاً أقل بنسبة 51.8% من المعالجة الثابتة في اختبار OmniVideoBench؛ إنها نتيجة اختبار معلنة، لا نسبة توفير مضمونة لكل فيديو. 12
16
وفي الاجتماعات، يدعم النموذج مدخلات صوتية ومرئية تصل إلى ساعة، مع إمكان ربط المتحدثين بما يظهر على الشاشة، وتفريغ الكلام ونسبته إلى أصحابه. ويمكن أن يمتد سير العمل إلى إعداد محضر أو قائمة مهام، ثم استخدام الأدوات لتنفيذ خطوات لاحقة بحسب التطبيق. نافذة السياق الكبيرة مفيدة هنا لأنها تتيح التعامل مع مادة مطوّلة ومتنوعة داخل المهمة نفسها، لكنها لا تغني عن اختيار المعلومات ذات الصلة والتحقق من المخرجات. 52
2
6
بحسب علي بابا، ارتفع متوسط نتيجة Qwen3.8-Omni-Flash بأكثر من 25% عن Qwen3.5-Omni-Plus عبر 29 تقييماً. ينبغي قراءة ذلك بوصفه متوسطاً لا وعداً بأن كل مهمة ستتحسن بالنسبة نفسها. 12
ولإدخال هذه القدرات في تطبيقات الوكلاء، وسّعت الشركة Qwen-MM-Plugins مفتوحة المصدر لدعم التعامل مع الصوت والفيديو الطويلين، واستدعاء الأدوات وتنفيذ سير العمل. كما طرحت Qwen-Live Harness مفتوحة المصدر للتفاعلات المستمرة في الوقت الفعلي. وتوضح وثائق QwenCloud أن إصدار Qwen3.8-Omni-Flash-Realtime يدعم التفاعل المباشر بالصوت والفيديو، مع إخراج نصي وصوتي، والصوت متعدد القنوات، وتجميع الفيديو، وأدوات MCP البعيدة؛ وMCP بروتوكول يتيح ربط الوكيل بأدوات خارجية. وهذه قدرات للإصدار المباشر، لا ينبغي الخلط بينها وبين مخرجات النموذج الأساسي النصية. 52
1
5
تقول علي بابا إن تكلفة واجهة البرمجة لكل ساعة من إدخال الصوت انخفضت بأكثر من 98%، ولكل ساعة من إدخال الصوت والفيديو معاً بأكثر من 93%. وبالاقتران مع فحص الفيديو عند الحاجة، قد يجعل ذلك تشغيل وكلاء يراجعون التسجيلات مراراً ويستخدمون الأدوات أكثر جدوى من حيث التكلفة. لكن الفاتورة الفعلية تظل رهناً بحجم الوسائط والرموز المعالَجة والمخرجات والأدوات المستخدمة، فضلاً عن اختلاف عبء العمل عن ظروف الاختبارات المعلنة. 12
16
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يتلقى النموذج النصوص والصور والصوت والفيديو ضمن سير عمل واحد، مع نافذة سياق تصل إلى مليون رمز؛ ويُقدَّم عبر منصة Qwen AI.
يتلقى النموذج النصوص والصور والصوت والفيديو ضمن سير عمل واحد، مع نافذة سياق تصل إلى مليون رمز؛ ويُقدَّم عبر منصة Qwen AI. تقول علي بابا إن متوسط أدائه تحسّن بأكثر من 25% مقارنةً بـQwen3.5 Omni Plus عبر 29 تقييماً.
يساعد انتقاء المقاطع ذات الصلة من الفيديو، إلى جانب أدوات الوكلاء، على تحويل التسجيلات الطويلة إلى مخرجات عملية بدلاً من الاكتفاء بوصفها.