كان QVQ 72B Preview نموذجاً بحثياً تجريبياً للتفكير البصري أطلقه فريق Qwen التابع لعلي بابا في ديسمبر 2024. استهدف النموذج تحليل الصور والرسوم البيانية والمسائل الرياضية البصرية عبر استدلال متعدد الخطوات، لكن طول مسار الاستدلال لا يضمن بقاء الإجابة مستندة إلى الصورة.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Cloud’s QVQ-72B-Preview, released in December 2024 as an experimental open-weight multimodal AI model combining Qwen2-VL-72B. Article summary: QVQ-72B-Preview was Alibaba Cloud’s December 2024 experimental, open-weight visual-reasoning model: it paired Qwen2-VL-72B’s image understanding with QwQ-style extended chain-of-thought reasoning. Its significance was le. Topic tags: general, general web, government, education, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, c
QVQ-72B-Preview هو نموذج بحثي تجريبي من فريق Qwen التابع لعلي بابا، قُدّم في ديسمبر 2024 بهدف تحسين التفكير البصري: أي فحص ما في الصورة ثم بناء إجابة عبر خطوات استدلالية. استند إلى Qwen2-VL-72B، وركّز على التعامل مع المسائل المعتمدة على الصور بصورة أعمق من مجرد وصف محتواها. لذلك، من الأدق النظر إليه كتجربة مبكرة بأوزان مفتوحة تجمع الفهم البصري مع حل المشكلات متعددة الخطوات، لا كمساعد متعدد الوسائط مكتمل الأغراض.38
39
عند تزويده بصورة وتعليمات نصية، صُمّم QVQ لاستخراج الأدلة البصرية ثم الاستدلال عليها قبل الإجابة. ويشمل ذلك مهام مثل:
يشير الرقم 72B إلى حجمه ضمن عائلة Qwen، فيما تعني كلمة Preview أن الإصدار تجريبي. وقدّمه فريق Qwen صراحةً كنموذج بحثي مع توثيق قيوده، إلى جانب نتائج الاختبارات المعيارية.38
39
وفق جدول المقارنات المنشور من Qwen، حقق QVQ-72B-Preview النتائج التالية مقارنة بـ Qwen2-VL-72B:
| الاختبار المعياري | QVQ-72B-Preview | Qwen2-VL-72B للمقارنة |
|---|---|---|
| MMMU (التحقق) | 70.3 | 64.5 |
| MathVision (كامل) | 35.9 | 25.9 |
| OlympiadBench | 20.4 | 11.2 |
يقيس MMMU الفهم متعدد الوسائط في موضوعات أكاديمية واسعة بمستوى جامعي. أما MathVision فيركّز على المسائل الرياضية المعتمدة على الصور، ويشمل OlympiadBench أسئلة صعبة ثنائية اللغة في الرياضيات والفيزياء. وتُظهر الأرقام المنشورة تفوق QVQ على Qwen2-VL-72B في الاختبارات الثلاثة، وهو ما ينسجم مع تموضعه كنموذج للاستدلال.39
40
لكن هذه النتائج معلنة من الجهة المطوّرة وليست تقييماً مستقلاً لأدائه في بيئات الاستخدام الفعلية. فالنتائج المعيارية مؤشر مفيد، لكنها لا تمنع الأخطاء الناتجة عن الصور الملتبسة أو التعليمات غير المعتادة أو نقص السياق أو هشاشة الاستدلال.
كانت قيود الإطلاق جزءاً أساسياً من فهم النموذج، لأنها ترسم الفاصل بين عرض بحثي واعد ومساعد عملي يمكن الاعتماد عليه.
دعم الإصدار التجريبي إدخال الصور فقط، ولم يدعم الفيديو، رغم أن الإصدارات السابقة من سلسلة Qwen2-VL كانت تمتلك قدرات مرتبطة بالفيديو. وبذلك انحصر استخدامه في التحليل البصري للمحتوى الثابت.37
43
كان التفاعل مع الصورة عملياً من جولة واحدة: لا يمكن للمستخدم طرح سؤال لاحق مع الاحتفاظ بسياق الصورة الذي استند إليه النموذج. وللحصول على إجابة جديدة عن الصورة نفسها، كان يجب إرسالها من جديد مع تعليمات جديدة.34
أهم تحذير من Qwen هو أن النموذج، أثناء الاستدلال البصري متعدد الخطوات، قد يفقد تدريجياً تركيزه على محتوى الصورة ويبدأ في اختلاق معلومات غير صحيحة. أي إن الشرح الطويل والمنظم قد يبدو مقنعاً، مع أنه لم يعد مرتبطاً بما تظهره الصورة فعلياً.33
38
كما حذّرت بطاقة النموذج من إمكان خلط اللغات أو الانتقال المفاجئ بينها، ومن الوقوع في حلقات استدلال دائرية تنتج إجابات مطوّلة من دون الوصول إلى نتيجة.38
39
الخلاصة العملية: يلزم التحقق من مخرجات QVQ في أي استخدام حساس. فوجود مسار استدلال ظاهر لا يثبت أن كل ملاحظة فيه صحيحة أو مستندة فعلاً إلى الصورة.
تتجاوز أهمية الإصدار جدول النتائج المعيارية؛ إذ يندرج ضمن نهج أوسع يرتبط بعائلة Qwen ونماذج صينية أخرى تقوم على إتاحة الأوزان. وتعني الأوزان المفتوحة إتاحة المعاملات المدرّبة للنموذج للتنزيل والاستخدام والتعديل، بما يسمح للمؤسسات بتشغيله خارج تطبيق المطور أو واجهة برمجة التطبيقات الخاصة به وتكييفه لاستخدامات جديدة.18
وقد يوفّر ذلك للمطورين مزايا منها:
لكن هذه المرونة تفرض مسؤوليات أيضاً: فالجهة التي تشغّل الأوزان المحمّلة تصبح مسؤولة عن البنية التحتية والتقييم وضبط الوصول وممارسات الأمن والحد من إساءة الاستخدام. وتشير رويترز إلى أن الأنظمة مفتوحة الأوزان يمكن تنزيلها وفحصها وتعديلها، لكنها قد تُعدّل وتُعاد توزيعها مع قدر محدود نسبياً من الرقابة.19
من الصحيح عموماً أن مطورين صينيين عديدين روّجوا لنماذج مفتوحة الأوزان، بينما لا تتيح شركات أميركية رائدة مثل OpenAI وAnthropic مواصفات نماذجها المتقدمة للتنزيل.19 لكن اختزال المشهد إلى «الصيني مفتوح والأميركي مغلق» تبسيط مخل؛ فالقرار يختلف باختلاف النموذج والمطور والقدرات والاستراتيجية التجارية.
والفارق العملي هو:
وهنا يظهر مفاضل حقيقية في السياسات: قد تكون القواعد المبنية على المراقبة المركزية أو الاختبارات أو الترخيص أو الإبلاغ أسهل تطبيقاً لدى مزوّدي واجهات API الكبار، ما قد يمنح نموذجهم التشغيلي أفضلية. لكن هذا استنتاج عن الحوافز التنظيمية، وليس نتيجة مؤكدة. ويمكن للسياسات بدلاً من ذلك أن تركز على الاستخدامات عالية المخاطر والجهات المشغّلة لها، لا على حظر توزيع الأوزان بحد ذاته. ويحذّر باحثون في ستانفورد من أن الانتشار العالمي للنماذج الصينية مفتوحة الأوزان قد يؤثر في الوصول إلى التقنية والمنافسة والسلامة وحوكمة الذكاء الاصطناعي.18
كان QVQ-72B-Preview تجربة بارزة في ديسمبر 2024 للتفكير البصري بأوزان مفتوحة. فقد أظهر، وفق تقييمات Qwen المعلنة، تحسناً على MMMU وMathVision وOlympiadBench، لكنه وثّق في الوقت ذاته قيوداً كبيرة في قابلية الاستخدام والموثوقية. والدرس ليس أن الاستدلال المتسلسل حلّ مشكلات الذكاء الاصطناعي متعدد الوسائط، بل أن تحسين التفكير في الصور يمكن إتاحته بصيغة تسمح للمطورين بفحص النموذج وتشغيله؛ وهي صيغة تجعل التقييم الدقيق والتشغيل المسؤول أكثر أهمية، لا أقل.38
39
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
كان QVQ 72B Preview نموذجاً بحثياً تجريبياً للتفكير البصري أطلقه فريق Qwen التابع لعلي بابا في ديسمبر 2024.
كان QVQ 72B Preview نموذجاً بحثياً تجريبياً للتفكير البصري أطلقه فريق Qwen التابع لعلي بابا في ديسمبر 2024. استهدف النموذج تحليل الصور والرسوم البيانية والمسائل الرياضية البصرية عبر استدلال متعدد الخطوات، لكن طول مسار الاستدلال لا يضمن بقاء الإجابة مستندة إلى الصورة.
تتيح الأوزان المفتوحة تشغيل النموذج وتكييفه خارج واجهة برمجة تطبيقات المورّد، لكنها تنقل قدراً أكبر من مسؤوليات التقييم والأمن والتشغيل إلى الجهة التي تستخدمه.[18][19]