يجمع ZDTaichu5.0 9B بين مفكك لغة Qwen3.5 9B بحجم يقارب 9 مليارات معلَمة ومشفّر الرؤية C RADIOv4 H، ويدعم النصوص والصور والفيديو وسياقًا يصل إلى 128 ألف رمز. تعتمد ميزته التقنية البارزة، «الاستدلال التكراري التكيفي المُبوَّب بالإنتروبيا»، على تخصيص خطوات تنقيح داخلية إضافية للرموز الأكثر صعوبة أو عدمًا لليقين بدلًا م...
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
لا يستهدف ZDTaichu5.0-9B مجرد وصف الصور أو الإجابة عن أسئلة بصرية مباشرة. فهذا النموذج المفتوح متعدد الوسائط من TaichuAI موجّه إلى الحالات التي تحتاج فيها المنظومة إلى فهم العلاقات بين الأشياء، وتبدّل زاوية الرؤية، والأدلة الموزعة على صور متعددة أو مقاطع فيديو طويلة؛ وهي مهام مهمة لأبحاث الذكاء المتجسّد والأنظمة الوكيلة التي تتعامل مع أدوات. 2
يجمع النموذج بين مفكك لغة Qwen3.5-9B بحجم يقارب 9 مليارات معلَمة ومشفّر رؤية C-RADIOv4-H. ويقبل النصوص، وصورة واحدة أو عدة صور، والفيديو، مع دعم مدخلات مرئية بأي دقة ونافذة سياق تصل إلى 128 ألف رمز. 2
ولا يقتصر نطاقه المعلن على تفسير المشاهد؛ إذ تضعه بطاقة النموذج ضمن استخدامات تشمل المستندات والمخططات والرسوم البيانية والتعرّف الضوئي على الحروف (OCR)، والإجابة عن الأسئلة البصرية، والرياضيات البصرية. 2
تركّز TaichuAI على قدرات مكانية ومتجسّدة قد تكون أصعب على نماذج اللغة والرؤية العامة، ومنها:
ويدعم النموذج كذلك تفاعلات موجهة للوكلاء البرمجيين. لكن ذلك لا يعني أنه ينفذ الأدوات استقلاليًا: يمكنه التخطيط لاستدعاءات الأدوات والمشاركة في سير عمل متعدد الخطوات أو الجولات، فيما تبقى مسؤولية تنفيذ الأدوات والتحقق من مخرجاتها وتأمينها على التطبيق المضيف. 2
تتمثل الفكرة التقنية الرئيسية في ما تسميه TaichuAI Entropy-Gated Adaptive Recurrent Reasoning، أي الاستدلال التكراري التكيفي المُبوَّب بالإنتروبيا. بدل إضافة مقدار الحساب الإضافي نفسه إلى كل رمز يولده النموذج، تستخدم الآلية درجة عدم اليقين لتحديد المواضع التي تستحق تنقيحًا إضافيًا داخل الفضاء الكامن. 2
بصياغة أبسط: قد تمر الخطوات السهلة بصورة اعتيادية، بينما تحصل التنبؤات الأكثر التباسًا أو صعوبة على جولات تنقيح داخلية إضافية. والهدف هو توجيه عمق حسابي أكبر إلى خطوات الاستدلال الصعبة دون رفع الكلفة الحسابية بالقدر نفسه عبر الاستجابة كلها. 2
وهذا مهم خصوصًا في الأسئلة المكانية؛ إذ إن خطأً واحدًا في تقدير علاقة بين جسمين أو في فهم تغيير زاوية الكاميرا قد يقلب الإجابة النهائية.
تنشر TaichuAI النتائج التالية ضمن مواد النموذج:
| مجال التقييم | المعيار | النتيجة المعلنة |
|---|---|---|
| مكاني / متجسّد | ViewSpatial | 62.50 |
| مكاني / متجسّد | MMSI-Bench | 47.20 |
| مكاني / متجسّد | MindCube-tiny | 78.27 |
| مكاني / متجسّد | ERQA | 48.00 |
| مكاني / متجسّد | RoboSpatial | 56.00 |
| وكلاء / اتباع التعليمات | TAU2-Bench | 87.70 |
| وكلاء / اتباع التعليمات | Claw-Eval | 71.40 |
| وكلاء / اتباع التعليمات | IFEval | 93.70 |
وتضع الشركة النموذج في موقع متقدم في الاستدلال المكاني والمتجسّد ضمن نماذج الرؤية واللغة العامة التي تقارنها وبحجم يقارب 10 مليارات معلَمة، مع الحفاظ على قدرات بصرية عامة قوية. 2
لكن هذه النتائج تبقى معلنة من الجهة المطوّرة، وليست تصنيفًا عالميًا حاسمًا. فالمقارنات تتأثر بإصدارات النماذج المختارة، والمطالبات، والمعالجة المسبقة، وإعدادات فك الترميز، ومنهجية التقييم. لذلك يلزم أن يعيد طرف مستقل تنفيذ الاختبارات مع كشف تلك التفاصيل قبل التعامل معها بوصفها أداءً مقارنًا مثبتًا. 2
يتوفر ZDTaichu5.0-9B عبر مستودع TaichuAI على Hugging Face. وتصفه النسخة المنشورة بأنه نموذج يعتمد على شيفرة مخصصة، مع روابط لمواد متعلقة بالاستدلال التكراري والنشر. 2
وبحسب الترتيب الترخيصي المعلن، تخضع مواد النموذج المنشورة إلى NVIDIA Open Model License، بينما تتضمن مكونات Qwen3.5 إشعارات ترخيص Apache-2.0. وعلى الفرق التي تفكر في إعادة التوزيع أو الاستخدام التجاري مراجعة ملفات الترخيص والإشعارات الأحدث في المستودع مباشرة. 2
ولخدمة النموذج، توثق TaichuAI مسارات مخصصة عبر vLLM 0.26.0 وDocker، بما في ذلك إعدادات أخذ عينات مختلفة لمهام التأريض المكاني وللمهام العامة. 2
يبرز ZDTaichu5.0-9B كنموذج مفتوح متعدد الوسائط بحجم يقارب 9 مليارات معلَمة، وتتمحور هويته حول الاستدلال عبر الصور والزوايا والمشاهد والفيديو، لا مجرد التعرّف على المحتوى البصري. ودعم السياق البالغ 128 ألف رمز، والمدخلات المرئية بأي دقة، وآلية الاستدلال التكراري التكيفية، تجعله خيارًا جديرًا بالنظر للباحثين والمطورين العاملين في نماذج الرؤية واللغة المكانية والذكاء المتجسّد وسير العمل الوكيلي الذي يديره التطبيق المضيف. 2
أما أرقامه المنشورة فتبدو واعدة، ولا سيما في المعايير المكانية، لكنها تظل دليلًا صادرًا عن المطور إلى أن تؤكدها اختبارات مستقلة وشفافة. 2
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يجمع ZDTaichu5.0 9B بين مفكك لغة Qwen3.5 9B بحجم يقارب 9 مليارات معلَمة ومشفّر الرؤية C RADIOv4 H، ويدعم النصوص والصور والفيديو وسياقًا يصل إلى 128 ألف رمز.
يجمع ZDTaichu5.0 9B بين مفكك لغة Qwen3.5 9B بحجم يقارب 9 مليارات معلَمة ومشفّر الرؤية C RADIOv4 H، ويدعم النصوص والصور والفيديو وسياقًا يصل إلى 128 ألف رمز. تعتمد ميزته التقنية البارزة، «الاستدلال التكراري التكيفي المُبوَّب بالإنتروبيا»، على تخصيص خطوات تنقيح داخلية إضافية للرموز الأكثر صعوبة أو عدمًا لليقين بدلًا من زيادة الحسابات على جميع الرموز.
تتوفر الأوزان ومواد النشر عبر مستودع المشروع على Hugging Face، مع مسارات تشغيل مخصصة باستخدام vLLM 0.26.0 وDocker.