يوفر النموذج، بحجم يقارب 9 مليارات معلمة، نقطة انطلاق متاحة للتنزيل لدراسة فهم المشاهد والعلاقات المكانية واستخدام الأدوات، مع سياق معلن يصل إلى 128 ألف رمز. يدعم النصوص والصور والفيديو، وتوفر TaichuAI نسختَي FP8 وNVFP4 وخيارات تشغيل موثقة عبر vLLM.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
إذا تغيّرت زاوية رؤية الكاميرا، فهل يستطيع النموذج تحديد موقع الجسم نفسه بالنسبة إلى غيره؟ هذا النوع من الأسئلة هو ما يجعل ZDTaichu5.0-9B مثيرًا للاهتمام في أبحاث الذكاء الاصطناعي المتجسد، أي الأنظمة التي يُراد لها فهم بيئة مادية والتفاعل معها. تقدّمه TaichuAI نموذجًا بصريًا لغويًا متاحًا للتنزيل لدراسة فهم المشاهد والاستدلال المكاني وعمل الوكلاء الذين يستخدمون الأدوات. لكنه ليس نظام روبوتات متكاملًا ثبتت سلامة تشغيله: الإجابة الصحيحة عن صورة لا تعني القدرة على تنفيذ حركة آمنة في المكان المصوَّر. 2
20
يجمع ZDTaichu5.0-9B بين مفكّك لغوي من Qwen3.5-9B ومُرمّز بصري من C-RADIOv4-H. وتذكر بطاقة النموذج أنه يقبل النصوص وصورة واحدة أو عدة صور والفيديو، مع دعم مدخلات بصرية بأي دقة، وأن طول السياق يصل إلى 128 ألف رمز. يتيح ذلك للباحثين تصميم تجارب تتطلب الرجوع إلى أكثر من منظور للمشهد؛ لكنه لا يضمن أداءً ثابتًا عند كل دقة أو عند بلوغ الحد الأقصى للسياق. 2
تسمي TaichuAI آليتها «الاستدلال التكراري التكيّفي الموجَّه بالإنتروبيا». ووفق وصفها، يستطيع النموذج تخصيص خطوات إضافية لتحسين التمثيل الداخلي عند التعامل مع الرموز الأصعب، بدل إنفاق المقدار نفسه من الحساب على كل رمز. الفكرة هي تعميق الاستدلال حيث تدعو الحاجة، لا زيادة العمل الحسابي بالتساوي في جميع المواضع. 20
تنسجم هذه الآلية مع الاستخدام البحثي المقصود: تتبُّع موضع جسم عند تبدّل زاوية الرؤية، وفهم العلاقات بين الأشياء، ثم إدخال هذا الفهم في تجربة لوكيل يستخدم الأدوات. وهي قدرات تصلح للاختبار في إعدادات الباحثين، لا دليلًا مسبقًا على نجاح نظام روبوتي يعمل من البداية إلى النهاية. 2
20
في المقارنات التي نشرتها TaichuAI مع نماذج بصرية لغوية عامة مقاربة في الحجم، سجّل النموذج 62.50 في ViewSpatial و78.27 في MindCube-tiny و47.20 في MMSI-Bench و48.00 في ERQA و56.00 في RoboSpatial. وتصف الشركة أداءه المكاني بأنه متقدم بين النماذج التي شملتها مقارنتها. هذه نتائج معلنة من الجهة المطوّرة، ولم تُعَد تجربتها بصورة مستقلة هنا؛ لذا ينبغي اختبار النموذج على مشاهد الباحث وإعداد الوكيل والبيئة المادية المستهدفة قبل الاعتماد على أي ترتيب أو نتيجة عامة. 1
20
تنشر TaichuAI النموذج الأساسي على منصة Hugging Face إلى جانب نسختَي FP8 وNVFP4. وتوفر أيضًا DSpark، وهو نموذج مساعد مخصص لفك الترميز التخميني مع النموذج الأساسي عند التقديم عبر vLLM. وللتشغيل، توثّق الشركة صورة Docker خاصة بالنموذج وفرعًا معدّلًا من vLLM؛ وهما نقطة انطلاق أوضح من افتراض أن التثبيت غير المعدّل سيتصرف بالطريقة نفسها. 2
4
5
3
17
قبل إعادة الاستخدام، تحقّق من ترخيص النموذج الأصلي وشروط مكوّناته وأي أوزان محوّلة. فإحدى نسخ GGUF التي أعدّها طرف ثالث تحمل وسم Apache-2.0، بينما يصف فهرس آخر ترتيبًا مختلفًا للترخيص؛ ولا يكفي وسم النسخة المحوّلة لحسم شروط النموذج الأصلي. 8
6
وانتبه أيضًا إلى الفرق بين إعداد الخادم ومواصفة النموذج: يضبط مثال TaichuAI في vLLM الخيار --max-model-len 220000، في حين تنص بطاقة النموذج على سياق يصل إلى 128 ألف رمز. لذلك لا يُعدّ رقم إعداد الخادم إثباتًا لصلاحية سياق فعّال بطول 220 ألف رمز. 17
2
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يوفر النموذج، بحجم يقارب 9 مليارات معلمة، نقطة انطلاق متاحة للتنزيل لدراسة فهم المشاهد والعلاقات المكانية واستخدام الأدوات، مع سياق معلن يصل إلى 128 ألف رمز.
يوفر النموذج، بحجم يقارب 9 مليارات معلمة، نقطة انطلاق متاحة للتنزيل لدراسة فهم المشاهد والعلاقات المكانية واستخدام الأدوات، مع سياق معلن يصل إلى 128 ألف رمز. يدعم النصوص والصور والفيديو، وتوفر TaichuAI نسختَي FP8 وNVFP4 وخيارات تشغيل موثقة عبر vLLM.
نتائج الاختبارات منشورة من الجهة المطوّرة ولم تُتحقق بصورة مستقلة هنا؛ كما أن فهم المشهد لا يثبت سلامة التصرف فيه.