ZDTaichu5.0 9B लगभग 9 अरब पैरामीटर वाला विज़न लैंग्वेज मॉडल है। यह टेक्स्ट, एक या कई इमेज और वीडियो ले सकता है; इसकी घोषित कॉन्टेक्स्ट सीमा 128K टोकन तक है। [2] स्थानिक समझ पर इसके स्कोर TaichuAI के रिपोर्ट किए हुए हैं। शोधकर्ता इन्हें शुरुआती संकेत मानें, स्वतंत्र पुष्टि या रोबोट की सुरक्षित कार्रवाई का प्रमाण नहीं...
प्रकाशितकर्ताGPT-6 Sol से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
अगर कैमरे का कोण बदल जाए, तो क्या कोई AI मॉडल फिर भी बता पाएगा कि वस्तु कहाँ है और दूसरी वस्तुओं से उसका क्या संबंध है? ZDTaichu5.0-9B को इसी तरह के सवालों पर शोध के लिए पेश किया गया है। TaichuAI का यह डाउनलोड करने योग्य विज़न-लैंग्वेज मॉडल दृश्य समझने, स्थानिक संबंधों पर तर्क करने और टूल इस्तेमाल करने वाले AI एजेंट के प्रयोगों में काम आ सकता है। लेकिन किसी दृश्य के बारे में सही जवाब देना, उस दृश्य में रोबोट के सुरक्षित ढंग से काम कर पाने का प्रमाण नहीं है। 2
20
इसमें भाषा के लिए Qwen3.5-9B डिकोडर और दृश्य जानकारी के लिए C-RADIOv4-H एनकोडर है। मॉडल विवरण के मुताबिक यह टेक्स्ट, एक इमेज, कई इमेज और वीडियो ले सकता है; दृश्य इनपुट को ‘any-resolution’ बताया गया है। इसकी घोषित कॉन्टेक्स्ट सीमा 128K टोकन तक है—यानी एक बार में मॉडल को दी जा सकने वाली सामग्री की अधिकतम बताई गई मात्रा। ये सुविधाएँ एक ही दृश्य के कई कोणों पर प्रयोग करने का आधार देती हैं, लेकिन हर इनपुट आकार या पूरी कॉन्टेक्स्ट सीमा पर समान प्रदर्शन की गारंटी नहीं हैं। 2
TaichuAI अपनी तकनीक को एंट्रॉपी-गेटेड अडैप्टिव रिकरेंट रीज़निंग कहता है। उसके अनुसार, मॉडल हर टोकन पर बराबर आंतरिक गणना करने के बजाय अधिक चुनौतीपूर्ण हिस्सों के लिए अतिरिक्त सुधार-चरण इस्तेमाल कर सकता है। मकसद जहाँ ज़रूरत हो, वहाँ तर्क की गहराई बढ़ाना है। यह मॉडल की बताई गई कार्यप्रणाली है; इससे अपने-आप यह सिद्ध नहीं होता कि कोई पूरा रोबोटिक्स सिस्टम भरोसेमंद होगा। 20
2
TaichuAI की तुलना में समान आकार के सामान्य विज़न-लैंग्वेज मॉडलों के मुकाबले ZDTaichu5.0-9B के रिपोर्ट किए गए स्कोर ViewSpatial पर 62.50, MindCube-tiny पर 78.27, MMSI-Bench पर 47.20, ERQA पर 48.00 और RoboSpatial पर 56.00 हैं। कंपनी अपने तुलना-समूह में स्थानिक प्रदर्शन को अग्रणी बताती है। ये प्रकाशक की ओर से रिपोर्ट किए गए परिणाम हैं, यहाँ स्वतंत्र रूप से दोहराए गए परीक्षण नहीं। अपने कैमरों, एजेंट सेटअप और भौतिक वातावरण में प्रदर्शन अलग से जाँचना होगा। 1
20
मुख्य मॉडल Hugging Face पर उपलब्ध है। TaichuAI ने FP8 और NVFP4 संस्करण भी दिए हैं, साथ ही vLLM में मुख्य मॉडल के साथ इस्तेमाल के लिए DSpark ड्राफ्ट मॉडल दिया है। मॉडल चलाने के लिए उसके निर्देशों में एक मॉडल-विशिष्ट vLLM Docker इमेज और संशोधित vLLM ब्रांच है; इसलिए सामान्य, बिना बदलाव वाला इंस्टॉलेशन उसी तरह काम करेगा, यह मानकर न चलें। 2
4
5
3
17
दो जाँचें खास तौर पर ज़रूरी हैं। पहली, पुनः उपयोग से पहले मूल मॉडल, उसके घटकों और बदले गए वेट्स की लाइसेंस शर्तें जाँचें। एक तीसरे पक्ष के GGUF रूपांतरण पर Apache-2.0 लिखा है, जबकि दूसरी मॉडल सूची अलग लाइसेंस व्यवस्था बताती है। रूपांतरण का लेबल मूल मॉडल की शर्तें तय नहीं करता। 8
6 दूसरी, सर्वर सेटिंग को मॉडल की प्रमाणित क्षमता न समझें। TaichuAI के उदाहरण में
--max-model-len 220000 है, जबकि मॉडल विवरण कॉन्टेक्स्ट 128K टोकन तक बताता है। सेटिंग में 220000 लिखे होने से उतनी प्रभावी कॉन्टेक्स्ट क्षमता सत्यापित नहीं हो जाती। 17
2
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
ZDTaichu5.0 9B लगभग 9 अरब पैरामीटर वाला विज़न लैंग्वेज मॉडल है। यह टेक्स्ट, एक या कई इमेज और वीडियो ले सकता है; इसकी घोषित कॉन्टेक्स्ट सीमा 128K टोकन तक है। [2]
ZDTaichu5.0 9B लगभग 9 अरब पैरामीटर वाला विज़न लैंग्वेज मॉडल है। यह टेक्स्ट, एक या कई इमेज और वीडियो ले सकता है; इसकी घोषित कॉन्टेक्स्ट सीमा 128K टोकन तक है। [2] स्थानिक समझ पर इसके स्कोर TaichuAI के रिपोर्ट किए हुए हैं। शोधकर्ता इन्हें शुरुआती संकेत मानें, स्वतंत्र पुष्टि या रोबोट की सुरक्षित कार्रवाई का प्रमाण नहीं। [1][20]
मुख्य मॉडल के साथ FP8 और NVFP4 संस्करण उपलब्ध हैं। इस्तेमाल से पहले मूल लाइसेंस और मॉडल के लिए दिए गए vLLM निर्देश जाँचना ज़रूरी है। [2][4][5][8][6][17]