नेटिव मल्टीमॉडेलिटी में टेक्स्ट, इमेज और वीडियो की समझ एजेंट की योजना, कार्रवाई और सत्यापन के एक ही चक्र में रहती है; Kimi K3 और Qwen3.8 Max इसी दिशा में काम कर रहे हैं। Kimi K3 ने Arena के Frontend Code Arena में 1,679 अंक के साथ शीर्ष स्थान हासिल किया। एक अलग Puter परीक्षण में इसने वेबपेज की जानबूझकर डाली गई पाँच...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
किसी मॉडल का इमेज इनपुट स्वीकार कर लेना और दृश्य जानकारी को एजेंट की सोचने-करने की प्रक्रिया का मूल हिस्सा बनाना, दो अलग बातें हैं। कोडिंग एजेंटों के लिए असली फर्क इसी जगह पैदा होता है।
Moonshot AI का Kimi K3 लंबे समय तक चलने वाले कोडिंग कार्य, नॉलेज वर्क, विज़ुअल अंडरस्टैंडिंग और रीजनिंग के लिए नेटिव मल्टीमॉडल एजेंटिक मॉडल के रूप में पेश किया गया है। Alibaba के अनुसार, Qwen3.8-Max में विज़ुअल अंडरस्टैंडिंग योजना, निष्पादन और सत्यापन—तीनों चरणों में काम करती है। 17
35
व्यावहारिक लक्ष्य सरल है: एजेंट कोई वेबपेज या ऐप बनाए, उसका रेंडर किया हुआ परिणाम देखे, कमी पहचाने और उसी आधार पर सुधार करे—बिना हर दृश्य संकेत को पहले टेक्स्ट रिपोर्ट या स्क्रीन-कोऑर्डिनेट में बदलने की मजबूरी के।
टेक्स्ट-फर्स्ट मॉडल कोड जनरेशन, बड़े कॉन्टेक्स्ट में विश्लेषण, टूल कॉलिंग और उन कामों के लिए अब भी उपयोगी हैं जिनकी इनपुट और सफलता की शर्तें टेक्स्ट में साफ बताई जा सकती हैं। ऐसे एजेंट OCR से लिखाई निकाल सकते हैं, DOM या accessibility tree देख सकते हैं, किसी तत्व के कोऑर्डिनेट मंगा सकते हैं, या स्क्रीनशॉट को अलग विज़न-लैंग्वेज मॉडल (VLM) को भेज सकते हैं। दस्तावेज़ से डेटा निकालने, संरचित UI जांच या एक बार के दृश्य प्रश्नों के लिए यह किफायती और उपयुक्त व्यवस्था हो सकती है।
नेटिव मल्टीमॉडल प्रशिक्षण एक अलग दांव है। इसका लक्ष्य टेक्स्ट, इमेज, वीडियो, कोड और एजेंट की कार्य-अवस्था को संयुक्त रूप से संभालना है, ताकि दृश्य प्रमाण सीधे योजना और संशोधन को प्रभावित कर सके। चीनी मॉडल बाजार पर एक रिपोर्ट ने Moonshot, Alibaba और ByteDance को इस दिशा में आगे बढ़ते हुए बताया, जबकि उस समय DeepSeek, Zhipu और Hunyuan की सामान्य-उद्देश्य रिलीज़ अपेक्षाकृत टेक्स्ट-केंद्रित थीं। 15
इसे कंपनियों के बीच स्थायी विभाजन नहीं मानना चाहिए। DeepSeek V4 Flash और V4 Pro शुरुआत में केवल टेक्स्ट समर्थित थे, लेकिन बाद में DeepSeek ने प्रयोगात्मक DeepSeek-V4-Flash-Vision-Exp पेश किया। 13
4 मॉडल लाइनअप तेजी से बदलते हैं और उपलब्ध स्रोत हर लैब के आंतरिक फैसलों की निर्णायक वजह नहीं बताते—खासकर ByteDance, Zhipu और Tencent के मामले में।
वेबपेज केवल शब्दों और DOM संरचना का नाम नहीं है। उसमें दृश्य पदानुक्रम, खाली जगह, अलाइनमेंट, कॉन्ट्रास्ट, टाइपोग्राफी, कटे हुए हिस्से, इमेजरी और अलग-अलग तत्वों का आपसी संबंध भी शामिल होता है। किसी संदर्भ डिज़ाइन को हूबहू बनाने वाले एजेंट के लिए अक्सर यही वास्तविक स्वीकार्यता मानदंड होते हैं।
विज़न-इन-द-लूप वर्कफ़्लो इस तरह चल सकता है:
Qwen3.8-Max स्पष्ट रूप से इसी बंद-लूप तरीके का वर्णन करता है: लंबे समय तक चलने वाले कार्यों में नेटिव विज़ुअल अंडरस्टैंडिंग योजना, निष्पादन और सत्यापन के दौरान इस्तेमाल होती है। इसके होस्टेड मॉडल में इमेज, टेक्स्ट और वीडियो इनपुट तथा टेक्स्ट आउटपुट समर्थित है। 35 Kimi K3 भी एक ही मॉडल में टेक्स्ट, इमेज और वीडियो को समझता है तथा 10 लाख टोकन का कॉन्टेक्स्ट विंडो देता है।
25
फायदा केवल इतना नहीं कि मॉडल “देख” सकता है। अहम बात यह है कि एजेंट अनुरोध, कोड, दृश्य आउटपुट और बदलती योजना को एक ही कार्य-संदर्भ में रखकर सुधार कर सकता है।
बाहरी परसेप्शन टूल उपयोगी हो सकते हैं, लेकिन वे देखने और कार्रवाई के बीच एक इंटरफ़ेस जोड़ते हैं।
OCR चुनिंदा जानकारी देता है। वह दिख रहा टेक्स्ट निकाल सकता है, लेकिन सिर्फ शब्दों से यह हमेशा नहीं पता चलता कि बटन कट रहा है, लेआउट असंतुलित है, कोई मॉडेल कंटेंट ढक रहा है, या दृश्य पदानुक्रम रेफरेंस से अलग है।
कोऑर्डिनेट व्यवस्थित, लेकिन सीमित होते हैं। “तत्व x/y पर है” जैसी जानकारी ऑटोमेशन में मददगार है, लेकिन इससे उसकी दृश्य प्रमुखता, स्टाइल, ओवरलैप या यह तय नहीं होता कि स्क्रीन पर वही सही तत्व दिख रहा है या नहीं।
बार-बार का रूपांतरण लंबी श्रृंखला को जटिल बना सकता है। हर स्क्रीनशॉट-से-वर्णन या स्क्रीनशॉट-से-कोऑर्डिनेट हैंडऑफ में संदर्भ का कुछ हिस्सा छूट सकता है। अधूरे विवरण पर किया गया पैच नई दृश्य समस्या पैदा कर सकता है, जिसके लिए एक और जांच चक्र चाहिए।
नेटिव मल्टीमॉडल मॉडल भी गलतियां कर सकते हैं, लेकिन वे स्क्रीनशॉट और इम्प्लीमेंटेशन के संदर्भ पर एक साथ विचार कर सकते हैं; उन्हें केवल स्क्रीनशॉट के टेक्स्ट सारांश पर निर्भर नहीं रहना पड़ता। फ्रंट-एंड डेवलपमेंट, GUI ऑटोमेशन, विज़ुअल रिग्रेशन डिबगिंग, इमेज एडिटिंग और वीडियो वर्कफ़्लो में यही इसकी मुख्य अपील है।
Kimi K3 के सार्वजनिक नतीजे बताते हैं कि डेवलपर्स इस दिशा पर ध्यान क्यों दे रहे हैं। Arena के मुताबिक, Kimi K3 ने Frontend Code Arena में 1,679 अंक के साथ शीर्ष स्थान लिया। यह Kimi K2.6 की तुलना में 17 पायदान की छलांग थी और मॉडल सात में से छह सूचीबद्ध फ्रंट-एंड डोमेन में पहले स्थान पर रहा। 32
अलग से, Puter के एक परीक्षण पर आई रिपोर्ट के अनुसार Kimi K3 ने लक्ष्य वेबपेज और रेंडर किए गए संस्करण की तुलना करके जानबूझकर डाली गई पाँच दृश्य विसंगतियों को बिना किसी गलत सकारात्मक परिणाम के पहचान लिया। 28
ये दृश्य सत्यापन के सार्थक उदाहरण हैं, लेकिन इनसे यह सिद्ध नहीं होता कि नतीजे केवल नेटिव विज़न की वजह से आए। मॉडल का आकार, प्रशिक्षण डेटा, पोस्ट-ट्रेनिंग, प्रॉम्प्ट डिज़ाइन, ब्राउज़र टूलिंग, एजेंट फ्रेमवर्क और बेंचमार्क की बनावट—सभी प्रदर्शन बदल सकते हैं। अधिक सटीक निष्कर्ष यह है कि विज़ुअल फीडबैक ऐसी वास्तविक विफलताओं को पकड़ सकता है जिन्हें टेक्स्ट-ओनली टेस्ट छोड़ दें।
यदि काम में बार-बार अवलोकन और सुधार जरूरी हो, और दृश्य गुणवत्ता ही “काम पूरा हुआ” की परिभाषा का हिस्सा हो, तो नेटिव मल्टीमॉडल एजेंट को प्राथमिकता देना समझदारी हो सकता है:
कम लागत वाले एक्सट्रैक्शन, बैच प्रोसेसिंग, या सिर्फ संरचित टेक्स्ट और UI स्टेट वाले काम में मॉड्यूलर OCR या बाहरी VLM पाइपलाइन बेहतर विकल्प रह सकती है। असली सवाल यह नहीं है कि विज़न नया ट्रेंड है या नहीं। सवाल यह है: क्या एजेंट को बार-बार यह जांचना है कि क्या आउटपुट सचमुच देखने में सही है?
ऐसे कामों में नेटिव मल्टीमॉडेलिटी परसेप्शन को कभी-कभार होने वाली टूल कॉल से बदलकर एजेंट के ऑपरेटिंग लूप का हिस्सा बना देती है—एक दिशा जिसे Kimi K3 और Qwen3.8-Max स्पष्ट रूप से आगे बढ़ा रहे हैं। 17
35
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
नेटिव मल्टीमॉडेलिटी में टेक्स्ट, इमेज और वीडियो की समझ एजेंट की योजना, कार्रवाई और सत्यापन के एक ही चक्र में रहती है; Kimi K3 और Qwen3.8 Max इसी दिशा में काम कर रहे हैं।
नेटिव मल्टीमॉडेलिटी में टेक्स्ट, इमेज और वीडियो की समझ एजेंट की योजना, कार्रवाई और सत्यापन के एक ही चक्र में रहती है; Kimi K3 और Qwen3.8 Max इसी दिशा में काम कर रहे हैं। Kimi K3 ने Arena के Frontend Code Arena में 1,679 अंक के साथ शीर्ष स्थान हासिल किया। एक अलग Puter परीक्षण में इसने वेबपेज की जानबूझकर डाली गई पाँच दृश्य विसंगतियां बिना गलत सकारात्मक परिणाम के पहचानीं। [32][28]