SenseNova U1.5 तस्वीरों को समझने, उन पर तर्क करने, उन्हें बनाने और संपादित करने के लिए SenseTime का 8B पैरामीटर Mixture of Transformers मॉडल है। इसे अलग विज़न एनकोडर या VAE की ज़रूरत नहीं पड़ती। मॉडल तस्वीर को 32×32 पिक्सेल के विज़ुअल टोकन में निरूपित करता है। नया स्पेशल डिकोडर पड़ोसी हिस्सों को साथ लेकर तस्वीर बनात...
प्रकाशितकर्ताGPT-6 Sol से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 का मुख्य विचार सीधा है: तस्वीर को समझने और नई तस्वीर बनाने के लिए अलग-अलग प्रणालियों पर निर्भर रहने के बजाय, दोनों काम एक साझा विज़ुअल व्यवस्था में किए जाएँ। SenseTime इसे 8B-पैरामीटर Mixture-of-Transformers (MoT) मॉडल बताती है, जो तस्वीरों को समझ सकता है, उन पर तर्क कर सकता है और उन्हें बना या संपादित कर सकता है। इसके लिए बाहरी विज़न एनकोडर नहीं लगाया जाता; तस्वीर बनाते समय भी VAE के ज़रिये इमेज लैटेंट को डिकोड करने के बजाय RGB पिक्सेल में आउटपुट पुनर्निर्मित किया जाता है। कंपनी की तकनीकी रिपोर्ट के मुताबिक, इस डिज़ाइन का लक्ष्य समझने की क्षमता बनाए रखते हुए 4K तक की इमेज जनरेशन बेहतर करना है। 1
3
U1.5 तस्वीर के 32×32 पिक्सेल वाले हिस्सों को विज़ुअल टोकन के रूप में निरूपित करता है। इससे मॉडल को पूरी तस्वीर के बजाय हिस्सों का एक क्रम मिलता है, जिस पर वह काम कर सके। यही साझा विज़ुअल इंटरफ़ेस तस्वीर समझने और बनाने—दोनों प्रक्रियाओं का आधार है। आउटपुट बनाते समय मॉडल अपने विज़ुअल स्टेट से RGB पिक्सेल पुनर्निर्मित करता है, न कि VAE से कोई लैटेंट इमेज डिकोड कराता है। 1
21
U1 से सबसे अहम बदलाव पिक्सेलों को वापस तस्वीर में जोड़ने के तरीके में है। U1 का पैच-आधारित MLP हेड हर हिस्से को स्वतंत्र रूप से बनाता था। बड़े आकार की तस्वीरों में इससे हिस्सों के बीच जोड़ की रेखाएँ या ग्रिड जैसे निशान दिख सकते थे। U1.5 विज़ुअल स्टेट को फिर दो-आयामी ग्रिड में रखता है और Pixel Shuffle तथा 3×3 कन्वोल्यूशन वाला हल्का स्पेशल डिकोडर इस्तेमाल करता है। अब पड़ोसी हिस्से पुनर्निर्माण में एक-दूसरे को प्रभावित कर सकते हैं। 1
3
22
4096×4096 पिक्सेल तक इमेज जनरेशन के लिए SenseTime रिज़ॉल्यूशन-अवेयर नॉइज़ कंडीशनिंग भी बताती है। इसमें आउटपुट के आकार पर निर्भर नॉइज़-स्केल एम्बेडिंग को जनरेशन के टाइमस्टेप के साथ जोड़ा जाता है, ताकि रिज़ॉल्यूशन बदलने पर नॉइज़ का बदलता व्यवहार मॉडल के ध्यान में रहे। स्पेशल डिकोडर हिस्सों के बीच निरंतरता पर काम करता है; नॉइज़ कंडीशनिंग बदलते आकार पर। इनका उद्देश्य 4K जनरेशन को अधिक स्थिर बनाना है—यह हर तस्वीर में त्रुटियाँ न होने की गारंटी नहीं है। 1
3
29
SenseTime ट्रेनिंग के बाद मॉडल को निखारने के लिए ‘पहले विशेषज्ञ बनाओ, फिर एक करो’ का तरीका अपनाती है। विज़ुअल आकर्षण, चीनी और अंग्रेज़ी टेक्स्ट को तस्वीर में दिखाने, इन्फोग्राफ़िक्स बनाने और इमेज एडिटिंग के लिए अलग विशेषज्ञ ऑप्टिमाइज़ किए जाते हैं। फिर उनकी क्षमताओं को मल्टी-एक्सपर्ट ऑन-पॉलिसी डिस्टिलेशन के ज़रिये एक मॉडल में समेटा जाता है। यानी ये विशेषज्ञ ट्रेनिंग की प्रक्रिया का हिस्सा हैं; हर अनुरोध पर चार अलग मॉडल चलाने की ज़रूरत बताई नहीं जा रही। 1
29
SenseTime के मुताबिक, U1 की तुलना में U1.5 बड़े आकार की तस्वीरों में अधिक बारीक विवरण और हिस्सों के बीच बेहतर निरंतरता देता है। कंपनी टेक्स्ट रेंडरिंग, लेआउट और एडिटिंग में भी सुधार बताती है, जबकि बाहरी एनकोडर और VAE के बिना तस्वीर समझने व बनाने वाला डिज़ाइन कायम है। रिपोर्ट में GenEval पर 0.92, CVTG-2K पर 0.948 और ImgEdit पर 4.59 स्कोर दिए गए हैं। ये रिपोर्ट किए गए परीक्षण परिणाम हैं, हर विज़ुअल काम में सुधार का स्वतंत्र प्रमाण नहीं। 1
3
28
U1.5 की तकनीकी रिपोर्ट सार्वजनिक है। Hugging Face पर SenseNova-U1.5-8B-MoT नाम से पूर्ण मॉडल के चेकपॉइंट की अलग लिस्टिंग भी है। इसे U1.5-8B-MoT-Preview पेज या SenseTime के अलग से घोषित U1.5-Lite-Preview रिलीज़ के साथ एक नहीं समझना चाहिए। 1
31
22
13
SenseTime का कहना है कि वह सुपरवाइज़्ड फ़ाइन-ट्यूनिंग, रीइन्फोर्समेंट लर्निंग और ऑन-पॉलिसी डिस्टिलेशन का ट्रेनिंग कोड ओपन-सोर्स करेगी। रिपोर्ट और मॉडल लिस्टिंग मौजूद होने से यह निष्कर्ष नहीं निकलता कि वादा किया गया पूरा ट्रेनिंग कोड अभी उपलब्ध है। 1
3
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
SenseNova U1.5 तस्वीरों को समझने, उन पर तर्क करने, उन्हें बनाने और संपादित करने के लिए SenseTime का 8B पैरामीटर Mixture of Transformers मॉडल है। इसे अलग विज़न एनकोडर या VAE की ज़रूरत नहीं पड़ती।
SenseNova U1.5 तस्वीरों को समझने, उन पर तर्क करने, उन्हें बनाने और संपादित करने के लिए SenseTime का 8B पैरामीटर Mixture of Transformers मॉडल है। इसे अलग विज़न एनकोडर या VAE की ज़रूरत नहीं पड़ती। मॉडल तस्वीर को 32×32 पिक्सेल के विज़ुअल टोकन में निरूपित करता है। नया स्पेशल डिकोडर पड़ोसी हिस्सों को साथ लेकर तस्वीर बनाता है, ताकि U1 में दिख सकने वाली जोड़ की रेखाएँ कम हों।
पूर्ण U1.5 चेकपॉइंट की लिस्टिंग, Preview और Lite Preview से अलग है। तकनीकी रिपोर्ट सार्वजनिक है, लेकिन ट्रेनिंग कोड जारी करने का वादा अपने आप में उसके उपलब्ध होने की पुष्टि नहीं करता।