يجمع SenseNova U1.5 فهم الصور والاستدلال البصري وتوليد الصور وتحريرها في نموذج من فئة 8 مليارات معلمة، من دون مُرمّز رؤية خارجي أو مُرمّز تلقائي تبايني. يستخدم مناطق بصرية بحجم 32×32 بكسل، ثم يعيد بناء الصورة مع مراعاة المناطق المتجاورة للحد من الفواصل التي قد تظهر بين أجزائها.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
الفكرة في SenseNova U1.5 ليست وضع أداة لفهم الصور إلى جانب أخرى لرسمها، بل جمع فهم المحتوى البصري والاستدلال بشأنه وتوليد الصور وتحريرها في نموذج واحد من SenseTime، يعتمد بنية «مزيج المحوّلات» (MoT) ومن فئة 8 مليارات معلمة. ووفق التقرير التقني، لا يحتاج هذا التصميم إلى مُرمّز رؤية خارجي لمعالجة الصور، ولا إلى مُرمّز تلقائي تبايني (VAE) لفك ترميز الصور الناتجة؛ إذ يعيد بناء المخرجات في فضاء ألوان RGB. 1
3
يمثّل النموذج كل منطقة من الصورة بحجم 32×32 بكسل في رمز بصري، ليعمل على تسلسل مضغوط من الرموز بدل معالجة كل بكسل على حدة داخل بنية النموذج. وعند التوليد، يحوّل الحالات البصرية إلى بكسلات RGB عبر مفكّك ترميز، من دون الاعتماد على VAE لفك تمثيل كامن للصورة. هذه الواجهة البصرية المشتركة هي أساس الجمع بين الفهم والإنشاء في بنية واحدة. 1
21
لكن الفرق الأهم عن الإصدار السابق U1 يظهر عند تجميع الصورة الناتجة. فقد كان U1 يتنبأ بكل جزء من الصورة بصورة مستقلة باستخدام رأس قائم على شبكة إدراك متعددة الطبقات (MLP)، ما قد يُظهر فواصل أو أنماطًا شبكية، ولا سيما عند الدقات العالية. في U1.5، تُرتّب الحالات البصرية مجددًا في شبكة ثنائية الأبعاد، ثم يعيد مفكّك ترميز مكاني خفيف بناء الصورة تدريجيًا باستخدام Pixel Shuffle وعمليات التفاف بحجم 3×3. بذلك يمكن للمناطق المتجاورة أن تؤثر بعضها في بعض بدل رسم كل منطقة بمعزل عن جارتها. 1
3
22
ولتوليد صور تصل إلى 4096×4096 بكسل، تصف SenseTime آلية إضافية تراعي الدقة عند ضبط الضوضاء: يُدمج تمثيل لمقياس الضوضاء يتغير بحسب دقة الصورة مع الخطوة الزمنية لعملية التوليد. يعالج مفكّك الترميز ترابط الأجزاء، فيما تساعد هذه الآلية النموذج على التكيّف مع تغيّر حجم المخرجات. والهدف هو جعل التوليد بدقة 4K أكثر استقرارًا، لا ضمان خلو كل صورة من العيوب. 1
3
29
تتبع SenseTime نهج «التخصص ثم التوحيد» بعد التدريب الأساسي: تُحسّن خبراء لمهام جمالية الصورة، وإظهار النصوص بالصينية والإنجليزية، وتصميم الرسوم المعلوماتية، وتحرير الصور، ثم تدمج قدراتهم بعملية «تقطير متعددة الخبراء على أساس سلوك النموذج الحالي» (on-policy distillation). هؤلاء الخبراء جزء من عملية التدريب؛ ولا يعني ذلك ضرورة تشغيل أربعة نماذج متخصصة لكل طلب بعد التوحيد. 1
29
مقارنةً بـU1، تفيد SenseTime بتحسن التفاصيل عند الدقات العالية والترابط المكاني، إلى جانب إظهار النصوص والتخطيطات والتحرير، مع الحفاظ على التصميم الذي يجمع الفهم والتوليد بلا مُرمّز رؤية خارجي أو VAE. وتشمل النتائج التي أوردتها 0.92 في GenEval، و0.948 في CVTG-2K، و4.59 في ImgEdit. هذه نتائج تقييم منشورة، وليست دليلًا مستقلًا على التحسن في كل مهمة بصرية. 1
3
28
التقرير التقني متاح للعامة، وتوجد على Hugging Face صفحة رسمية لنقطة تحقق باسم SenseNova-U1.5-8B-MoT. وهي منفصلة عن صفحة U1.5-8B-MoT-Preview وعن إصدار U1.5-Lite-Preview الذي أعلنت عنه SenseTime على حدة؛ لذا لا ينبغي الخلط بين أصول النسخ التجريبية ونقطة تحقق النموذج الكامل. 1
31
22
13
أما شيفرة التدريب، فتقول الشركة إنها ستتيحها مفتوحة المصدر، بما يشمل شيفرة الضبط الدقيق الخاضع للإشراف، والتعلّم المعزّز، والتقطير على أساس سلوك النموذج الحالي. ولا يكفي نشر التقرير أو صفحات النموذج للاستنتاج أن الشيفرة الكاملة الموعودة أصبحت متاحة بالفعل. 1
3
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يجمع SenseNova U1.5 فهم الصور والاستدلال البصري وتوليد الصور وتحريرها في نموذج من فئة 8 مليارات معلمة، من دون مُرمّز رؤية خارجي أو مُرمّز تلقائي تبايني.
يجمع SenseNova U1.5 فهم الصور والاستدلال البصري وتوليد الصور وتحريرها في نموذج من فئة 8 مليارات معلمة، من دون مُرمّز رؤية خارجي أو مُرمّز تلقائي تبايني. يستخدم مناطق بصرية بحجم 32×32 بكسل، ثم يعيد بناء الصورة مع مراعاة المناطق المتجاورة للحد من الفواصل التي قد تظهر بين أجزائها.
للنموذج الكامل صفحة مستقلة على Hugging Face، تختلف عن نسختَي Preview وLite Preview؛ أما إتاحة شيفرة التدريب الكاملة فلا تزال وعدًا معلنًا.