SenseNova U1.5 מאחד הבנת תמונה, הסקה חזותית, יצירה ועריכה במודל Mixture of Transformers בעל כ־8 מיליארד פרמטרים, ללא מקודד ראייה חיצוני או VAE. המודל מייצג אזורי תמונה באמצעות טוקנים של 32×32 פיקסלים.
פורסם על ידינערך באמצעות GPT-6 Solהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
האתגר ב־SenseNova U1.5 הוא לא רק לגרום למודל לענות על שאלות לגבי תמונה וגם ליצור תמונה חדשה. האתגר הוא לעשות זאת באותה ארכיטקטורה, בלי להעביר את התמונה למקודד ראייה חיצוני ובלי להשתמש ב־VAE — רכיב שנפוץ לשחזור תמונה מייצוג דחוס. לפי הדוח של SenseTime, מודל Mixture of Transformers (MoT) בעל כ־8 מיליארד פרמטרים משלב הבנה, הסקה חזותית, יצירה ועריכה, ומשחזר את הפלט במרחב פיקסלי RGB. 1
3
U1.5 מייצג אזורי תמונה באמצעות טוקנים חזותיים של 32×32 פיקסלים. כך הוא יכול לעבוד עם רצף קומפקטי יחסית של מידע חזותי, בלי מקודד ראייה נפרד. בצד היצירה, מצבי המודל החזותיים משמשים לשחזור פיקסלי RGB, ולא עוברים דרך VAE שמפענח ייצוג תמונה דחוס. זהו הממשק המשותף שעליו נשען השילוב בין תפיסה ליצירה. 1
21
השינוי הבולט לעומת U1 נמצא בשלב שחזור התמונה. הדגם הקודם חזה כל מקטע תמונה בנפרד באמצעות רכיב MLP; ברזולוציה גבוהה, גבולות בין המקטעים יכלו להיראות כמו תפרים או דוגמת רשת. ב־U1.5 המצבים החזותיים מסודרים מחדש כרשת דו־ממדית ומועברים למפענח מרחבי קל, שמשתמש בשלבים של Pixel Shuffle ובקונבולוציות 3×3. כך אזורים שכנים יכולים להשפיע זה על זה בשחזור, במקום להיווצר בבידוד. 1
3
22
ליצירה של עד 4096×4096 פיקסלים, SenseTime מתארת גם התאמת רעש לרזולוציה: ייצוג של עוצמת רעש התלויה בגודל התמונה משולב עם שלב תהליך היצירה. המפענח המרחבי מטפל ברציפות בין מקטעים; התאמת הרעש נועדה להתמודד עם שינוי קנה המידה. אלה צעדים לשיפור יציבות היצירה ב־4K, לא הבטחה לתמונה נטולת פגמים. 1
3
29
גישת האימון המתקדם של SenseTime היא להתמחות ואז לאחד: החברה מאמנת מומחים לאסתטיקה חזותית, להצגת טקסט בסינית ובאנגלית, לאינפוגרפיקה ולעריכת תמונות, ואז מאחדת את יכולותיהם במודל באמצעות זיקוק רב־מומחים בשיטת on-policy. המומחים הם חלק מתהליך האימון; התוצאה המתוארת היא מודל מאוחד, לא דרישה להפעיל ארבעה מודלים בכל בקשה. 1
29
בהשוואה ל־U1, החברה מדווחת על פרטים חדים יותר ברזולוציה גבוהה ועל רציפות מרחבית משופרת, לצד שיפור בהצגת טקסט, בפריסות ובעריכה. לדבריה, המודל שומר גם על יכולות הבנת התמונה ועל הגישה שאינה משתמשת במקודד ראייה חיצוני או ב־VAE. התוצאות המדווחות הן 0.92 ב־GenEval, 0.948 ב־CVTG-2K ו־4.59 ב־ImgEdit. אלה ציוני הערכה שדווחו על המודל, ולא הוכחה עצמאית לשיפור בכל משימה חזותית. 1
3
28
הדוח הטכני של U1.5 פומבי, וב־Hugging Face מופיע רישום רשמי של נקודת ביקורת בשם SenseNova-U1.5-8B-MoT. יש להבחין בינו לבין העמוד של U1.5-8B-MoT-Preview ובין גרסת U1.5-Lite-Preview ש־SenseTime הציגה בנפרד. נכסי גרסאות התצוגה המקדימה אינם תחליף לזיהוי הנכון של המודל המלא. 1
31
22
13
SenseTime אומרת כי תפרסם בקוד פתוח קוד אימון לכוונון מפוקח, ללמידת חיזוק ולזיקוק בשיטת on-policy. עצם פרסום הדוח ורישומי המודלים אינו מאשר שכל קוד האימון שהובטח כבר זמין. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 מאחד הבנת תמונה, הסקה חזותית, יצירה ועריכה במודל Mixture of Transformers בעל כ־8 מיליארד פרמטרים, ללא מקודד ראייה חיצוני או VAE.
SenseNova U1.5 מאחד הבנת תמונה, הסקה חזותית, יצירה ועריכה במודל Mixture of Transformers בעל כ־8 מיליארד פרמטרים, ללא מקודד ראייה חיצוני או VAE. המודל מייצג אזורי תמונה באמצעות טוקנים של 32×32 פיקסלים. מפענח מרחבי חדש נועד לצמצם תפרים בין אזורים, לצד התאמת תהליך היצירה לרזולוציות של עד 4096×4096.
הדוח הטכני ורישום נפרד של המודל המלא זמינים; הם אינם זהים לגרסאות Preview ו־Lite Preview.