SenseNova U1.5 ของ SenseTime เป็นโมเดล 8B MoT สำหรับเข้าใจ ให้เหตุผลเกี่ยวกับ สร้าง และแก้ไขภาพ โดยไม่พึ่งตัวเข้ารหัสภาพภายนอกหรือ VAE โมเดลแทนพื้นที่ภาพขนาด 32×32 พิกเซลด้วยโทเคนภาพ แล้วใช้ตัวถอดรหัสที่คำนึงถึงพื้นที่ข้างเคียง เพื่อลดรอยต่อระหว่างส่วนของภาพที่อาจพบใน U1 มีรายงานเทคนิคและหน้าเช็กพอยต์ U1.5 รุ่นเต็มแ...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ถ้าต้องการให้ AI ดูภาพแล้วตอบคำถาม และ สร้างหรือแก้ภาพ ได้ด้วย โมเดลหนึ่งตัวต้องรับมือกับงานที่ต่างกันมาก SenseNova U1.5 ของ SenseTime ใช้สถาปัตยกรรม Mixture-of-Transformers หรือ MoT ขนาด 8B พารามิเตอร์ เพื่อรวมการเข้าใจภาพ การให้เหตุผลเกี่ยวกับภาพ การสร้าง และการแก้ไขภาพไว้ในระบบเดียว จุดสำคัญคือโมเดลไม่ส่งภาพไปให้ตัวเข้ารหัสภาพภายนอก และไม่ใช้ VAE ซึ่งเป็นตัวถอดรหัสภาพจากข้อมูลแฝงในขั้นสร้างภาพ แต่สร้างผลลัพธ์กลับมาในพื้นที่พิกเซล RGB 1
3
U1.5 แทนพื้นที่ภาพขนาด 32×32 พิกเซล ด้วยโทเคนภาพหนึ่งหน่วย ทำให้โมเดลประมวลผลภาพเป็นลำดับข้อมูลที่กระชับได้ แต่การแปลงโทเคนกลับเป็นภาพมีโจทย์สำคัญ: ถ้าสร้างภาพแต่ละส่วนแยกจากกัน รอยต่ออาจปรากฏชัดเมื่อภาพมีขนาดใหญ่ 1
21
นั่นคือข้อแตกต่างหลักจาก U1 รุ่นก่อน ซึ่งใช้ส่วนประมวลผล MLP สร้างภาพ RGB ทีละส่วนอย่างอิสระ จนอาจเกิดแนวตารางหรือรอยต่อในภาพความละเอียดสูง U1.5 นำสถานะของโทเคนกลับมาจัดเป็นตารางสองมิติ แล้วใช้ตัวถอดรหัสที่เชื่อมข้อมูลเชิงพื้นที่ โดยอาศัย Pixel Shuffle แบบเป็นขั้นและคอนโวลูชันขนาด 3×3 พื้นที่ข้างเคียงจึงมีส่วนช่วยในการสร้างภาพ แทนที่จะถูกวาดแยกขาดจากกัน 1
3
22
สำหรับการสร้างภาพได้ถึง 4096×4096 พิกเซล SenseTime ยังอธิบายวิธีปรับเงื่อนไขสัญญาณรบกวนตามความละเอียด โดยนำข้อมูลระดับสัญญาณรบกวนที่ขึ้นกับขนาดภาพมารวมกับขั้นเวลาของกระบวนการสร้างภาพ ตัวถอดรหัสช่วยเรื่องความต่อเนื่องระหว่างส่วนของภาพ ส่วนวิธีนี้ช่วยให้โมเดลคำนึงถึงความเปลี่ยนแปลงเมื่อขนาดภาพเพิ่มขึ้น ทั้งคู่มีเป้าหมายให้การสร้างภาพ 4K เสถียรขึ้น ไม่ใช่คำรับประกันว่าภาพจะไร้จุดบกพร่อง 1
3
29
แนวทางหลังการฝึกของ SenseTime คือ แยกฝึกความถนัด แล้วนำมารวมกัน โดยปรับโมเดลเฉพาะทางด้านความสวยงามของภาพ การแสดงข้อความจีนและอังกฤษ อินโฟกราฟิก และการแก้ไขภาพ จากนั้นถ่ายทอดความสามารถกลับสู่โมเดลเดียวด้วยกระบวนการ multi-expert on-policy distillation โมเดลเฉพาะทางเหล่านี้เป็นส่วนของการฝึก ไม่ได้หมายความว่าผู้ใช้ต้องเรียกใช้หลายโมเดลพร้อมกันทุกครั้ง 1
29
SenseTime รายงานว่าเมื่อเทียบกับ U1 รุ่นใหม่ให้รายละเอียดภาพความละเอียดสูงและความต่อเนื่องเชิงพื้นที่ดีขึ้น รวมถึงการแสดงข้อความ การจัดวางองค์ประกอบ และการแก้ไขภาพ โดยยังคงแนวทางเข้าใจและสร้างภาพแบบไม่ใช้ตัวเข้ารหัสภาพภายนอกหรือ VAE คะแนนที่รายงาน ได้แก่ GenEval 0.92, CVTG-2K 0.948 และ ImgEdit 4.59 ตัวเลขเหล่านี้เป็นผลประเมินที่รายงานไว้ ไม่ใช่หลักฐานอิสระว่า U1.5 ดีกว่าในทุกงานด้านภาพ 1
3
28
รายงานเทคนิค U1.5 เปิดเผยแล้ว และมีหน้า Hugging Face สำหรับเช็กพอยต์ SenseNova-U1.5-8B-MoT โดยเฉพาะ หน้านี้แยกจาก U1.5-8B-MoT-Preview และรุ่น U1.5-Lite-Preview ที่ SenseTime ประกาศต่างหาก จึงไม่ควรนำไฟล์รุ่น Preview ไปนับเป็นเช็กพอยต์รุ่นเต็ม 1
31
22
13
ส่วนซอร์สโค้ดสำหรับการฝึก SenseTime ระบุว่า จะเปิดเผย โค้ดสำหรับการปรับจูนแบบมีผู้สอน การเรียนรู้แบบเสริมกำลัง และ on-policy distillation การมีรายงานเทคนิคกับหน้าโมเดลแล้ว ไม่ได้ยืนยันว่าโค้ดฝึกทั้งหมดตามที่ประกาศเปิดให้ใช้งานครบแล้ว 1
3
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
SenseNova U1.5 ของ SenseTime เป็นโมเดล 8B MoT สำหรับเข้าใจ ให้เหตุผลเกี่ยวกับ สร้าง และแก้ไขภาพ โดยไม่พึ่งตัวเข้ารหัสภาพภายนอกหรือ VAE
SenseNova U1.5 ของ SenseTime เป็นโมเดล 8B MoT สำหรับเข้าใจ ให้เหตุผลเกี่ยวกับ สร้าง และแก้ไขภาพ โดยไม่พึ่งตัวเข้ารหัสภาพภายนอกหรือ VAE โมเดลแทนพื้นที่ภาพขนาด 32×32 พิกเซลด้วยโทเคนภาพ แล้วใช้ตัวถอดรหัสที่คำนึงถึงพื้นที่ข้างเคียง เพื่อลดรอยต่อระหว่างส่วนของภาพที่อาจพบใน U1
มีรายงานเทคนิคและหน้าเช็กพอยต์ U1.5 รุ่นเต็มแยกจาก Preview และ Lite Preview แต่คำประกาศว่าจะเปิดซอร์สโค้ดฝึกยังไม่ใช่หลักฐานว่าโค้ดทั้งหมดเผยแพร่แล้ว