SenseNova U1.5 là mô hình Mixture of Transformers khoảng 8 tỷ tham số, kết hợp hiểu, suy luận, tạo và chỉnh sửa ảnh mà không cần bộ mã hóa thị giác bên ngoài hoặc VAE. Thay vì dựng riêng từng mảnh ảnh như U1, U1.5 cho các vùng lân cận cùng tham gia tái tạo, nhằm giảm đường nối và ô lưới dễ lộ ở độ phân giải cao.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Điểm đáng chú ý ở SenseNova U1.5 không chỉ là khả năng tạo ảnh tới 4096 × 4096 pixel. SenseTime thiết kế mô hình Mixture-of-Transformers (MoT) khoảng 8 tỷ tham số để xử lý cả việc hiểu, suy luận về ảnh lẫn tạo và chỉnh sửa ảnh. Mô hình không chuyển ảnh đầu vào cho một bộ mã hóa thị giác bên ngoài, cũng không dùng bộ tự mã hóa biến phân (VAE) để giải mã ảnh tạo ra; đầu ra được tái tạo trong không gian pixel RGB. 1
3
U1.5 biểu diễn các vùng ảnh bằng token thị giác tương ứng với vùng 32 × 32 pixel. Cách này biến ảnh thành một chuỗi gọn hơn để mô hình xử lý, trong khi việc tạo ảnh vẫn đi qua giao diện thị giác chung thay vì một bộ giải mã VAE riêng. 1
21
Thay đổi quan trọng so với U1 nằm ở bước tái tạo ảnh. U1 dùng một mạng perceptron nhiều lớp (MLP) để dự đoán độc lập từng mảnh ảnh; khi phóng lên độ phân giải cao, ranh giới giữa các mảnh có thể hiện thành đường nối hoặc ô lưới. U1.5 đưa các trạng thái thị giác trở lại bố cục hai chiều, rồi dùng bộ giải mã không gian nhẹ với Pixel Shuffle theo từng bước và các phép tích chập 3 × 3. Nhờ vậy, những vùng kề nhau có thể ảnh hưởng tới quá trình dựng ảnh, thay vì bị xử lý hoàn toàn tách biệt. 1
3
22
Để hỗ trợ tạo ảnh tới 4096 × 4096 pixel, SenseTime còn mô tả cơ chế điều kiện nhiễu theo độ phân giải: thông tin về mức nhiễu phụ thuộc kích thước ảnh được kết hợp với bước tạo ảnh, giúp mô hình tính đến việc đặc tính nhiễu thay đổi theo độ phân giải đầu ra. Bộ giải mã không gian nhắm vào tính liền mạch giữa các mảnh; cơ chế điều kiện nhiễu nhắm vào sự thay đổi quy mô. Đây là các giải pháp nhằm giúp quá trình tạo ảnh 4K ổn định hơn, không phải cam kết ảnh sẽ không còn lỗi. 1
3
29
SenseTime chọn cách chuyên môn hóa trước, hợp nhất sau. Ở giai đoạn hậu huấn luyện, hãng tối ưu các mô hình chuyên biệt cho tính thẩm mỹ, hiển thị chữ Trung và Anh, tạo đồ họa thông tin và chỉnh sửa ảnh. Sau đó, năng lực của chúng được gom vào mô hình thống nhất bằng phương pháp chưng cất đa chuyên gia theo chính sách hiện hành (multi-expert on-policy distillation). Các chuyên gia phục vụ quá trình huấn luyện; mô tả này không có nghĩa mỗi yêu cầu của người dùng phải chạy bốn mô hình riêng. 1
29
So với U1, SenseTime báo cáo ảnh độ phân giải cao có chi tiết và tính liền mạch không gian tốt hơn, cùng cải thiện ở chữ trong ảnh, bố cục và chỉnh sửa. U1.5 vẫn giữ hướng thiết kế thống nhất khả năng hiểu và tạo ảnh, không cần bộ mã hóa thị giác bên ngoài hay VAE. Các điểm số được công bố gồm GenEval 0,92; CVTG-2K 0,948; và ImgEdit 4,59. Đó là kết quả đánh giá do các nguồn công bố, không phải bằng chứng độc lập rằng U1.5 tốt hơn ở mọi tác vụ thị giác. 1
3
28
Báo cáo kỹ thuật U1.5 đã được công bố. Trên Hugging Face có trang riêng cho checkpoint SenseNova-U1.5-8B-MoT; cần phân biệt trang này với SenseNova-U1.5-8B-MoT-Preview và bản U1.5-Lite-Preview mà SenseTime công bố riêng. Không nên lấy tài nguyên của các bản Preview làm đại diện cho checkpoint đầy đủ. 1
31
22
13
SenseTime nói hãng sẽ công bố mã huấn luyện cho tinh chỉnh có giám sát, học tăng cường và chưng cất theo chính sách hiện hành. Việc báo cáo kỹ thuật và các trang mô hình đã xuất hiện chưa đủ để kết luận toàn bộ mã huấn luyện được hứa hẹn đã có sẵn. 1
3
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
SenseNova U1.5 là mô hình Mixture of Transformers khoảng 8 tỷ tham số, kết hợp hiểu, suy luận, tạo và chỉnh sửa ảnh mà không cần bộ mã hóa thị giác bên ngoài hoặc VAE.
SenseNova U1.5 là mô hình Mixture of Transformers khoảng 8 tỷ tham số, kết hợp hiểu, suy luận, tạo và chỉnh sửa ảnh mà không cần bộ mã hóa thị giác bên ngoài hoặc VAE. Thay vì dựng riêng từng mảnh ảnh như U1, U1.5 cho các vùng lân cận cùng tham gia tái tạo, nhằm giảm đường nối và ô lưới dễ lộ ở độ phân giải cao.
Báo cáo kỹ thuật và trang checkpoint U1.5 đầy đủ đã xuất hiện; đây là các tài nguyên khác với bản Preview và Lite Preview.