SenseTime의 SenseNova U1.5는 이미지를 이해하고 추론하는 일부터 생성·편집까지 하나의 80억 매개변수 규모 Mixture-of-Transformers(MoT) 모델에 결합한다. 핵심은 입력 이미지를 처리할 때 별도의 시각 인코더를 두지 않고, 결과 이미지를 만들 때도 VAE(변분 오토인코더)에 맡기지 않는다는 점이다. 기술 보고서는 이 설계를 유지하면서 최대 4096×4096픽셀(4K) 이미지 생성의 품질을 높이는 방법을 설명한다.
1
3
같은 모델이 이미지를 읽고 만드는 방법
U1.5는 이미지의 32×32픽셀 영역을 시각 토큰으로 표현한다. 이 토큰을 공통 인터페이스로 사용해 이미지를 처리하고, 생성 과정에서는 모델의 시각적 상태를 VAE의 잠재표현을 거치지 않고 RGB 픽셀로 복원한다. 이미지 이해와 생성을 서로 분리된 시스템이 아닌 하나의 모델로 다루는 방식이다.
1
21
이전 모델 U1과의 중요한 차이는 픽셀을 복원하는 방식에 있다. U1은 다층 퍼셉트론(MLP) 출력부가 이미지 조각을 각각 독립적으로 예측했다. 고해상도에서는 조각의 경계가 이음새나 격자무늬처럼 드러날 수 있었다. U1.5는 시각 토큰을 2차원 격자로 다시 배열한 뒤, Pixel Shuffle과 3×3 합성곱을 사용하는 가벼운 공간 디코더로 이미지를 단계적으로 복원한다. 인접한 영역을 함께 고려해 경계의 연속성을 높이려는 설계다.
1
3
22
4K 생성을 위해서는 해상도 인식 노이즈 조건화도 적용했다. 출력 크기에 따라 달라지는 노이즈 특성을 모델이 고려하도록, 해상도에 따른 노이즈 규모의 임베딩을 생성 시간 단계와 결합하는 방식이다. 공간 디코더가 이미지 조각 사이의 연결을 다룬다면, 이 조건화는 출력 해상도가 바뀔 때의 생성 과정을 다룬다. 두 장치가 4K 생성을 더 안정적으로 만들려는 것이지, 모든 결과물에서 결함이 사라진다는 뜻은 아니다.
1
3
29
전문가를 따로 학습하고, 결과는 하나로
SenseTime은 후속 학습에서 시각적 완성도, 중국어·영어 글자 표현, 인포그래픽, 이미지 편집에 특화된 전문가 모델을 최적화한 뒤 다중 전문가 온폴리시 증류로 역량을 통합했다고 설명한다. 전문가들은 학습 과정의 일부다. 사용자가 요청할 때마다 네 모델을 별도로 실행해야 한다는 의미는 아니다.
1
29
SenseTime은 U1 대비 고해상도 세부 묘사와 공간적 연속성, 글자 표현, 레이아웃, 편집 성능이 개선됐으며 시각 인코더·VAE 없이 이해와 생성을 결합하는 설계는 유지했다고 보고한다. 제시한 평가 점수는 GenEval 0.92, CVTG-2K 0.948, ImgEdit 4.59다. 다만 이는 보고된 평가 결과로, 모든 시각 작업에서 성능이 향상됐다는 독립적 증명은 아니다.
1
3
28
지금 확인할 수 있는 공개 자료는?
U1.5 기술 보고서는 공개돼 있다. 허깅페이스에는 정식 SenseNova-U1.5-8B-MoT 체크포인트 페이지도 있으며, 이는 U1.5-8B-MoT-Preview 페이지 및 별도로 발표된 U1.5-Lite-Preview와 구분해야 한다. 프리뷰 자료만 보고 정식 모델 전체의 공개 범위를 판단해서는 안 된다.
1
31
22
13
SenseTime은 지도 미세조정, 강화학습, 온폴리시 증류를 위한 학습 코드를 오픈소스로 공개할 예정이라고 밝혔다. 기술 보고서와 모델 페이지가 있다는 사실만으로 예고된 전체 학습 코드가 이미 제공된다고 단정할 수는 없다.
1
3