SenseNova-U1.5: Towards Native Unified Visual Intelligence

발행일
출처
arXiv
논문 번호
1080
분야
Computer Vision
arXiv 번호
2609.11929

이 논문은 이미지 '이해'와 '생성'을 하나의 모델에서 처리하는 문제를, 비전 인코더와 VAE(이미지를 압축하는 부품) 없이 픽셀에서 바로 배우는 단일 아키텍처로 풀었다.

이 논문은 한마디로 이미지를 보는 것과 만드는 것을 하나의 8B 모델(SenseNova-U1.5)이 픽셀 단위 표현 하나로 함께 하게 만든 연구다. 기존 시스템은 이해용 인코더와 생성용 VAE라는 서로 다른 부품을 썼는데, 이 논문은 둘 다 없애고 32x32 픽셀을 토큰 하나로 압축한 뒤 이웃 영역끼리 정보를 주고받으며(공간적으로 이어붙이는 재구성) 4K 해상도까지 자연스러운 이미지를 만든다. 훈련은 각 능력(미적 감각, 중영문 글자 렌더링, 인포그래픽, 이미지 편집)마다 전문 강화학습 전문가를 따로 만들고, 이걸 다시 한 모델로 통합하는 온-폴리시 증류(모델 자신의 생성 경로를 따라 지식을 옮기는 기법)로 합쳤다. 그 결과 이미지 품질, 글자 렌더링, 복잡한 구도, 여러 참고 이미지 편집, 텍스트-이미지 섞어 쓰기에서 상용 최고 모델들(Nano-Banana-Pro, GPT-Image-2 등)을 넘어서는 성적을 냈다.

핵심 요약

  • 인코더와 VAE를 없애고 픽셀에서 직접 배우는 단일 구조로, 이미지 이해·추론·생성·편집을 한 모델에서 처리했다.
  • 각 픽셀 조각을 따로 예측하던 기존 방식을 고쳐, 이웃 영역끼리 정보를 주고받는 재구성 방식으로 바꿔 고해상도(4K)에서도 이음새 없는 이미지를 만들었다.
  • 능력마다 전문 강화학습 전문가를 따로 훈련한 뒤 온-폴리시 증류로 하나로 합치는 '특화 후 통합' 전략을 썼다.
  • 텍스트-이미지 교차 생성 벤치마크 VBVR-Pro-Bench에서 68.2점으로 Nano-Banana-Pro(56.4)와 GPT-Image-2(50.7) 같은 상용 모델을 제쳤다.
  • 생성 학습데이터에 구조화된 형식이 거의 없었는데도 길고 복잡한 구조적 지시를 잘 따르는 것을 확인해, 이해 능력이 생성 능력으로 옮겨간다는 것을 보여줬다.
  • 추론 중심 편집 벤치마크(RISEBench)에서 사고 과정(CoT)을 쓰면 인과·논리·시간 편집 성적이 크게 올라갔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)