i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models

발행일
출처
arXiv
논문 번호
401
분야
Computer Vision
arXiv 번호
2606.11289

텍스트-이미지 diffusion 모델의 완전 오픈(가중치+데이터+코드) 레시피. 300+ 통제 실험을 통해 설계 공간을 체계적으로 탐구하고, 3B 모델 i1으로 기존 오픈 모델 대비 29.5%p 우수한 성능 달성.

i1은 텍스트-이미지 diffusion 모델의 설계 공간을 300개 이상의 통제 실험(700K+ TPU v6e 시간)으로 체계적으로 탐구한 결과다. 모델링 측면에서 단일 강력한 텍스트 인코더와 큰 어댑터가 다중 인코더보다 우수하고, dual-stream DiT와 long skip connection이 강력한 백본 설계임을 발견했다. 데이터 측면에서는 equal weighting이 큐레이션 데이터셋 혼합의 강력한 기본값이며, 합성 캡션 선택이 중요함을 보였다. 이 통찰으로 훈련한 3B 모델 i1은 5개 벤치마크에서 기존 최고 오픈 모델 대비 평균 29.5%p 우수하다.

핵심 요약

  • 단일 강력한 텍스트 인코더(T5Gemma-2B)와 큰 어댑터(2 transformer blocks)가 다중 인코더보다 효과적
  • Dual-stream DiT와 long skip connection, QK-Norm이 강력한 백본 설계; AdaLN은 T2I에서 이점 미미
  • 긴 캡션 학습이 짧은 캡션보다 우수하나 추론 시 프롬프트 재작성 필요
  • Equal weighting(데이터셋별 동일 이미지 수)이 큐레이션 데이터셋 혼합의 강력한 기본값
  • i1-3B: 공개 데이터만 사용, 5개 벤치마크에서 기존 최고 완전 오픈 모델 대비 평균 29.5%p 우수
  • 17B HiDream-I1, 12B FLUX.1[Dev] 등 더 큰 모델들도 능가하며 설계 탐구의 가치 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)