i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 401
- 분야
- Computer Vision
- arXiv 번호
- 2606.11289
텍스트-이미지 diffusion 모델의 완전 오픈(가중치+데이터+코드) 레시피. 300+ 통제 실험을 통해 설계 공간을 체계적으로 탐구하고, 3B 모델 i1으로 기존 오픈 모델 대비 29.5%p 우수한 성능 달성.
i1은 텍스트-이미지 diffusion 모델의 설계 공간을 300개 이상의 통제 실험(700K+ TPU v6e 시간)으로 체계적으로 탐구한 결과다. 모델링 측면에서 단일 강력한 텍스트 인코더와 큰 어댑터가 다중 인코더보다 우수하고, dual-stream DiT와 long skip connection이 강력한 백본 설계임을 발견했다. 데이터 측면에서는 equal weighting이 큐레이션 데이터셋 혼합의 강력한 기본값이며, 합성 캡션 선택이 중요함을 보였다. 이 통찰으로 훈련한 3B 모델 i1은 5개 벤치마크에서 기존 최고 오픈 모델 대비 평균 29.5%p 우수하다.
핵심 요약
- 단일 강력한 텍스트 인코더(T5Gemma-2B)와 큰 어댑터(2 transformer blocks)가 다중 인코더보다 효과적
- Dual-stream DiT와 long skip connection, QK-Norm이 강력한 백본 설계; AdaLN은 T2I에서 이점 미미
- 긴 캡션 학습이 짧은 캡션보다 우수하나 추론 시 프롬프트 재작성 필요
- Equal weighting(데이터셋별 동일 이미지 수)이 큐레이션 데이터셋 혼합의 강력한 기본값
- i1-3B: 공개 데이터만 사용, 5개 벤치마크에서 기존 최고 완전 오픈 모델 대비 평균 29.5%p 우수
- 17B HiDream-I1, 12B FLUX.1[Dev] 등 더 큰 모델들도 능가하며 설계 탐구의 가치 입증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.