SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

발행일
출처
arXiv
논문 번호
477
분야
Computer Vision
arXiv 번호
2606.22568

Semantic-First Diffusion 기반 T2I 파운데이션 모델로, 적은 학습 컴퓨터(125K A800시간)로 경쟁사급 성능을 달성한다.

SeFi-Image는 Semantic-First Diffusion 패러다임을 적용한 텍스트-이미지 파운데이션 모델로, 1B/2B/5B 세 가지 규모로 제공된다. 5B 모델은 단 125K A800 GPU시간(Z-Image의 10~20%)으로 학습했음에도 GenEval, DPG, LongTextBench 등에서 Qwen-Image, Z-Image와 동등 이상의 성능을 달성했다. 시맨틱 인코더의 특징을 비동기적으로 주입하여 수렴을 가속화하며, DMD2 증류로 few-step turbo 변형도 제공한다.

핵심 요약

  • Semantic-First Diffusion: 시맨틱 인코더 특징을 비동기 주입하여 고재현 VAE 공간에서도 빠른 수렴 달성
  • 5B 모델 학습에 125K A800시간만 소요(Z-Image 대비 10~20% 컴퓨터)
  • GenEval, DPG, LongTextBench, OneIG, CVTG-2K 등 다수 벤치마크에서 Qwen-Image/Z-Image와 동등 이상
  • 1B/2B/5B 3규모 + DMD2 증류 turbo 변형으로 다양한 하드웨어/레이턴시 요구 대응
  • 450M 이미지-텍스트 쌍 + 28M 합성 텍스트 렌더링 데이터로 학습, 코드/가중치 공개

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)