SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- 발행일
- 출처
- arXiv
- 논문 번호
- 477
- 분야
- Computer Vision
- arXiv 번호
- 2606.22568
Semantic-First Diffusion 기반 T2I 파운데이션 모델로, 적은 학습 컴퓨터(125K A800시간)로 경쟁사급 성능을 달성한다.
SeFi-Image는 Semantic-First Diffusion 패러다임을 적용한 텍스트-이미지 파운데이션 모델로, 1B/2B/5B 세 가지 규모로 제공된다. 5B 모델은 단 125K A800 GPU시간(Z-Image의 10~20%)으로 학습했음에도 GenEval, DPG, LongTextBench 등에서 Qwen-Image, Z-Image와 동등 이상의 성능을 달성했다. 시맨틱 인코더의 특징을 비동기적으로 주입하여 수렴을 가속화하며, DMD2 증류로 few-step turbo 변형도 제공한다.
핵심 요약
- Semantic-First Diffusion: 시맨틱 인코더 특징을 비동기 주입하여 고재현 VAE 공간에서도 빠른 수렴 달성
- 5B 모델 학습에 125K A800시간만 소요(Z-Image 대비 10~20% 컴퓨터)
- GenEval, DPG, LongTextBench, OneIG, CVTG-2K 등 다수 벤치마크에서 Qwen-Image/Z-Image와 동등 이상
- 1B/2B/5B 3규모 + DMD2 증류 turbo 변형으로 다양한 하드웨어/레이턴시 요구 대응
- 450M 이미지-텍스트 쌍 + 28M 합성 텍스트 렌더링 데이터로 학습, 코드/가중치 공개
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.