Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models

발행일
출처
arXiv
논문 번호
962
분야
Computer Vision
arXiv 번호
2608.20334

6B(60억 파라미터)짜리 작은 통합 이미지 생성·편집 모델을 체계적인 학습 엔지니어링만으로 오픈소스 최고 수준까지 끌어올린 기술 보고서다.

이 논문은 한마디로 작은 모델(6B)로 이미지 생성과 편집을 한 번에 하는 통합 모델의 성능 한계를 탐구한 기술 보고서다. 점진적 사전학습 → 병렬 전문가 강화학습 → 다중 교사 증류로 이어지는 학습 파이프라인을 제안했다. 프롬프트 개선기(PE)로 '요청 이해'와 '그리기'를 분리한 게 핵심인데, 지식이 필요한 어려운 요청에서 점수가 크게 올랐다. 6B 모델이 평가한 오픈소스 중 최고 종합 성적을 냈고, 3B로 줄여도 성능 손실이 거의 없다.

핵심 요약

  • 텍스트→이미지 생성, 한 장 편집, 여러 장 편집을 하나의 가중치로 처리하는 6B 통합 모델을 만들었다.
  • 프롬프트 개선기(PE)가 요청을 시각 작업 지시로 바꿔주자 지식 집약 벤치마크 점수가 2.49→4.63으로 폭등했다. 복잡한 생성의 병목은 렌더링이 아니라 의도 해석이었다.
  • 구조 프루닝(가지치기)으로 3B로 줄여도 성능이 거의 유지됐고, 소수 스텝 증류 모델(Turbo)은 오히려 종합 편집 점수가 더 높았다(4.20 vs 4.16).
  • 학습에 약 243K GPU시간만 들어, 수백억 파라미터 없이도 튼튼한 성능을 낼 수 있음을 보였다.
  • '학습데이터 분포를 모델 능력에 맞게 진화시키기', '충돌하는 목표는 분리 학습 후 통합' 같은 실전 교훈을 정리했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)