Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 962
- 분야
- Computer Vision
- arXiv 번호
- 2608.20334
6B(60억 파라미터)짜리 작은 통합 이미지 생성·편집 모델을 체계적인 학습 엔지니어링만으로 오픈소스 최고 수준까지 끌어올린 기술 보고서다.
이 논문은 한마디로 작은 모델(6B)로 이미지 생성과 편집을 한 번에 하는 통합 모델의 성능 한계를 탐구한 기술 보고서다. 점진적 사전학습 → 병렬 전문가 강화학습 → 다중 교사 증류로 이어지는 학습 파이프라인을 제안했다. 프롬프트 개선기(PE)로 '요청 이해'와 '그리기'를 분리한 게 핵심인데, 지식이 필요한 어려운 요청에서 점수가 크게 올랐다. 6B 모델이 평가한 오픈소스 중 최고 종합 성적을 냈고, 3B로 줄여도 성능 손실이 거의 없다.
핵심 요약
- 텍스트→이미지 생성, 한 장 편집, 여러 장 편집을 하나의 가중치로 처리하는 6B 통합 모델을 만들었다.
- 프롬프트 개선기(PE)가 요청을 시각 작업 지시로 바꿔주자 지식 집약 벤치마크 점수가 2.49→4.63으로 폭등했다. 복잡한 생성의 병목은 렌더링이 아니라 의도 해석이었다.
- 구조 프루닝(가지치기)으로 3B로 줄여도 성능이 거의 유지됐고, 소수 스텝 증류 모델(Turbo)은 오히려 종합 편집 점수가 더 높았다(4.20 vs 4.16).
- 학습에 약 243K GPU시간만 들어, 수백억 파라미터 없이도 튼튼한 성능을 낼 수 있음을 보였다.
- '학습데이터 분포를 모델 능력에 맞게 진화시키기', '충돌하는 목표는 분리 학습 후 통합' 같은 실전 교훈을 정리했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.