Qwen-Image-Flash: Beyond Objective Design
- 발행일
- 출처
- arXiv
- 논문 번호
- 358
- 분야
- Computer Vision
- arXiv 번호
- 2606.03746
Qwen-Image-2.0 기반으로 T2I 생성과 이미지 편집을 통합한 few-step distillation 모델로, 4 NFE만으로 고품질 생성·편집을 달성한다. 핵심은 distillation objective뿐 아니라 훈련 파이프라인 전체의 설계에 달려 있다는 실증적 분석이다.
본 논문은 few-step distillation에서 objective 설계 외에 훈련 레시피가 학생 모델 성능에 미치는 영향을 체계적으로 분석한다. Qwen-Image-2.0을 교사 모델로 DMD(Distribution Matching Distillation)를 적용하여 세 가지 핵심 발견을 도출했다. 첫째, 데이터 다양성 증가가 오히려 성능을 저하시키고 단일 카테고리의 일관된 데이터가 비예상적으로 잘 전이된다. 둘째, 보완적 강점을 가진 교사 모델들을 step-wise multi-teacher guidance로 결합하여 안정성을 확보한다. 셋째, T2I:Edit 비율이 균형잡혀야 최고 성능이 나오며, 편집 supervision이 T2I 생성 품질까지 향상시킨다.
핵심 요약
- DMD(Distribution Matching Distillation) 기반 Qwen-Image-2.0 → 4 NFE 학생 모델 distillation
- 데이터 구성의 반직관적 발견: 다양성 증가가 성능 저하 유발, 단일 카테고리 일관 데이터가 더 잘 전이됨
- Step-wise multi-teacher guidance로 보완적 교사 모델 강점 결합 및 훈련 안정화
- T2I:Edit 균형 비율에서 최고 통합 성능 달성, 편집 supervision이 생성 품질까지 향상
- Qwen-Image-Flash: 포스터 생성 등 다양한 시나리오에서 4 NFE로 고품질 결과
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.