Qwen-Image-Flash: Beyond Objective Design

발행일
출처
arXiv
논문 번호
358
분야
Computer Vision
arXiv 번호
2606.03746

Qwen-Image-2.0 기반으로 T2I 생성과 이미지 편집을 통합한 few-step distillation 모델로, 4 NFE만으로 고품질 생성·편집을 달성한다. 핵심은 distillation objective뿐 아니라 훈련 파이프라인 전체의 설계에 달려 있다는 실증적 분석이다.

본 논문은 few-step distillation에서 objective 설계 외에 훈련 레시피가 학생 모델 성능에 미치는 영향을 체계적으로 분석한다. Qwen-Image-2.0을 교사 모델로 DMD(Distribution Matching Distillation)를 적용하여 세 가지 핵심 발견을 도출했다. 첫째, 데이터 다양성 증가가 오히려 성능을 저하시키고 단일 카테고리의 일관된 데이터가 비예상적으로 잘 전이된다. 둘째, 보완적 강점을 가진 교사 모델들을 step-wise multi-teacher guidance로 결합하여 안정성을 확보한다. 셋째, T2I:Edit 비율이 균형잡혀야 최고 성능이 나오며, 편집 supervision이 T2I 생성 품질까지 향상시킨다.

핵심 요약

  • DMD(Distribution Matching Distillation) 기반 Qwen-Image-2.0 → 4 NFE 학생 모델 distillation
  • 데이터 구성의 반직관적 발견: 다양성 증가가 성능 저하 유발, 단일 카테고리 일관 데이터가 더 잘 전이됨
  • Step-wise multi-teacher guidance로 보완적 교사 모델 강점 결합 및 훈련 안정화
  • T2I:Edit 균형 비율에서 최고 통합 성능 달성, 편집 supervision이 생성 품질까지 향상
  • Qwen-Image-Flash: 포스터 생성 등 다양한 시나리오에서 4 NFE로 고품질 결과

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)