Qwen-Image-2.0-RL Technical Report

발행일
출처
arXiv
논문 번호
514
분야
Computer Vision
arXiv 번호
2606.27608

Qwen-Image-2.0에 RLHF와 on-policy distillation을 적용해 이미지 생성 품질과 명령어 준수 능력을 향상시킨 포스트트레이닝 파이프라인.

Qwen-Image-2.0-RL은 diffusion 모델에 RLHF를 적용하기 위해 VLM 기반 복합 보상 모델(alignment·aesthetics·portrait)을 구축하고, GRPO 기반 RL 훈련 프레임워크를 제안한다. 이후 on-policy distillation(OPD)으로 T2I와 이미지 편집의 task-specialized RL teacher들을 단일 모델로 통합한다. 그 결과 Qwen-Image-Bench 57.84점(+2.61), T2I 아레나 Elo 1193(+78), 편집 아레나 Elo 1349(+93)를 달성했다.

핵심 요약

  • VLM을 pointwise scoring + CoT reasoning으로 파인튜닝하여 task별 복합 보상 모델 구축 (T2I: alignment/aesthetics/portrait, 편집: instruction/face ID)
  • GRPO 기반 RL 프레임워크에 hybrid CFG 전략을 도입해 pre-trained 지식 보존과 훈련 안정성 동시 확보
  • On-policy distillation(OPD)으로 T2I teacher와 편집 teacher를 trajectory-level velocity matching으로 단일 student 모델에 통합
  • OPD가 mixed RL(다중 보상 동시 최적화) 대비 cross-task 간섭을 피하며 더 우수한 성능 달성
  • Qwen-Image-Bench 57.84점(+2.61), T2I 아레나 Elo +78, 편집 아레나 Elo +93의 일관된 개선 확인

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)