Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

발행일
출처
arXiv
논문 번호
1044
분야
Computer Vision
arXiv 번호
2608.26872

이미지 생성 모델을 원하는 목표에 맞추는 학습에서 비싼 '교사 모델'을 없애고, 학생 모델이 스스로 뻗어나간 시도를 보상으로 채점해 좋은 갈래는 당기고 나쁜 갈래는 밀어내는 Self-OPD를 제안한 논문.

이 논문은 한마디로 '교사 없는 온폴리시 증류'로, 생성 모델이 자기 탐색의 결과를 스스로 채점해 학습 신호를 만드는 방법이다. 기존 온폴리시 증류(OPD)는 목표마다 전용 교사 모델을 미리 학습해야 해서 비싸고, 교사와 학생의 궤적이 어긋나면 오차가 쌓이는 문제가 있었다. Self-OPD는 매 시간 단계에서 학생의 예측을 K개의 확률적 갈래로 나눠 각각 이미지까지 굴리고, 확정적 자기 기준선과 보상을 비교해 우위를 계산한 뒤 좋은 갈래는 끌어당기고 나쁜 갈래는 밀어낸다. 그 결과 교사 3개 학습에 97시간 걸리던 파이프라인을 웜스타트 기준 약 44~48시간(약 2배 빠름)으로 줄이면서 OCR 0.946·GenEval 0.915로 성능은 오히려 더 높였고, 여러 목표도 보상 수준에서 합쳐 한 장의 이미지가 글자·구도·미감을 동시에 만족하게 했다.

핵심 요약

  • 교사 모델이 아예 필요 없어, DiffusionOPD의 총 97시간(교사 학습 85.8h + 증류 11.3h) 대비 웜스타트 구성으로 약 44~48시간에 도달해 2배 가까이 빨라졌다.
  • K개 확률적 갈래 + 자기 기준선으로 매 스텝 밀도 높은 학습 신호를 얻어, 종료 보상만 쓰는 강화학습(Flow-GRPO류)의 높은 분산 문제를 피했다.
  • 좋은 갈래만 따라가는 Best-of-K는 학습이 불안정했고, 전 갈래 풀-푸시 + KL 정규화가 안정 수렴의 핵심이었다(제한 없는 반발 항은 성능 붕괴 0.768 유발).
  • 여러 목표(글자·구도·미감)를 보상 수준에서 합쳐 그래디언트 충돌 없이 한 이미지가 동시에 만족하게 했다(선호 점수 하락 폭 0.48 vs 교사 방식 1.23).

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)