DanceOPD: On-Policy Generative Field Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 500
- 분야
- Computer Vision
- arXiv 번호
- 2606.27377
단일 이미지 생성 모델에서 T2I, 로컬 편집, 글로벌 편집 역량을 통합하는 on-policy 증류 프레임워크. 각 샘플을 하나의 역량 필드로 라우팅하여 student 자신의 rollout 상태에서 감독한다.
DanceOPD는 flow-matching 이미지 생성 모델에서 T2I, 로컬 편집, 글로벌 편집의 충돌을 해결하기 위해 각 역량을 velocity field로 모델링하고 on-policy distillation로 통합한다. 핵심 설계는 hard-routed sample-wise field matching, student rollout 상태에서의 단일 쿼리, velocity MSE 손실이다. GEditBench에서 최고 OPD baseline 대비 8.1% 향상, local+global 편집 조합에서 16.1% 향상을 달성했다.
핵심 요약
- T2I, 로컬 편집, 글로벌 편집의 충돌을 velocity field 관점에서 정식화하고 on-policy distillation로 해결한다.
- 샘플별로 정확히 하나의 역량 필드만 할당하는 hard routing으로 target-field 모호성을 제거한다.
- GEditBench에서 기존 OPD baseline 대비 8.1% 향상, T2I 소스와 동등한 GenEval 성능을 유지했다.
- local+global 편집 조합에서 최고 경쟁 baseline 대비 16.1%, local edit 소스 대비 7.9% 향상했다.
- realism field 흡수 시 off-policy distillation 대비 9.9% 향상, student-teacher reward gap의 85.3%를 달성했다.
- CFG(classifier-free guidance)도 동일한 velocity MSE 목표 하에 흡수 가능함을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.