Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

발행일
출처
arXiv
논문 번호
730
분야
Computer Vision
arXiv 번호
2607.24731

확산 영상 증류에서 겉만 맞추면 내부 오차가 숨는 함정을 짚고, 구성 요소를 따로 감독하는 해법을 준다.

확산 영상 모델을 학생 궤적으로 증류할 때 CFG 합성 예측만 맞추는 기존 방식은 양수와 음수 가지 오차가 서로 상쇄되어 감독이 흐려진다. 교사 음수 가지에 특권 정보가 있으면 양수는 좋아지고 음수는 나빠지는 반대 움직임(NBA)이 생긴다. 저자들은 양수 예측과 CFG 방향을 따로 제약하는 PDM을 제안한다. 밀집 대 희소 영상 제어에서 기존 방식은 가이던스 스케일 변화에 취약하지만 PDM은 안정적이고 제어 정확도도 높였다.

핵심 요약

  • CFG 합성만 맞추는 OPD는 가지 수준에서 정체가 안 잡혀 오차가 상쇄된다.
  • 교사 음수 가지의 특권 정보가 음수 가지 비대칭(NBA) 실패를 일으킨다.
  • PDM은 양수 예측과 CFG 방향(양수 빼기 음수)을 따로 제약해 상쇄를 막는다.
  • 가이던스 스케일이 바뀌면 기본 방식은 무너지고 PDM은 안정적이다.
  • 방향 가중치와 감독 상태 수를 조절해 정확도와 효율의 최적점을 찾았다.
  • 포즈, 깊이, 스크리블 밀집 대 희소 영상 제어에서 제어 충실도를 개선했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)