On-Policy Self-Distillation in Diffusion Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 1007
- 분야
- Computer Vision
- arXiv 번호
- 2608.24646
이 논문은 이미지 단위 보상을 확산 모델의 중간 예측이 따라갈 구체적 목표로 바꿔주는 자기증류 방식을 제안해, 더 적은 GPU 시간으로 더 좋은 정렬 성능을 얻었다.
이 논문은 한마디로 '보상을 중간 예측의 목표로 바꿔주는 확산 모델 후학습법'이다. 기존 강화학습은 완성된 이미지에만 점수를 주기 때문에 중간 잡음 제거 단계가 어떻게 바뀌어야 하는지는 알려주지 못했다. DiffusionOPSD는 얼어붙은 행동 정책이 내놓은 예측을 기준점으로 삼고, 보상의 기울기로 좋은 목표와 나쁜 목표를 만들어 학습 정책이 그 목표를 따라가게 한다. SD3.5-M과 9단계 Z-Image-Turbo에서 보상을 맞춘 평가 조건 20개 중 19개에서 최종 점수가 가장 높았고, 가장 강한 경쟁 기법보다 최대 44.0% 좋아졌다. 학습 비용도 DiffusionNFT 대비 GPU 시간이 각각 40%와 63% 줄었다.
핵심 요약
- 얼어붙은 행동 정책이 궤적과 기준점을 만들고, 보상 기울기로 기준점 주변에 크기를 제한한 긍정 목표와 부정 목표를 세운 뒤, 학습 정책이 이를 끊어낸 지도 신호로 따라 학습한다.
- 목표를 만드는 단계와 그 목표에 실제로 맞춰지는 단계를 갈라놓아, 성능이 안 오를 때 어느 쪽이 문제인지 따로 잴 수 있게 했다.
- 두 백본과 평가기 10개로 이뤄진 보상 일치 조건 20개 가운데 19개에서 보류 세트 최종 점수가 가장 높았다.
- DiffusionNFT 대비 갱신 100회당 GPU 시간이 40%와 63% 줄어, 같은 예산으로 이미지 생성 모델을 사람 선호에 맞추는 후학습을 더 자주 돌릴 수 있다.
- 다만 통제 실험에서 목표를 잘 만들었다고 한 번의 갱신으로 그만큼 얻는 것은 아니어서, HPSv2.1에서는 프롬프트 512개 중 62.3%에서 순서가 뒤집혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.